Eleven v4 est la nouvelle génération Text to Speech d’ElevenLabs. Le modèle remplace le SSML par des Audio Tags en langage naturel, prend en charge plus de 90 langues et améliore le clonage vocal. Sa variante Eleven v4 Turbo cible les agents avec environ 100 ms de latence médiane d’inférence et environ 150 ms avant le début de la parole. Eleven v4 répond à plusieurs limites précises de la génération précédente. Eleven v3 était limité à 5 000 caractères par génération et ses Professional Voice Clones n’étaient pas pleinement pris en charge ; v4 porte la limite à 10 000 caractères, rétablit le PVC et améliore la stabilité de l’identité vocale. En parallèle, v4 Turbo cible les interactions temps réel avec une latence nettement inférieure à celle de v3 Conversational. Le changement est suffisamment important pour parler d’une nouvelle génération : ElevenLabs indique que v4 repose sur une architecture entièrement nouvelle, sans en publier tous les détails techniques. Côté perception, le Provider Voice Arena d’Artificial Analysis place actuellement Eleven v4 en tête avec un Elo de 1319 sur 1 674 échantillons, devant Sonic 3.6 et Gemini 3.8 Flash TTS. Modèle (Provider Voice Arena) Score Elo (Artificial Analysis) Échantillons Prix API de référence (hors promo v4) Eleven v4 1319 1 674 80 $ / 1M caractères Cartesia Sonic 3.6 1276 1 946 49 $ / 1M caractères Gemini 3.8 Flash TTS 1267 2 198 16,5 $ / 1M caractères Pour les directions techniques, l’intérêt n’est donc pas seulement une hausse de qualité perçue : v4 combine davantage de contrôle expressif, une meilleure fidélité des clones et une continuité pensée pour les productions longues. Les équipes qui utilisent déjà la v3 d'ElevenLabs ont intérêt à réaliser des tests A/B sur leurs propres voix, car ElevenLabs précise lui-même que fidélité accrue et préférence subjective ne coïncident pas toujours. Dans Eleven v4, le retrait du SSML n’est pas qu’une simplification de syntaxe. Il matérialise un changement de philosophie : au lieu de décrire chaque paramètre vocal avec un balisage technique, le créateur formule une intention que le modèle interprète. Avec un tag comme [excited] — ou d’autres indications telles que [whispers] et [long pause] — on se rapproche moins de la programmation d’une voix que de la direction d’une performance. Je reste convaincu que l’avenir de l’intégration vocale ne se jouera pas uniquement dans la course à la milliseconde. La capacité à adapter la livraison, préserver une identité vocale sur la durée et gérer plusieurs langues devient tout aussi stratégique. À terme, cette expressivité pourrait nourrir des expériences de formation, de narration ou d’assistance beaucoup plus adaptatives, à condition de conserver des garde-fous et une validation humaine appropriée. Il y a une forme de poésie technique à voir ces modèles s’approprier le sous-texte d’une phrase. Mais cette liberté d’interprétation impose davantage de rigueur dans les tests : le non-déterminisme des émotions et des Audio Tags pourrait faire émerger de nouveaux outils d’évaluation prosodique, capables de mesurer non seulement la justesse technique d’une sortie, mais aussi sa cohérence de ton d’une génération à l’autre. Pour approfondir l’intégration sécurisée de services créatifs et agentiques dans des environnements tiers, je vous recommande également l’article consacré à ElevenLabs MCP et à son usage d’OAuth. Eleven v4 et v4 Turbo sont disponibles dans l’écosystème ElevenLabs. Vous pouvez les explorer via le lien partenaire KingLand vers ElevenLabs ; l’offre API de lancement est annoncée jusqu’au 12 octobre 2026.
Chargement de KingLand…
Eleven v4 : du SSML à la direction vocale en langage naturel