ElevenLabs Dubbing v2 traduit et double automatiquement des vidéos dans plus de 90 langues. Le modèle détecte les locuteurs, sépare les dialogues de la bande-son et adapte la traduction au rythme original. Il préserve autant que possible le ton, l’identité et l’émotion des voix, mais une relecture humaine reste recommandée avant toute diffusion professionnelle, notamment pour les noms et termes. La localisation vidéo franchit un cap important en 2026. Les entreprises, agences et créateurs cherchent à rentabiliser leurs catalogues sur plusieurs marchés sans réenregistrer manuellement chaque voix dans chaque langue. Les premiers systèmes de doublage automatique facilitaient déjà la traduction, mais leur dépendance excessive à la transcription et à la synthèse textuelle pouvait atténuer les hésitations, l'énergie, les accents d'intention et les variations émotionnelles de la performance originale. Avec le lancement de Dubbing v2 Alpha dans l'écosystème ElevenCreative , ElevenLabs ajoute la performance acoustique originale aux informations utilisées pour générer la nouvelle voix. Le modèle ne se contente donc plus de reconstruire l'interprétation à partir d'un transcript traduit : il cherche aussi à transférer le ton, le rythme, la diction et l'intention présents dans le média source. Cette évolution compte pour trois raisons majeures : Une synchronisation temporelle plus naturelle : Le système adapte la formulation, les débuts, les fins et le débit afin de rapprocher la durée du dialogue traduit de celle de la séquence originale. Cette fonction ne doit pas être confondue avec une modification automatique des mouvements de lèvres. Un workflow de localisation plus intégré : La détection des locuteurs, la séparation de la bande-son, la traduction, la génération vocale et le réassemblage sont orchestrés dans un même service, même si ElevenLabs ne documente pas l'ensemble comme une unique passe neuronale. Une mise sur le marché accélérée : Une équipe peut produire plusieurs versions linguistiques plus rapidement qu'avec un cycle entièrement manuel, sous réserve de vérifier la traduction, les noms propres, le vocabulaire métier et le mixage final. Dubbing v2 réduit ainsi une partie de la fragmentation technique de la localisation audiovisuelle. Il ne rend toutefois pas obsolètes les traducteurs, comédiens, directeurs artistiques et ingénieurs du son lorsque le projet exige une adaptation culturelle précise, un jeu d'acteur contrôlé ou une qualité de diffusion professionnelle. « Une voix ne transporte pas seulement des mots. Elle transmet un rythme, une intention et une identité. L'intérêt de Dubbing v2 est de replacer cette performance au centre de la traduction, sans prétendre que l'automatisation remplace le jugement humain. » — L'équipe éditoriale KingLand Cette évolution modifie notre rapport à la barrière linguistique. Jusqu'à présent, la traduction automatisée impliquait souvent une perte d'énergie ou de personnalité. En conditionnant la nouvelle génération sur la performance source, Dubbing v2 rapproche le résultat de l'intention originale. Cette avancée doit cependant rester encadrée par le consentement des personnes, la maîtrise des droits vocaux et la transparence sur l'usage de voix générées. La réactivation de catalogues d'archives représente un autre potentiel majeur. Des cours, conférences ou interviews peuvent devenir accessibles à de nouveaux publics en conservant une partie de la présence vocale de leur auteur. Cette possibilité suppose néanmoins de vérifier les droits sur les œuvres, les enregistrements et les voix concernées. Bien utilisée, la technologie devient alors moins un remplacement des métiers de la localisation qu'une infrastructure supplémentaire pour diffuser le savoir à l'échelle internationale.
Chargement de KingLand…
Studio Dubbing V2 : le doublage IA sans perte d'émotion
Rédaction assistée par intelligence artificielle, sous la direction éditoriale de Charles Pestel.
Avec Dubbing v2, ElevenCreative traduit et double des vidéos dans plus de 90 langues en préservant autant que possible la voix, le rythme et l’émotion des intervenants.