Face à l'explosion des données audio d'entreprise, Microsoft AI lance MAI-Transcribe-2 sur Azure. Ce modèle propriétaire atteint une vitesse inédite de 410× le temps réel pour seulement 0,10 $ de l'heure. Cette solution de Speech-to-Text ultra-rapide réduit drastiquement vos coûts d'infrastructure et accélère l'exploitation de vos flux vocaux. Microsoft AI (MAI) renforce rapidement sa présence sur le marché du Speech-to-Text en cette fin d'année 2026. Avec MAI-Transcribe-2, la firme ajoute à Azure Speech un modèle développé en interne et positionné sur la précision, le débit et le coût. Cette stratégie élargit la pile de modèles propriétaires de Microsoft et intensifie la concurrence avec les fournisseurs spécialisés de reconnaissance vocale. La vitesse constitue l'un des principaux points différenciants mesurés. Artificial Analysis évalue actuellement MAI-Transcribe-2 à environ 410,7× le temps réel sur son benchmark de transcription non-streaming. À titre de comparaison, ElevenLabs Scribe v2 se situe autour de 52 à 53× sur ce même classement. MAI-Transcribe-2 obtient également un AA-WER de 2,0 %, contre environ 2,2 % pour Scribe v2. Ces chiffres constituent des résultats de benchmark et ne garantissent ni la même latence end-to-end ni le même taux d'erreur sur les données propres à chaque entreprise. Cette évolution s'inscrit dans la foulée des annonces du 2 juin 2026, lorsque Microsoft AI a présenté sept nouveaux modèles développés en interne, parmi lesquels MAI-Thinking-1, MAI-Code-1-Flash et MAI-Transcribe-1.5. MAI-Image-2.6, annoncé en août, a ensuite été rendu disponible en Public Preview dans Microsoft Foundry le 4 septembre 2026. Microsoft développe ainsi une gamme propriétaire couvrant progressivement le raisonnement, le code, l'image, la voix et la transcription, sans que cela implique pour autant la fin de ses partenariats avec d'autres fournisseurs de modèles. L'évaluation de MAI-Transcribe-2 peut donc être pertinente pour les équipes d'ingénierie qui traitent de gros volumes audio, à condition de confronter les benchmarks publics à leurs propres enregistrements et aux contraintes d'une Public Preview. L'arrivée de MAI-Transcribe-2 illustre la maturation industrielle de la transcription vocale. Microsoft AI transforme une capacité autrefois coûteuse en composant d'infrastructure proposé à un prix promotionnel extrêmement bas, tout en ajoutant diarisation, timestamps mot à mot, code-switching et contextualisation par mots-clés. Cette combinaison accroît la pression concurrentielle sur les API spécialisées, sans pour autant rendre obsolètes leurs différenciations dans le streaming, les agents vocaux, l'analyse audio ou la génération de voix. Cette montée en puissance des modèles développés directement par Microsoft montre également que les grands fournisseurs de cloud cherchent à maîtriser davantage de couches de leur pile IA. Cela peut réduire la dépendance de Microsoft à des modèles tiers pour certains workloads ciblés, sans signifier une rupture globale avec OpenAI ou les autres fournisseurs présents dans son écosystème. La question stratégique est donc moins de savoir si la transcription devient « gratuite » que de déterminer où se déplacera la valeur. À 0,10 $ par heure jusqu'à la fin de 2026, le coût du Speech-to-Text brut devient très faible, mais l'architecture complète conserve ses coûts de stockage, d'orchestration, d'indexation, de supervision et de migration. Une entreprise prudente gagnera à normaliser le format de ses transcriptions derrière une couche d'abstraction afin de pouvoir comparer MAI-Transcribe-2, Scribe v2, Gemini 3.5 Transcribe, Deepgram ou d'autres fournisseurs sans reconstruire tout son pipeline. Le prix de 2027 n'étant pas encore connu, cette portabilité constitue probablement la meilleure assurance contre un futur changement de grille tarifaire.
Chargement de KingLand…
MAI-Transcribe-2 : ce qu'il change pour la transcription