Dicter ou coder à la voix dans le bruit reste un défi de productivité. Wispr Flow résout cette friction avec son modèle autonome Canto, conçu pour transcrire avec précision en milieu dégradé. Cette souveraineté technique élimine les API tierces, réduit la latence sous 150ms et garantit un ROI immédiat pour vos flux professionnels. En cette rentrée 2026, plusieurs éditeurs d'applications IA cherchent à mieux contrôler les briques techniques qui déterminent directement l'expérience utilisateur. Pour une application de dictée comme Flow, la qualité du modèle de reconnaissance vocale conditionne notamment la précision, la robustesse au bruit et la capacité à exploiter un vocabulaire spécialisé. Wispr Flow a annoncé le 17 août 2026 une Series B de 280 millions de dollars, à une valorisation de 2 milliards de dollars. Un mois plus tard, son Advanced Interfaces Lab, dirigé par le CSO Ariya Rastrow, a présenté Canto comme le premier modèle de reconnaissance vocale développé en interne par l'entreprise. Wispr compare officiellement Canto à des modèles de Google, OpenAI, AssemblyAI et Deepgram, mais ne précise pas que ces services constituaient auparavant les moteurs de transcription de Flow. L'intérêt du mouvement est donc surtout la capacité de Wispr à entraîner et optimiser directement un modèle pour ses propres usages de dictée, plutôt qu'une rupture documentée avec un fournisseur précis. Cette verticalisation peut donner à Wispr davantage de contrôle sur la recherche, l'évaluation et l'évolution de sa chaîne de reconnaissance vocale. Les conséquences exactes sur les coûts, les marges ou la dépendance à d'autres infrastructures ne sont toutefois pas détaillées publiquement. La réflexion de l'explorateur IA Le lancement de Canto montre qu'un éditeur d'application peut chercher à reprendre le contrôle d'une brique de modèle directement liée à son expérience utilisateur. Chez Wispr, cette logique concerne aujourd'hui la reconnaissance vocale, sans pour autant signifier une indépendance complète vis-à-vis du cloud ou de toute infrastructure tierce. L'observation de ce mouvement suggère que la différenciation ne se joue pas seulement sur la taille des modèles. Canto illustre une autre voie : partir d'un modèle préentraîné à grande échelle, puis concentrer le post-entraînement, les évaluations et les signaux de contexte sur un usage précis. Les résultats publiés par Wispr mettent ainsi l'accent sur les dictées réelles et les conditions acoustiques difficiles, tout en montrant que Canto ne domine pas chaque benchmark public ni chaque sous-ensemble de test. La trajectoire mérite surtout d'être suivie parce que Wispr annonce déjà entraîner un successeur de Canto à plus de dix fois son échelle, avec des objectifs portant sur l'audio difficile, la reconnaissance multi-locuteurs, le vocabulaire contextuel et davantage de langues. Ces objectifs restent des travaux en cours et ne doivent pas être présentés comme des fonctions actuelles. À court terme, Canto reste d'abord un moteur de dictée cloud intégré à Flow ; son intérêt se mesure donc sur la qualité réelle de cette expérience, pas sur des usages industriels ou des API que Wispr ne propose pas encore.
Chargement de KingLand…
Wispr Flow Canto : la dictée vocale sans dépendance cloud