Le 1er octobre 2026, Microsoft AI a lancé MAI-Transcribe-2-Streaming, son tout premier modèle de transcription en temps réel, se classant immédiatement en tête de la plateforme Artificial Analysis pour la précision de ses retranscriptions finales et partielles. L’entreprise a également introduit deux nouveaux modèles vocaux, MAI-Voice-2.1 et MAI-Voice-2.1-Flash.
L’architecture de transcription de Microsoft s’impose directement sur le marché des agents conversationnels en temps réel. Développé en interne, le modèle arrive alors que l’industrie des assistants vocaux franchit une étape notable.
Microsoft domine les classements de transcription
Le système affiche un taux d’erreur par mot de 2,5 % et un délai de transcription finale de 0,13 seconde, selon les données de la plateforme. Le modèle de transcription en continu prend en charge 60 langues avec une détection automatique et continue. Le système produit ses premières hypothèses, appelées partielles, en un peu plus de 100 millisecondes après la réception des données audio, contrairement aux approches traditionnelles qui exigent la fin complète d’une phrase. Ces résultats permettent aux applications de réagir avant même que l’interlocuteur n’ait terminé de parler.

Sur l’indice de référence public, les concurrents directs se classent derrière la solution, avec Grok Voice Transcribe 2.0 à 2,7 % d’erreur et un délai de 0,49 seconde. Le modèle s’inscrit dans la lignée du système de traitement par lots MAI-Transcribe-2 commercialisé en septembre. L’évaluation s’appuie sur un corpus d’environ huit heures comprenant des conditions acoustiques variées, des parlers du monde réel et des registres spécialisés répartis à travers des ensembles de données distincts.
MAI-Transcribe-2-Streaming est disponible à un tarif promotionnel de 0,54 dollar par heure d’audio jusqu’à la fin de l’année 2026, tandis que la version par lots, MAI-Transcribe-2, est facturée à 0,10 dollar par heure pour le déploiement tarifaire.
La firme introduit deux variantes de synthèse vocale
MAI-Voice-2.1 prend en charge 23 langues et 26 variantes régionales, permettant à une même voix de changer de langue de manière fluide tout en conservant son timbre et un accent authentique. En parallèle, l’entreprise a dévoilé deux modèles de synthèse vocale pour enrichir les boucles conversationnelles. Le coût de génération est fixé à 22 dollars par million de caractères.
MAI-Voice-2.1-Flash génère 45 secondes de contenu audio avec une latence de bout en bout de 150 millisecondes pour les charges de travail à forte volumétrie et sensibles à la latence. Ce modèle affiche un coût de 15 dollars par million de caractères, tout en intégrant des fonctionnalités de clonage vocal dotées de garde-fous pour empêcher les utilisations abusives.

Les développeurs accèdent aux interfaces de distribution
Les équipes de développement peuvent intégrer ces solutions à travers plusieurs interfaces, notamment le MAI Playground, Vercel et Azure Voice Live. La démo Chatter a été mise en place pour permettre d’expérimenter directement l’interaction entre ces technologies de transcription et de synthèse vocale.