Freitag, 2. Oktober 2026 · 13:23 Uhr
Microsoft erweitert eigene KI-Modellfamilie MAI um Audio-Funktionen
Microsoft stellt mit MAI-Transcribe-2-Streaming und zwei Voice-Modellen neue Audio-KI für Sprachagenten vor.
Microsoft hat seine KI-Modellfamilie MAI um drei neue Audio-Modelle erweitert: MAI-Transcribe-2-Streaming, MAI-Voice-2.1 und MAI-Voice-2.1-Flash123. Die Modelle sollen Echtzeit-Transkription sowie Sprachausgabe für sogenannte Voice-Agents ermöglichen14.
MAI-Transcribe-2-Streaming ist laut Microsoft das erste eigene Modell für Echtzeit-Transkription und soll bei Tests von Artificial Analysis in Sachen Genauigkeit den ersten Platz belegen4. Die beiden Voice-Modelle ergänzen das Angebot um Sprachsynthese in unterschiedlichen Geschwindigkeits- und Qualitätsstufen14.
Mit der Erweiterung positioniert sich Microsoft stärker im Wettbewerb um Sprachassistenten und Voice-Agents, einem Bereich, in dem auch andere große KI-Anbieter aktiv投资ieren123.