Stand: Sa 03.10. · 06:31
KI

Freitag, 2. Oktober 2026 · 13:23 Uhr

Microsoft erweitert eigene KI-Modellfamilie MAI um Audio-Funktionen

Microsoft stellt mit MAI-Transcribe-2-Streaming und zwei Voice-Modellen neue Audio-KI für Sprachagenten vor.

Mi­cro­soft hat seine KI-Mo­dell­fa­mi­lie MAI um drei neue Audio-Mo­del­le er­wei­tert: MAI-Tran­s­cri­be-2-Strea­ming, MAI-Voice-2.1 und MAI-Voice-2.1-Flash123. Die Mo­del­le sol­len Echt­zeit-Tran­skrip­ti­on sowie Sprach­aus­ga­be für so­ge­nann­te Voice-Agents er­mög­li­chen14.

MAI-Tran­s­cri­be-2-Strea­ming ist laut Mi­cro­soft das erste ei­ge­ne Mo­dell für Echt­zeit-Tran­skrip­ti­on und soll bei Tests von Ar­ti­fi­ci­al Ana­ly­sis in Sa­chen Ge­nau­ig­keit den ers­ten Platz be­le­gen4. Die bei­den Voice-Mo­del­le er­gän­zen das An­ge­bot um Sprach­syn­the­se in un­ter­schied­li­chen Ge­schwin­dig­keits- und Qua­li­täts­s­tu­fen14.

Mit der Er­wei­te­rung po­si­tio­niert sich Mi­cro­soft stär­ker im Wett­be­werb um Sprachas­sis­ten­ten und Voice-Agents, einem Be­reich, in dem auch an­de­re große KI-An­bie­ter ak­ti­v投资ie­ren123.