2026年10月02日 12時56分
AI

Microsoftがリアルタイム文字起こしAI「MAI-Transcribe-2-Streaming」を現地時間の2026年10月1日にリリースしました。競合モデルと比べてエラー率が低く、遅延も短く抑えられています。
Our first streaming transcription model debuts at no. 1 on Artificial Analysis | Microsoft AI
https://microsoft.ai/news/our-first-streaming-transcription-model/
MAI-Transcribe-2-StreamingはMicrosoft初のリアルタイム文字起こしモデルとして位置付けられており、競合モデルと比べて高精度かつ高速なことがアピールされています。以下のグラフは第三者機関のArtificial Analysisによる性能分析の結果で、縦軸は文字起こしエラー率を示しています。MAI-Transcribe-2-Streamingはテスト対象のリアルタイム文字起こしモデルの中で最もエラー率が低いです。

以下のグラフは横軸が文字起こ完了までの遅延秒数、縦軸がエラー率を示しています。MAI-Transcribe-2-Streamingは同等精度のモデルと比べて遅延が短いことが分かります。

MAI-Transcribe-2-StreamingはAPI経由で利用可能で、2026年末までは1時間当たり0.54ドル(約85円)で使用できます。APIの詳細は以下のリンク先で確認できます。
Use MAI-Transcribe-2-Streaming with the Realtime API – Speech Service – Foundry Tools | Microsoft Learn
https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming-realtime

・関連記事
Microsoftが文字起こしAI「MAI-Transcribe-2」をリリース、Gemini 3.5 Transcribeより5倍高速&GPT-Transcribeより10倍高速 – GIGAZINE
最大8人の話者を識別しつつリアルタイム文字起こしできるAIモデル「NVIDIA Nemotron 3 Diarization」がオープンモデルとして公開される – GIGAZINE
Apple Watchで周囲の音を聞き取ってAIが分析する「Audio Intelligence」はどうやってプライバシーを保護するのか – GIGAZINE
Metaがリアルタイム文字起こしAI「Muse Voice Transcribe」をリリース – GIGAZINE
「あー」「えー」などを自動削除しつつリアルタイムで文字起こししできる音声認識モデル「Gemini 3.5 Transcribe」をGoogleが発表 – GIGAZINE
「Qwen3.8-Omni-Flash」リリース、Gemini 3.8 Flashに匹敵する音声・映像処理性能を達成 – GIGAZINE