Microsoft AI は 2026 年 10 月 1 日、音声関連の新モデルを 3 つ同時に公開しました。リアルタイム文字起こし向けの「 MAI-Transcribe-2-Streaming 」、多言語テキスト読み上げ向けの「 MAI-Voice-2.1 」、そして高速処理に特化した「 MAI-Voice-2.1-Flash 」です。いずれも現時点ではプレビュー版の位置づけで、商用利用にはまだ適していません。
MAI-Transcribe-2-Streaming は、話し手の言葉をほぼリアルタイムで文字に変換するモデルです。第三者機関 Artificial Analysis の評価では 38 モデル中 1 位を獲得し、語誤り率 2.5 %・発話終了後わずか 0.13 秒で文字起こし結果を出力します。これまで首位だった xAI の「 Grok Voice Transcribe 2.0 」(語誤り率 2.7 %・応答 0.49 秒)を精度・速度ともに上回りました。 60 言語に対応しており、価格は 1 時間あたり 0.54 ドル(約 81 円)で、この水準は 2026 年末まで続く予定です。
MAI-Voice-2.1 は、テキストを自然な音声に変換する読み上げモデルです。 23 言語・ 26 地域に対応しており、複数言語を使い分けても同じ声のまま、それぞれの言語に自然なアクセントで読み上げられるのが特徴です。 4,000 人を対象にした聴き比べテストでは、回答者の 50.3 %がこのモデルの音声を人間の声と同等か、それ以上に自然だと評価しました。価格は 100 万文字あたり 22 ドル(約 3,300 円)です。
MAI-Voice-2.1-Flash は、大量処理や即時応答が求められる用途に向けて設計されたモデルです。 45 秒分の音声を 150 ミリ秒という短い処理時間で生成でき、処理速度は標準モデルより 55 %速くなっています。価格は 100 万文字あたり 15 ドル(約 2,250 円)で、 Microsoft は「同等モデルと比べて約 60 %安い」としています。
3 つのモデルはいずれも Microsoft Foundry 、 MAI Playground 、 Vercel から利用でき、 MAI-Voice-2.1 と Flash は OpenRouter にも対応しています。 LiveKit との連携も近く追加される予定です。
今回のリリースで注目されているのは、技術的な性能だけではありません。業界では「 Microsoft が OpenAI に依存せず、自社モデルだけで音声認識の首位に立ったことは、自前の AI 基盤の構築を着実に進めている証拠だ」との見方が広がっています。音声を聞き取り、文字に起こし、応答し、音声で返すという一連の流れを、 Microsoft が初めて自社技術だけで完結できるようになったことは、今後のサービス展開にも大きな意味を持ちそうです。
