01 / QUICK GUIDE
まず、30秒でつかむ
- 01
Microsoftは9月3日、60言語に対応する音声認識モデルMAI-Transcribe-2を発表しました。
- 02
話者の区別、単語ごとの時刻、専門語の優先認識、話した通りと読みやすい文章の二つの出力に対応します。
- 03
音声1時間0.10ドルは年末までの限定価格です。公開試験の成績は、自社音声での正確さを保証しません。
02 / KEY WORDS
専門用語を、やさしく。
ここだけ押さえれば、残りの本文はスムーズに読めます。
- 音声認識
- 人の声をコンピューターが文字へ変換する技術です。雑音、アクセント、専門用語、複数人の重なりで難しさが変わります。
- WER
- Word Error Rate、単語誤り率の略です。置き換え、抜け、余分な単語を数え、一般には低いほど文字起こしが正確です。
- 話者分離
- 一つの録音の中で、どの発言を誰が話したかを分けて表示する機能です。名前を自動で正しく特定することとは別です。
- キーワードバイアス
- 商品名、人名、医療用語など、聞き間違えやすい言葉を事前に渡し、候補として優先させる仕組みです。
03 / THE FACTS
何が起きたのか
Microsoft AIは9月3日、MAI-Transcribe-2を発表しました。Microsoft Foundryでは同日からパブリックプレビューを始め、MAI Playgroundでも試せます。OpenRouterは近日提供予定です。
60言語に対応し、言語の自動判定、会話途中で言語が切り替わるコードスイッチ、雑音のある環境も対象にしています。
FLEURSの60言語平均WERは5.2%で1位と発表しました。FLEURSは公開の多言語音声試験で、各社サービスの実務音声をそのまま集めたものではありません。
Artificial AnalysisではWER順位が2位で、精度と待ち時間の両立で上位と説明しています。一つの評価でも、Microsoftがすべての指標で1位というわけではありません。
同評価ではGPT-Transcribeの10倍、Scribe v2の7倍、Gemini 3.5 Transcribeの5倍速いとしています。これは指定されたバッチ処理条件での比較です。
価格は音声1時間当たり0.10ドルです。ただし2026年12月末までの期間限定で、終了後の料金は発表本文に示されていません。
つまり、何が重要なのか
MAI-Transcribe-2は、速さと単価だけでなく、話者分離、単語単位の時刻、専門語への調整を一つのモデルへまとめました。文字起こし後の編集や検索を減らす狙いです。
ただし、見出しの「世界最速・最高精度・最安」はMicrosoftの評価です。日本語の会議や顧客電話で使うなら、公開ベンチマークより自社の聞き間違いを測る必要があります。
04 / THE CONTEXT
なぜ、今これが重要なのか
会議、動画、電話が増え、音声を検索できる文章へ変える需要が広がっています。人が最初から書き起こすより、AIの下書きを直す方が速い場面も増えました。
一方、単語が合っていても、誰の発言か、何分何秒の発言かが分からなければ確認に時間がかかります。後工程まで含む機能が重要になっています。
汎用モデルは専門語を普通の言葉へ置き換えがちです。業界用語や商品名を事前に渡せることが、医療、法務、営業記録などで実用性を左右します。
05 / WHAT IT MEANS FOR YOU
私たちには、何が変わる?
WER 5.2%は、単純に100語のうち必ず5.2語だけ間違うという保証ではありません。言語、録音状態、固有名詞、話者の重なりで誤りは増減します。
医療や法務で使える設計と、誤りなく使える認証は別です。診断名、薬、金額、期限、否定表現は、音声を聞き直して人が確定します。
価格比較ではAPI単価だけでなく、アップロード、保存、話者名の修正、機密情報の管理、人の校正時間まで含めます。安い誤変換は後で高くつきます。
日本語では、同音異義語、社内略語、苗字、数字を重点的に試します。公開データより、自社の過去音声20本ほどを正解付きで比べる方が判断に役立ちます。
07 / NEXT ACTION
今日から、どう動くか
- 01
雑音、複数話者、専門語を含む自社音声を20本選び、正解の文字起こしを用意する。
- 02
WERに加え、人名、数字、否定語、話者、時刻の誤りと、人が直す時間を測る。
- 03
機密音声の保存場所と削除期限を確認し、年末後の料金変更や別サービスへの移行条件を残す。