毎朝更新
← 今日のニュース2026.09.04 / Fujin編集7分で読めます

「声をまねるAI」から「声を設計するAI」へ——ByteDanceのTTSonicが分けた3つの要素

音声AIは、文章を上手に読むだけの道具ではなくなりつつあります。次の焦点は「何を話すか」と「誰のような声で、どう話すか」を分けて選べることです。

01 / QUICK GUIDE

まず、30秒でつかむ

  • 01

    ByteDanceは9月4日、音声生成モデルTTSonicの仕組みと試聴デモを公式GitHubで公開しました。

  • 02

    話す内容と抑揚、話者の声色を分け、一つの仕組みで声の複製や話し方の移し替えなど6機能を扱います。

  • 03

    公開されたのは技術説明とデモです。モデルやAPI(外部ソフトから使う接続口)の一般提供、価格、詳しい比較結果はまだ確認できません。

02 / KEY WORDS

専門用語を、やさしく。

ここだけ押さえれば、残りの本文はスムーズに読めます。

TTS(音声合成)
Text to Speechの略で、入力した文章を人が話しているような音声へ変換する技術です。読み上げ、動画のナレーション、音声案内などに使われます。
ゼロショット音声合成
新しい話者ごとに長時間の追加学習をせず、短い参照音声などを手がかりに、その声に近い音声を作る方法です。
韻律(プロソディ)
声の高さ、速さ、強弱、間の取り方といった「話し方」のまとまりです。同じ文章でも、韻律が違えば感情や伝わり方が変わります。
声色(ティンバー)
同じ高さと大きさでも誰の声かを聞き分けられる、声そのものの質感です。TTSonicは話し方とは別の条件として扱います。

03 / THE FACTS

何が起きたのか

ByteDance公式GitHub組織は9月4日、TTSonicの技術デモページを公開しました。最初のページ追加は15時20分57秒JSTで、同日23時42分30秒JSTまでに音声の再構成例も加えています。

公式ページが掲げる機能は6つです。新しい話者ごとに追加学習をせず音声を作るゼロショット音声合成、参照音声からの声の複製、指示を加えた複製、話し方だけの複製、別の声への変換、文章で説明した声の設計です。

内部は大きく3段階です。まず音声をAIが扱える記号へ変え、次に文章から発音や間、抑揚の流れを計画し、最後にその計画と指定した声色から耳で聞ける音声を作ります。

ここで重要なのが、話した内容や抑揚の情報と、話者の声色をできるだけ分ける考え方です。料理にたとえるなら、台本が材料、話し方が味付け、声色が器で、それぞれを選び直せる設計です。

説明では、音声認識の正解を手がかりにした学習、AIの出力を評価して改善する強化学習、段階的な話し方の計画も使います。基盤部分は0.5B、つまり約5億個のパラメーターを持つ規模です。パラメーターとは、AIが学習で調整する内部の数値で、数が多ければ必ず音質がよいという意味ではありません。

ただし、公開ページには比較表や評価データの詳しい条件がありません。論文本文、モデル重み(学習済みの能力を数値で保存したデータ)、学習コード、API(外部ソフトから機能を呼び出す接続口)、価格、一般提供日も確認できず、現段階は仕組みと音の例を見せる技術デモです。

THE CONCLUSION

つまり、何が重要なのか

TTSonicのポイントは、声を一つの塊としてコピーするのではなく、文章の意味と話し方を計画する部分、話者らしい声色を決める部分、実際の音声にする部分を分けたことです。

この設計なら、ある人の声色へ別の話し方を合わせるなど、複数の機能を一つの枠組みで組み立てられます。ただし、実用サービスが完成したという発表ではありません。

04 / THE CONTEXT

なぜ、今これが重要なのか

音声制作では、自然に読めるだけでは足りません。広告なら明るさ、研修なら聞き取りやすさ、物語なら登場人物らしさが必要で、修正のたびに人が録り直すと時間がかかります。

従来の声の複製は、話者の特徴と参照音声の感情が一緒に移りやすい問題があります。声色と話し方を別々に指定できれば、同じ声で落ち着いた案内と元気な告知を作り分けやすくなります。

一方、声を細かく操作できるほど、本人が話していない内容を本人らしく聞かせる危険も増えます。品質の進歩と、同意、表示、保存、削除の運用は同じ速度で考える必要があります。

TTSonicは、この可能性を一つの構成で示した研究デモです。使える製品の比較ではなく、音声AIがどの要素を分離し、組み合わせようとしているかを見る資料として読むのが適切です。

05 / WHAT IT MEANS FOR YOU

私たちには、何が変わる?

動画や講座を作る人にとって、この設計は一本の音声を生成して終わるのではなく、声色、速さ、感情、間を別々に直す制作方法を考える材料になります。修正指示も具体的にできます。

たとえば「もっと自然に」では確認基準が曖昧です。「語尾を急がない」「製品名の前に短い間を置く」「声色は変えない」のように分ければ、人とAIで同じ完成像を共有しやすくなります。

企業が音声AIを試すなら、音質だけで選ばないことです。対象言語、固有名詞の読み、長文での安定性、再生成しても声が変わらないか、修正にかかる人の時間を同じ台本で比べます。

声の複製では、使ってよい人物と用途を先に決めます。本人の書面同意、利用期間、公開先、元音声と生成物の保存場所、削除方法まで残せなければ、便利でも本番へ出さない判断が必要です。

07 / NEXT ACTION

今日から、どう動くか

  1. 01

    30秒の台本を一つ選び、文章の内容、間や速さ、声色の3列に分けて、理想の読み方を書き出す。

  2. 02

    利用中の音声AIがあるなら、同じ台本を3回生成し、読み間違い、声の揺れ、修正時間を記録する。

  3. 03

    声を複製する前に、本人の同意、利用目的、公開期間、保存先、削除方法を確認するチェック表を作る。

BOTTOM LINE

TTSonicは、内容、話し方、声色を分けて編集する音声AIの可能性を示しましたが、現時点では一般向けサービスではなく技術デモです。

今日のAIニュース一覧へ →