01 / QUICK GUIDE
まず、30秒でつかむ
- 01
NVIDIAは2026年8月11日、30BパラメータのNemotron 3.5 Lightningと、複数AIを自動で使い分けるNeMo Switchyardを発表しました。
- 02
NVIDIAはLightningが同クラスのオープンモデルより最大4倍速く文章を出し、エージェントの仕事を30%速く完了したと説明しています。
- 03
Switchyardは費用を約3分の1へ抑えながら高い完了水準を保ったとしていますが、自社評価です。仕事、機器、比較相手が変われば結果も変わります。
02 / KEY WORDS
専門用語を、やさしく。
ここだけ押さえれば、残りの本文はスムーズに読めます。
- 30Bパラメータ
- Bはbillion、つまり10億を表します。30Bは約300億個の調整値を持つモデルという意味で、ファイル容量や必要メモリーにも関わります。
- MoE
- Mixture of Expertsの略で、複数の専門部分から入力に必要な一部だけを動かす設計です。モデル全体が大きくても計算を抑えやすくなります。
- モデルルーティング
- 質問や作業の内容を見て、速いモデル、得意なモデル、低価格なモデルなど、送り先を自動で選ぶ仕組みです。
- オープンモデル
- 重みなどが公開され、利用者が自分の環境で動かしたり追加学習したりできるモデルです。公開範囲と利用条件はライセンスごとに異なります。
03 / THE FACTS
何が起きたのか
NVIDIAは8月11日、Nemotron 3.5 Lightningを公開しました。主な発表記事は日付のみですが、別のNVIDIA公式更新欄には同日6時PTの項目として掲載されています。
Lightningは300億パラメータのMoEモデルです。大きなAIが計画を立て、Lightningのような軽い専門モデルがコード確認、ツール操作、警告の監視などを大量に処理する使い方を想定しています。
同社は、同クラスのモデルと比べて出力速度が最大4倍、エージェント課題の完了が30%速いと説明しました。自社データで追加学習でき、PC、ワークステーション、データセンター、クラウドなどで動かせます。
同時に公開したNeMo Switchyardは、各作業を精度、速度、費用に合うモデルへ送るオープンソースのライブラリです。利用企業は自社の優先順位に合わせて振り分け方を変更できます。
NVIDIAの内部評価では、Switchyardが高性能モデルだけを使う場合に近い課題完了水準を保ち、Claude Opus 4.8単独と比べて完了費用を約3分の1にしたとされています。
つまり、何が重要なのか
今回のポイントは、NVIDIAが新モデルだけでなく「どのモデルへ仕事を渡すか」という交通整理まで製品化したことです。Lightningは専門作業を高速に回し、Switchyardは難易度や費用に応じて送り先を変えます。
AIエージェントが長時間働くほど、一回の回答の賢さだけでなく、待ち時間と利用料金が積み上がります。複数モデルをチームとして組む発想は、実運用のコストを考えるうえで重要です。
04 / THE CONTEXT
なぜ、今これが重要なのか
AIエージェントは、一つの依頼で何十回もモデルを呼び出すことがあります。調査、計画、実行、確認のすべてに高価なモデルを使うと、小さな業務でも料金と待ち時間が膨らみます。
一方、簡単な分類と難しい判断では必要な能力が違います。受付は軽いモデル、重要な判断は高性能モデルという分業ができれば、全体の品質を保ちながら無駄を減らせます。
企業は機密データをクラウドへ送りたくない場合もあります。小さめのオープンモデルを社内やPCで動かし、必要な場面だけ外部モデルへつなぐ設計への需要が高まっています。
05 / WHAT IT MEANS FOR YOU
私たちには、何が変わる?
初心者は「一番賢いモデルを選べば終わり」と考えがちですが、実際のシステムではモデル選びそのものが仕事になります。Switchyardは、その振り分けを自動化する交換台のような存在です。
開発者にとっては、モデルを差し替えるたびにアプリ全体を書き直さず、ルーターの設定を変えて試せる利点があります。費用上限や応答時間を条件に加えることもできます。
ただし、安いモデルへ送れば必ず得をするわけではありません。NVIDIAが紹介したLangChainの評価では費用が74%下がる一方、精度が6%下がった例もあり、明確な交換条件があります。
最大4倍、30%高速、約3分の1という数字はNVIDIAが選んだ条件での結果です。自社の文書、端末、混雑状況、モデル構成でも同じになる保証はありません。
07 / NEXT ACTION
今日から、どう動くか
- 01
AIに任せる作業を、定型処理、専門作業、最終判断の三段階に分け、必要な精度と許容時間を書く。
- 02
代表的な自社タスクを同じ条件で複数モデルへ実行し、料金、完了時間、正答、手直しを一緒に測る。
- 03
誤りの影響が大きい処理は高性能モデルと人へ送り、軽いモデルから自動送信や削除を直接行わせない。