01 / QUICK GUIDE
まず、30秒でつかむ
- 01
OpenAIは8月13日、GPT-5.6を本番利用する新興企業の事例と、費用・速度・精度を調整する設計方法をまとめたガイドを公開しました。
- 02
GPT-5.6の比較的低価格なLunaやTerra、考える量の調整、過去の思考の再利用、複数エージェント、プログラムによる道具の操作を組み合わせる内容です。
- 03
掲載された改善率は、OpenAI自身のベンチマークか採用企業の自己報告です。自社でも同じ数字になるとは限らず、同じ仕事と評価基準で比較する必要があります。
02 / KEY WORDS
専門用語を、やさしく。
ここだけ押さえれば、残りの本文はスムーズに読めます。
- モデル選択
- 一つのAIを全工程へ使うのではなく、文章抽出、検索、判断、最終確認など仕事の難しさに合わせて、異なる性能や料金のモデルを割り当てることです。
- Responses API
- OpenAIのモデルへ指示を送り、検索や外部ツール利用を含む一連の応答を組み立てる開発者向けの窓口です。長く続くAIエージェントの土台になります。
- プログラム型ツール呼び出し
- AIが検索結果の整理や集計をJavaScriptなどのコードへ任せ、判断に必要な部分だけをモデルへ戻す仕組みです。無駄な入力を減らす狙いがあります。
- プロンプトキャッシュ
- 毎回同じ長い指示や資料を送り直す代わりに、以前処理した共通部分を一定時間再利用する仕組みです。料金と応答時間を抑えやすくなります。
03 / THE FACTS
何が起きたのか
OpenAIは2026年8月13日付で『The builder’s guide to GPT-5.6』を公開しました。公開時刻は示されていません。これはモデルの新規発表ではなく、早期試験から本番利用まで企業を支援した経験をまとめた実装ガイドです。
検索能力を測るBrowseCompでは、GPT-5.5の最高設定が84.36%、総費用33.27ドルだったのに対し、GPT-5.6 Lunaは84.04%、1.33ドルだったとOpenAIは説明しています。点差は小さい一方、これは特定の評価環境での結果です。
導入企業の自己報告も紹介されています。Hyphaは文書抽出の精度をGPT-5.5の98%に保ち、費用を18分の1にしたと説明。Browser Useは難しい106件の操作でLunaが78%を約14ドル、比較対象が80%を約235ドルで完了したとしています。
設計面では、以前の推論を次の応答へ残す機能、長い会話を短くまとめる圧縮、複数AIの並列分担、コードによるツール操作を組み合わせます。ARC-AGI-3という未知の課題への適応を測る評価では、Solが標準構成の13.3%から38.3%へ上がり、出力トークンは約6分の1になったとOpenAIは報告しました。
プロンプトキャッシュの最低保持時間は30分へ延びました。Ployは2万9,000トークンの共通指示に区切りと専用キーを加え、キャッシュされない入力を28%減らしたと述べています。いずれも事例企業の環境に基づく数字です。
つまり、何が重要なのか
結論から言うと、このガイドの主役はGPT-5.6そのものではなく、AIの使い分けです。安いモデルで十分な工程と、高い判断力が必要な工程を分けることで、全体の費用対効果を高めます。
ただし、掲載事例は成功例を選んだ企業資料です。ベンチマークの点数や費用を、異なる業務へそのまま当てはめず、自社の正答率、修正時間、処理費用で確かめる必要があります。
04 / THE CONTEXT
なぜ、今これが重要なのか
AIエージェントは、一度答えて終わるチャットより多くの処理を行います。検索し、資料を読み、道具を動かし、結果を確認するため、少しの単価差が大量処理では大きな費用差になります。
モデルの種類も増えました。最も高性能なSolだけでなく、価格や速度を重視するTerraとLunaがあり、同じ仕事でも推論量を変えられます。選択肢が増えた分、設計と測定が重要になっています。
さらに、モデルの賢さだけでなく実行基盤が成績を左右します。同じモデルでも、過去の思考を引き継ぐか、不要な検索結果をコードで除くかによって、精度、速度、料金が変わるからです。
05 / WHAT IT MEANS FOR YOU
私たちには、何が変わる?
非技術職の人は、モデル名を暗記する必要はありません。自分の仕事を『情報を抜く』『候補を探す』『判断する』『最終確認する』へ分け、どこで間違うと困るかを決めることが第一歩です。
開発チームは、正答率だけでなく一件当たり費用、待ち時間、人が直した量を同時に測る必要があります。安いモデルが少し間違えても修正が簡単なら得ですが、誤りが契約や送金へ直結する工程では高くつきます。
複数AIを使う場合も、数を増やせば自動的に安全になるわけではありません。役割、共有する情報、停止条件、最後に承認する人を決めなければ、処理回数と費用だけが増える可能性があります。
公開数字には留保があります。OpenAIの評価は同社の実行環境、企業事例は各社の選んだ仕事と基準に依存します。独立機関が同じ条件で全モデルを比較した結果ではありません。
07 / NEXT ACTION
今日から、どう動くか
- 01
繰り返し業務を一つ選び、抽出、検索、判断、承認の工程へ分けて、失敗時の影響を書く。
- 02
同じ20件を小型モデルと高性能モデルで試し、正答率、費用、待ち時間、人の修正時間を比べる。
- 03
本番化する前に、予算上限、処理の停止条件、最終承認者、モデル更新後の再試験日を決める。