毎朝更新
← 今日のニュース2026.08.12 / Fujin編集約7分で読めます

AIが長い仕事を途中で投げ出さない——Grok 4.6は「ひと晩任せる」働き方を変えるか

AIに難しい仕事を頼んだのに、途中で話がずれたり、確認を忘れたりした経験はないでしょうか。Grok 4.6が狙うのは、一問の賢さより、長い仕事に最後まで付き合う力です。

01 / QUICK GUIDE

まず、30秒でつかむ

  • 01

    xAIは2026年8月12日、長時間の調査、コード開発、情報分析、対話型の画面制作を重点的に強化したGrok 4.6を公開しました。

  • 02

    同社評価ではArtificial Analysis Intelligence Indexが61、CursorBench 3.2が69.9%です。Cursor、Grok Build、APIなどで提供を始めました。

  • 03

    ただし評価値にはxAI自身の測定や、各社が公開した数字が含まれます。実務の完了率や誤操作率を第三者が同じ条件で確認した結果ではありません。

02 / KEY WORDS

専門用語を、やさしく。

ここだけ押さえれば、残りの本文はスムーズに読めます。

長時間エージェント
一度答えて終わるのではなく、調査、作成、確認、修正を何段階も続けるAIです。長いほど途中の目的や前提を保つ力が重要になります。
SFT
Supervised Fine-Tuningの略で、日本語では教師あり追加学習です。望ましい回答や作業例を手本として見せ、モデルの振る舞いを整えます。
RL
Reinforcement Learningの略で、日本語では強化学習です。結果への評価を手掛かりに、より良い行動を選べるよう訓練します。
トークン
AIが文章を読み書きするときの細かな処理単位です。文字数と完全には一致せず、API料金は入出力したトークン数を基に計算されます。

03 / THE FACTS

何が起きたのか

xAIは8月12日、Grok 4.5を土台にしたGrok 4.6を公開しました。公式ページには日付だけがあり、公開時刻とタイムゾーンは示されていません。

追加学習では、推論や高度な技術分野のモデル生成データ、質を選別したエンジニアリングデータを使ったと説明しています。その後、SFTとRLを行い、一般的なコード開発だけでなく、計算カーネルの最適化、Web制作、CADと呼ばれる設計作業なども訓練しました。

xAIによると、長い作業ではモデルが自分の成果を試し、確かめてから進む場面が増えました。また、広いアイデアから動く試作品を作り、利用者の指摘を受けながら改善する視覚・対話型の仕事を強化しています。

公開された評価では、九つの試験をまとめたAA Intelligence Indexが61、コード編集を測るCursorBench 3.2が69.9%でした。比較表にはDeepSWE、FrontierCodeなどもありますが、試験ごとに実行環境や採点方法が違うため、一つの順位だけで万能さは判断できません。

提供先はGrok Build、Cursor、xAI APIに加え、OpenRouter、Vercel、Cloudflareです。API価格は100万入力トークン当たり2ドル、100万出力トークン当たり6ドルからで、高速版はその2倍と説明されています。

THE CONCLUSION

つまり、何が重要なのか

結論から言うと、Grok 4.6は『質問に答えるモデル』から『長い仕事を進めるモデル』への更新です。xAIは、複数の手順が必要な調査、知識労働、コードベース全体の作業、アプリ制作を主な用途に挙げています。

注目すべきは、答えの点数だけでなく、自分で試し、結果を確認してから次へ進む振る舞いです。一方、長く動けることと、正しく安全に終えられることは同じではありません。

04 / THE CONTEXT

なぜ、今これが重要なのか

生成AIは短い下書きでは十分に役立つようになりました。しかし実務は、資料を探し、判断し、ファイルを直し、動作を確認する連続作業です。途中で目的を忘れるAIでは、人が何度も引き戻す必要があります。

そこで各社は、単発の知識問題より、実際のパソコンや開発環境で何段階の仕事を完了できるかを競っています。モデルの能力だけでなく、道具の使い方と確認手順を含む『働き方全体』が製品になり始めました。

同時に、長い処理は出力トークンと利用料金を増やします。速さや点数だけでなく、完了までの総額、人が直す時間、失敗後に戻れるかを一緒に見る時期です。

05 / WHAT IT MEANS FOR YOU

私たちには、何が変わる?

利用者にとっては、依頼を細かな一問一答へ分けるだけでなく、『調べて、作って、試して、問題点を報告して』と一連の成果を頼める可能性が広がります。人は作業そのものより、目的と合格条件を決める役へ移ります。

ただしベンチマークは、決められた課題を同じ採点基準で比べる模擬試験です。AA Intelligenceの61やCursorBenchの69.9%は、どの会社のどの仕事でも同じ割合で成功するという意味ではありません。

会社で使うなら、完成物だけでなく作業履歴、参照した情報、実行したテストを残す必要があります。長時間動いた後の誤りは見つけにくいため、途中の確認地点を減らしすぎないことが大切です。

料金も一回の質問だけで比べないほうが安全です。調査の繰り返し、コードの読み直し、失敗した処理まで含め、成果物一件を完成させる総費用で比べる必要があります。

07 / NEXT ACTION

今日から、どう動くか

  1. 01

    途中で目的を見失いやすい実務を一つ選び、依頼文に成果物、確認方法、中止条件まで書いてGrok 4.6で試す。

  2. 02

    同じ課題を現在使っているAIにも実行させ、点数ではなく完了時間、手直し時間、API総額を比べる。

  3. 03

    送信、購入、削除、本番公開の直前には人の承認を置き、AIが行った操作と参照元を記録する。

BOTTOM LINE

Grok 4.6が示すのは、AIの価値が一問の正解から、長い仕事を終える力へ移ったことです。導入判断はベンチマークの順位ではなく、自分の仕事の完了率、修正量、総費用で行うべきです。

今日のAIニュース一覧へ →