毎朝更新
← 今日のニュース2026.08.20 / Fujin編集約8分で読めます

AIは、自分を賢くする方法まで発明できるのか——最良でも「残る差は8割超」

AIに研究を任せれば、次のAIを生む方法まで自動で進歩する——そんな未来を測るには、設定を変えたことと、学び方を発明したことを分けなければなりません。

01 / QUICK GUIDE

まず、30秒でつかむ

  • 01

    研究チームは、AIが機械学習の訓練方法そのものを改善できるかを測る「AI4AI-Bench」を公開しました。10種類の研究課題を、途中で変わらない状態に固定して比べます。

  • 02

    6システム29構成の平均点は0.166、最良は0.250でした。この尺度の0.1が元の手法、1.0が課題上の最適値です。一般的な知能を100点満点で測った数字ではありません。

  • 03

    多くの提出は、学び方を変えず設定や周辺部分を調整しました。学習法へ踏み込んだ少数の提出は高得点でしたが、結果は査読前の著者実験です。

02 / KEY WORDS

専門用語を、やさしく。

ここだけ押さえれば、残りの本文はスムーズに読めます。

訓練アルゴリズム
AIがデータから何を手がかりに、どう間違いを直すかを決める学習の手順です。料理でいえば、火加減ではなく調理法そのものに当たります。
再帰的自己改善
AIがAIを作る工程を改善し、その成果を次のAI開発にも受け継ぐ考え方です。今回の評価は、その入口となる訓練方法の設計力を測ります。
共通尺度
単位の違う10課題を比べるための物差しです。各課題で0は役に立たないモデル、0.1は元の手法、1.0はその課題の最適値に置かれました。

03 / THE FACTS

何が起きたのか

論文初版は8月20日17時56分59秒UTC、同21日2時56分59秒JSTにarXivへ投稿されました。8月21日分の新着一覧に載った、査読前の研究報告です。

評価には、10種類の訓練アルゴリズムを扱う10の研究リポジトリが使われました。課題は評価中に更新せず、AIが偶然新しい答えを見つけにくいよう固定されています。

各AIにはNVIDIA B300のGPUを1基与え、4時間で訓練コードを書き換えさせました。そのコードを最初から最長12時間動かし、AIには見えない評価方法で採点しました。

6システム29構成を全10課題で試した平均は0.166、最良は0.250でした。0.1が各リポジトリに元からある手法なので、平均でも改善は確認されています。

ただし0.250は『AI能力が25%』という意味ではありません。10課題をそろえるため著者らが作った物差しで、1.0は各課題上の最適値です。

学習方法を実際に変えた少数の提出は平均0.226、それ以外は0.126でした。深く考える設定を増やすと、学習法へ踏み込む割合が8%から64%へ増え、平均も0.094から0.196へ上がりました。

THE CONCLUSION

つまり、何が重要なのか

AIは、与えられた研究コードを直して得点を上げました。しかし最良でも0.250で、著者らの換算では元の手法から最適までの差の5分の1未満しか埋めていません。

大事なのは、AIが改善したかどうかだけではありません。設定調整で伸びたのか、次の学習にも使える新しい方法を作ったのかを分けて測る必要があります。

04 / THE CONTEXT

なぜ、今これが重要なのか

AIがコードを読み、実験し、修正する能力は急速に上がっています。そこで次の焦点は、研究者の作業を助けるだけでなく、AI開発の方法自体を生み出せるかへ移っています。

従来の評価では、データを増やしたり細かな設定を探したりするだけでも点が上がります。それでは、同じ改善を次の世代へ引き継げる『発明』なのか判別できません。

今回のベンチマークは、設定変更と学習方法の変更を切り分けようとしました。自己改善という大きな言葉を、4時間のコード変更と再実行という具体的な仕事へ落とした点が重要です。

一方で、10課題とB300 1基という条件は研究世界の一部です。得点が低いから自己改善が不可能とも、高いから人の研究者が不要とも結論できません。

05 / WHAT IT MEANS FOR YOU

私たちには、何が変わる?

仕事でAIに改善案を出させるときも、成果と改善の種類を分けるべきです。たとえば広告文の成績が上がっても、題材を変えただけか、再利用できる作り方を見つけたかは別です。

AIへ『もっと良くして』と頼むだけでは、目先の数字に合わせた調整へ寄りやすくなります。変えてよい範囲、評価データ、再実行の条件を固定すると、改善の中身を比べやすくなります。

0.166や0.250は派手な性能競争の順位ではなく、研究設計の物差しです。自社導入でも、平均値だけでなく、どの工程を変え、その変更が別案件でも効くかを記録する必要があります。

07 / NEXT ACTION

今日から、どう動くか

  1. 01

    AIに改善させたい仕事を一つ選び、変えてよい部分と固定する評価データを先に書く。

  2. 02

    変更前後を同じ条件で3回以上試し、平均だけでなく失敗したケースも保存する。

  3. 03

    単発の設定変更と、別案件にも使える手順変更を分けて改善記録へ残す。

BOTTOM LINE

AIによるAI開発は始まっていますが、現在の壁は点数を上げることより、目先の調整を次世代へ残せる学習法の発明へ変えることです。

今日のAIニュース一覧へ →