毎朝更新
← 今日のニュース2026.08.14 / Fujin編集約8分で読めます

AI研究員は、まだ「発明家」ではない——756回の実験で見えた本当の得意・不得意

AIに研究を任せ、高い点数が出た。これだけで『AIが発明した』と言えるでしょうか。美団などの研究は、完成点だけを見ると隠れてしまう、方針選び、実装、失敗からの回復を756回の試行から分けて調べました。

01 / QUICK GUIDE

まず、30秒でつかむ

  • 01

    美団と中国科学院大学の研究者は、7種類の先端AIに36の長時間研究開発課題を各3回解かせ、合計756回の作業過程を分析しました。

  • 02

    AIは既存の手法を組み合わせて改善する力を示しましたが、252件の最良試行のうち、本当に新しい方法と分類されたのは3件でした。

  • 03

    これは査読前の論文で、2026年6月から7月10日のモデルと特定の作業環境を使った結果です。現在の万能な順位表として読むものではありません。

02 / KEY WORDS

専門用語を、やさしく。

ここだけ押さえれば、残りの本文はスムーズに読めます。

長時間タスク
一問一答ではなく、数時間かけて方針を立て、コードを直し、結果を見て再挑戦する仕事です。この研究では1課題あたり2〜12時間の上限がありました。
harness
AIへファイル操作やテストなどの道具を渡し、仕事の進め方を支える実行環境です。同じモデルでもharnessが違うと、安定性が変わる場合があります。
avg@3 / best@3
同じ課題を3回試した平均点と、その中の最高点です。最高点が高くても平均が低ければ、たまに成功するだけで再現しにくい可能性があります。
preprint
学術誌などの査読を終える前に公開された研究原稿です。早く読める一方、方法や結論が後から修正される可能性があります。

03 / THE FACTS

何が起きたのか

論文v1は8月13日16時11分22秒UTCに提出され、日本時間14日付のarXiv新着欄へ掲載されました。論文の日付と一般の新着公開日を分けて確認する必要があります。査読済みとは記載されていません。

対象はClaude Opus 4.7、GPT-5.5、Gemini 3.1 Pro、GLM-5.2、Kimi K2.7 Code、DeepSeek V4 Pro、LongCat 2.0の7種類です。36課題を各3回実行したため、主評価は756回になりました。

課題はモデル開発、システム最適化、パズル、CUDAというGPU向け低水準処理の4分野です。研究チームは最終点だけでなく、良い方針を選べたか、動くものを作れたか、悪化後に戻せたかを別々に測りました。

全体ではOpus 4.7がavg@3で0.739、best@3で0.790と首位でした。ただ、最高点と平均点の差から、複数モデルが良い案へ届く一方、毎回同じように成功できるとは限らないことが分かりました。

独創性の確認では、7モデル×36課題の最良試行252件のうち、新しい方法と分類されたのは3件でした。評価にはLLM判定も使われています。研究全体の推論費は約10万ドルとされ、費用推定は公開料金を基にしています。

THE CONCLUSION

つまり、何が重要なのか

この研究の結論は、現在のAI研究エージェントは『未知の方法を次々に発明する科学者』より、『既存案を試して改善する技術者』に近い、というものです。

ただしAIが役に立たないという意味ではありません。実装と改善はかなり進められる一方、成功の安定性、経験の使い方、独創性には別々の課題が残ると示しています。

04 / THE CONTEXT

なぜ、今これが重要なのか

AIは一度の回答だけでなく、自分で実験し、結果を読み、次の変更を考えるようになりました。そのため従来の一発勝負のベンチマークでは、実務で頼れるかを十分に見られません。

企業がAIへ研究開発を任せたいと考えるほど、『最高で何点を出したか』より『失敗しても戻れるか』『前の経験を正しく使えるか』が重要になります。たまの成功だけでは工程を任せられないからです。

モデルだけでなくharnessも増えています。研究では、同じAIでも専用harnessを使うと結果のばらつきが小さくなる例があり、能力はモデル名だけで決まらないことが見えてきました。

05 / WHAT IT MEANS FOR YOU

私たちには、何が変わる?

研究者や開発者は、AIへ『良い答えを出して』と任せるだけでなく、途中の仮説、試した変更、測定結果、戻した理由を記録させる必要があります。過程が見えれば、失敗の場所を直せます。

管理職はbest@3のような最高値だけで製品を選ばず、平均、失敗率、再実行時のばらつき、費用も見るべきです。最高点が近くても、安定して出せるモデルと偶然届くモデルでは運用が違います。

経験の蓄積も自動的に良い結果を生みません。研究では、別課題の経験によりDeepSeek V4 Proのavg@3が0.093上がる一方、Gemini 3.1 Proは0.017下がりました。古い教訓が思い込みになる場合があります。

『3件しか発明できなかった』という数字も、AI全体の発明率ではありません。研究者が用意した36課題、評価基準、期間、モデル構成の中で得られた結果です。

07 / NEXT ACTION

今日から、どう動くか

  1. 01

    AIへ一つの改善課題を3回実行させ、最高結果だけでなく平均、失敗回数、費用、作業時間を記録する。

  2. 02

    各試行で仮説、変更内容、テスト結果、採用・撤回の理由を残し、後から人が判断を追える形にする。

  3. 03

    過去の成功例を次の課題へ渡すときは、経験あり・なしの小さな比較を行い、思い込みで性能が下がらないか確かめる。

BOTTOM LINE

AI研究エージェントの現在地は、勝手に大発明する存在ではなく、既存の選択肢を高速に試す改善者です。実務では最高点より、安定性と過程の記録が価値を決めます。

今日のAIニュース一覧へ →