01 / QUICK GUIDE
まず、30秒でつかむ
- 01
美団と中国科学院大学の研究者は、7種類の先端AIに36の長時間研究開発課題を各3回解かせ、合計756回の作業過程を分析しました。
- 02
AIは既存の手法を組み合わせて改善する力を示しましたが、252件の最良試行のうち、本当に新しい方法と分類されたのは3件でした。
- 03
これは査読前の論文で、2026年6月から7月10日のモデルと特定の作業環境を使った結果です。現在の万能な順位表として読むものではありません。
02 / KEY WORDS
専門用語を、やさしく。
ここだけ押さえれば、残りの本文はスムーズに読めます。
- 長時間タスク
- 一問一答ではなく、数時間かけて方針を立て、コードを直し、結果を見て再挑戦する仕事です。この研究では1課題あたり2〜12時間の上限がありました。
- harness
- AIへファイル操作やテストなどの道具を渡し、仕事の進め方を支える実行環境です。同じモデルでもharnessが違うと、安定性が変わる場合があります。
- avg@3 / best@3
- 同じ課題を3回試した平均点と、その中の最高点です。最高点が高くても平均が低ければ、たまに成功するだけで再現しにくい可能性があります。
- preprint
- 学術誌などの査読を終える前に公開された研究原稿です。早く読める一方、方法や結論が後から修正される可能性があります。
03 / THE FACTS
何が起きたのか
論文v1は8月13日16時11分22秒UTCに提出され、日本時間14日付のarXiv新着欄へ掲載されました。論文の日付と一般の新着公開日を分けて確認する必要があります。査読済みとは記載されていません。
対象はClaude Opus 4.7、GPT-5.5、Gemini 3.1 Pro、GLM-5.2、Kimi K2.7 Code、DeepSeek V4 Pro、LongCat 2.0の7種類です。36課題を各3回実行したため、主評価は756回になりました。
課題はモデル開発、システム最適化、パズル、CUDAというGPU向け低水準処理の4分野です。研究チームは最終点だけでなく、良い方針を選べたか、動くものを作れたか、悪化後に戻せたかを別々に測りました。
全体ではOpus 4.7がavg@3で0.739、best@3で0.790と首位でした。ただ、最高点と平均点の差から、複数モデルが良い案へ届く一方、毎回同じように成功できるとは限らないことが分かりました。
独創性の確認では、7モデル×36課題の最良試行252件のうち、新しい方法と分類されたのは3件でした。評価にはLLM判定も使われています。研究全体の推論費は約10万ドルとされ、費用推定は公開料金を基にしています。
つまり、何が重要なのか
この研究の結論は、現在のAI研究エージェントは『未知の方法を次々に発明する科学者』より、『既存案を試して改善する技術者』に近い、というものです。
ただしAIが役に立たないという意味ではありません。実装と改善はかなり進められる一方、成功の安定性、経験の使い方、独創性には別々の課題が残ると示しています。
04 / THE CONTEXT
なぜ、今これが重要なのか
AIは一度の回答だけでなく、自分で実験し、結果を読み、次の変更を考えるようになりました。そのため従来の一発勝負のベンチマークでは、実務で頼れるかを十分に見られません。
企業がAIへ研究開発を任せたいと考えるほど、『最高で何点を出したか』より『失敗しても戻れるか』『前の経験を正しく使えるか』が重要になります。たまの成功だけでは工程を任せられないからです。
モデルだけでなくharnessも増えています。研究では、同じAIでも専用harnessを使うと結果のばらつきが小さくなる例があり、能力はモデル名だけで決まらないことが見えてきました。
05 / WHAT IT MEANS FOR YOU
私たちには、何が変わる?
研究者や開発者は、AIへ『良い答えを出して』と任せるだけでなく、途中の仮説、試した変更、測定結果、戻した理由を記録させる必要があります。過程が見えれば、失敗の場所を直せます。
管理職はbest@3のような最高値だけで製品を選ばず、平均、失敗率、再実行時のばらつき、費用も見るべきです。最高点が近くても、安定して出せるモデルと偶然届くモデルでは運用が違います。
経験の蓄積も自動的に良い結果を生みません。研究では、別課題の経験によりDeepSeek V4 Proのavg@3が0.093上がる一方、Gemini 3.1 Proは0.017下がりました。古い教訓が思い込みになる場合があります。
『3件しか発明できなかった』という数字も、AI全体の発明率ではありません。研究者が用意した36課題、評価基準、期間、モデル構成の中で得られた結果です。
07 / NEXT ACTION
今日から、どう動くか
- 01
AIへ一つの改善課題を3回実行させ、最高結果だけでなく平均、失敗回数、費用、作業時間を記録する。
- 02
各試行で仮説、変更内容、テスト結果、採用・撤回の理由を残し、後から人が判断を追える形にする。
- 03
過去の成功例を次の課題へ渡すときは、経験あり・なしの小さな比較を行い、思い込みで性能が下がらないか確かめる。