01 / QUICK GUIDE
まず、30秒でつかむ
- 01
SWE-Bench ProMaxは、実在するソフトウェアの大規模な整理・改修をAIへ任せるための、新しい評価用データセットです。
- 02
170件の課題は7言語にまたがり、正解例では平均11.4ファイル、261.6行を変更します。著者らの実験では最良モデルでも解決率41.2%でした。
- 03
これは『AIが仕事の58.8%で必ず失敗する』という意味ではありません。選ばれた課題と二つのエージェント構成内の結果で、実務条件にそのまま置き換えられません。
02 / KEY WORDS
専門用語を、やさしく。
ここだけ押さえれば、残りの本文はスムーズに読めます。
- リファクタリング
- 利用者から見える動きを変えずに、コードの構造を整理する作業です。将来の修正をしやすくし、技術的な借金を減らす目的があります。
- ベンチマーク
- 複数のAIを同じ問題と採点方法で比べる共通テストです。点数は条件つきの比較材料で、あらゆる実務能力を示す成績表ではありません。
- resolve rate
- 用意されたテストなどの判定基準を満たし、課題を解決できた割合です。日本語では『課題解決率』と考えると分かりやすいです。
- agent scaffold
- AIモデルへどの情報を渡し、どの道具を使わせ、どんな順番で作業させるかを決める実行の枠組みです。同じモデルでも結果が変わります。
03 / THE FACTS
何が起きたのか
データセットは、実際のGitHub上の改修履歴から選んだ170件で構成されます。Python、Java、TypeScript、Go、C、C++、Rustの7言語を含み、一つの言語だけに強いAIでは通用しにくい設計です。
正解となる変更は平均11.4ファイル、261.6行に及びます。30%の課題は10ファイルを超え、32%は200行を超えて変更します。代表例には、NASAのF'Primeというソフトウェアで244ファイルを連動して直す課題も含まれます。
単に難しい問題を集めただけではありません。著者らは課題文を書き直し、求める変更を明確にしました。さらに、人間の専門家がテストを確認し、正しい別解を不当に落とす狭すぎるテストや、課題文にない条件まで求める広すぎるテストを除いたと説明しています。
二つのagent scaffoldで複数の先端モデルを評価した結果、最良モデルのresolve rateは41.2%でした。失敗した実行は、正解に必要な数より少ないファイルしか変更できない一方、やり取りの回数を多く消費する傾向がありました。
論文は費用差も例示しています。Claude Sonnet 4.6は一件平均4.77ドルで38.8%、GLM-5は0.24ドルで36.5%でした。ただし価格、API、実行条件は変わり得るため、単純な製品価格表や将来の優劣として読む数字ではありません。
つまり、何が重要なのか
上海交通大学、北京大学、Douyin Groupなどの研究者は、2026年8月10日16時23分19秒UTCにSWE-Bench ProMaxをarXivへ投稿しました。論文はCOLM 2026の会議論文として掲載されたと明記されています。
研究が示したのは、現在のコーディングAIが無力だということではありません。小さな修正では見えにくい『広い変更範囲を読み切り、動作を保ったまま最後まで直す力』には、まだ大きな差があるということです。
04 / THE CONTEXT
なぜ、今これが重要なのか
既存の有名なコード評価では上位モデルの点数が高くなり、差が見えにくくなっています。しかも公開リポジトリ由来の問題は、学習データに正解が混ざる可能性や、採点テスト自体の不備が指摘されています。
一方、実際の会社では、機能を壊さずコードの構造を変える仕事が頻繁に起きます。ファイル同士のつながり、型、ビルド方法、テストを同時に理解しなければならず、一画面のコード生成よりはるかに長い作業です。
AIエージェントが長時間働けるようになった今、評価も一問一答からプロジェクト単位へ変える必要があります。SWE-Bench ProMaxは、見栄えのよい短い成功例と、継続的なソフトウェア開発の間を測ろうとしています。
05 / WHAT IT MEANS FOR YOU
私たちには、何が変わる?
企業の担当者は、広告にある総合ベンチマークだけで導入を決めない方がよいです。自社で多い言語、変更ファイル数、必須テストに合わせた小さな社内評価を作るほうが、実際の任せやすさが分かります。
解決率41.2%は、残りを人が少し直せば済むとも限りません。広い改修で一部のファイルを見落とすと、表面上は動いても後から不具合が出ます。成功・失敗の二択に加え、変更漏れと確認時間も測る必要があります。
また、同じモデルでもagent scaffoldで結果が変わります。モデル名だけを比較するのではなく、どのファイルを探索させ、テストを何回回し、どこで人が承認するかまで含めて評価することが重要です。
07 / NEXT ACTION
今日から、どう動くか
- 01
自社で最近行った中規模の改修を一件選び、AIに課題文だけを渡して、調査したファイルと提案差分を記録する。
- 02
合格条件を、テスト通過、変更漏れ、レビュー時間、追加修正回数の四項目に分け、人の作業と比較する。
- 03
AIへ本番変更を任せる前に、影響範囲の一覧と必須テストを人が承認する停止地点を開発手順へ組み込む。