01 / QUICK GUIDE
まず、30秒でつかむ
- 01
ByteDance Seedなどの研究チームは、実際に利用実績のあるAIスタートアップ製品の仕事を調べ、医療、金融、法務、経営、理工系、教育の6分野で97件の課題を作りました。
- 02
9モデルを同じエージェント環境で3回ずつ動かし、細かな評価項目の合計が90点以上なら完了と判定しました。最高はGPT-5.6-solの31.27%、Kimi-K3は29.55%です。
- 03
これは世の中の仕事全体でAIが3割しか使えないという意味ではありません。研究用に再構成した難しい課題と厳格な採点条件で、最終成果物まで合格できた割合です。
02 / KEY WORDS
専門用語を、やさしく。
ここだけ押さえれば、残りの本文はスムーズに読めます。
- E2E課題
- End to Endの略で、途中の一作業ではなく、依頼の理解からファイル作成、確認、納品までを一続きで終える課題です。
- エージェント環境
- AIがファイルを読み、道具を使い、複数の手順を進めるための作業場です。同じモデルでも環境の設計で結果が変わります。
- 評価項目
- 成果物の正確さ、抜け漏れ、専門ルール、形式などを一つずつ確認する採点表です。この研究では1課題あたり平均25.3項目あります。
- 厳格完了率
- 100点満点のうち90点以上を取った実行だけを完了と数えた割合です。平均点や途中まで進んだ割合とは別の数字です。
03 / THE FACTS
何が起きたのか
StartupBench論文は8月18日14時01分32秒UTC、同日23時01分32秒JSTにarXiv v1として公開されました。所属はByteDance Seed、南京大学、M-A-P、TokenWave.AIで、査読前です。
研究チームはAIスタートアップの製品を調査し、30人超の深い利用者へ聞き取りを行いました。50人超の分野専門家が150件超の候補を、再現できる作業へ作り直し、品質確認後に97件を残しました。
課題は医療、金融、法務、経営、理工系、教育の6分野です。納品物にはDOCX、XLSX、PPTX、PDF、Markdown、画像が含まれ、単に短い答えを返すテストではありません。
各課題には平均25.3件の評価項目があり、正確さ、構成、情報の統合、専門ルール、実装、見た目を確認します。重要度には5、3、1の重みを付け、合計90点以上だけを成功としました。
9モデルを同じ条件で3回ずつ評価した結果、厳格完了率はGPT-5.6-solが31.27%、Kimi-K3が29.55%でした。平均点はKimi-K3が73.67、GPT-5.6-solが73.61で、平均点と完了率の首位は一致しません。
採点はGPT-5.5を使うAgentJudgeが項目ごとに行いました。著者らの抽出確認では専門家判断との項目一致率92.78%、成功判定の一致率92.84%でしたが、人が全提出物を採点した結果ではありません。
つまり、何が重要なのか
結論から言うと、現在のAIエージェントは実務の大部分を進められても、重要な条件をすべて満たした成果物を安定して納める段階には達していません。
トップモデルの平均点は約74点でしたが、厳格完了は最高31.27%です。この差が示すのは、AIの弱点が「何もできない」から「最後の抜けを自分で見つけ切れない」へ移ったことです。
04 / THE CONTEXT
なぜ、今これが重要なのか
これまでのAI評価は、数学の答えやコードの一部など、正解を短く判定しやすい問題が中心でした。しかし仕事では、計算が合っていても、指定形式、根拠、例外、見た目のどれかが欠ければ納品できません。
AIエージェントがWordやExcel、スライドまで作れるようになり、評価対象も文章の上手さから成果物の使いやすさへ変わっています。見栄えの良いファイルを作れることと、重要条件を守ることを分けて測る必要が出ています。
論文では、一般エージェントの全実行平均の完了率19.74%に対し、分野専用エージェントは39.18%でした。万能モデル一つより、仕事の手順と確認を組み込んだ専用設計がまだ強い場面を示します。
05 / WHAT IT MEANS FOR YOU
私たちには、何が変わる?
会社でAIを導入するときは「使ったか」ではなく「そのまま提出できたか」を測る必要があります。下書き時間が半分になっても、数字や参照先を人が全部直すなら、削減できた仕事は想定より少ないかもしれません。
たとえば月次レポートを任せるなら、文章を出せたかだけで終わらせません。数値が元表と一致する、前月との差を説明する、指定テンプレートを守る、出典を開ける、という合格条件を先に作ります。
31.27%はAI全体の固定能力ではありません。用意された97課題、統一環境、3回実行、90点以上という厳しい条件の数字です。自社の仕事では、自社の合格表で小さく測り直す必要があります。
07 / NEXT ACTION
今日から、どう動くか
- 01
よくある仕事を一つ選び、納品前に必ず満たす条件を10項目以内で書き出す。
- 02
同じ依頼をAIへ3回実行し、平均的な出来だけでなく、毎回変わる失敗も記録する。
- 03
AIには下書きと整形を任せ、数字、根拠、権限、最終提出は人が確認する境界を決める。