01 / QUICK GUIDE
まず、30秒でつかむ
- 01
中国科学技術大学は2026年8月17日、表、列、シートの関係をグラフで整理して操作するAIエージェントSheetCompassを、研究原稿の公開サイトarXivで発表しました。
- 02
GPT-5を使った著者評価では、複雑なSpreadsheetBenchの厳しい判定で22.0%となり、比較先SheetAgentの15.1%を6.9ポイント上回りました。
- 03
論文は査読前で、土台に閉鎖型GPTを使っています。本文と表でモデル名やSheetRMの数値が一致しない箇所もあるため、結果は慎重に読む必要があります。
02 / KEY WORDS
専門用語を、やさしく。
ここだけ押さえれば、残りの本文はスムーズに読めます。
- 関係グラフ
- 表、列、シートを点として置き、参照や同じ意味の項目を線で結んだ地図です。AIが離れた場所にある情報のつながりを追いやすくします。
- 表計算エージェント
- 指示を受け、Excelなどの中身を読み、計算式、表、グラフ、書式を変更し、結果を確認するAIです。文章回答だけでなくファイルを操作します。
- pass@1
- 一回目に作った回答やファイルが基準を満たした割合です。複数回試した最高値ではない一方、採点方法や課題の難しさで数字は変わります。
- hard判定
- SpreadsheetBenchで、期待された値や構造へ厳しく一致したかを見る採点です。soft判定より条件が厳しく、22%でも全課題を解ける意味ではありません。
03 / THE FACTS
何が起きたのか
論文は8月17日付のarXiv新着欄に掲載され、正確な掲載時刻は非開示です。v1受付は8月14日16時39分16秒UTC、日本時間15日1時39分16秒で、受付日と公開日が異なります。
SheetCompassは最初に、Excelファイル内の表、列、参照関係を階層的なグラフへ整理します。その後、探索役が場所を探し、実装役が操作を作り、検証役が結果を見直します。短期と長期の二つの記憶も使います。
評価は、表計算操作を測るSheetCopilotBench 221件、複雑なファイルを扱うSpreadsheetBench 912指示・2729テスト、SheetRM 180課題中90課題で行われました。SpreadsheetBenchでは35.7%が一つのシートに複数表を持ち、42.7%が標準的でない配置です。
GPT-5条件では、SheetCopilotBenchのpass@1が71.3%で、比較先SheetAgentの70.0%を1.3ポイント上回りました。SpreadsheetBenchのhard判定は22.0%対15.1%、SheetRMは52.3%対44.8%でした。すべて著者側の測定です。
関係グラフを外すと、SheetCopilotBenchは71.3%から56.4%、SheetRMは52.3%から41.4%へ下がりました。一方、論文本文は小型土台をGPT-4o-miniとし、表ではGPT-4と表記しています。SheetRMも本文43.5%と表42.5%が一致しません。
つまり、何が重要なのか
結論から言うと、SheetCompassはExcelを一枚の長い文章へ平らにせず、表と列の関係を地図として保ちます。その地図を探索役、操作を実装する役、結果を確認する役が共有する設計です。
著者評価では複数の比較で改善しましたが、成績が低い課題もあります。論文内にモデル名と数値の不一致もあり、『Excel作業をほぼ自動化できた』とは言えません。
04 / THE CONTEXT
なぜ、今これが重要なのか
生成AIは文章の要約が得意でも、表計算では離れたセルの参照、複数表、結合セル、独自の見出しを追う必要があります。文章として並べるだけでは構造が消えます。
企業の重要な数字は、担当者が長年更新したExcelにも残っています。売上、在庫、予算が別シートでつながるため、位置と意味の両方を理解するAIが求められます。
またAIへファイル操作を任せる場合、答えが自然かより、正しいセルを変えたかが重要です。探索、実装、検証を分ける設計は、どこで間違えたかを人が確認しやすくする狙いがあります。
05 / WHAT IT MEANS FOR YOU
私たちには、何が変わる?
例えば月次予算で、売上シートの『部門コード』と人件費シートの『部署ID』が同じ意味だと分かれば、AIは二つの表を対応付けて差異を調べられます。関係地図は、この対応を保つために使えます。
SpreadsheetBench hardの22.0%は、約8割で基準を満たさなかったことも示します。改善幅が大きくても、人の確認なしで重要ファイルを上書きできる段階ではありません。
GPT-5の能力を使った結果なので、SheetCompassという仕組みだけの強さとも言い切れません。同じ枠組みを別モデル、別言語、日本独自の帳票へ移したときに、同じ改善が出るかは未確認です。
評価用SheetRMは180課題の半分で、正解を人が構築しています。現場では数式だけでなく、書式、参照切れ、マクロ、個人情報、保存履歴も確認する必要があります。
07 / NEXT ACTION
今日から、どう動くか
- 01
よく使うExcelを一つコピーし、各シートの目的、主な表、共通ID、参照先を人の言葉で一枚に整理する。
- 02
AIへ操作させるときは原本を読み取り専用にし、変更版のセル差分、数式、参照切れを人が確認する。
- 03
一つの定型集計を10回試し、成功率だけでなく間違えたセル、修正時間、再実行時のばらつきを記録する。