01 / QUICK GUIDE
まず、30秒でつかむ
- 01
China Mobileの研究チームは、社内文書を参照するAIを、不要資料、情報不足、資料同士の矛盾がある状況で試すEnterpriseRAGを発表しました。
- 02
983件、6分野、13モデルの評価で、最良モデルは個別条件を83.8%満たしましたが、全条件を同時に守った回答は26.8%でした。いずれも著者の報告です。
- 03
論文は査読前です。元の社内ログは公開されず、匿名化した評価データと仕組みも『公開時に提供予定』で、現時点では第三者が全面再現できません。
02 / KEY WORDS
専門用語を、やさしく。
ここだけ押さえれば、残りの本文はスムーズに読めます。
- RAG
- Retrieval-Augmented Generationの略で、社内文書などを検索してから、その内容を根拠にAIが答える仕組みです。
- 検索ノイズ
- 質問と少し関係はあるものの、答えには不要な資料が検索結果へ混ざることです。実際の社内検索では頻繁に起こります。
- Loose IAS
- 指示を一項目ずつ採点し、守れた割合を見る指標です。十個中八個を守れば高得点でも、重要な二個を落とす可能性があります。
- Strict IAS
- 指定された条件をすべて守った回答だけを合格にする厳しい指標です。一つでも落とすと、その回答は不合格になります。
03 / THE FACTS
何が起きたのか
研究チームは、実運用の問い合わせ491件を基に983の評価例を作りました。対象はエネルギー、医療、法律、金融、組織運営、ウェブ検索の6分野です。個人情報は除去したとしています。
現実の検索を再現するため、関係の薄い文書が混ざる検索ノイズ、答えに必要な情報がない知識不足、資料同士が食い違う事実矛盾の三つを用意しました。
13モデルを試すと、最良モデルは個別条件の83.8%を守った一方、全条件合格は26.8%でした。差は57ポイントで、書式より、引用、不足の申告、矛盾の扱いで失敗が多く出ました。
答えられない質問を拒む正確さは最高42.7%、矛盾を見つける率は最高44.3%でした。どちらも半数未満で、モデルが親切に答えようとして推測する弱点が表れています。
評価には規則判定とKimi-k2-thinkingによるAI採点を併用しました。150件の人手確認では88%一致しましたが、AI採点の偏りは残ります。評価データは論文公開時に出す予定とされています。
つまり、何が重要なのか
EnterpriseRAGが示したのは、AIが一項目ずつ指示を理解できても、複数条件を一つの回答で守り切るのは難しいという結果です。最高値はLoose IAS 83.8%、Strict IAS 26.8%でした。
これは『RAGは使えない』という結論ではありません。平均的な正しさだけで公開せず、情報不足や矛盾を含む自社の失敗条件を、合否方式で試す必要があるという警告です。
04 / THE CONTEXT
なぜ、今これが重要なのか
会社のAIは、文章を自然に書くだけでは足りません。指定書式、根拠、守秘、足りない情報の扱いなど、複数の業務ルールを同時に守る必要があります。
ところが一般的な試験は、きれいな資料と一つの質問を使うことが多く、古い文書や矛盾した報告書が混ざる現場との差が見えにくい状態でした。
AIエージェントが回答だけでなく更新や承認まで進める今、一つの条件漏れが事故へつながります。平均80点より、必須条件をすべて通した割合が重要になっています。
05 / WHAT IT MEANS FOR YOU
私たちには、何が変わる?
社内検索AIへ『出典を付けて』と書くだけでは不十分です。情報がない場合、矛盾した場合、古い資料しかない場合の返し方を、別々のテストとして用意する必要があります。
Strict IAS 26.8%は、世の中の社内AIすべての成功率ではありません。特定の983件と13モデルで、研究チームが定めた全条件を満たした割合です。
データは文章だけで、PDF内の図表や画像は対象外です。また全条件合格は厳しい二値判定なので、軽微な書式違反と重大な根拠不足を同じ不合格として数える限界があります。
それでも、答えの見栄えより『分からないと言えるか』を測った点は実務的です。自動化範囲を広げる前に、拒否と矛盾報告を合格条件へ入れるべきです。
07 / NEXT ACTION
今日から、どう動くか
- 01
情報不足、古い資料、矛盾した資料を含む社内テストを各10件作り、拒否と出典を確認する。
- 02
平均点に加えて、必須条件をすべて満たした回答率と、重大条件を落とした件数を記録する。
- 03
AIの回答後に、出典、禁止事項、矛盾の申告を機械的に検査し、失敗時は人へ戻す。