毎朝更新
← 今日のニュース2026.08.13 / Fujin編集約7分で読めます

AIを2体にすれば安心、とは限らない——同じモデルが90%で共倒れした実験

一人の確認では不安だから、もう一人にも見てもらう。人の仕事では有効な方法です。ところがAIでは、同じモデルを二つ並べると、同じ思い込みを共有して一緒に間違えることがあります。新しい研究は、その共倒れを数字で測りました。

01 / QUICK GUIDE

まず、30秒でつかむ

  • 01

    研究者らは、2体のAIが仕事を受け渡す構成を、事前に決めた方法で1万8,000件評価しました。採点はAIではなく、正解が決まるプログラムで行いました。

  • 02

    同じモデルを2体に使うと、どちらかが失敗した2,418件のうち2,177件、90.0%で両方が失敗しました。独立した二重確認とは言いにくい結果です。

  • 03

    ただし未査読のプレプリントで、対象は小売・金融の合成任務と中規模の公開モデルです。最先端モデル、文章作成、医療などでも90%になるとは示していません。

02 / KEY WORDS

専門用語を、やさしく。

ここだけ押さえれば、残りの本文はスムーズに読めます。

相関した失敗
二つのAIの失敗が別々に起きるのではなく、同じ問題で一緒に起きやすい状態です。同じ学習元や仕組みを持つモデルは、似た弱点を共有する可能性があります。
独立性の仮定
一つのAIが失敗しても、もう一つの失敗確率には影響しないと考える前提です。二つの信頼度を単純に掛け合わせる計算は、この前提に依存します。
事前登録
結果を見る前に、仮説、件数、評価方法、失敗とみなす条件を記録しておく研究手続きです。都合の良い分析だけを後から選ぶ危険を減らします。
プレプリント
専門家による査読を終える前に公開された研究論文です。早く読める一方、方法や結論が今後の検証で修正される可能性があります。

03 / THE FACTS

何が起きたのか

インドの独立研究者らは2026年8月13日07時25分05秒UTC、論文の初版をarXivへ提出しました。査読済みの採択先は記載されていません。主実験は結果を見る前に方法を登録し、2体が順番に処理する1万8,000件を評価しました。

約240億個の調整値を持つ中規模モデル、Mistral Small 24Bの2体では、1体目の失敗率が39.4%、2体目が37.2%でした。失敗が独立なら両方の失敗は14.6%程度と見込まれますが、実測は36.3%でした。

どちらか一方でも失敗した任務は2,418件で、そのうち両方が失敗したのは2,177件、90.0%です。ここでの90%は全任務の失敗率ではなく、『少なくとも一方が失敗した任務の中で共倒れした割合』です。

片方を異なるモデルへ替えると、三つの構成で計6回行った比較のすべてで失敗の結びつきが弱まりました。一方、モデルがすでに異なる状態で提供会社まで替えても差は確認できず、著者らは事前仮説を支持しない結果として報告しています。

実験全体は3万820件ですが、事前登録された主分析は1万8,000件です。小売と金融の六つの合成タスクを、正解ルールを持つコードで採点し、AI審査員は使っていません。コードと分析手順も公開されています。

THE CONCLUSION

つまり、何が重要なのか

結論から言うと、『AIを2体にしたから安全性も2倍』とは考えられません。同じモデルを使う2体は同じ問題で失敗しやすく、見かけの二重確認が一つの確認に近づく場合があります。

研究が示したのは、AIの数より失敗の違いを測る重要性です。ただし90.0%は特定のモデルと任務での数字であり、あらゆる複数AIへ一般化できる値ではありません。

04 / THE CONTEXT

なぜ、今これが重要なのか

複数のAIを役割分担させる仕組みが、調査、開発、顧客対応へ広がっています。作成役の回答を確認役が読む設計は分かりやすい一方、両方へ同じモデルを使う例も少なくありません。

従来は、各AIの正答率を測り、それらが別々に失敗すると仮定して全体の信頼度を計算することがありました。しかし同じ学習や設計を持つモデルは、同じ見落としをする可能性があります。

AIが送金、審査、契約などへ近づくほど、一度の共倒れの影響は大きくなります。平均点だけではなく、『どの入力で一緒に間違えたか』を記録する必要性が高まっています。

05 / WHAT IT MEANS FOR YOU

私たちには、何が変わる?

利用者は、AIの回答を別の会話へ貼り付けて同じモデルへ確認させても、独立した意見とは限らないと理解する必要があります。表現が違っても、根本の弱点が同じ場合があります。

企業は、確認役を増やす前に、違うモデル、決められた規則で判定するプログラム、データベース照合、人の承認を組み合わせるべきです。大切なのは人数ではなく確認方法の違いです。

研究の範囲にも注意が必要です。対象は中規模の公開モデルで、最先端モデルは未検証です。小売と金融の正解が決まる合成任務に限られ、自由作文や医療判断で同じ大きさの相関が出るかは分かりません。

また、異なるモデルへの交換はモデルの能力差も同時に変えています。『違う学習のため失敗が分散した』のか、『単に性能が違った』のかを完全には分けられていないと著者らも認めています。

07 / NEXT ACTION

今日から、どう動くか

  1. 01

    同じ20件を作成役と確認役へ通し、両方が誤ったケースと原因を一覧にする。

  2. 02

    金額、日付、禁止事項などは別AIだけに任せず、計算コードや原文照合を確認工程へ加える。

  3. 03

    重大な処理には人の承認と停止条件を置き、モデル更新後に共倒れ試験をやり直す。

BOTTOM LINE

AIの二重確認を強くするのは、AIの数ではありません。違う失敗の仕方を持つ確認手段を組み合わせ、共倒れを測り続けることです。

今日のAIニュース一覧へ →