毎朝更新
← 今日のニュース2026.08.17 / Fujin編集約8分で読めます

安全装置を外されたAIに、あえて嘘を答えさせる——Fool’s Goldが突きつけた難問

AIの安全装置を外されたら、危険な答えを出せないよう守る。Fool’s Goldは逆を選びました。突破された後に、本物そっくりの偽情報を答えさせます。

01 / QUICK GUIDE

まず、30秒でつかむ

  • 01

    Microsoft Azure所属のMark Russinovich氏は、安全機能を外された公開型AIに、危険な回答の核心を意図的に偽らせるFool’s Goldを発表しました。

  • 02

    5系統7モデルで試し、事前に決めた基準を通った6モデルでは、攻撃後回答の51〜90%が囮になりました。通常時の正答率や、攻撃を防いだ割合ではありません。

  • 03

    論文は査読前の単著研究で、独立追試もありません。対象は化学・生物の危険領域と特定の安全解除攻撃で、通常の脱獄指示や改変全般への効果は示していません。

02 / KEY WORDS

専門用語を、やさしく。

ここだけ押さえれば、残りの本文はスムーズに読めます。

オープンウェイトモデル
学習済みの重みを入手し、自分の設備で動かしたり改変したりできるAIです。自由度が高い一方、提供者は公開後の変更を止めにくくなります。
安全解除攻撃
危険な依頼を断る性質を、重みの編集や追加学習で弱める攻撃です。この研究は、拒否に関係する内部の方向を取り除く方法を主に想定します。
囮防御
攻撃後のAIへ、見た目は自然でも重要な手順だけが誤った答えを出させる防御です。破られた金庫に偽の設計図を置く発想に近いものです。
64回答の合意攻撃
同じ質問を64回行い、回答に共通する要素から正しい手順を復元しようとする攻撃です。何度も聞けば囮を見抜けるかを試します。

03 / THE FACTS

何が起きたのか

論文初版は8月17日23時26分32秒の世界標準時(UTC)、18日8時26分32秒の日本時間(JST)に、論文公開サイトarXivへ提出されました。単著で、査読済みの採択記載はありません。

研究では元のAIへ安全解除攻撃を行い、危険な答えの見た目を保ちながら、重要要素だけを変えた囮データを作ります。その囮が攻撃後に出るよう追加学習します。

対象は5系統7モデルで、規模は90億から1,220億パラメーターです。この数字はモデルの大きさを示すだけで、安全性や賢さの順位ではありません。

事前登録した基準を通った6モデルでは、攻撃後回答の51〜90%が囮になりました。防御による増加分は27〜84ポイントと著者が推定しています。最小の1モデルは基準を通りませんでした。

外部の攻撃試験では、1,220億モデルが出した同程度の品質の答えの82〜86%に、手順を使えなくする致命的な誤りがありました。無防御モデルは最大10%でした。

測定できた対象では、64回答から完全な手順を再構成できた割合は8.3〜62.5%でした。無防御の58〜96%より低いものの、ゼロではありません。最も弱い対象では一回答ごとの効果に限られます。

THE CONCLUSION

つまり、何が重要なのか

Fool’s Goldは、安全機能を絶対に壊させない技術ではありません。壊された後の答えに偽の核心を混ぜ、攻撃者がどれを信じてよいか分からない状態を作ります。

守りのためにAIへ嘘を教えるため、副作用も重い手法です。攻撃時に効くかだけでなく、通常の質問へ囮が漏れないかを同じ厳しさで測る必要があります。

04 / THE CONTEXT

なぜ、今これが重要なのか

公開型AIは、自社の設備で動かせ、研究や開発の自由度を広げます。しかし重みを受け取った人は、提供者が想定しない方法で安全機能を書き換えられます。

危険な知識を完全に消せば、化学や生物の正当な研究能力まで落ちるかもしれません。拒否だけを強くしても、拒否機能そのものを外す攻撃には破られます。

そこで、侵入を防ぎ切れないなら価値ある情報を渡さないという、昔からある囮の考え方をAI内部へ持ち込みました。新しいのは、その囮がモデルの重みに埋め込まれる点です。

対象は化学・生物と特定の攻撃に限られます。放射線、核、爆発物の全領域や、通常の文章指示による脱獄、さらに改変されたモデルへは一般化できません。

05 / WHAT IT MEANS FOR YOU

私たちには、何が変わる?

一般利用者が今すぐ使う機能ではありません。AIの重みを公開する組織が、公開後に安全機能を外される可能性まで含めて考える研究です。

通常の質問へ囮が漏れれば、正当な研究者や利用者が誤情報を信じる危険があります。公開前には通常時、攻撃後、境界に近い質問を分けて漏出を測る必要があります。

外部の問題集を使ったことは、第三者が結果を監査した意味ではありません。数値は著者自身の評価で、独立した研究チームによる再現はまだありません。

企業が公開モデルを追加学習するときも、安全設定を固定物と考えないことが重要です。変更後の重みで、拒否、一般能力、危険回答、誤情報を測り直します。

07 / NEXT ACTION

今日から、どう動くか

  1. 01

    研究結果を見るとき、対象モデル、攻撃方法、危険領域、失敗例、査読状況を一枚に整理し、範囲外へ広げて解釈しない。

  2. 02

    公開モデルを追加学習したら、通常能力だけでなく、拒否の維持、危険回答、誤情報の漏出を変更後の重みで再評価する。

  3. 03

    実用候補と見る前に、独立した追試、別の攻撃、正当利用への副作用、公開後の再改変に関する検証を待つ。

BOTTOM LINE

Fool’s Goldは、安全装置を破られた後のAIへ偽の核心を埋める防御です。限定された査読前研究であり、嘘の副作用まで測って初めて評価できます。

今日のAIニュース一覧へ →