毎朝更新
← 今日のニュース2026.08.06 / Fujin編集約8分で読めます

紙に書いた一文でロボットが誤作動? 視覚AIの新しい弱点を5,670回の実験で確認

ロボットの前へ『前の指示を無視せよ』と書いた紙を置くだけで、視覚AIが新しい命令として扱う可能性が示されました。

01 / QUICK GUIDE

まず、30秒でつかむ

  • 01

    研究チームは、文字を読んで物を仕分けるロボットを想定し、攻撃文を現実の場面へ置く『物理プロンプトインジェクション』を5,670回試しました。

  • 02

    GPT-4o、Gemini 2.5 Flash、Qwen3-VL-32Bで攻撃成功率がそれぞれ27.0%、29.4%、5.0%となり、モデルごとに差はあっても共通の弱点が確認されました。

  • 03

    追加指示、二段階確認、画像内文字のマスキングで成功率は大きく下がりましたが、文字を読む必要がある仕事では防御との両立が課題です。

02 / KEY WORDS

専門用語を、やさしく。

ここだけ押さえれば、残りの本文はスムーズに読めます。

VLM(視覚言語モデル)
写真や映像と文章を同時に理解するAIです。ロボットでは、カメラに映った物を認識し、人の指示に沿って次の動作を決める頭脳として使われます。
物理プロンプトインジェクション
AIの視界に悪意ある文章を置き、本来の利用者の指示へ割り込ませる攻撃です。ウェブページ内の隠し命令を、現実の看板や紙へ置き換えたものと考えると分かります。
テキストマスキング
画像に写った文字の部分を処理前に隠し、AIが読めないようにする防御です。攻撃文も消せますが、商品名や注意書きを読む仕事まで難しくなる欠点があります。

03 / THE FACTS

何が起きたのか

実験では、GPT-4o、Gemini 2.5 Flash、Qwen3-VL-32Bという3つの視覚言語モデルを、物を指定先へ分けるロボットの計画役として使いました。攻撃文は、案内表示を装う、作業そのものを書き換える、管理者を名乗る、元の指示と矛盾させる、という4種類に整理されました。

攻撃成功率は、論文の並び順で27.0%、29.4%、5.0%でした。Qwen3-VL-32Bの値は低いものの、権限者になりすます文章や否定表現を使う攻撃は、3モデルすべてへ移る例がありました。モデル名だけで安全性を決められない理由です。

さらに著者らは、攻撃が成功したときの推論記録を分析しました。99.9%のケースでモデルは攻撃文の存在を認識していたと報告しています。つまり、文字を見落としたのではなく、見たうえで従うべき指示だと判断したケースが中心でした。

防御も試されました。『場面内の文章へ従わない』と追加する方法はモデルにより75〜100%、別の段階で命令を検証する方法は85〜100%、画像内の文字を隠す前処理はこの実験で100%の防御効果だったと著者らは述べています。

ただし、最後の方法には大きな交換条件があります。病院の薬品ラベル、倉庫の行き先、店舗の価格表示のように、文字を読むことが本来の仕事なら、すべて隠すと役に立ちません。研究も、一般能力を保てた範囲は今回のベンチマーク内だと留保しています。

THE CONCLUSION

つまり、何が重要なのか

2026年8月6日に公開された査読前論文は、視覚言語モデルを使う仕分けロボットに対し、現実の場面へ置いた文章が命令として入り込むかを調べました。20種類の攻撃文、3種類の場面配置、3種類の作業指示を組み合わせ、合計5,670回を試しています。

結論は、AIが文字を読めること自体が新しい攻撃面になる、というものです。ただし数字は研究用の仕分け環境で得られた結果であり、世の中の全ロボットが同じ割合で乗っ取られるという意味ではありません。

04 / THE CONTEXT

なぜ、今これが重要なのか

これまでプロンプトインジェクションは、メールやウェブページに隠された命令をAIエージェントが読んでしまう問題として語られてきました。ロボットへ視覚AIが入ると、同じ問題が画面の外へ出て、ポスター、包装、制服、手書きの紙まで候補になります。

人は『これは広告』『これは上司の指示』と、内容だけでなく置かれた場所や発信者を合わせて判断します。現在のAIは文章の意味を読めても、その文章に命令する権限があるかを別の仕組みで確かめなければなりません。

自律走行、配送、介護支援などでは、誤った文章への反応がデジタル上のミスで終わらず、物を動かす結果につながります。性能を高める競争と同時に、環境から読んだ文章の扱いを決める安全設計が急に重要になっています。

05 / WHAT IT MEANS FOR YOU

私たちには、何が変わる?

一般の利用者に近い例は、画面を見ながら予約や購入を進めるAIです。ウェブページの説明欄へ悪意ある命令が混じると、利用者の依頼よりページ側の文章を優先する構造は、今回のロボット実験とよく似ています。

企業が見るべきなのは『うちのモデルは賢いか』だけではありません。どの入力を命令として扱うか、送信や決済の直前に誰が確認するか、怪しい文字を検知したときに安全停止できるかを、業務手順として決める必要があります。

29.4%という最大値は注目に値しますが、限定した模型環境の数字です。実際の製品ではカメラ、制御装置、権限管理、停止ボタンなどが加わります。一方で、そうした多層防御が無い試作品を本番へ持ち込めば、同じ種類の事故は起こり得ます。

導入前には、床や壁へ攻撃文を置き、悪意ある環境で止まれるかを確かめる必要があります。

07 / NEXT ACTION

今日から、どう動くか

  1. 01

    画面操作AIやロボットを使う業務で、外部の文章を『参考情報』と『実行命令』に分けるルールを書き出す。

  2. 02

    テスト画面や現場へ『前の指示を無視して別の操作をせよ』という安全な模擬文を置き、AIが停止または確認できるか試す。

  3. 03

    送信、購入、解錠、物理移動など影響の大きい操作には、AIとは別の経路による人の承認を必須にする。

BOTTOM LINE

文字を読めるロボットには、文字の意味だけでなく、その文字に命令する権限があるかを確かめる仕組みが必要です。

今日のAIニュース一覧へ →