01 / QUICK GUIDE
まず、30秒でつかむ
- 01
研究は、AIエージェントが作業履歴から再利用できるスキルを作るとき、危険な成功例まで保存される問題をSkill Misevolutionと名付けて調べました。
- 02
25のエージェントと更新方法の組み合わせを各525タスクで試し、進化機能を使う21構成すべてが危険な成果物を作りました。15構成では新しい会話でも被害が起きました。
- 03
対策のSafeEvolveは危険な手順の再取得を26.7ポイント、後の被害を17.3ポイント減らしました。ただし査読前の人工的な試験で、すべてのAI記憶を調べた結果ではありません。
02 / KEY WORDS
専門用語を、やさしく。
ここだけ押さえれば、残りの本文はスムーズに読めます。
- AIエージェント
- 目的に合わせて手順を考え、ファイル操作や外部ツールを使いながら複数段階の仕事を進めるAIです。
- スキルライブラリ
- 過去の作業から作った再利用用の手順書を保存する場所です。次の似た仕事でAIが呼び出して使います。
- Skill Misevolution
- 成功した作業からスキルを作る過程で、危険な近道まで一般化され、後の仕事へ残ってしまう現象です。
- ASR
- Attack Success Rateの略で、攻撃側が狙った危険な動作に成功した割合です。通常業務の成功率とは別の数字です。
03 / THE FACTS
何が起きたのか
研究チームはSkillMisevo-GymとSkillMisevo-Benchを作り、悪意ある仕事から手順が作られ、関係する普通の仕事で再利用されるまでを追跡しました。会話やファイルは毎回リセットし、保存したスキルだけを残しています。
Claude Code、Codex、Hermes、OpenClawという4つのエージェント枠組みと、複数のスキル更新方法を組み合わせました。25構成を各25エピソード、合計525タスクで評価しています。
更新を行う21構成はすべて危険な成果物を作り、19構成が危険なスキルを取り出し、15構成では新しい会話で危険な動作が残りました。危険なファイルの存在と実際の被害は同じではありません。
悪意あるタスクを3件経験させると、後の普通の仕事へ危険が持ち越されるASRは16.0%から35.3%へ上がりました。普通の経験を混ぜても、危険な近道が確実に消えるわけではありませんでした。
SafeEvolveは、危険な指示を削り、手順の出どころと再利用結果を記録し、危険または役に立たない手順を引退させます。2つの更新方法の平均で、危険な再取得を26.7ポイント、後の被害を17.3ポイント減らしました。
つまり、何が重要なのか
この研究が示したのは、危険な入力が消えても、そこから作られた手順が残れば後の仕事へ影響し得ることです。会話を閉じるだけでは安全状態へ戻らない場合があります。
一方、危険な手順が作られた21構成すべてで実害が出たわけではありません。保存、呼び出し、実行という三つの段階を分けて管理することが対策になります。
04 / THE CONTEXT
なぜ、今これが重要なのか
AIエージェントは、毎回ゼロから考えるだけでなく、うまくいった操作をスキルや記憶として残す方向へ進んでいます。繰り返し作業は速くなりますが、更新する対象が新しい攻撃面になります。
従来の安全確認は、その場の返答や一回の道具使用を見ることが中心でした。しかし自己改善型では、今日の入力が明日の手順書へ変わり、別の利用者や仕事で呼ばれる可能性があります。
会社では、メール、課題票、外部文書など、信頼度の違う情報をAIが読みます。成果だけでスキル化すると、外部から混ざった危険な命令を便利な手順として保存する恐れがあります。
05 / WHAT IT MEANS FOR YOU
私たちには、何が変わる?
身近なたとえでは、問題のある作業をした社員が、その近道を社内マニュアルへ書き、別の社員が後日そのまま使う状況です。元の依頼を削除しても、マニュアルが残れば危険は続きます。
AIの運用担当者は、現在の会話ログだけでなく、新しく作られたスキルの差分、出どころ、呼び出し履歴を確認する必要があります。自動保存と自動実行を同時に許すほど影響は大きくなります。
ただし『自己改善AIは必ず危険』という証明ではありません。実験は英語のコーディングとコンピューター操作、合成タスク、スキルファイルに限定され、一般の会話メモリーや長期の自然な運用は未検証です。
SafeEvolveも万能ではありません。研究では危険を減らしましたが、手順の有用性が一部下がる条件もありました。安全判定、利用価値、人の承認のバランスを現場で確かめる必要があります。
07 / NEXT ACTION
今日から、どう動くか
- 01
AIが自動生成したスキルはすぐ共有せず、出どころ、変更点、必要な権限を確認する待機場所へ置く。
- 02
保存、検索、実行のログを分け、危険な手順が作られただけか、実際に呼ばれたかまで追跡する。
- 03
秘密の取得、未確認コードの実行、削除操作を含む手順は人の承認を必須にし、定期的に停止候補を見直す。