毎朝更新
← 今日のニュース2026.08.18 / Fujin編集約7分で読めます

AIの「前回の学び」は、仕事の順番でマイナスになる——Salesforceが3回ずつ再検証

AIへ成功体験を覚えさせれば、仕事を重ねるほど賢くなる。直感的には正しそうですが、今回の2手法では、仕事の順番を変えただけで改善が悪化へ反転しました。

01 / QUICK GUIDE

まず、30秒でつかむ

  • 01

    Salesforce AI Researchは8月18日、作業経験を文章の記憶へ変えるAWMとReasoningBankを、3つのウェブ操作評価で再検証した論文を提出しました。

  • 02

    各条件を3回試すと、記憶を使った24条件中17条件、約71%で成績のばらつきが増えました。最良と最悪の差は最大10.42ポイントでした。

  • 03

    既定の仕事順で+1.5ポイントだったReasoningBankは、ランダム順で-4.5ポイントになりました。ただし2手法、3評価、主にGPT-5-miniへ限った査読前の結果です。

02 / KEY WORDS

専門用語を、やさしく。

ここだけ押さえれば、残りの本文はスムーズに読めます。

自己改善エージェント
終えた仕事の成功や失敗から手順を作り、次の仕事へ再利用するAIです。今回はモデルの重みを学び直さず、文章の記憶を追加する方式を指します。
タスク順序
AIへ仕事を渡す並び方です。簡単な仕事から難しい仕事へ進むと、前の成功が後で役立ちやすく、評価を有利にする場合があります。
反復
同じ条件の実験を繰り返すことです。生成AIは同じ指示でも結果が揺れるため、1回の成功だけでは安定した実力か判断できません。

03 / THE FACTS

何が起きたのか

論文のv1は8月18日17時55分07秒UTC、19日02時55分07秒JSTにarXivへ提出されました。Salesforce AI Researchの研究で、査読済み会議や学術誌への採択は記載されていません。

対象は、成功した手順を蓄積するAgent Workflow Memoryと、成功・失敗から幅広い気づきを残すReasoningBankの2手法です。原則としてGPT-5-miniを作業役と記憶作成役に使いました。

評価はWebArena 812件、VisualWebArena 910件、SCUBA 267件です。買い物、地図、掲示板、顧客管理などのウェブ操作に限られ、数学、文章作成、実店舗の仕事は対象外です。

各条件を3回ずつ走らせると、記憶手法を使った24条件のうち17条件で標準偏差が増え、11条件では増加率が50%を超えました。最良と最悪の差は最大10.42ポイントです。

既定順ではReasoningBankが基準より平均+1.5ポイントでしたが、ランダム順では-4.5ポイントになりました。評価基準、環境の失敗情報、明確な制約を記憶作成へ加えても、悪化の31%を埋めるにとどまりました。

THE CONCLUSION

つまり、何が重要なのか

結論は、AIの記憶機能が危険だという一般論ではありません。この研究で再評価したAWMとReasoningBankは、3つのウェブ操作評価で、順序と偶然に成績が強く左右されました。

重要なのは『学んだか』ではなく、『何を、どの条件で学び、別の順番でも再現するか』です。企業は記憶件数より、複数回と順序変更のテストを見る必要があります。

04 / THE CONTEXT

なぜ、今これが重要なのか

AIエージェントへ長期記憶を持たせる動きが広がっています。毎回ゼロから説明せず、過去の成功手順を再利用できれば、運用コストを下げられるからです。

ただ、生成AIの一回ごとの出力には揺れがあります。早い段階で偶然うまくいった方法を『正しい教訓』として保存すると、その後の仕事で繰り返し呼び出されます。

既定の評価順は、前半の成功率が約75%から始まり、後半は40%未満へ落ちる部分がありました。簡単な仕事から難しい仕事へ進む隠れた授業順が、自己改善を助けた可能性があります。

現実の問い合わせは、きれいな順番では来ません。朝に難しい例外対応が来て、午後に簡単な処理が来る。だから順序を崩す試験は、本番の安定性を見るうえで重要です。

05 / WHAT IT MEANS FOR YOU

私たちには、何が変わる?

会社でAIの記憶を使うなら、成功例だけを自動保存し続ける設計は避けた方がいいです。誤った近道が残ったとき、人が見つけて削除できる画面が必要です。

たとえば営業支援AIが、最初の顧客では有効だった値引き提案を記憶しても、次の顧客の契約条件では使えないかもしれません。条件を一緒に残さなければ、成功例が誤案内になります。

導入テストは一回の平均点で終わらせず、最低3回、仕事の順番も複数用意するべきです。平均だけでなく、最悪値、ばらつき、誤った記憶の件数を確認します。

今回の結果はすべての記憶製品へ当てはまりません。それでも、2手法で順序依存が確認されたことは、『記憶を増やせば自動的に賢くなる』という説明を疑う材料になります。

07 / NEXT ACTION

今日から、どう動くか

  1. 01

    AIが保存する記憶へ、成功条件、対象外条件、根拠、作成日、承認者の欄を追加する。

  2. 02

    同じ評価を最低3回走らせ、仕事順を2種類以上に変えて平均、最悪値、ばらつきを比べる。

  3. 03

    誤った記憶を検索、停止、修正、削除できる担当者と、月1回の棚卸し日を決める。

BOTTOM LINE

今回の2手法では、AIの記憶は仕事順と偶然で成績を悪化させ得るため、保存より先に再検証と削除の仕組みが必要です。

今日のAIニュース一覧へ →