毎朝更新
← 今日のニュース2026.08.17 / Fujin編集約8分で読めます

スマホAIは1年前の記憶を正しく使える?——MobileMemが「覚える・更新する・答えない」を測る

スマホAIが一年前の予定を覚えていても、今は変わった好みを古いまま答えたら困ります。長期記憶に必要なのは、たくさん保存する力ではなく、必要な記憶を正しく更新して取り出す力です。

01 / QUICK GUIDE

まず、30秒でつかむ

  • 01

    OPPOとOpenKGの研究チームは、2026年8月17日のarXiv新着欄で、スマホAIの1年規模の長期記憶を測るMobileMemを公開しました。

  • 02

    画像を含むMobileMem-Omniは、16人分の軌跡、1万9060枚の画像、7415問を収録し、時系列、知識更新、暗黙の好み、答えない判断などを評価します。

  • 03

    論文のv1受付は8月11日、datasetのGitHub公開は8月1日で、新着掲載より前です。査読前のTechnical Reportで、実ユーザーの生データそのものではなく合成した会話や画像を多く含みます。

02 / KEY WORDS

専門用語を、やさしく。

ここだけ押さえれば、残りの本文はスムーズに読めます。

長期記憶
一回の会話を超えて、過去の予定、好み、関係、出来事を保存し、後の質問や行動へ使うAIの仕組みです。
ベンチマーク
複数のAIを同じ問題と採点方法で比べる評価セットです。点数はその条件での成績で、実生活の便利さを直接保証しません。
RAG
Retrieval-Augmented Generationの略で、質問に関係する記録を検索してから回答を作る方法です。検索で外すと、記憶が保存済みでも答えられません。
LLM-as-a-Judge
人の代わりに別の大規模言語モデルが回答を採点する方法です。大量評価に向きますが、人の判断と完全には一致しません。

03 / THE FACTS

何が起きたのか

MobileMemは8月17日付のarXiv新着一覧へ掲載されました。掲載時刻は非開示です。論文v1の受付は8月11日14時09分51秒UTC、日本時間23時09分51秒、公式GitHubのdataset公開日は8月1日で、三つの日付は別の出来事です。

研究は文章中心のMobileMemと、文章と画像を扱うMobileMem-Omniの二本立てです。単純な思い出しだけでなく、複数の記録をつなぐ推論、時間の前後、古い知識の更新、言葉にされていない好み、答えがない質問への棄権を測ります。

MobileMem-Omniには16人分の軌跡があり、中国語利用者8人、英語利用者8人です。1589イベント、15万5670の会話ターン、1万9060枚の画像、7415問を収録し、一人あたりの文脈は平均172万トークンです。

ただし、この量を実在16人のスマホから丸ごと吸い上げたわけではありません。会話、アプリ画面、私的な写真の多くは、人物設定や時間条件を使ってAIで合成され、画像はHTML描画や画像生成モデルで作られています。

文章版では2人の協力者からOPPO端末の利用統計とmetadataを収集しましたが、生の操作内容は記録しない設計です。それを人物情報や時系列の手掛かりにして、KEMEという合成手順が長期間のuser-app体験を組み立てます。

THE CONCLUSION

つまり、何が重要なのか

結論から言うと、MobileMemは新しいスマホAI製品ではありません。個人AIが長い時間の記憶を正しく保存、検索、更新し、分からないときに答えないかを比べるための公開ベンチマークです。

規模は大きい一方、軌跡の多くは実データを手掛かりにAIで合成されています。『16人を一年間そのまま記録したデータ』と受け取るのは正しくありません。

04 / THE CONTEXT

なぜ、今これが重要なのか

AIがスマホの常駐助手になると、毎回ゼロから説明する手間を減らせます。しかし保存量を増やすだけでは、転職前の勤務先や昔の食事制限を現在の情報として答える危険も増えます。

現実の記憶は、メモ、写真、予定、通知、買い物など複数アプリへ散らばります。文章の会話履歴だけを使う従来評価では、このばらばらな情報を結び付ける難しさを測れません。

個人データをクラウドへ集めることにも抵抗があります。研究チームは端末内処理を将来像に置きますが、容量、電池、速度の制約があるため、必要な記憶だけを小さく正確に扱う技術が必要です。

05 / WHAT IT MEANS FOR YOU

私たちには、何が変わる?

例えば『前に好きだった航空会社の会員ランクは?』という質問では、現在のGoldだけでなく、過去のSilverを時間順に取り出す必要があります。似た言葉のホテル会員情報を拾うと、保存済みでも誤答します。

著者評価では、GPT-5.4-miniを土台にした文章版でHippoRAG2が総合80.06、A-MEMが78.39でした。一方、長い履歴をそのまま入れる方式は45.19です。これは検索や整理の設計が重要という結果ですが、同一研究内のLLM判定です。

画像版の採点にはQwen3-14Bを使い、人の評価との一致率は1320例で平均80.7%でした。約2割は一致しない計算になるため、小数点までを絶対的な実力差として読むべきではありません。

またMobileMemは端末内AIの完成を示していません。実際のスマホ上での電池消費、保存容量、削除要求、家族との共有、情報漏えいまで測った製品試験ではなく、主に記憶方式を比べる研究用の土台です。

07 / NEXT ACTION

今日から、どう動くか

  1. 01

    個人AIに覚えさせたい情報を、予定、好み、連絡先などに分け、それぞれ保存期限、更新条件、削除方法を決める。

  2. 02

    同じ質問を『昔』『今』『情報なし』の三条件で試し、古い情報を更新できるか、分からないと答えられるか確認する。

  3. 03

    MobileMemを比較に使う場合は、dataset公開8月1日、v1受付8月11日、新着8月17日、査読前、合成中心という条件を記録する。

BOTTOM LINE

MobileMemが教えるのは、個人AIの記憶は保存量では決まらないということです。必要な情報を時間に沿って更新し、根拠を取り出し、分からないと止まれるかまで測って初めて、便利な記憶になります。

今日のAIニュース一覧へ →