毎朝更新
← 今日のニュース2026.08.18 / Fujin編集約7分で読めます

画像AIは「何枚集めたか」だけで決まらない——Alibabaが5段階の学習設計を公開

画像AIの差は、モデルを大きくする前に「どの教材を、どの順番で学ばせるか」で生まれます。

01 / QUICK GUIDE

まず、30秒でつかむ

  • 01

    Alibaba Groupは、文章から画像を作る力、画像を編集する力、固有名詞や知識を絵へ結びつける力を、別々だが連携できる教材で育てる研究を発表しました。

  • 02

    教材は文章付き画像4.4億件、編集前後の画像ペア1.2億件、画像と人物・場所などを結ぶデータ2,700万件超です。学習は256ピクセルから1,024ピクセルまで5段階で進めます。

  • 03

    3Bと6Bの画像モデルを訓練し、著者らの評価では近い得点を出しました。ただし査読前で、採点は画像を見る別のAIも使っています。実製品の性能や第三者による再現を示す結果ではありません。

02 / KEY WORDS

専門用語を、やさしく。

ここだけ押さえれば、残りの本文はスムーズに読めます。

T2I
Text to Imageの略で、文章の指示から画像を作る技術です。今回の4.4億件は、画像と説明文を組み合わせた学習用の教材を指します。
編集ペア
編集前の画像、編集後の画像、何を変えたかという指示を一組にした教材です。AIは完成画像だけでなく、変化のしかたを学べます。
カリキュラム学習
人が基礎から応用へ進むように、AIへ見せる課題の難しさや解像度を段階的に変える学習法です。順番も教材設計の一部になります。
VLM採点
画像と文章を理解する別のAIに、生成結果の品質を採点させる方法です。大量評価に向く一方、人の評価や実利用と完全に同じではありません。

03 / THE FACTS

何が起きたのか

論文は8月18日17時59分01秒UTC、同19日2時59分01秒JSTにarXiv v1として公開されました。著者は全員Alibaba Group所属で、現時点では査読前の研究報告です。

提案した基盤には三つの教材エンジンがあります。文章と画像を結ぶ生成用、編集前後の関係を学ぶ編集用、画像を人物・場所・科学概念などへ結びつける知識用です。別々に弱点を測りつつ、共通の説明文で能力を移しやすくします。

生成用では十億件規模の候補から4.4億件を選びました。編集用は1.2億ペア、知識用は約300万の重要な固有名詞を起点に、2,700万件超の画像・エンティティ対を作ったと報告しています。

学習は5段階です。低解像度の基本生成から始め、複雑な構図、生成と編集の共同学習、高解像度の継続学習、1,024ピクセルの仕上げへ進みます。評価で見つかった弱点は、追加収集や専門家が作る教材へ戻します。

研究チームは3Bと6BのMM-DiT型モデルをゼロから訓練しました。CPI-General 2,039例とCPI-Practical 558例をVLMが1〜5点で採点し、総合は3Bが3.93、6Bが3.94でした。大きいモデルが大差を付けた結果ではありません。

この得点は著者らの測定です。CPI-Benchも著者と重なるチームの査読前研究で、訓練データの全体、権利処理、3B・6Bモデルの重み、他社による再現結果は、確認した論文本文からは判断できません。

THE CONCLUSION

つまり、何が重要なのか

結論から言うと、Alibabaの研究は「良い画像だけを大量に集める」方法ではありません。生成、編集、知識の三つに教材を分け、学習の進み具合に応じて混ぜ方と解像度を変える仕組みです。

重要なのは、AIの能力を増やすにはモデルのサイズだけでなく、教材の目的、順番、失敗を次の収集へ戻す仕組みまで設計する必要があると示した点です。

04 / THE CONTEXT

なぜ、今これが重要なのか

画像AIは、単純な一枚絵だけでなく、文字入りポスター、商品画像、複数画像の合成、指示編集まで一つのモデルへ求められています。能力ごとに必要な教材が違うため、固定したデータの混ぜ方では弱点が残ります。

モデルを大きくする方法は分かりやすい一方、計算費用も増えます。今回、3Bと6Bの得点差が0.01だったことは、この条件ではサイズ以外の設計が結果を左右した可能性を示します。ただし、サイズが不要だと証明したわけではありません。

生成物が次の学習データへ混ざる時代には、低品質なAI画像を見分ける作業も重要です。研究チームはAI生成物の検出、安全性のフィルター、重複除去を組み込み、教材の質を継続的に管理しています。

05 / WHAT IT MEANS FOR YOU

私たちには、何が変わる?

非エンジニアの仕事でも同じ考え方が使えます。社内AIへ資料を全部まとめて渡すより、基本ルール、良い完成例、修正前後、例外処理を分け、簡単な仕事から順に試す方が弱点を見つけやすくなります。

たとえば商品画像を作るなら、ブランドの色や構図だけでなく「この失敗を、どう直したか」の組も残します。完成品だけのフォルダより、修正履歴のある教材の方が編集AIへ具体的な判断を渡せます。

一方で、大量データは権利と出所の問題を伴います。会社で応用するときは、枚数を増やす前に、利用許諾、個人情報、更新日、削除依頼へ対応できる記録を整える必要があります。

07 / NEXT ACTION

今日から、どう動くか

  1. 01

    AIへ任せたい仕事を一つ選び、基本資料、良い完成例、修正前後、例外の四つに分ける。

  2. 02

    毎回の失敗を一行で記録し、次に追加すべき教材と確認テストへ結びつける。

  3. 03

    外部画像や顧客資料を教材へ入れる前に、利用許諾、個人情報、削除方法を確認する。

BOTTOM LINE

強い画像AIを作る鍵は、教材の枚数だけではなく、何をどの順番で学ばせ、失敗からどう教材を直すかです。

今日のAIニュース一覧へ →