毎朝更新
← 今日のニュース2026.08.21 / Fujin編集約7分で読めます

画像AIは「作る」から「直し続ける」へ——SenseNova U1.5 Lite正式版

ポスターのカップだけ変えたいのに、背景も人物の顔も別物になる。画像AIを仕事で使うとき、本当に困るのは最初の生成より、その後の修正です。

01 / QUICK GUIDE

まず、30秒でつかむ

  • 01

    SenseTimeは8月21日、画像の理解と生成を一つの仕組みで扱う「SenseNova U1.5 Lite」正式版を公開し、世界の開発者向けに配布を始めました。

  • 02

    同社によると、3,000〜4,000文字の指示、原生4K出力、文字と複雑な配置、指定部分だけの編集、複数の参考画像を組み合わせる制作に対応します。

  • 03

    モデルは80億パラメーターで、単一GPUでも動くと説明されています。ただしGPUの種類、必要なメモリー、生成時間、第三者による品質評価は示されていません。

02 / KEY WORDS

専門用語を、やさしく。

ここだけ押さえれば、残りの本文はスムーズに読めます。

統一マルチモーダルモデル
画像を読み取る力と、新しい画像を作る力を一つのモデルで扱う設計です。別々のAIを何度も切り替える手間や遅れを減らす狙いがあります。
原生4K
後から単純に拡大するのではなく、高い解像度を前提に画像を生成するという意味です。ただし発表には、出力できる縦横の組み合わせや所要時間がありません。
8Bパラメーター
モデルが学習した調整値がおよそ80億あることを示します。数が多いほど必ず高品質になるわけではなく、学習方法や入力、動かす機器でも結果は変わります。
編集保持
指定した場所を直すとき、背景、人物、文字、配置など変更しない部分を元のまま残す能力です。制作物を何度も直す現場では重要な性能です。

03 / THE FACTS

何が起きたのか

SenseTimeは8月21日、軽量な統一マルチモーダルモデル「SenseNova U1.5 Lite」の正式版を公開しました。GitHubやHugging Faceなどから世界向けに配布しています。

同社は、プレビュー版で示した基礎能力を、実際の画像制作で正確かつ安定して使えるように学習データ、課題設計、追加学習の工程を見直したと説明しています。

指示は3,000〜4,000文字まで扱えるとしています。被写体の数、位置関係、文字、配置、作風など複数の条件を同時に指定する用途を想定しています。

生成では原生4K、中文と英文の文字、ポスターや情報図の複雑な配置に対応すると説明しました。4Kの詳しい縦横サイズや、文字の正確さを示す数値は載っていません。

編集では、人物や構図、変更しない領域を保ちながら、要素や文字を部分的に直せるとしています。枠で場所を指定する方法や、印を付けた画像による指示にも対応します。

一枚だけでなく、複数の参考画像から人物、作風、光、配置を取り出し、一つの画像へ組み直す例も公開されました。掲載例は同社が選んだもので、無作為な試験ではありません。

モデルは80億パラメーターです。複数の専門モデルを学習時に使い、その能力を一つへまとめることで、配布時は一つのモデルとして動かす設計だと説明しています。

SenseTimeは単一GPUで滑らかに動き、費用と待ち時間を抑えられると主張します。しかしGPU型番、必要VRAM、1枚の生成時間、消費電力、同時利用数は公表していません。

THE CONCLUSION

つまり、何が重要なのか

正式版の中心は、きれいな一枚を作る競争より、長い指示を読み、元の構図を保ち、局所修正を重ねる制作工程です。プレビュー版から実際の納品作業へ焦点を移しました。

一方、「単一GPUで滑らか」「超大型の商用モデルに匹敵」といった表現はSenseTimeの評価です。必要な機器と速度が分からないため、自社で安く動くとはまだ断定できません。

04 / THE CONTEXT

なぜ、今これが重要なのか

画像AIは短い指示から一枚を作るだけなら使いやすくなりました。ところが仕事では、ブランド色を守る、文字を直す、人物を残すといった細かな修正が何度も続きます。

従来は、一部分を直すたびに別の場所まで変わり、担当者が画像編集ソフトで戻すことがありました。修正しても崩れないことが、見栄えの次の競争になっています。

さらに企業は、クラウドの利用料や機密画像の扱いを気にします。公開モデルを自社環境で動かせれば選択肢は増えますが、実際の機器費用と運用負担は別に確かめる必要があります。

05 / WHAT IT MEANS FOR YOU

私たちには、何が変わる?

たとえば商品の広告で、ボトルだけ新製品へ替え、人物、背景、価格表、ロゴの位置を残せるなら、毎回ゼロから作り直す時間を減らせます。これが編集保持の価値です。

長い指示へ対応しても、長く書けば正確になるとは限りません。必須条件、変えてよい場所、残す場所、文字の完全一致を分け、結果を確認する方が再現しやすくなります。

4Kも、そのまま印刷に使える保証ではありません。小さな文字、ロゴ、商品の形、権利上問題のある要素を拡大して点検し、必要なら人が仕上げます。

導入を考える会社は、公式の見本ではなく自社素材で試すべきです。20件ほどの代表作業で、指示の遵守、変更禁止部分の崩れ、文字の誤り、生成時間を記録します。

07 / NEXT ACTION

今日から、どう動くか

  1. 01

    自社のポスターや商品画像を20件選び、変更箇所、保持箇所、文字条件を同じ書式で指定する。

  2. 02

    指示どおりか、非対象部分が崩れたか、文字が正しいか、4K生成時間を1件ごとに記録する。

  3. 03

    導入前にGPU型番、必要VRAM、ライセンス条件、商用利用、保存場所、更新時の再試験方法を確認する。

BOTTOM LINE

SenseNova U1.5 Liteが問うのは、画像AIが高解像度画像を作れるかではなく、長い指示を守り、必要な部分だけを何度も直して実務の納品まで進められるかです。

今日のAIニュース一覧へ →