先に結論から。
xAIはImagine Video 1.5へ画像・音声参照、テキスト動画生成、ネイティブ1080p、最大7枚の画像参照を追加しました。
これは動画生成モデルの性能更新というより、広告やシリーズ制作で一貫性を保つための制作基盤の更新です。
03 / THE FACTS
何が起きたのか
人物画像と声を参照させ、複数シーンで同じ顔と声を維持できるとされています。
テキスト動画と1080pはGrokのWeb・iOS・Androidで一般提供。画像・音声参照は米国の上位プランから順次展開され、APIの音声参照は申請制です。
04 / THE CONTEXT
なぜ、今これが重要なのか
これまでのAI動画は、カットごとの人物・衣装・背景・声のズレが長尺化の大きな壁でした。
参照素材を固定できることで、単発クリップではなく、同じキャラクターを使ったシリーズ制作へ進みやすくなります。
07 / NEXT ACTION
今日から、どう動くか
- 01
人物、表情、衣装、商品、場所、声をまとめた参照パックを作る。
- 02
同じキャラクターで3〜5カット生成し、顔・声・衣装の維持率を確認する。
- 03
Web版の展開状況とAPIの対応範囲を分け、小規模テスト後に量産工程へ入れる。