TECHNOLOGY LANDSCAPE · 2026

图生成视频技术全景

从一张静态图片,到可控、连贯、带声音的视频:梳理技术路线、模型架构、训练与推理、代表系统、评测方法、工程选型和未来趋势。

Image-to-VideoVideo DiTFlow Matching多模态控制长视频音视频联合生成

当前通用图生视频的主流,已经收敛到“时空压缩 Video VAE + 视频 Diffusion Transformer + Diffusion / Flow Matching + 多模态条件控制”。

竞争焦点已经从“让图片动起来”,转向主体与风格一致性、动作与物理合理性、镜头控制、多模态参考、原生音频、长时一致性,以及生成成本和可编辑性。

主流:视频扩散 / 流匹配 前沿:统一多模态音视频 瓶颈:一致性 × 运动幅度

01. “图生视频”并不是一个单一任务

输入图片可能是强约束的首帧,也可能只是人物、商品、场景或风格的参考。不同任务的条件强度和适用模型并不相同。

任务图片的作用典型用途关键技术要求
首帧生成视频必须成为视频第一帧照片动画、广告镜头首帧重建、后续身份保持
参考图生成视频定义人物、商品或风格换场景、跨镜头叙事参考特征解耦、多视角一致性
首尾帧插值指定开始和结束画面转场、变形、镜头衔接双端条件、遮挡与中间路径推断
多参考图生成分别提供人物、场景、道具、服装商业广告、品牌内容多条件路由、元素绑定
动作迁移图片给角色,视频或姿态给动作舞蹈、数字人、角色动画姿态与外观解耦、身体结构稳定
音频驱动图片给人物,音频驱动表情和嘴型口播、虚拟主播音画同步、身份和口型保持
相机控制图片给场景,相机轨迹给视角产品环绕、推进、航拍隐式三维理解、视角外内容补全
生成式插帧两张关键帧限定动作端点二维动画中间帧非线性运动、反遮挡、线条稳定
容易混淆的地方:首帧模式追求“第一帧必须像原图”;参考图模式追求“人物或风格像原图”,构图和视角可以发生变化。很多结果“不听提示词”,实际是任务模式与目标不匹配。

02. 六条主要技术路线

路线核心原理优势主要局限
2.5D 运镜 / 视差深度估计、分层、图像变形快、便宜、稳定只能推拉摇移,无法生成真正语义动作
光流 / 网格变形预测像素或特征运动场适合水、云、头发和循环动画大动作和新视角容易拉伸破碎
专用动作迁移姿态、关键点、驱动视频控制主体人物动作精确任务范围窄,开放域泛化有限
生成式关键帧插值利用视频先验生成中间过程能处理遮挡和非线性运动中间路径未必符合导演意图
通用扩散式 I2V从噪声联合生成整段视频开放域、画质高、动作丰富算力高,精准控制和长视频仍难
自回归 / 世界模型按帧或按片段预测后续世界状态适合长视频、流式和交互生成容易累计误差和身份漂移

当前通用能力最强的是扩散 / 流匹配路线;2.5D、光流、专用驱动和关键帧插值并未消失,而是作为更稳定、更便宜或更可控的补充。

03. 主流模型内部架构

输入条件图片 / 多参考图
文本姿态轨迹相机音频
条件编码Video VAE、视觉编码器、文本与控制编码器
视频生成骨干3D U-Net 或 Video DiT
在时空 latent 中扩散去噪 / Flow Matching
视频输出VAE 解码、超分、插帧、音频与后期编辑
Representation

Video VAE:压缩空间和时间

高清长视频像素量过大,模型先把视频压缩成低维时空 latent,再由 DiT 生成,最后解码还原。更高压缩率能显著提速,但会增加人脸、手部、小字和纹理损失,因此现代系统常加入二阶段超分或高质量解码器。

Backbone

3D U-Net → Video DiT

早期主流是在图像扩散模型上增加时间卷积和时间注意力;当前更偏向将视频切成时空 token,由 Transformer 建模。Video DiT 更容易扩大模型、统一多模态条件和支持不同分辨率、时长与画幅。

Conditioning

图片条件的多路注入

常见方法包括 latent 拼接、首帧遮罩、视觉 token 交叉注意力、Reference Attention,以及注入深度、姿态、边缘、轨迹的 ControlNet / Adapter / LoRA。现代系统往往同时使用语义特征和高频像素特征。

Objective

Diffusion 与 Flow Matching

模型学习把噪声视频恢复为真实视频。高噪声阶段主要确定构图、动作和场景演化,低噪声阶段恢复面部、纹理和光影。CFG 等引导方法用于调节文字、图片和其他条件的影响强度。

Video DiT 的常见时序建模方式

  • 空间—时间分解注意力:分别计算空间和时间关系,成本较低。
  • 完整时空注意力:所有 token 共同建模,一致性强但计算昂贵。
  • 局部窗口 / 稀疏注意力:控制长视频的上下文成本。
  • 因果或分段注意力:允许按片段继续生成,适合长视频和实时交互。
  • 多专家架构:让不同专家处理不同噪声阶段、模态或生成任务。

04. 训练技术详解:模型怎样真正学会“让图片动起来”

图生视频训练不是把若干视频直接喂给模型这么简单。它通常由数据工程、Video VAE、图像预训练、视频预训练、I2V 条件训练、高质量微调、偏好对齐和推理蒸馏组成。训练目标同时拉扯三个方向:首帧要像原图、后续帧要有合理运动、整段视频要符合文字与物理常识。

最核心的训练矛盾:图片条件太弱,人物、商品和背景会漂移;图片条件太强,模型会走“复制首帧”的捷径,结果只剩轻微缩放或局部抖动。高质量 I2V 的关键不是单纯增大首帧权重,而是让模型在外观保持与运动自由度之间学到可调的平衡。

4.1 训练数据流水线

数据清洗

镜头切分、去重、去字幕/水印、过滤模糊、低美学和异常视频。

自动标注

用视频理解模型生成详细描述,并估计动作、光流、镜头和主体信息。

课程学习

从图片到视频、从短到长、从低分辨率到高清、多画幅渐进训练。

典型模型会先利用大规模图片学习外观和语义,再用视频数据学习时间、运动和物理先验,最后在精选数据上微调画质、镜头语言和提示词遵循。偏好优化和 VLM 奖励正逐渐进入视频模型的后训练阶段。

4.2 完整训练栈:六个相互依赖的阶段

阶段 0 · 训练 Video VAE
把像素视频压成时空 latent,并保证解码后细节与时间连续性。主模型训练时通常冻结 VAE,避免 latent 空间持续漂移。
阶段 1 · 图像 / 文生图预训练
利用数量更大、质量更高的图片学习物体、材质、构图和文字语义。这一阶段提供大部分空间画质。
阶段 2 · 大规模视频预训练
从低分辨率短片段起步,学习速度、遮挡、形变、相机运动和时间因果;这一阶段决定模型是否真正“会动”。
阶段 3 · I2V 条件适配
加入首帧 latent、图像语义 token、位置 mask 与图文联合 CFG,并通过条件丢弃或加噪防止静态复制。
阶段 4 · 高质量视频微调
提高分辨率、帧数和画幅多样性,用精选视频改善细节、复杂动作、电影化运镜和提示词遵循。
阶段 5 · 后训练与部署
用 SFT、偏好优化或强化学习对齐人类审美,再做少步蒸馏、量化和并行优化,得到可上线版本。
为什么不从头直接训练高清长视频:视频 token 数随“帧数 × 高 × 宽”增长,全注意力的计算和显存还会近似随 token 数平方增长。渐进训练先解决空间,再解决短时运动,最后扩展时长与分辨率,能显著减少无效计算和训练不稳定。

4.3 数据工程:训练上限首先由数据决定

镜头切分与规范化

按 shot boundary 切成单镜头,统一色彩和帧率;保留原始画幅并按宽高比、分辨率、帧数分桶,避免粗暴拉伸或中心裁剪。

去重与质量过滤

清除近重复、硬切、黑帧、严重压缩、模糊、字幕、水印和异常帧,同时记录安全、肖像权、版权和来源许可。

运动质量过滤

用光流、相机估计和动态区域比例过滤近静态样本,也排除剧烈抖动、闪烁和切镜;不能把“光流越大”简单等同于“越好”。

稠密视频描述

用视频理解模型重写 caption,明确主体、动作方向与速度、交互、景别、镜头移动和时间顺序,而不只写“一个人在走路”。

分层与平衡采样

按类别、动作、运镜、风格、画幅、帧率和运动强度分层,抑制自拍、静态展示等高频类别支配训练。

离线编码与审计

预计算 VAE latent 和文本 embedding 可提高吞吐,但会锁定编码器版本;必须保存数据版本、过滤分数和来源链。

数据问题模型学到的错误捷径典型症状修正方法
大量近静态视频复制首帧就能降低损失动态不足、只有呼吸式缩放运动分桶与重采样;首帧条件加噪或丢弃
多镜头混在一个片段把切镜当作正常时间变化瞬移、身份突变、背景跳变严格镜头切分;多镜头叙事另设任务
caption 只写静态内容忽略动作和运镜词“向左走”与“向右走”无差别时序稠密重标注;加入方向对比样本
固定横屏、固定时长把画幅和时间当常量竖屏构图坏,延长后快速漂移多画幅、多帧数、多 fps bucket;显式时长条件
过度美学过滤只会慢镜头和“电影感”普通动作、手持镜头覆盖不足质量与多样性双目标采样,不用单一阈值

4.4 Video VAE:先决定主模型能够“看见”什么

Video VAE 将像素视频 x 压缩成 latent z,DiT 实际上只在 z 上学习。它通常同时做空间和时间压缩,并采用因果或分块 3D 卷积。压缩率越高,主模型越便宜;但小字、手指、细线、快速运动和高频纹理也越可能在进入 DiT 之前永久丢失。

常见损失组合

  • 像素重建:L1/L2 保证整体颜色与结构;
  • 感知损失:LPIPS/VGG 类特征改善主观清晰度;
  • 对抗损失:恢复纹理锐度,但可能引入闪烁;
  • KL 正则:让 latent 连续且便于生成建模;
  • 时间损失:约束相邻帧、光流或频域一致性。

VAE 验收

  • 重建视频的 PSNR、SSIM、LPIPS;
  • 播放时的闪烁、色漂和边缘跳动;
  • 首帧与后续帧的编码规则是否一致;
  • 快速运动、遮挡、文字、脸和手的压力测试;
  • 长视频分块编码后的接缝与内存峰值。
诊断原则:如果原视频经过 VAE 编码再解码就已经出现文字糊、脸漂或时序闪烁,继续增大 DiT、修改提示词或增加采样步数都无法从根本上修复;问题应先在表示层解决。

4.5 主干模型学什么:扩散与流匹配

两类方法都把真实 latent 与随机噪声连接起来,让网络学习“从当前噪声状态往视频数据方向走”。差异主要在路径定义、预测目标和采样器。

训练范式一种常见形式网络预测工程关注点
扩散训练zₜ = αₜz₀ + σₜε噪声 ε、干净 latent z₀ 或 v-parameterization噪声日程、SNR 加权、预测参数化和采样器要匹配
Rectified Flow / Flow Matchingzₜ = (1−t)z₀ + tε沿路径的速度;在该约定下目标可写为 ε−z₀时间采样分布、flow shift 和 ODE 步数决定质量与速度

一次典型 I2V 训练迭代

  1. 采样视频从对应 bucket 取连续片段及稠密文字描述。
  2. 编码目标冻结的 Video VAE 把全部帧编码为干净 latent z₀
  3. 构造图片条件取首帧或随机关键帧,得到首帧 latent、语义 token 和 mask。
  4. 采样时间与噪声采样 t 与高斯噪声 ε,构造 zₜ
  5. 随机丢弃条件独立或联合丢弃文字、图片,训练无条件分支并防止依赖过强。
  6. DiT 前向时空 token 经过自注意力、文本 cross-attention 与图像条件模块。
  7. 计算损失对噪声、速度或 z₀ 做加权 MSE,可叠加首帧、感知和一致性损失。
  8. 更新参数混合精度反传、梯度裁剪、分布式同步,并维护 EMA 权重。
时间步并非平均重要:高噪声端主要决定全局布局和大运动,低噪声端恢复纹理与细节。中间偏置采样可加快结构学习,但长期忽略两端会损害纯噪声起步和最终细节,因此需要损失加权或分阶段调整时间采样。

4.6 I2V 条件注入:既保身份,又不锁死运动

条件通道携带信息常见做法主要风险
首帧 VAE latent像素级布局、颜色和细节与噪声 latent 拼接;写入首帧位置;配合 mask最容易造成静态复制,并继承 VAE 重建误差
图像语义 token身份、类别、风格和全局语义CLIP/VLM 编码后经 cross-attention 注入定位弱,可能“像同类人”但不是同一人
多尺度参考特征纹理、轮廓和细粒度外观ReferenceNet、Adapter 或特征拼接显存大,数据不足时容易过拟合背景
显式运动条件轨迹、姿态、深度、相机运动Control 分支、条件 token 或额外 latent 通道控制估计错误会被强制写入视频

Frame Replacement

每个去噪步把首帧位置替换为未加噪的图像 latent,首帧一致性很强;需要配合图像条件丢弃,避免模型被首帧锁死。

Condition Noise

随时间步给条件图加噪、模糊或低通。高噪声阶段弱化细节复制,低噪声阶段再恢复身份和纹理。

Joint Image–Text CFG

训练时分别丢弃图像和文字,推理时独立调节“像原图”和“听指令”的强度,比单一总 CFG 更适合 I2V。

实际训练常把 T2V 与 I2V 放进同一模型:无图片时使用空图像条件,有图片时启用首帧通道。混合训练能保留文生视频的运动多样性,也能减少专用 I2V 模型对静态复制的过拟合。

4.7 课程训练:先学“是什么”,再学“怎么动”

阶段主要数据训练规格学习重点阶段验收
A · 空间基座高质量图片 + caption多画幅图片语义、构图、材质、审美图像质量稳定,文字条件有效
B · 时序启蒙大规模普通视频低分辨率、短片段基础动作、遮挡、连续性无明显闪烁,动作方向可辨
C · 规模扩展多样视频更多帧、更高分辨率、多 fps复杂运动、运镜、长时一致不同 bucket 无明显质量断层
D · I2V / 控制视频及首帧、姿态、轨迹配对接近部署规格身份保持、可控运动、条件组合静态偏差与主体漂移同时受控
E · 高质微调精选、精标视频目标高清规格细节、镜头语言、复杂提示词人评提升且动态度没有倒退

阶段切换不能只看“训练了多少步”。更可靠的做法是用固定验证集追踪四条曲线:外观质量、时间一致性、动态程度、条件遵循。如果高清微调只提升锐度却持续降低动态程度,说明数据或首帧条件过强,应先纠正采样配比。

4.8 大规模训练工程

并行与显存

  • 数据并行结合 FSDP / ZeRO 分片参数、梯度与优化器状态;
  • 张量并行处理大线性层,序列 / 上下文并行切分长时空 token;
  • Flash Attention、激活检查点、BF16/FP8 与梯度累积;
  • VAE 分块、视频切片和 Ring/Ulysses 类注意力扩展序列长度。

优化器与稳定性

  • AdamW + 学习率 warm-up,再采用常数或余弦衰减;
  • 梯度裁剪、EMA、动态 loss scale 和 NaN 自动隔离;
  • 按“视频 token 总数”而不是“clip 数”定义有效 batch;
  • 分别监控不同时间步、画幅、分辨率和运动档位的损失。
常见瓶颈并不在 GPU 算子:视频解码、随机寻址、VAE 在线编码和不均匀 bucket 都会让加速卡等待。应同时监控数据加载时间、有效 token/s、padding 比例、网络通信和各 bucket 的硬件利用率,而不只看单步耗时。

4.9 高质量微调、偏好对齐与领域适配

方法训练信号 / 适用目标主要改善风险与约束
精选数据 SFT高质量视频—文本对美学、复杂提示词、镜头语言数据太窄会遗忘普通动作并降低多样性
图像辅助空间微调高质量图片或合成静帧纹理、主体细节与画面质量应限制空间模块更新,防止运动能力退化
偏好优化 / DPO同一条件下的优劣视频对人类偏好的画质、运动、遵循度偏好标签昂贵;单一奖励易牺牲动态
视频奖励 + RL/GRPOVLM、专用奖励模型和人评物理、文本一致性和综合质量采样成本高,存在奖励投机和域外失真
全参数微调与基座差异很大的新领域重塑整体画质和运动分布需要较大数据,并混入通用回放防止遗忘
LoRA人物、商品、风格或有限动作便宜、可组合、易管理版本区分空间与时间 LoRA,防止主体像但不再动
Adapter / Control 分支姿态、轨迹、深度等新控制冻结基座,较少破坏通用能力控制与视频要逐帧对齐,并随机化控制强度

视频偏好不应只给一个总分。最好把主体一致性、动作幅度、物理合理性、镜头稳定、清晰度和文字遵循分别标注,并保留“画质更好但动作更差”这类冲突样本。否则奖励模型很容易学会“少动就少出错”。

小数据微调原则:先用几十到几百条样本验证条件设计和过拟合方向,再扩充数据;保留训练中未出现的人物、背景与动作组合。只在训练主体上看起来很像,不能证明模型学会了可泛化的身份保持或动作规律。

4.10 蒸馏与推理效率

  • 高压缩 Video VAE,减少时空 token 数;
  • 少步蒸馏和 Consistency / Lightning 类采样;
  • 量化、算子融合、Flash Attention 和序列并行;
  • 缓存相邻去噪步骤中变化较小的特征;
  • 粗分辨率生成,再做空间和时间超分;
  • 按片段生成并压缩历史上下文。
工程上的现实:“模型生成耗时”并不是唯一成本。提示词改写、排队、超分、音频、候选筛选和失败重试,通常共同决定一个可用镜头的最终成本。

4.11 训练监控与消融:不要只盯总 loss

固定样片矩阵

固定 seed 和提示词,覆盖静态人物、快速动作、物体交互、运镜、文字、手部、动物和复杂遮挡;对 checkpoint 横向播放比较。

分维度自动评测

分别测图像保真、动态度、时间一致、文本一致、美学和物理;再用人工盲评校准,不能只压成一个总分。

关键消融

单独扫描首帧噪声、图像 dropout、图像/文本 CFG、运动样本比例、时间步分布与分辨率课程,定位静态或漂移来源。

可进入部署的最低证据:在未见过的主体和动作组合上,外观质量、身份保持、动态程度与提示词遵循同时不退化;VAE、基座模型、蒸馏模型和最终产品流水线都有各自的固定回归集,而不是只展示精选样片。

05. 可控生成:从“描述”走向“导演”

文字很难精确表达“第 2 秒抬手,第 4 秒转身,同时镜头向左环绕”。因此,可控生成正在从自然语言扩展到结构化条件。

对象运动

拖拽轨迹、稠密光流、运动区域、分割蒙版。

人物表演

人体骨架、面部/手部关键点、驱动视频和音频。

电影语言

相机内外参、镜头轨迹、景别、焦段和时间轴。

画面结构

深度、法线、边缘、草图、布局和遮罩。

关键时刻

首帧、尾帧、中间关键帧及分镜脚本。

多模态参考

人物图、商品图、场景图、参考视频、音乐和音效组合输入。

Motion-I2V 通过显式预测像素轨迹,再沿轨迹传播原图特征;DragAnything 使用拖拽轨迹控制多个实体;MotionCtrl 则将相机运动与物体运动分开建模。这类方法代表了从“继续堆提示词”向“可操作控制信号”的转变。

06. 动作迁移任务详解

动作迁移(Motion Transfer / Character Animation)的标准输入是一张目标角色参考图和一段驱动视频,输出是“由目标角色完成驱动视频动作”的新视频。它要求模型把两类信息拆开:外观来自参考图,动作与节奏来自驱动视频。

形式化理解:给定参考图 I_ref 和驱动视频 V_drv,模型生成 V_out,希望 Appearance(V_out) ≈ Appearance(I_ref),同时 Motion(V_out) ≈ Motion(V_drv)。难点不在复制像素,而在把身份、体型、服装、动作、表情、相机和背景正确解耦后再重新组合。

6.1 动作迁移内部还包含六类任务

子任务主要驱动信号保持什么典型用途
肖像表情迁移头部姿态、眼睛、嘴部和表情脸部身份与发型头像动画、表情复刻
全身姿态迁移人体骨架、DensePose 或 3D 姿态人物、服装和背景舞蹈、走秀、虚拟试衣展示
整体角色动画身体、面部、手部联合信号完整角色外观和表演节奏表演、短剧、游戏角色
角色替换驱动视频的动作、镜头和空间布局原视频背景、光照和构图替身、预演、角色重定向
音频驱动动画语音、歌声、韵律和语义人物身份数字人、演讲、唱歌
任意角色迁移显式姿态或隐式运动 token卡通、动物、拟人角色结构游戏、动画、IP 内容

严格来说,“音频驱动”是动作生成而不是视频到视频的动作迁移,但两者在产品上经常被统一为角色动画:参考图负责外观,音频或视频负责表演。

6.2 一条典型的技术流水线

参考角色身份、脸、体型、服装、纹理
+
驱动视频身体、表情、手势、节奏、相机
解耦与重定向外观编码器 + 运动编码器
姿态对齐、比例适配、局部专家
视频合成Video DiT / 扩散解码
角色动画或场景内替换
  1. 预处理:检测人物、脸、手、分割区域、相机变化,并从驱动视频提取姿态或隐式运动特征。
  2. 外观编码:从参考图提取身份、服装、发型、体型和高频纹理,多参考图系统还会建立主体特征库。
  3. 运动重定向:把驱动者的动作映射到目标角色坐标系,处理身高、四肢长度、头身比和画幅差异。
  4. 时空生成:将外观与运动条件注入视频 U-Net 或 Video DiT,联合生成连续帧。
  5. 局部增强:对脸、眼睛、嘴型和手部使用更高分辨率特征、区域损失或专门分支。
  6. 合成与重光照:角色替换模式还要保留背景、阴影、遮挡关系,并使新角色适应原场景色温和亮度。

6.3 运动究竟如何表示

运动表示优点容易失败的地方适合场景
2D 骨架 / DWPose紧凑、可编辑、身份泄漏少缺少深度、遮挡、衣服和手指细节;比例差异会错位常规全身动作、舞蹈
DensePose / 人体语义图比稀疏骨架包含更多表面对应关系快速运动、宽松服装和遮挡下估计不稳人体表面与服装对齐
SMPL / 3D 姿态有深度和身体结构,可做比例重定向拟合误差会传递;难覆盖头发、裙摆和非人角色大视角变化、结构精确的人体动画
光流 / 轨迹保留精细的局部运动和相机运动会把驱动者轮廓和背景变化一起带入,长遮挡时不可靠局部动作、物体和镜头运动
原始视频特征 / 隐式 token可捕捉表情、手势、软组织和运动风格容易泄漏驱动者的脸、衣服和体型,难以显式编辑高表现力整体迁移
混合表示身体用结构信号,脸和手用隐式特征,兼顾稳定与细节系统复杂,条件之间可能冲突当前高质量整体角色动画

技术趋势正从“所有部位共用一张骨架图”转向分而治之:身体需要全局结构稳定,脸部需要高频表情,手部需要局部关节细节。Kling-MotionControl 即采用身体、脸和手的异构运动表示;IM-Animation 则把每帧动作压缩成紧凑的一维运动 token,减少空间比例错位和驱动者身份泄漏。

6.4 外观保持与运动注入

Appearance branch

外观分支

ReferenceNet、视觉编码器或主体库在多个网络层注入参考角色特征。浅层偏纹理和颜色,深层偏身份与语义;多尺度 Reference Attention 能比单个 CLIP 向量保留更多衣服、饰品和面部细节。

Motion branch

运动分支

Pose Guider、ControlNet、运动 Transformer 或视频编码器把驱动信号变成逐帧条件。显式姿态更干净可控;隐式特征表现力更强,但必须通过瓶颈、遮罩或身份无关训练防止外观泄漏。

Retargeting

动作重定向

源角色和目标角色的肩宽、腿长、头身比不同,不能直接叠加 2D 坐标。系统需要归一化骨架、3D 对齐、局部比例变换,或使用与空间位置弱绑定的运动 token。

Temporal synthesis

时空联合生成

逐帧生成容易闪烁,当前方法通过时间注意力、完整序列上下文、重叠片段 latent 融合或因果生成保持连续性。脸、手和快速运动区域常被额外加权。

6.5 模型如何获得训练数据

最常见的训练方式是从同一段人物视频取一帧作为“参考图”,其余帧作为目标视频,再由姿态或视频特征提供驱动。这种自重建数据量大、无需人工配对,但也带来一个问题:参考人物和驱动人物本来就是同一身份,模型可能偷看驱动视频的脸和服装,而没有真正学会跨身份动作迁移。

  • 身份无关瓶颈:只允许运动分支传递姿态或压缩运动 token,阻断纹理和身份信息。
  • 条件随机丢弃:随机移除部分姿态、音频或视频条件,使模型兼容不同驱动强度。
  • 跨身份或合成配对:构造同一动作对应不同角色的数据,直接训练“动作相同、身份不同”。
  • 分阶段训练:先学外观重建,再学逐帧姿态,最后训练时间模块和整体 DiT。
  • 区域加权:对脸、手和高置信度关节点放大损失,缓解关键区域模糊。
  • 混合条件扩容:将音频、视频、姿态等不同强弱条件混合训练,利用更多不完全标注的视频。

6.6 代表性技术节点

方法年份关键设计意义
Animate Anyone2023/24ReferenceNet + Pose Guider + 时间建模建立扩散式角色动画的经典范式
MagicAnimate2023/24外观编码器、视频扩散、长视频融合强化参考身份与时间一致性
Champ2024SMPL、深度、法线和语义图联合引导将 3D 人体先验引入动作迁移
MimicMotion2024/25置信度感知姿态、手部区域增强、渐进 latent 融合提升长视频与错误姿态下的稳定性
LivePortrait2024隐式关键点、拼接和眼嘴重定向非扩散路线,实时肖像动画效率突出
OmniHuman-12025DiT + 音频/视频等混合条件训练将弱条件音频驱动扩展到半身和全身表演
Wan-Animate2025骨架身体控制、隐式表情、重光照 LoRA统一角色动画和原视频内角色替换
Kling-MotionControl2026DiT 中分别编排身体、脸和手运动表示整体动作迁移转向多粒度运动建模
IM-Animation2026身份解耦的一维隐式运动 token缓解比例错位与驱动者身份泄漏
OmniHuman-1.52026多模态规划模型 + DiT,语音语义与动作规划音频驱动从嘴型同步走向长时行为和多角色互动

6.7 为什么动作迁移仍然会失败

身份泄漏

驱动者的脸、体型或服装混入输出,说明运动分支没有真正去身份。

参考姿态锁定

参考图姿势影响过强,目标角色无法完整执行驱动动作。

比例错配

儿童、夸张卡通、动物或不同头身比无法直接套用人体 2D 骨架。

遮挡与接触

交叉手臂、转身、坐下、拿物体会暴露不可见区域并改变遮挡层级。

相机和背景纠缠

驱动视频的推拉摇移、背景光流可能被误认为角色自身动作。

细粒度动作损失

脚步节奏看似一致,但手指、眼神、口型和个人步态等信号被平滑掉。

动作迁移不等于动作捕捉:它生成的是“视觉上像在做同一动作”的新像素,不保证逐关节角度、接触点或生物力学完全一致。研究发现,当前生成动画即使视觉质量较高,也可能无法保留可用于步态识别的细微运动特征。需要精确骨骼数据、游戏控制或机器人轨迹时,应使用 3D 动捕 / 姿态估计与骨骼重定向,而不是把生成视频当成数值准确的动作数据。

6.8 评测不能只看“像不像一段真视频”

  • 身份保持:ArcFace、DINO/CLIP 相似度,以及服装和配饰区域的一致性。
  • 动作遵循:关键点误差、PCK、3D MPJPE、轨迹/光流误差和动作节奏对齐。
  • 表情与口型:面部关键点、表情系数、SyncNet 类音画同步指标。
  • 时间质量:FVD、闪烁、光流一致性和跨片段边界突变。
  • 局部质量:脸、手、脚、饰品以及人与物接触区域单独评测。
  • 人类评测:分开询问“角色像不像”“动作像不像”“是否自然”,避免单一总体分掩盖问题。

6.9 实际选型与素材准备

目标优先方案素材建议
实时头像、表情复刻LivePortrait 类隐式关键点方案正脸清晰、少遮挡、驱动视频头部完整
舞蹈和全身表演视频驱动整体角色动画;本地可选 Wan-Animate全身入镜、固定镜头、四肢不出画、动作连续
角色替换并保留场景显式 replacement 模式 + 人物蒙版 + 重光照背景稳定、遮挡关系清楚、保留干净背景板更佳
音频口播或唱歌OmniHuman / HunyuanVideo-Avatar 等音频驱动模型干净人声、少混响;全身动作应给文字或额外视频条件
卡通、动物或异形角色身份无关隐式运动或任意角色模型参考图尽量显示完整结构;避免与人类体型差异过大的动作
精确动画和可编辑骨骼传统动捕 / 3D 姿态重定向,生成模型只做渲染增强使用多视角、深度或专业动捕数据
  1. 参考图最好完整显示要运动的身体区域,分辨率足够、轮廓清楚,避免手脚被裁掉。
  2. 参考图初始姿势应尽量接近驱动视频第一帧,否则开头容易突然变形。
  3. 驱动视频尽量单镜头、少剪切、少遮挡;快速旋转、地面动作和多人接触应拆段处理。
  4. 角色与驱动者的画幅占比、朝向和头身比越接近,迁移通常越稳定。
  5. 需要保留原背景时应明确选择“角色替换”而不是“角色动画”,并提供蒙版或背景条件。
  6. 商业和公开使用前确认参考人物、声音和动作视频的授权,并对生成内容进行来源标记。

07. 最核心的矛盾:原图一致性 × 运动幅度

图片条件太弱

  • 脸、服装和商品结构发生变化
  • 首帧之后逐渐换人或换风格
  • 新视角无法保持主体细节

图片条件太强

  • 模型直接复制原图,形成“静态捷径”
  • 只产生眨眼、呼吸等轻微运动
  • 奔跑、转身等提示难以执行

CVPR 2026 的研究显示,在一个控制实验中,从 T2V 转成 I2V 后,动态程度下降约 18.6%。原因之一是原图的高频细节过早锁死生成路径。自适应低通条件在早期阶段弱化高频约束、后期再恢复细节,可在一定程度上改善这个矛盾。

实践含义:产品中的“动态强度、创意度、图片参考强度、CFG”等参数,本质上都在不同程度地调节这个平衡。

08. 技术演进脉络

2021 以前|变形与专用生成
GAN、RNN、光流、关键点和神经渲染为主,适合特定对象或小幅运动。
2022|视频扩散成立
将图像扩散扩展到时空维度,联合训练图片和视频,并开始研究时间/空间扩展。
2023|Latent Video Diffusion 普及
在 latent 中生成显著降低成本,SVD、I2VGen-XL、DynamiCrafter 等推进开放域图像动画。
2024|Video DiT 与显式运动控制
3D VAE、时空 token、Transformer 扩展成为主线;轨迹、相机和姿态控制快速发展。
2025|规模化、开放模型与后训练
Wan、HunyuanVideo、LTX 等开放权重模型扩大规模;蒸馏、缓存、偏好优化和长视频成为重点。
2026|统一多模态和音视频生成
文本、图片、视频、音频联合参考,原生声音、多镜头、局部编辑和实时生成逐渐进入产品。

09. 2026 年代表性系统

下表用于展示技术方向,不是统一排行榜。闭源模型公开信息有限,厂商内部测试集和营销样片无法直接横向比较。

系统公开能力与技术定位开放性
Google Veo 3.1首帧、首尾帧、多张内容/风格参考图、视频延长及原生音频;API 提供 720p/1080p 和多种时长。闭源 API / 产品
Kling 3.0统一文本、图片、参考视频和编辑流程;加强多参考一致性、多语言原生音频及最长 15 秒生成。闭源产品
Seedance 2.0统一图像、视频、音频和文字输入;最多组合 9 张图片、3 段视频和 3 段音频,支持 15 秒多镜头音视频。闭源产品 / 云服务
Runway Gen-4.5强调复杂连续指令、电影镜头语言和风格一致性;I2V 支持 2–10 秒、720p、24/25fps。闭源产品
Sora 2视频与同步音频联合生成,强调物理表现、提示词遵循和可控性;公开架构细节相对有限。闭源 API
Wan 2.2重要开放权重路线;提供 14B I2V 和统一 5B TI2V。5B 支持 720p/24fps,并可面向 24GB 显存部署。开放权重
LTX-2.322B 音视频模型;提供 I2V、关键帧插值、控制 LoRA、局部重生成和两阶段超分。需留意社区许可证。开放权重 / 社区许可
HunyuanVideo-I2V支持首帧一致性、I2V 推理和特效 LoRA 训练,是可定制图生视频的重要研究基线。开放权重

10. 长视频、流式生成与实时化

一次性让所有帧参与完整时空注意力,计算和显存会迅速增长。当前解决方法包括滑动窗口、分段生成、历史帧压缩、因果注意力、历史引导和自回归式视频扩散。

FramePack

把历史帧压缩为固定长度上下文,使生成瓶颈更接近图像扩散;同时通过反向采样和提前建立端点来减轻长视频漂移。

Diffusion Forcing

允许模型接受可变数量的历史帧,并使用历史引导提高时间一致性、运动表现和超长视频滚动稳定性。

需要区分:“可以生成一分钟”不等于“一分钟都可直接使用”。长期身份、服装、道具、空间关系和事件因果仍会逐段漂移。

11. 怎样完整评测图生视频

  1. 原图保持脸、服装、商品、背景、构图和画风是否延续。
  2. 时间一致性闪烁、结构突变、主体漂移和细节跳变。
  3. 运动质量运动幅度、平滑度、完整性和自然程度。
  4. 控制遵循提示词、轨迹、姿态、相机和起止帧是否准确。
  5. 物理与常识重力、碰撞、遮挡、数量、空间和因果关系。
  6. 视觉质量清晰度、纹理、噪声、压缩和美学。
  7. 音画质量口型、对白、环境声、节奏和画面事件同步。
  8. 生产指标首轮可用率、重试次数、时延和每个可用镜头成本。

VBench 将视频质量拆为主体一致性、动态程度、运动平滑度、闪烁和美学等多个维度,并在 VBench++ 中适配 I2V。传统 FVD 不适合作为唯一指标:它对部分时间失真不敏感,并且需要较大样本才能稳定估计。

12. 工程与业务选型建议

需求优先技术方案原因与注意点
广告、短片、分镜预演高质量闭源通用 I2V + 多参考图综合画质和指令遵循更好;应按短镜头生成,再剪辑。
品牌人物 / 商品一致性多参考、角色参考、首尾帧和局部编辑单一首帧不够;文字和包装细节建议后期合成。
口播数字人专用音频驱动头像模型比通用 I2V 的口型和身份稳定性更高。
舞蹈 / 人物动作迁移姿态或驱动视频条件模型显式动作条件比纯文字控制可靠。
二维动画中间帧生成式关键帧插值 + 草图/线稿控制适合端点明确的非线性运动,但仍需人工修线。
隐私、本地化、模型微调Wan 2.2、LTX-2.3、HunyuanVideo 等开放权重方案可控、可训练;需评估显存、许可、运维和推理时延。
精确产品运镜2.5D / 3D 渲染与生成模型混合几何和品牌细节必须准确时,不宜完全依赖生成式视频。

更稳定的生产工作流

  1. 先设计主体、场景和风格参考图,保持画幅一致;
  2. 一个镜头只安排一个主要动作和一个明确运镜;
  3. I2V 提示词重点描述“接下来发生什么”,少重复图片已有内容;
  4. 需要明确落点时使用尾帧或关键帧,不靠长篇文字硬控;
  5. 一次生成多候选,以“可用率”而不是最好样片评估模型;
  6. 文字、Logo、商品标签、复杂特效和精确节奏留给后期;
  7. 长片拆成短镜头,并维护角色、道具和场景参考资产库。

13. 未解决问题与未来趋势

当前局限

  • 隐式物理先验不是可靠的物理仿真;
  • 图片不可见区域只能依靠模型猜测;
  • 拥抱、格斗、递物等多主体接触仍脆弱;
  • 精确帧级时间控制有限;
  • 长视频存在身份和世界状态漂移;
  • 文字、手部和微小结构仍不稳定;
  • 生成结果缺乏像 3D 软件那样的完全可逆编辑。

清晰趋势

  • 从单图走向图、视频、音频统一参考;
  • 从提示词走向轨迹、姿态和时间轴控制;
  • 从一次生成走向局部重拍和对象级编辑;
  • 从无声视频走向原生音视频联合建模;
  • 从单镜头一致性走向世界状态一致性;
  • 从整段生成走向流式、实时和交互视频;
  • 融合显式 3D、几何、物理和可验证约束。
成熟度判断:图生视频已经进入“可以生成有用短镜头素材”的阶段,但尚未进入“无需筛选即可生成完整成片”的阶段。可靠的生产流程仍然是参考资产设计、短镜头生成、多候选筛选、局部重生成与传统后期合成。

14. 代表性论文与官方资料

  1. Image-to-Video Diffusion: From Foundations to Open Frontiers — 2026 年图生视频专项综述。
  2. Video Diffusion Models — 将图像扩散系统化扩展到视频。
  3. Stable Video Diffusion — 图像预训练、视频预训练、精选视频微调及系统化数据过滤。
  4. VideoCrafter2 — 用低质量视频学习运动、用高质量图像改善空间质量的解耦训练。
  5. STIV — 统一 T2V/I2V、首帧替换、图文联合 CFG 与图像条件丢弃。
  6. Conditional Image Leakage — 研究 I2V 静态偏差及随时间步调整条件噪声的方法。
  7. CV-VAE — 视频 VAE 的重建、感知、对抗与 KL 训练设计。
  8. DynamiCrafter — 语义上下文与完整图像 latent 双路注入。
  9. CogVideoX — 3D VAE 与视频 Diffusion Transformer。
  10. Wan — 开放大规模视频生成框架。
  11. HunyuanVideo — 大规模视频生成的系统化框架。
  12. LTX-Video — 高压缩 latent 与快速视频生成。
  13. Classifier-Free Diffusion Guidance — 通过条件丢弃联合训练条件与无条件预测。
  14. VideoDPO — 视频生成的多维偏好对齐。
  15. Systematic Post-Training for Video Generation — SFT、视频强化学习、提示词增强与推理优化的系统化后训练框架。
  16. Motion-I2V — 显式运动场与轨迹控制。
  17. DragAnything — 基于实体表示的拖拽运动控制。
  18. MotionCtrl — 相机运动与对象运动解耦控制。
  19. Animate Anyone — ReferenceNet、姿态引导和时间建模的经典角色动画框架。
  20. MagicAnimate — 外观保持与时序一致的人体动作迁移。
  21. MimicMotion — 置信度感知姿态引导、手部增强和长视频 latent 融合。
  22. LivePortrait — 隐式关键点、拼接与眼嘴重定向的高效肖像动画。
  23. OmniHuman-1 — 通过混合运动条件扩展音频及视频驱动的人体动画。
  24. Wan-Animate — 统一角色动画、角色替换和场景重光照。
  25. Kling-MotionControl — 身体、脸部与手部多粒度运动协同。
  26. IM-Animation — 身份解耦的紧凑隐式运动表示。
  27. OmniHuman-1.5 — 多模态规划与 DiT 结合的长时音频驱动角色动画。
  28. Gait Biometric Fidelity Study — 说明视觉逼真不等同于保留精确的个体运动特征。
  29. FramePack — 固定长度历史上下文与长视频生成。
  30. History-Guided Video Diffusion — 可变历史条件与 Diffusion Forcing。
  31. VBench / VBench++ — 多维视频生成评测体系。
  32. Beyond FVD — 对 FVD 局限的系统分析。
  33. Adaptive Low-Pass Guidance — I2V 静态偏差与动态增强研究。
  34. Veo 3.1 官方文档Wan 2.2 官方仓库LTX-2 官方仓库