当前通用图生视频的主流,已经收敛到“时空压缩 Video VAE + 视频 Diffusion Transformer + Diffusion / Flow Matching + 多模态条件控制”。
竞争焦点已经从“让图片动起来”,转向主体与风格一致性、动作与物理合理性、镜头控制、多模态参考、原生音频、长时一致性,以及生成成本和可编辑性。
01. “图生视频”并不是一个单一任务
输入图片可能是强约束的首帧,也可能只是人物、商品、场景或风格的参考。不同任务的条件强度和适用模型并不相同。
| 任务 | 图片的作用 | 典型用途 | 关键技术要求 |
|---|---|---|---|
| 首帧生成视频 | 必须成为视频第一帧 | 照片动画、广告镜头 | 首帧重建、后续身份保持 |
| 参考图生成视频 | 定义人物、商品或风格 | 换场景、跨镜头叙事 | 参考特征解耦、多视角一致性 |
| 首尾帧插值 | 指定开始和结束画面 | 转场、变形、镜头衔接 | 双端条件、遮挡与中间路径推断 |
| 多参考图生成 | 分别提供人物、场景、道具、服装 | 商业广告、品牌内容 | 多条件路由、元素绑定 |
| 动作迁移 | 图片给角色,视频或姿态给动作 | 舞蹈、数字人、角色动画 | 姿态与外观解耦、身体结构稳定 |
| 音频驱动 | 图片给人物,音频驱动表情和嘴型 | 口播、虚拟主播 | 音画同步、身份和口型保持 |
| 相机控制 | 图片给场景,相机轨迹给视角 | 产品环绕、推进、航拍 | 隐式三维理解、视角外内容补全 |
| 生成式插帧 | 两张关键帧限定动作端点 | 二维动画中间帧 | 非线性运动、反遮挡、线条稳定 |
02. 六条主要技术路线
| 路线 | 核心原理 | 优势 | 主要局限 |
|---|---|---|---|
| 2.5D 运镜 / 视差 | 深度估计、分层、图像变形 | 快、便宜、稳定 | 只能推拉摇移,无法生成真正语义动作 |
| 光流 / 网格变形 | 预测像素或特征运动场 | 适合水、云、头发和循环动画 | 大动作和新视角容易拉伸破碎 |
| 专用动作迁移 | 姿态、关键点、驱动视频控制主体 | 人物动作精确 | 任务范围窄,开放域泛化有限 |
| 生成式关键帧插值 | 利用视频先验生成中间过程 | 能处理遮挡和非线性运动 | 中间路径未必符合导演意图 |
| 通用扩散式 I2V | 从噪声联合生成整段视频 | 开放域、画质高、动作丰富 | 算力高,精准控制和长视频仍难 |
| 自回归 / 世界模型 | 按帧或按片段预测后续世界状态 | 适合长视频、流式和交互生成 | 容易累计误差和身份漂移 |
当前通用能力最强的是扩散 / 流匹配路线;2.5D、光流、专用驱动和关键帧插值并未消失,而是作为更稳定、更便宜或更可控的补充。
03. 主流模型内部架构
在时空 latent 中扩散去噪 / Flow Matching
Video VAE:压缩空间和时间
高清长视频像素量过大,模型先把视频压缩成低维时空 latent,再由 DiT 生成,最后解码还原。更高压缩率能显著提速,但会增加人脸、手部、小字和纹理损失,因此现代系统常加入二阶段超分或高质量解码器。
3D U-Net → Video DiT
早期主流是在图像扩散模型上增加时间卷积和时间注意力;当前更偏向将视频切成时空 token,由 Transformer 建模。Video DiT 更容易扩大模型、统一多模态条件和支持不同分辨率、时长与画幅。
图片条件的多路注入
常见方法包括 latent 拼接、首帧遮罩、视觉 token 交叉注意力、Reference Attention,以及注入深度、姿态、边缘、轨迹的 ControlNet / Adapter / LoRA。现代系统往往同时使用语义特征和高频像素特征。
Diffusion 与 Flow Matching
模型学习把噪声视频恢复为真实视频。高噪声阶段主要确定构图、动作和场景演化,低噪声阶段恢复面部、纹理和光影。CFG 等引导方法用于调节文字、图片和其他条件的影响强度。
Video DiT 的常见时序建模方式
- 空间—时间分解注意力:分别计算空间和时间关系,成本较低。
- 完整时空注意力:所有 token 共同建模,一致性强但计算昂贵。
- 局部窗口 / 稀疏注意力:控制长视频的上下文成本。
- 因果或分段注意力:允许按片段继续生成,适合长视频和实时交互。
- 多专家架构:让不同专家处理不同噪声阶段、模态或生成任务。
04. 训练技术详解:模型怎样真正学会“让图片动起来”
图生视频训练不是把若干视频直接喂给模型这么简单。它通常由数据工程、Video VAE、图像预训练、视频预训练、I2V 条件训练、高质量微调、偏好对齐和推理蒸馏组成。训练目标同时拉扯三个方向:首帧要像原图、后续帧要有合理运动、整段视频要符合文字与物理常识。
4.1 训练数据流水线
数据清洗
镜头切分、去重、去字幕/水印、过滤模糊、低美学和异常视频。
自动标注
用视频理解模型生成详细描述,并估计动作、光流、镜头和主体信息。
课程学习
从图片到视频、从短到长、从低分辨率到高清、多画幅渐进训练。
典型模型会先利用大规模图片学习外观和语义,再用视频数据学习时间、运动和物理先验,最后在精选数据上微调画质、镜头语言和提示词遵循。偏好优化和 VLM 奖励正逐渐进入视频模型的后训练阶段。
4.2 完整训练栈:六个相互依赖的阶段
把像素视频压成时空 latent,并保证解码后细节与时间连续性。主模型训练时通常冻结 VAE,避免 latent 空间持续漂移。
利用数量更大、质量更高的图片学习物体、材质、构图和文字语义。这一阶段提供大部分空间画质。
从低分辨率短片段起步,学习速度、遮挡、形变、相机运动和时间因果;这一阶段决定模型是否真正“会动”。
加入首帧 latent、图像语义 token、位置 mask 与图文联合 CFG,并通过条件丢弃或加噪防止静态复制。
提高分辨率、帧数和画幅多样性,用精选视频改善细节、复杂动作、电影化运镜和提示词遵循。
用 SFT、偏好优化或强化学习对齐人类审美,再做少步蒸馏、量化和并行优化,得到可上线版本。
4.3 数据工程:训练上限首先由数据决定
镜头切分与规范化
按 shot boundary 切成单镜头,统一色彩和帧率;保留原始画幅并按宽高比、分辨率、帧数分桶,避免粗暴拉伸或中心裁剪。
去重与质量过滤
清除近重复、硬切、黑帧、严重压缩、模糊、字幕、水印和异常帧,同时记录安全、肖像权、版权和来源许可。
运动质量过滤
用光流、相机估计和动态区域比例过滤近静态样本,也排除剧烈抖动、闪烁和切镜;不能把“光流越大”简单等同于“越好”。
稠密视频描述
用视频理解模型重写 caption,明确主体、动作方向与速度、交互、景别、镜头移动和时间顺序,而不只写“一个人在走路”。
分层与平衡采样
按类别、动作、运镜、风格、画幅、帧率和运动强度分层,抑制自拍、静态展示等高频类别支配训练。
离线编码与审计
预计算 VAE latent 和文本 embedding 可提高吞吐,但会锁定编码器版本;必须保存数据版本、过滤分数和来源链。
| 数据问题 | 模型学到的错误捷径 | 典型症状 | 修正方法 |
|---|---|---|---|
| 大量近静态视频 | 复制首帧就能降低损失 | 动态不足、只有呼吸式缩放 | 运动分桶与重采样;首帧条件加噪或丢弃 |
| 多镜头混在一个片段 | 把切镜当作正常时间变化 | 瞬移、身份突变、背景跳变 | 严格镜头切分;多镜头叙事另设任务 |
| caption 只写静态内容 | 忽略动作和运镜词 | “向左走”与“向右走”无差别 | 时序稠密重标注;加入方向对比样本 |
| 固定横屏、固定时长 | 把画幅和时间当常量 | 竖屏构图坏,延长后快速漂移 | 多画幅、多帧数、多 fps bucket;显式时长条件 |
| 过度美学过滤 | 只会慢镜头和“电影感” | 普通动作、手持镜头覆盖不足 | 质量与多样性双目标采样,不用单一阈值 |
4.4 Video VAE:先决定主模型能够“看见”什么
Video VAE 将像素视频 x 压缩成 latent z,DiT 实际上只在 z 上学习。它通常同时做空间和时间压缩,并采用因果或分块 3D 卷积。压缩率越高,主模型越便宜;但小字、手指、细线、快速运动和高频纹理也越可能在进入 DiT 之前永久丢失。
常见损失组合
- 像素重建:L1/L2 保证整体颜色与结构;
- 感知损失:LPIPS/VGG 类特征改善主观清晰度;
- 对抗损失:恢复纹理锐度,但可能引入闪烁;
- KL 正则:让 latent 连续且便于生成建模;
- 时间损失:约束相邻帧、光流或频域一致性。
VAE 验收
- 重建视频的 PSNR、SSIM、LPIPS;
- 播放时的闪烁、色漂和边缘跳动;
- 首帧与后续帧的编码规则是否一致;
- 快速运动、遮挡、文字、脸和手的压力测试;
- 长视频分块编码后的接缝与内存峰值。
4.5 主干模型学什么:扩散与流匹配
两类方法都把真实 latent 与随机噪声连接起来,让网络学习“从当前噪声状态往视频数据方向走”。差异主要在路径定义、预测目标和采样器。
| 训练范式 | 一种常见形式 | 网络预测 | 工程关注点 |
|---|---|---|---|
| 扩散训练 | zₜ = αₜz₀ + σₜε | 噪声 ε、干净 latent z₀ 或 v-parameterization | 噪声日程、SNR 加权、预测参数化和采样器要匹配 |
| Rectified Flow / Flow Matching | zₜ = (1−t)z₀ + tε | 沿路径的速度;在该约定下目标可写为 ε−z₀ | 时间采样分布、flow shift 和 ODE 步数决定质量与速度 |
一次典型 I2V 训练迭代
- 采样视频从对应 bucket 取连续片段及稠密文字描述。
- 编码目标冻结的 Video VAE 把全部帧编码为干净 latent
z₀。 - 构造图片条件取首帧或随机关键帧,得到首帧 latent、语义 token 和 mask。
- 采样时间与噪声采样
t与高斯噪声ε,构造zₜ。 - 随机丢弃条件独立或联合丢弃文字、图片,训练无条件分支并防止依赖过强。
- DiT 前向时空 token 经过自注意力、文本 cross-attention 与图像条件模块。
- 计算损失对噪声、速度或 z₀ 做加权 MSE,可叠加首帧、感知和一致性损失。
- 更新参数混合精度反传、梯度裁剪、分布式同步,并维护 EMA 权重。
4.6 I2V 条件注入:既保身份,又不锁死运动
| 条件通道 | 携带信息 | 常见做法 | 主要风险 |
|---|---|---|---|
| 首帧 VAE latent | 像素级布局、颜色和细节 | 与噪声 latent 拼接;写入首帧位置;配合 mask | 最容易造成静态复制,并继承 VAE 重建误差 |
| 图像语义 token | 身份、类别、风格和全局语义 | CLIP/VLM 编码后经 cross-attention 注入 | 定位弱,可能“像同类人”但不是同一人 |
| 多尺度参考特征 | 纹理、轮廓和细粒度外观 | ReferenceNet、Adapter 或特征拼接 | 显存大,数据不足时容易过拟合背景 |
| 显式运动条件 | 轨迹、姿态、深度、相机运动 | Control 分支、条件 token 或额外 latent 通道 | 控制估计错误会被强制写入视频 |
Frame Replacement
每个去噪步把首帧位置替换为未加噪的图像 latent,首帧一致性很强;需要配合图像条件丢弃,避免模型被首帧锁死。
Condition Noise
随时间步给条件图加噪、模糊或低通。高噪声阶段弱化细节复制,低噪声阶段再恢复身份和纹理。
Joint Image–Text CFG
训练时分别丢弃图像和文字,推理时独立调节“像原图”和“听指令”的强度,比单一总 CFG 更适合 I2V。
实际训练常把 T2V 与 I2V 放进同一模型:无图片时使用空图像条件,有图片时启用首帧通道。混合训练能保留文生视频的运动多样性,也能减少专用 I2V 模型对静态复制的过拟合。
4.7 课程训练:先学“是什么”,再学“怎么动”
| 阶段 | 主要数据 | 训练规格 | 学习重点 | 阶段验收 |
|---|---|---|---|---|
| A · 空间基座 | 高质量图片 + caption | 多画幅图片 | 语义、构图、材质、审美 | 图像质量稳定,文字条件有效 |
| B · 时序启蒙 | 大规模普通视频 | 低分辨率、短片段 | 基础动作、遮挡、连续性 | 无明显闪烁,动作方向可辨 |
| C · 规模扩展 | 多样视频 | 更多帧、更高分辨率、多 fps | 复杂运动、运镜、长时一致 | 不同 bucket 无明显质量断层 |
| D · I2V / 控制 | 视频及首帧、姿态、轨迹配对 | 接近部署规格 | 身份保持、可控运动、条件组合 | 静态偏差与主体漂移同时受控 |
| E · 高质微调 | 精选、精标视频 | 目标高清规格 | 细节、镜头语言、复杂提示词 | 人评提升且动态度没有倒退 |
阶段切换不能只看“训练了多少步”。更可靠的做法是用固定验证集追踪四条曲线:外观质量、时间一致性、动态程度、条件遵循。如果高清微调只提升锐度却持续降低动态程度,说明数据或首帧条件过强,应先纠正采样配比。
4.8 大规模训练工程
并行与显存
- 数据并行结合 FSDP / ZeRO 分片参数、梯度与优化器状态;
- 张量并行处理大线性层,序列 / 上下文并行切分长时空 token;
- Flash Attention、激活检查点、BF16/FP8 与梯度累积;
- VAE 分块、视频切片和 Ring/Ulysses 类注意力扩展序列长度。
优化器与稳定性
- AdamW + 学习率 warm-up,再采用常数或余弦衰减;
- 梯度裁剪、EMA、动态 loss scale 和 NaN 自动隔离;
- 按“视频 token 总数”而不是“clip 数”定义有效 batch;
- 分别监控不同时间步、画幅、分辨率和运动档位的损失。
4.9 高质量微调、偏好对齐与领域适配
| 方法 | 训练信号 / 适用目标 | 主要改善 | 风险与约束 |
|---|---|---|---|
| 精选数据 SFT | 高质量视频—文本对 | 美学、复杂提示词、镜头语言 | 数据太窄会遗忘普通动作并降低多样性 |
| 图像辅助空间微调 | 高质量图片或合成静帧 | 纹理、主体细节与画面质量 | 应限制空间模块更新,防止运动能力退化 |
| 偏好优化 / DPO | 同一条件下的优劣视频对 | 人类偏好的画质、运动、遵循度 | 偏好标签昂贵;单一奖励易牺牲动态 |
| 视频奖励 + RL/GRPO | VLM、专用奖励模型和人评 | 物理、文本一致性和综合质量 | 采样成本高,存在奖励投机和域外失真 |
| 全参数微调 | 与基座差异很大的新领域 | 重塑整体画质和运动分布 | 需要较大数据,并混入通用回放防止遗忘 |
| LoRA | 人物、商品、风格或有限动作 | 便宜、可组合、易管理版本 | 区分空间与时间 LoRA,防止主体像但不再动 |
| Adapter / Control 分支 | 姿态、轨迹、深度等新控制 | 冻结基座,较少破坏通用能力 | 控制与视频要逐帧对齐,并随机化控制强度 |
视频偏好不应只给一个总分。最好把主体一致性、动作幅度、物理合理性、镜头稳定、清晰度和文字遵循分别标注,并保留“画质更好但动作更差”这类冲突样本。否则奖励模型很容易学会“少动就少出错”。
4.10 蒸馏与推理效率
- 高压缩 Video VAE,减少时空 token 数;
- 少步蒸馏和 Consistency / Lightning 类采样;
- 量化、算子融合、Flash Attention 和序列并行;
- 缓存相邻去噪步骤中变化较小的特征;
- 粗分辨率生成,再做空间和时间超分;
- 按片段生成并压缩历史上下文。
4.11 训练监控与消融:不要只盯总 loss
固定样片矩阵
固定 seed 和提示词,覆盖静态人物、快速动作、物体交互、运镜、文字、手部、动物和复杂遮挡;对 checkpoint 横向播放比较。
分维度自动评测
分别测图像保真、动态度、时间一致、文本一致、美学和物理;再用人工盲评校准,不能只压成一个总分。
关键消融
单独扫描首帧噪声、图像 dropout、图像/文本 CFG、运动样本比例、时间步分布与分辨率课程,定位静态或漂移来源。
05. 可控生成:从“描述”走向“导演”
文字很难精确表达“第 2 秒抬手,第 4 秒转身,同时镜头向左环绕”。因此,可控生成正在从自然语言扩展到结构化条件。
对象运动
拖拽轨迹、稠密光流、运动区域、分割蒙版。
人物表演
人体骨架、面部/手部关键点、驱动视频和音频。
电影语言
相机内外参、镜头轨迹、景别、焦段和时间轴。
画面结构
深度、法线、边缘、草图、布局和遮罩。
关键时刻
首帧、尾帧、中间关键帧及分镜脚本。
多模态参考
人物图、商品图、场景图、参考视频、音乐和音效组合输入。
Motion-I2V 通过显式预测像素轨迹,再沿轨迹传播原图特征;DragAnything 使用拖拽轨迹控制多个实体;MotionCtrl 则将相机运动与物体运动分开建模。这类方法代表了从“继续堆提示词”向“可操作控制信号”的转变。
06. 动作迁移任务详解
动作迁移(Motion Transfer / Character Animation)的标准输入是一张目标角色参考图和一段驱动视频,输出是“由目标角色完成驱动视频动作”的新视频。它要求模型把两类信息拆开:外观来自参考图,动作与节奏来自驱动视频。
I_ref 和驱动视频 V_drv,模型生成 V_out,希望 Appearance(V_out) ≈ Appearance(I_ref),同时 Motion(V_out) ≈ Motion(V_drv)。难点不在复制像素,而在把身份、体型、服装、动作、表情、相机和背景正确解耦后再重新组合。6.1 动作迁移内部还包含六类任务
| 子任务 | 主要驱动信号 | 保持什么 | 典型用途 |
|---|---|---|---|
| 肖像表情迁移 | 头部姿态、眼睛、嘴部和表情 | 脸部身份与发型 | 头像动画、表情复刻 |
| 全身姿态迁移 | 人体骨架、DensePose 或 3D 姿态 | 人物、服装和背景 | 舞蹈、走秀、虚拟试衣展示 |
| 整体角色动画 | 身体、面部、手部联合信号 | 完整角色外观和表演节奏 | 表演、短剧、游戏角色 |
| 角色替换 | 驱动视频的动作、镜头和空间布局 | 原视频背景、光照和构图 | 替身、预演、角色重定向 |
| 音频驱动动画 | 语音、歌声、韵律和语义 | 人物身份 | 数字人、演讲、唱歌 |
| 任意角色迁移 | 显式姿态或隐式运动 token | 卡通、动物、拟人角色结构 | 游戏、动画、IP 内容 |
严格来说,“音频驱动”是动作生成而不是视频到视频的动作迁移,但两者在产品上经常被统一为角色动画:参考图负责外观,音频或视频负责表演。
6.2 一条典型的技术流水线
姿态对齐、比例适配、局部专家
角色动画或场景内替换
- 预处理:检测人物、脸、手、分割区域、相机变化,并从驱动视频提取姿态或隐式运动特征。
- 外观编码:从参考图提取身份、服装、发型、体型和高频纹理,多参考图系统还会建立主体特征库。
- 运动重定向:把驱动者的动作映射到目标角色坐标系,处理身高、四肢长度、头身比和画幅差异。
- 时空生成:将外观与运动条件注入视频 U-Net 或 Video DiT,联合生成连续帧。
- 局部增强:对脸、眼睛、嘴型和手部使用更高分辨率特征、区域损失或专门分支。
- 合成与重光照:角色替换模式还要保留背景、阴影、遮挡关系,并使新角色适应原场景色温和亮度。
6.3 运动究竟如何表示
| 运动表示 | 优点 | 容易失败的地方 | 适合场景 |
|---|---|---|---|
| 2D 骨架 / DWPose | 紧凑、可编辑、身份泄漏少 | 缺少深度、遮挡、衣服和手指细节;比例差异会错位 | 常规全身动作、舞蹈 |
| DensePose / 人体语义图 | 比稀疏骨架包含更多表面对应关系 | 快速运动、宽松服装和遮挡下估计不稳 | 人体表面与服装对齐 |
| SMPL / 3D 姿态 | 有深度和身体结构,可做比例重定向 | 拟合误差会传递;难覆盖头发、裙摆和非人角色 | 大视角变化、结构精确的人体动画 |
| 光流 / 轨迹 | 保留精细的局部运动和相机运动 | 会把驱动者轮廓和背景变化一起带入,长遮挡时不可靠 | 局部动作、物体和镜头运动 |
| 原始视频特征 / 隐式 token | 可捕捉表情、手势、软组织和运动风格 | 容易泄漏驱动者的脸、衣服和体型,难以显式编辑 | 高表现力整体迁移 |
| 混合表示 | 身体用结构信号,脸和手用隐式特征,兼顾稳定与细节 | 系统复杂,条件之间可能冲突 | 当前高质量整体角色动画 |
技术趋势正从“所有部位共用一张骨架图”转向分而治之:身体需要全局结构稳定,脸部需要高频表情,手部需要局部关节细节。Kling-MotionControl 即采用身体、脸和手的异构运动表示;IM-Animation 则把每帧动作压缩成紧凑的一维运动 token,减少空间比例错位和驱动者身份泄漏。
6.4 外观保持与运动注入
外观分支
ReferenceNet、视觉编码器或主体库在多个网络层注入参考角色特征。浅层偏纹理和颜色,深层偏身份与语义;多尺度 Reference Attention 能比单个 CLIP 向量保留更多衣服、饰品和面部细节。
运动分支
Pose Guider、ControlNet、运动 Transformer 或视频编码器把驱动信号变成逐帧条件。显式姿态更干净可控;隐式特征表现力更强,但必须通过瓶颈、遮罩或身份无关训练防止外观泄漏。
动作重定向
源角色和目标角色的肩宽、腿长、头身比不同,不能直接叠加 2D 坐标。系统需要归一化骨架、3D 对齐、局部比例变换,或使用与空间位置弱绑定的运动 token。
时空联合生成
逐帧生成容易闪烁,当前方法通过时间注意力、完整序列上下文、重叠片段 latent 融合或因果生成保持连续性。脸、手和快速运动区域常被额外加权。
6.5 模型如何获得训练数据
最常见的训练方式是从同一段人物视频取一帧作为“参考图”,其余帧作为目标视频,再由姿态或视频特征提供驱动。这种自重建数据量大、无需人工配对,但也带来一个问题:参考人物和驱动人物本来就是同一身份,模型可能偷看驱动视频的脸和服装,而没有真正学会跨身份动作迁移。
- 身份无关瓶颈:只允许运动分支传递姿态或压缩运动 token,阻断纹理和身份信息。
- 条件随机丢弃:随机移除部分姿态、音频或视频条件,使模型兼容不同驱动强度。
- 跨身份或合成配对:构造同一动作对应不同角色的数据,直接训练“动作相同、身份不同”。
- 分阶段训练:先学外观重建,再学逐帧姿态,最后训练时间模块和整体 DiT。
- 区域加权:对脸、手和高置信度关节点放大损失,缓解关键区域模糊。
- 混合条件扩容:将音频、视频、姿态等不同强弱条件混合训练,利用更多不完全标注的视频。
6.6 代表性技术节点
| 方法 | 年份 | 关键设计 | 意义 |
|---|---|---|---|
| Animate Anyone | 2023/24 | ReferenceNet + Pose Guider + 时间建模 | 建立扩散式角色动画的经典范式 |
| MagicAnimate | 2023/24 | 外观编码器、视频扩散、长视频融合 | 强化参考身份与时间一致性 |
| Champ | 2024 | SMPL、深度、法线和语义图联合引导 | 将 3D 人体先验引入动作迁移 |
| MimicMotion | 2024/25 | 置信度感知姿态、手部区域增强、渐进 latent 融合 | 提升长视频与错误姿态下的稳定性 |
| LivePortrait | 2024 | 隐式关键点、拼接和眼嘴重定向 | 非扩散路线,实时肖像动画效率突出 |
| OmniHuman-1 | 2025 | DiT + 音频/视频等混合条件训练 | 将弱条件音频驱动扩展到半身和全身表演 |
| Wan-Animate | 2025 | 骨架身体控制、隐式表情、重光照 LoRA | 统一角色动画和原视频内角色替换 |
| Kling-MotionControl | 2026 | DiT 中分别编排身体、脸和手运动表示 | 整体动作迁移转向多粒度运动建模 |
| IM-Animation | 2026 | 身份解耦的一维隐式运动 token | 缓解比例错位与驱动者身份泄漏 |
| OmniHuman-1.5 | 2026 | 多模态规划模型 + DiT,语音语义与动作规划 | 音频驱动从嘴型同步走向长时行为和多角色互动 |
6.7 为什么动作迁移仍然会失败
身份泄漏
驱动者的脸、体型或服装混入输出,说明运动分支没有真正去身份。
参考姿态锁定
参考图姿势影响过强,目标角色无法完整执行驱动动作。
比例错配
儿童、夸张卡通、动物或不同头身比无法直接套用人体 2D 骨架。
遮挡与接触
交叉手臂、转身、坐下、拿物体会暴露不可见区域并改变遮挡层级。
相机和背景纠缠
驱动视频的推拉摇移、背景光流可能被误认为角色自身动作。
细粒度动作损失
脚步节奏看似一致,但手指、眼神、口型和个人步态等信号被平滑掉。
6.8 评测不能只看“像不像一段真视频”
- 身份保持:ArcFace、DINO/CLIP 相似度,以及服装和配饰区域的一致性。
- 动作遵循:关键点误差、PCK、3D MPJPE、轨迹/光流误差和动作节奏对齐。
- 表情与口型:面部关键点、表情系数、SyncNet 类音画同步指标。
- 时间质量:FVD、闪烁、光流一致性和跨片段边界突变。
- 局部质量:脸、手、脚、饰品以及人与物接触区域单独评测。
- 人类评测:分开询问“角色像不像”“动作像不像”“是否自然”,避免单一总体分掩盖问题。
6.9 实际选型与素材准备
| 目标 | 优先方案 | 素材建议 |
|---|---|---|
| 实时头像、表情复刻 | LivePortrait 类隐式关键点方案 | 正脸清晰、少遮挡、驱动视频头部完整 |
| 舞蹈和全身表演 | 视频驱动整体角色动画;本地可选 Wan-Animate | 全身入镜、固定镜头、四肢不出画、动作连续 |
| 角色替换并保留场景 | 显式 replacement 模式 + 人物蒙版 + 重光照 | 背景稳定、遮挡关系清楚、保留干净背景板更佳 |
| 音频口播或唱歌 | OmniHuman / HunyuanVideo-Avatar 等音频驱动模型 | 干净人声、少混响;全身动作应给文字或额外视频条件 |
| 卡通、动物或异形角色 | 身份无关隐式运动或任意角色模型 | 参考图尽量显示完整结构;避免与人类体型差异过大的动作 |
| 精确动画和可编辑骨骼 | 传统动捕 / 3D 姿态重定向,生成模型只做渲染增强 | 使用多视角、深度或专业动捕数据 |
- 参考图最好完整显示要运动的身体区域,分辨率足够、轮廓清楚,避免手脚被裁掉。
- 参考图初始姿势应尽量接近驱动视频第一帧,否则开头容易突然变形。
- 驱动视频尽量单镜头、少剪切、少遮挡;快速旋转、地面动作和多人接触应拆段处理。
- 角色与驱动者的画幅占比、朝向和头身比越接近,迁移通常越稳定。
- 需要保留原背景时应明确选择“角色替换”而不是“角色动画”,并提供蒙版或背景条件。
- 商业和公开使用前确认参考人物、声音和动作视频的授权,并对生成内容进行来源标记。
07. 最核心的矛盾:原图一致性 × 运动幅度
图片条件太弱
- 脸、服装和商品结构发生变化
- 首帧之后逐渐换人或换风格
- 新视角无法保持主体细节
图片条件太强
- 模型直接复制原图,形成“静态捷径”
- 只产生眨眼、呼吸等轻微运动
- 奔跑、转身等提示难以执行
CVPR 2026 的研究显示,在一个控制实验中,从 T2V 转成 I2V 后,动态程度下降约 18.6%。原因之一是原图的高频细节过早锁死生成路径。自适应低通条件在早期阶段弱化高频约束、后期再恢复细节,可在一定程度上改善这个矛盾。
08. 技术演进脉络
GAN、RNN、光流、关键点和神经渲染为主,适合特定对象或小幅运动。
将图像扩散扩展到时空维度,联合训练图片和视频,并开始研究时间/空间扩展。
在 latent 中生成显著降低成本,SVD、I2VGen-XL、DynamiCrafter 等推进开放域图像动画。
3D VAE、时空 token、Transformer 扩展成为主线;轨迹、相机和姿态控制快速发展。
Wan、HunyuanVideo、LTX 等开放权重模型扩大规模;蒸馏、缓存、偏好优化和长视频成为重点。
文本、图片、视频、音频联合参考,原生声音、多镜头、局部编辑和实时生成逐渐进入产品。
09. 2026 年代表性系统
下表用于展示技术方向,不是统一排行榜。闭源模型公开信息有限,厂商内部测试集和营销样片无法直接横向比较。
| 系统 | 公开能力与技术定位 | 开放性 |
|---|---|---|
| Google Veo 3.1 | 首帧、首尾帧、多张内容/风格参考图、视频延长及原生音频;API 提供 720p/1080p 和多种时长。 | 闭源 API / 产品 |
| Kling 3.0 | 统一文本、图片、参考视频和编辑流程;加强多参考一致性、多语言原生音频及最长 15 秒生成。 | 闭源产品 |
| Seedance 2.0 | 统一图像、视频、音频和文字输入;最多组合 9 张图片、3 段视频和 3 段音频,支持 15 秒多镜头音视频。 | 闭源产品 / 云服务 |
| Runway Gen-4.5 | 强调复杂连续指令、电影镜头语言和风格一致性;I2V 支持 2–10 秒、720p、24/25fps。 | 闭源产品 |
| Sora 2 | 视频与同步音频联合生成,强调物理表现、提示词遵循和可控性;公开架构细节相对有限。 | 闭源 API |
| Wan 2.2 | 重要开放权重路线;提供 14B I2V 和统一 5B TI2V。5B 支持 720p/24fps,并可面向 24GB 显存部署。 | 开放权重 |
| LTX-2.3 | 22B 音视频模型;提供 I2V、关键帧插值、控制 LoRA、局部重生成和两阶段超分。需留意社区许可证。 | 开放权重 / 社区许可 |
| HunyuanVideo-I2V | 支持首帧一致性、I2V 推理和特效 LoRA 训练,是可定制图生视频的重要研究基线。 | 开放权重 |
10. 长视频、流式生成与实时化
一次性让所有帧参与完整时空注意力,计算和显存会迅速增长。当前解决方法包括滑动窗口、分段生成、历史帧压缩、因果注意力、历史引导和自回归式视频扩散。
FramePack
把历史帧压缩为固定长度上下文,使生成瓶颈更接近图像扩散;同时通过反向采样和提前建立端点来减轻长视频漂移。
Diffusion Forcing
允许模型接受可变数量的历史帧,并使用历史引导提高时间一致性、运动表现和超长视频滚动稳定性。
11. 怎样完整评测图生视频
- 原图保持脸、服装、商品、背景、构图和画风是否延续。
- 时间一致性闪烁、结构突变、主体漂移和细节跳变。
- 运动质量运动幅度、平滑度、完整性和自然程度。
- 控制遵循提示词、轨迹、姿态、相机和起止帧是否准确。
- 物理与常识重力、碰撞、遮挡、数量、空间和因果关系。
- 视觉质量清晰度、纹理、噪声、压缩和美学。
- 音画质量口型、对白、环境声、节奏和画面事件同步。
- 生产指标首轮可用率、重试次数、时延和每个可用镜头成本。
VBench 将视频质量拆为主体一致性、动态程度、运动平滑度、闪烁和美学等多个维度,并在 VBench++ 中适配 I2V。传统 FVD 不适合作为唯一指标:它对部分时间失真不敏感,并且需要较大样本才能稳定估计。
12. 工程与业务选型建议
| 需求 | 优先技术方案 | 原因与注意点 |
|---|---|---|
| 广告、短片、分镜预演 | 高质量闭源通用 I2V + 多参考图 | 综合画质和指令遵循更好;应按短镜头生成,再剪辑。 |
| 品牌人物 / 商品一致性 | 多参考、角色参考、首尾帧和局部编辑 | 单一首帧不够;文字和包装细节建议后期合成。 |
| 口播数字人 | 专用音频驱动头像模型 | 比通用 I2V 的口型和身份稳定性更高。 |
| 舞蹈 / 人物动作迁移 | 姿态或驱动视频条件模型 | 显式动作条件比纯文字控制可靠。 |
| 二维动画中间帧 | 生成式关键帧插值 + 草图/线稿控制 | 适合端点明确的非线性运动,但仍需人工修线。 |
| 隐私、本地化、模型微调 | Wan 2.2、LTX-2.3、HunyuanVideo 等开放权重方案 | 可控、可训练;需评估显存、许可、运维和推理时延。 |
| 精确产品运镜 | 2.5D / 3D 渲染与生成模型混合 | 几何和品牌细节必须准确时,不宜完全依赖生成式视频。 |
更稳定的生产工作流
- 先设计主体、场景和风格参考图,保持画幅一致;
- 一个镜头只安排一个主要动作和一个明确运镜;
- I2V 提示词重点描述“接下来发生什么”,少重复图片已有内容;
- 需要明确落点时使用尾帧或关键帧,不靠长篇文字硬控;
- 一次生成多候选,以“可用率”而不是最好样片评估模型;
- 文字、Logo、商品标签、复杂特效和精确节奏留给后期;
- 长片拆成短镜头,并维护角色、道具和场景参考资产库。
13. 未解决问题与未来趋势
当前局限
- 隐式物理先验不是可靠的物理仿真;
- 图片不可见区域只能依靠模型猜测;
- 拥抱、格斗、递物等多主体接触仍脆弱;
- 精确帧级时间控制有限;
- 长视频存在身份和世界状态漂移;
- 文字、手部和微小结构仍不稳定;
- 生成结果缺乏像 3D 软件那样的完全可逆编辑。
清晰趋势
- 从单图走向图、视频、音频统一参考;
- 从提示词走向轨迹、姿态和时间轴控制;
- 从一次生成走向局部重拍和对象级编辑;
- 从无声视频走向原生音视频联合建模;
- 从单镜头一致性走向世界状态一致性;
- 从整段生成走向流式、实时和交互视频;
- 融合显式 3D、几何、物理和可验证约束。
14. 代表性论文与官方资料
- Image-to-Video Diffusion: From Foundations to Open Frontiers — 2026 年图生视频专项综述。
- Video Diffusion Models — 将图像扩散系统化扩展到视频。
- Stable Video Diffusion — 图像预训练、视频预训练、精选视频微调及系统化数据过滤。
- VideoCrafter2 — 用低质量视频学习运动、用高质量图像改善空间质量的解耦训练。
- STIV — 统一 T2V/I2V、首帧替换、图文联合 CFG 与图像条件丢弃。
- Conditional Image Leakage — 研究 I2V 静态偏差及随时间步调整条件噪声的方法。
- CV-VAE — 视频 VAE 的重建、感知、对抗与 KL 训练设计。
- DynamiCrafter — 语义上下文与完整图像 latent 双路注入。
- CogVideoX — 3D VAE 与视频 Diffusion Transformer。
- Wan — 开放大规模视频生成框架。
- HunyuanVideo — 大规模视频生成的系统化框架。
- LTX-Video — 高压缩 latent 与快速视频生成。
- Classifier-Free Diffusion Guidance — 通过条件丢弃联合训练条件与无条件预测。
- VideoDPO — 视频生成的多维偏好对齐。
- Systematic Post-Training for Video Generation — SFT、视频强化学习、提示词增强与推理优化的系统化后训练框架。
- Motion-I2V — 显式运动场与轨迹控制。
- DragAnything — 基于实体表示的拖拽运动控制。
- MotionCtrl — 相机运动与对象运动解耦控制。
- Animate Anyone — ReferenceNet、姿态引导和时间建模的经典角色动画框架。
- MagicAnimate — 外观保持与时序一致的人体动作迁移。
- MimicMotion — 置信度感知姿态引导、手部增强和长视频 latent 融合。
- LivePortrait — 隐式关键点、拼接与眼嘴重定向的高效肖像动画。
- OmniHuman-1 — 通过混合运动条件扩展音频及视频驱动的人体动画。
- Wan-Animate — 统一角色动画、角色替换和场景重光照。
- Kling-MotionControl — 身体、脸部与手部多粒度运动协同。
- IM-Animation — 身份解耦的紧凑隐式运动表示。
- OmniHuman-1.5 — 多模态规划与 DiT 结合的长时音频驱动角色动画。
- Gait Biometric Fidelity Study — 说明视觉逼真不等同于保留精确的个体运动特征。
- FramePack — 固定长度历史上下文与长视频生成。
- History-Guided Video Diffusion — 可变历史条件与 Diffusion Forcing。
- VBench / VBench++ — 多维视频生成评测体系。
- Beyond FVD — 对 FVD 局限的系统分析。
- Adaptive Low-Pass Guidance — I2V 静态偏差与动态增强研究。
- Veo 3.1 官方文档、Wan 2.2 官方仓库、LTX-2 官方仓库。