Viggle-Animate 对比 Wan Animate——角色替换快 6 倍

Viggle-Animate 对比 Wan Animate——角色替换快 6 倍

两者都是替换视频里的角色,也都开源了权重。区别在于各自开跑之前需要什么,以及跑多久。Wan Animate 要一张角色图,外加 pose、面部、遮罩、背景四道预处理。Viggle-Animate 要这段视频和它自己的一帧重绘图——然后 3 次前向推理,而不是 40 次。

四个 sigma 边界之间就是三次推理,而且整段 124 帧在一个窗口内跑完。Wan 是 20 步采样,而它的窗口是 77 帧,所以 124 帧要拆成两段串起来——总共 40 次。下面片段里的标签数的是每段的采样步数(4 对 20),表格数的是总推理次数(3 对 40),两者描述的是同两次运行。另外 Viggle-Animate 反而是更大的模型(33.1B 对 17.3B),并不是靠更轻取胜;26 秒是单张 B200 的成绩,你自己的硬件会不同。

用任意图像编辑器改掉自己素材里的一帧,这一帧就会把角色带过整个镜头。不用提取骨骼、不用修遮罩、不用跟面部追踪较劲。你画成什么样,传播出去就是什么样。

角色替换通常正是在动得快的时候崩。并排渲染里 Wan2.2-Animate-14B 在头部和四肢快速移动时会拖影,而 Viggle-Animate 保住细节,并且对上了站姿宽度、手臂伸展和极限姿态的时间点——而且完全没有姿态输入。

因为链路里没有任何东西去提取姿态,同一套双输入接口就能处理动物、风格化与插画角色,以及非人形物体——公开案例里最难的是那架客机。而围绕姿态估计搭的流水线,只能走到估计器认得出主体的地方。

什么情况下选择 Viggle-Animate

单次渲染 6.1 倍、只算采样 10.3 倍:同一台机器、同一张 B200、同样的源视频,124 帧 / 24fps / 480×832,26 秒对 160 秒,采样 13.6 秒对 140 秒。那 160 秒还不包含 Wan 的预处理,所以实际差距更大。关于推理次数:Viggle-Animate 是整段 124 帧在一个窗口里跑 3 次,而 Wan 的窗口是 77 帧、采样 20 步,所以 124 帧会拆成两段串行、合计 40 次——这也是为什么对比片段上标的「4 steps」和「20 steps」,和表格里 3 对 40 那一行说的是同两次运行。Viggle-Animate 是两者中更大的模型(33.1B 对 17.3B),所以速度来自 3 次前向推理而不是 40 次,不是因为网络更小。

用托管版不需要——在浏览器里跑,你只上传一张角色图。本地使用的话,权重在 Hugging Face,已经能在 WanGP 和社区 ComfyUI 节点里跑。要注意 26 秒是 B200 的基准;消费级显卡会更慢,而且 33.1B 参数比 Wan 的 17.3B 需要更多显存。

不需要。重绘帧准备好之后,视频推理阶段不加载任何辅助模型——没有姿态估计、分割、面部追踪或文本编码器。Wan Animate 在采样开始前要先跑 pose、面部、遮罩、背景的预处理。

就是从你自己的驱动视频里取一帧,用图像编辑器把角色改掉——公开的方法里用的是 gpt-image。这是 Wan 没有的一步,也是 Wan 更简单的唯一地方:它直接吃一张角色图。代价交换是:重绘帧把 pose、遮罩、背景的预处理整套去掉了,而且它只是一次图片编辑,不是每段素材都要跑一条流水线。

Viggle-Animate,而这也是公开对比里差距最大的地方。Wan2.2-Animate-14B 在头部和四肢快速移动时容易丢细节、出拖影,而 Viggle-Animate 角色细节更清晰、也更贴合原始姿态——站姿宽度、手臂伸展、肢体位移和极限姿态的时间点——尽管它没有拿到任何骨骼输入。

两者都在 Hugging Face 发布了开源权重,也都能在 WanGP 和 ComfyUI 里跑。获取方式上的区别在托管:Viggle 有官方托管版,不用本地安装就能用;Wan Animate 只有第三方托管。

当你本地跑、17.3B 塞得进显存而 33.1B 塞不进时;当你需要把 pose、遮罩、背景当作可检查、可覆盖的独立输入时;或者你已经有一条基于 Wan 的 ComfyUI 流水线,迁移成本高于省下的渲染时间时。

权重可以免费下载自己跑。托管版可以免费试用,用量大之后走付费方案——当前档位见定价页。

一段视频,一张角色图,不用骨骼绑定也不用提示词。可以在浏览器里试,也可以下载权重自己跑。

Recommended articles