瓶颈被定位得很具体
这份工作值得看的地方在于它先说清楚了时间花在哪:在 MiniMax H3 上,注意力本身就占了总运行时间的 85% 以上。既然如此,压缩模型或者砍分辨率都不是最优解,该动的是注意力。 线性注意力当然更快,但单独用它会在主体一致性、场景布局和长程依赖上明显掉链子——这是视频生成里最容易露馅的三处。VDN-H3 的取舍是两条分支并行:一条逐帧的线性注意力(团队称为 Video Delta Attention)负责效率,一条 softmax 分支保住画质与一致性。工程上做得很克制——不改骨干权重,只挂一条独立的线性注意力分支和两个小 LoRA,推理时合并进去,因此可以直接打在未修改的 H3 骨干上。
那八张卡只用来做去噪
11.23 秒这个数字有前提,值得照抄下来:8 张 B200、8 步去噪、768p、14.4 秒时长。作者还给了实时场景的部署建议——把提示词改写、VAE 解码和 MP4 转码放到另外的机器上,让那八张卡只负责去噪。也就是说这个成绩测的是纯去噪环节,前后处理不在里面。 想在单卡上试的可以对照另一个数:单张 B200 上 8 步是 51 秒。从 51 秒到 11.23 秒基本就是八卡并行的收益,这条曲线比「比播放还快」这句宣传更能说明它现在处在什么位置。 发布物是完整的:50 步的 stage-b-step-2000(4.3GB)和 8 步加 turbo 适配器的 stage-dmd-step-250(5.1GB),加上 MiniMax-H3 的 72GB 基础权重;优化后的推理栈和训练代码一起放出,社区已经有 ComfyUI 移植。
先读许可再动手
这是本条里最该注意的一处:代码仓库是 Apache-2.0,但权重走的是 MiniMax H3 社区许可,模型卡上写明适用范围是「全球,但不包含欧盟、英国、韩国和美国」。这不是一句可以跳过的样板文——它决定了很多团队根本不能在生产里用这份权重。不在排除名单上的地区也别只看这一句,用途、再分发和商用条款都要自己核对原文。 抛开许可,它提出的思路是可迁移的:与其换一个更小的模型,不如把注意力里最贵的那部分换掉,并且留一条 softmax 分支兜住质量。对做视频生成推理优化的人,这个结构比那个秒数更值得研究;对只想跑起来的人,八张 B200 的门槛意味着这暂时还是云上的事。
via: Hugging Face: OpenVDN/vdn-minimax-h3 模型卡、GitHub: OpenVDN/vdn-minimax-h3、ComfyUI Wiki 报道