一张顶级显卡狂转 11 分钟,只能吐出一段 15 秒的视频
一张顶级显卡狂转 11 分钟,只能吐出一段 15 秒的视频。 这是过去两年所有视频生成模型最大的痛点。 现在这个时间被直接压到了 47 秒。 如果放在 8 卡集群上跑,只要不到 13 秒。 算力消耗的时间,第一次跑赢了视频本身的物理播放时长。 画质没有崩塌,原生的音视频同步也全部保住了。 怎么做到的? 很多人第一反应,是英伟达新芯片又堆了多少算力,或者谁家又烧了上万张卡。 其实都不是。 真正被打破的,是过去视频生成领域一直在默默缴纳的两笔巨额算力税。 过去生成一段视频为什么会慢到令人发指? 因为传统的视频扩散模型,背着两座大山在计算。 第一座山,叫步数税。 模型生成视频不是一笔画出来的。 它是从一堆毫无规律的纯噪声开始,一步一步做数学去噪。 基础版的 MiniMax H3 模型,生成一段视频需要把整个庞大的 Transformer 网络完整跑上 49 遍。 跑 49 遍,显卡就必须在底层矩阵里死循环 49 次。 第二座山,叫全量注意力税。 一段 15 秒的高清视频,拆解成空间和时间切片后,包含数十万个时空词元。 传统的密集注意力机制,要求每一个像素点都去和全片其他几十万个点计算关联。 画面角落的一朵静止白云,在第 1 秒到第 15 秒之间,被强迫着和移动的地板做了几万次全量矩阵乘法。 超过 90% 的算力,全耗在这些毫无意义的空转上。 加州大学圣地亚哥分校张昊团队主导的 FastVideo,干了一件极其干脆的事。 他们给这套解法起名叫稀疏蒸馏。 第一刀切向步数。 利用分布匹配蒸馏技术,把原本需要 49 遍才能走完的去噪轨迹,强行压缩到了 4 步。 网络前向计算次数瞬间砍掉了 91%。 第二刀切向注意力机制。 他们换上了专门研发的视频稀疏注意力内核。 把时空数据打包成微小立方体,让算法动态识别哪些区域是关键动态,哪些是静止背景。 静止的地方不重复算,无关的区域不做冗余交互。 整整 90% 的注意力计算冗余被直接剔除。 两刀下去,单张 B200 芯片的生成时间从 678.7 秒缩短到 47.2 秒。 整整 14.38 倍的提速。 这不仅是一个跑分数字的刷新。 当 15 秒视频的生成时间被压缩进 13 秒以内时,视频生成的物理定律被改写了。 过去需要排队等待数小时的离线渲染,第一次具备了实时交互的可能。 真正的技术跨越,从来不是靠无休止地堆砌显卡和吞噬电力。 它是有人找出了系统里交了太久的冗余税,然后一刀把它砍到底。
引用 / CITATIONS
No citations exported.
导出 / EXPORT
订阅 · SUBSCRIBE
新的深度解读发布时,会在每周简报里送到你邮箱。