---
id: "mb-20260830-00bd0d"
kind: "deep"
title: "一张顶级显卡狂转 11 分钟，只能吐出一段 15 秒的视频"
topic: "一张顶级显卡狂转 11 分钟，只能吐出一段 15 秒的视频"
source_type: "generated"
status: "published"
generated_at: "2026-08-30 14:54:37"
frame_type: ["稀疏蒸馏（Sparse Distillation", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# 一张顶级显卡狂转 11 分钟，只能吐出一段 15 秒的视频

一张顶级显卡狂转 11 分钟，只能吐出一段 15 秒的视频。
这是过去两年所有视频生成模型最大的痛点。
现在这个时间被直接压到了 47 秒。
如果放在 8 卡集群上跑，只要不到 13 秒。
算力消耗的时间，第一次跑赢了视频本身的物理播放时长。
画质没有崩塌，原生的音视频同步也全部保住了。
怎么做到的？
很多人第一反应，是英伟达新芯片又堆了多少算力，或者谁家又烧了上万张卡。
其实都不是。
真正被打破的，是过去视频生成领域一直在默默缴纳的两笔巨额算力税。
过去生成一段视频为什么会慢到令人发指？
因为传统的视频扩散模型，背着两座大山在计算。
第一座山，叫步数税。
模型生成视频不是一笔画出来的。
它是从一堆毫无规律的纯噪声开始，一步一步做数学去噪。
基础版的 MiniMax H3 模型，生成一段视频需要把整个庞大的 Transformer 网络完整跑上 49 遍。
跑 49 遍，显卡就必须在底层矩阵里死循环 49 次。
第二座山，叫全量注意力税。
一段 15 秒的高清视频，拆解成空间和时间切片后，包含数十万个时空词元。
传统的密集注意力机制，要求每一个像素点都去和全片其他几十万个点计算关联。
画面角落的一朵静止白云，在第 1 秒到第 15 秒之间，被强迫着和移动的地板做了几万次全量矩阵乘法。
超过 90% 的算力，全耗在这些毫无意义的空转上。
加州大学圣地亚哥分校张昊团队主导的 FastVideo，干了一件极其干脆的事。
他们给这套解法起名叫稀疏蒸馏。
第一刀切向步数。
利用分布匹配蒸馏技术，把原本需要 49 遍才能走完的去噪轨迹，强行压缩到了 4 步。
网络前向计算次数瞬间砍掉了 91%。
第二刀切向注意力机制。
他们换上了专门研发的视频稀疏注意力内核。
把时空数据打包成微小立方体，让算法动态识别哪些区域是关键动态，哪些是静止背景。
静止的地方不重复算，无关的区域不做冗余交互。
整整 90% 的注意力计算冗余被直接剔除。
两刀下去，单张 B200 芯片的生成时间从 678.7 秒缩短到 47.2 秒。
整整 14.38 倍的提速。
这不仅是一个跑分数字的刷新。
当 15 秒视频的生成时间被压缩进 13 秒以内时，视频生成的物理定律被改写了。
过去需要排队等待数小时的离线渲染，第一次具备了实时交互的可能。
真正的技术跨越，从来不是靠无休止地堆砌显卡和吞噬电力。
它是有人找出了系统里交了太久的冗余税，然后一刀把它砍到底。

_Rendered by mubei-terminal._
