{"id":"mb-20260830-00bd0d","kind":"deep","title":"一张顶级显卡狂转 11 分钟，只能吐出一段 15 秒的视频","summary":"一张顶级显卡狂转 11 分钟，只能吐出一段 15 秒的视频","body":"一张顶级显卡狂转 11 分钟，只能吐出一段 15 秒的视频。\n这是过去两年所有视频生成模型最大的痛点。\n现在这个时间被直接压到了 47 秒。\n如果放在 8 卡集群上跑，只要不到 13 秒。\n算力消耗的时间，第一次跑赢了视频本身的物理播放时长。\n画质没有崩塌，原生的音视频同步也全部保住了。\n怎么做到的？\n很多人第一反应，是英伟达新芯片又堆了多少算力，或者谁家又烧了上万张卡。\n其实都不是。\n真正被打破的，是过去视频生成领域一直在默默缴纳的两笔巨额算力税。\n过去生成一段视频为什么会慢到令人发指？\n因为传统的视频扩散模型，背着两座大山在计算。\n第一座山，叫步数税。\n模型生成视频不是一笔画出来的。\n它是从一堆毫无规律的纯噪声开始，一步一步做数学去噪。\n基础版的 MiniMax H3 模型，生成一段视频需要把整个庞大的 Transformer 网络完整跑上 49 遍。\n跑 49 遍，显卡就必须在底层矩阵里死循环 49 次。\n第二座山，叫全量注意力税。\n一段 15 秒的高清视频，拆解成空间和时间切片后，包含数十万个时空词元。\n传统的密集注意力机制，要求每一个像素点都去和全片其他几十万个点计算关联。\n画面角落的一朵静止白云，在第 1 秒到第 15 秒之间，被强迫着和移动的地板做了几万次全量矩阵乘法。\n超过 90% 的算力，全耗在这些毫无意义的空转上。\n加州大学圣地亚哥分校张昊团队主导的 FastVideo，干了一件极其干脆的事。\n他们给这套解法起名叫稀疏蒸馏。\n第一刀切向步数。\n利用分布匹配蒸馏技术，把原本需要 49 遍才能走完的去噪轨迹，强行压缩到了 4 步。\n网络前向计算次数瞬间砍掉了 91%。\n第二刀切向注意力机制。\n他们换上了专门研发的视频稀疏注意力内核。\n把时空数据打包成微小立方体，让算法动态识别哪些区域是关键动态，哪些是静止背景。\n静止的地方不重复算，无关的区域不做冗余交互。\n整整 90% 的注意力计算冗余被直接剔除。\n两刀下去，单张 B200 芯片的生成时间从 678.7 秒缩短到 47.2 秒。\n整整 14.38 倍的提速。\n这不仅是一个跑分数字的刷新。\n当 15 秒视频的生成时间被压缩进 13 秒以内时，视频生成的物理定律被改写了。\n过去需要排队等待数小时的离线渲染，第一次具备了实时交互的可能。\n真正的技术跨越，从来不是靠无休止地堆砌显卡和吞噬电力。\n它是有人找出了系统里交了太久的冗余税，然后一刀把它砍到底。","topic":"一张顶级显卡狂转 11 分钟，只能吐出一段 15 秒的视频","frame_type":["稀疏蒸馏（Sparse Distillation","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-08-30 14:54:37","legal_anchor_count":0,"transcript_citation_count":0}