击穿内存墙:为什么 DeepSeek V4.1 Flash 敢把长代码推理成本砍掉 86 倍?
用不到 1 块钱的成本,跑赢了标价 86 块钱的美国旗舰大模型。 不仅跑分超了,占用的硬件资源还缩水了好几倍。 2026 年 9 月,软件工程基准测试 DeepSWE 放榜。 DeepSeek 刚上线的 V4.1 Flash 跑出了 74.2 分。 排在它后面的,是 OpenAI 的当家旗舰 GPT-5.6 Sol,还有 Anthropic 的 Opus 5。 如果光看跑分,差距似乎不大,差了零点几分。 但如果翻开两边的账单,后背会发凉。 OpenAI 跑一百万 token 的输出,收费 20 美元。 如果代码上下文超过 27 万,输入还要翻倍扣钱。 DeepSeek 这边呢? 闲时输入一百万 token 只要 15 美分,输出 60 美分。 如果是长代码里反复命中的缓存,一百万 token 的输入甚至只要 0.3 美分。 在多轮写代码和网络安全攻防的真实环境里,综合成本直接被拉开了 86 倍。 这是在亏本补贴赔钱赚吆喝吗? 真要靠补贴硬扛,降价 86 倍一天就能把机房烧穿。 它敢把价格打到骨折,是因为它把大模型最致命的一堵墙给拆了。 什么墙? 内存墙。 写代码和搞网络安全,跟平时随便聊两句天完全是两种物种。 模型没法一次性把代码写完就交卷。 它得在终端里反复读整个代码库、改文件、跑测试、看报错、再重试。 这一套循环下来,上下文随随便便就堆到几十万甚至上百万 token。 在标准的 Transformer 架构里,这简直是一场灾难。 模型每读一个词,都要把前面几十万个词的注意力状态全算一遍,存进显存。 这就是常说的 KV 缓存。 代码上下文越长,显存被吃得越狠。 就算算力芯片的计算单元还空着,高带宽显存 HBM 也早就被塞满了。 放不下怎么办? 只能把缓存往固态硬盘 SSD 里倒腾。 显卡停下来等数据从硬盘里慢慢读,整个集群就这么被活活卡死。 大模型跑复杂任务之所以越跑越贵,根子全卡在显存带宽上。 DeepSeek 怎么把这堵墙拆掉的? 它动了神经网络的底层骨架。 新架构叫因果编解码架构。 整整 40 层神经网络,被硬生生切成了两半。 前面 20 层是因果编码器,专门负责读代码;后面 20 层是解码器,专门负责写代码。 关键就在这个分工上。 传统的架构,每一层都要辛辛苦苦算一套全局 KV 缓存。 现在呢? 只在编码器的最后一层,统一投射一次全局状态。 业内叫作只缓存一次。 光是这一刀,模型在输入阶段的计算开销就被砍掉了一大半。 但光拆成两半还不够。 进出模型的参数量,被设计成了不对称的。 读你几万行代码的时候,底座 5520 亿参数的庞然大物,只激活 80 亿参数在跑。 等到真正要动手写代码、吐结果时,才调动 160 亿参数。 再加上第二代压缩稀疏注意力,把各层的缓存直接复用、重编索引,不再到处重新算。 最后再压上一层原生的 FP4 量化。 这套组合拳打下来,数字有多夸张? 每个 token 占用的全局缓存,直接被压缩到了 890 个字节。 相比上一代,HBM 显存占用直接砍掉了近四分之三,只有原来的 3.8 分之一。 SSD 的存储需求更是暴降到八分之一。 把这几个硬件数字拼起来,因果链就清清楚楚了。 以前一台满载的显卡服务器,显存被长上下文塞满,只能勉强扛住一两个任务排队。 现在同样的显存空间,能一口气塞进好几个甚至十几个长代码智能体同时跑。 每一次推理分摊下来的硬件折旧和电费,被物理级压缩。 86 倍的价差,不需要补贴。 这是工程吞吐量在硬件极限上硬挤出来的空间。 这也解释了为什么他们上线第一天,就敢直接把上一代的 Pro 旗舰彻底下线。 在软件工程和网络攻防这种重度依赖多轮调用的场景里,实验室里堆参数的虚胖根本没有意义。 谁能在物理硬件的带宽极限上,把每一个字节的搬运代价逼到最低,谁才拥有把智能变成廉价基础设施的底气。
引用 / CITATIONS
No citations exported.
同领域解读 / AI & LLMS
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封独立、不受审查的科技与 AI 深度评论,周一发出。带出处,可核查。