深度解读AI 与大模型generatedpublished

参数翻倍反而便宜百倍:DeepSeek V4.1-Flash 如何靠两刀架构重构击穿智能体推理成本

因果编解码(CED)不对称计算解耦与分级KV缓存机制

读 5000 万个词的代码库只要 0.15 美元,而对面要收 25 美元。 这个把推理价格打出 160 倍差距的新模型,名字里还挂着“Flash”轻量版的标签。 奇怪的是,它的体型没有缩小,反而暴涨了整整一倍。 参数量从上一代的 2840 亿,一路飙到了 5520 亿。 体积翻倍了,读长文本的价格却被砸穿到了每百万 Token 只要 0.003 美元。 为什么大模型变得越重,跑起来反而越便宜? 先看大模型在今天究竟被什么东西拖垮。 过去测算大模型的账本,眼睛总是盯着乘除法。 只要浮点算力堆得足够高,模型就能飞速运转。 但真实的推理账本完全是另一套逻辑。 算力的大门被卡死,瓶颈往往不在计算本身,全在数据搬运的通道上。 也就是所谓的显存带宽与内存墙。 尤其在智能体接管了复杂的代码任务之后,整个工作流彻底变了。 以前人机对话,是你发几十个词,AI 吐出几百个词。 现在跑一个代码智能体,是它把上百万词的代码库、工具定义和历史报错,不知疲倦地反复读上几十遍。 一趟任务跑下来,读输入占了 95% 以上的数据吞吐量,最后真正写出来的代码可能只有几行。 传统的大模型架构遇到这种负载,直接变成了一场算力灾难。 因为无论读多长的背景资料,它都要把全身所有的参数全部拉出来算一遍。 更致命的是,读过的所有上下文,都要变成庞大的 KV 缓存,死死霸占着最昂贵的显存。 显存一旦被填满,机器就无法接收新的并发,几十万一张的显卡只能原地干等。 解决这个死局的第一刀,砍在了计算结构上。 它采用因果编解码 CED 架构,把 40 层的网络直接劈成两半。 前面 20 层是因果编码器,后面 20 层是解码器。 当智能体在疯狂阅读海量代码时,只走前面的编码器,仅仅激活 80 亿参数。 这比上一代轻量模型 130 亿的激活参数还要少。 读输入的计算量被直接抹去了一半。 只有到了最后真正要写代码吐字的时候,才调动解码器的 160 亿参数。 这就是为什么 5520 亿的大块头,读起长文本来却像 80 亿的小模型一样轻快。 第二刀砍在更昂贵的显存占用上。 存不下上下文,大模型就接不住长任务。 通过压缩稀疏注意力 CSA2 和 FP4 低精度格式,每个词的全局缓存被直接压缩到了 890 字节。 只有上一代体积的四分之一。 更巧妙的是分级存储的设计。 通用的代码库缓存,存放在至少能活 72 小时的持久化显存里。 那些随时间滑动的瞬时注意力,直接塞进便宜的主机内存条,连显存都不占。 就算内存里的临时记忆被清空了,也只需要回放最近的一个小窗口,就能把状态瞬间拼回来。 整套组合拳打下来,保留超长上下文的存储成本被砍掉了八分之七。 但这套极致的刀法,在开源社区里却引发了一场激烈的争吵。 对于买接口跑业务的公司来说,这是天大的喜讯。 但对想在本地自己部署模型的开发者来说,这几乎是一场灾难。 很多开发者在技术社区里公开质疑,这哪里还是轻量版? 主干 5520 亿参数,再加上 1960 亿的 Engram 条件记忆模块,普通的工作站根本塞不下。 官方技术报告里更是白纸黑字写着,想做大规模部署,需要准备 2000 张高端显卡外加独立的存储集群。 个人和小团队想靠自己的几张卡在本地玩转它,彻底行不通了。 “Flash”这个词的定义,在这里被彻底重写了。 它不再追求把模型的物理重量做小,去迁就普通人的个人电脑。 它的目标变成了云端工业级的大规模调度流水线。 通过重构计算流程,把企业跑智能体的单次任务成本,压到了像自来水一样的几厘钱。 大模型的战场正在彻底转向。 比起在榜单上争抢那一两个点的智商分数,单次任务的边际成本才是真正的决胜点。 当阅读海量代码的代价降到了几厘钱,谁能在极度廉价的试错环境里不知疲倦地反复调用,谁就拿到了下一阶段的生产力钥匙。

引用 / CITATIONS

No citations exported.

同领域解读 / AI & LLMS

查看全部「AI 与大模型」解读 →

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封独立、不受审查的科技与 AI 深度评论,周一发出。带出处,可核查。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情