曾把全行业逼到斩杀线上的低价神话,自己先扛不住峰值流量涨价了
曾把全行业逼到斩杀线上的低价神话,自己先扛不住峰值流量涨价了。 2026 年 8 月,大模型 API 历史上第一次出现了错峰用电式的分时加价。 过去跑上几十轮智能体任务的低价红利,瞬间被翻倍的账单打回原形。 但就在行业集体上调调用费的当口,阿里和智谱同日放出了新模型。 定价没有跟涨,反而直接砍到了前代模型的十分之一。 为什么当所有人都以为降价只能靠烧钱倒贴时,有人却能越压越低? 是巨头家底厚敢于流血补贴,还是大模型的成本逻辑从根上被换掉了? 把这笔账顺着物理极限拆到底,会看到一台正在重塑整个 AI 产业的冷酷机器。 架构级算力解耦。 2026 年,超大规模云厂商在推理上的资本开支,历史上第一次超过了训练开支。 过去的竞赛,比的是谁能堆出更大的参数规模和更高的跑分。 只要买得起上万张算力卡,参数就能翻倍。 现在的真实战场,彻底转移到了每一个智能体任务的落地成本。 当一个任务需要模型自主调用几十次工具、吞吐上百万 token 上下文时,哪怕每百万 token 差几分钱,乘上循环深度都会变成难以承受的开销。 靠资本补贴降价的模式,在万亿级真实调用的冲击下,必然会撞上财务斩杀线。 唯一的生路,是在底层架构上把计算量、数据搬运和显存占用三者彻底解开。 第一个瓶颈是注意力机制的二次方计算税。 序列越长,计算量呈二次方暴涨。 更致命的是数据搬运:预填充阶段卡算力,逐字解码阶段卡显存带宽。 传统稀疏注意力为了找出哪些上下文重要,本身还要跑一套索引计算,序列越长,索引自身的开销越重。 Qwen3.8-Flash 采用的解法,是门控 Delta 网络与自研 QSA 稀疏注意力的混合结构。 四分之三的层用线性注意力压缩隐状态,四分之一的全局层用 QSA。 QSA 直接在微型块级别估算重要性,把寻找上下文的索引成本一并压缩掉。 在 100 万 token 上下文下,预填充提速 7.6 倍,解码提速 4.9 倍。 智谱 GLM-5.3-Flash 则用稀疏与线性混合架构配上 IndexPool,把 4 个索引缓存向量聚合成 1 个,注意力计算量直接压低了 3 倍。 第二个瓶颈是显存墙对大参数的锁死。 大模型需要海量参数承载知识,但参数越多,显存开销越恐怖。 传统混合专家虽然降低了每次激活的参数量,却依然要把所有参数常驻在昂贵的 GPU 显存里。 Qwen3.8-Flash 在总参数 125B、激活仅 6B 的基础上,额外开辟了一个 51B 的局部短语嵌入表。 这 51B 参数只取决于输入的文字序列,在模型开始计算前就能确定寻址。 它们被直接存放在廉价的主机内存,通过异步预取和计算并行重叠,完全不占用 GPU 显存,也不消耗每 token 的矩阵乘预算。 参数变大了,知识变多了,昂贵的显存税却被绕了过去。 第三个瓶颈是残差连接的单车道拥堵。 过去十年,所有网络层都在共享同一条残差流。 网络越深,早期输入的关键信息越容易在深层被混合稀释。 新架构把残差流拆解成四条并行车道,通过门控机制让模型动态分流。 早期信息获得了一条直通深层的专用通道,让 6B 或 18B 的小激活参数爆发出比肩数百亿参数的推理表现。 配合将动量矩阵正交化的 Muon 优化器,训练开销直接降至前代九分之一。 在工程落地端,智谱甚至用国产芯片集群承载了数万亿 token 的盲测流量,把多模态编码、预填充和解码拆成独立工作池,端到端性能拉升 3 倍,单 token 成本追平主流英伟达 GPU。 这推翻了行业过去对算力需求的悲观预期。 很多人以为模型变便宜会让 GPU 需求见顶。 杰文斯悖论给出了相反的答案:当每次调用的边际成本逼近零,省下的预算不会被收回,会催生百倍、千倍的智能体自主运行。 大模型的竞争指标,已经从每百万 token 单价,彻底转向了单次任务的完成成本。 靠资本补贴撑起来的低价,总有被流量反噬的一天。 把物理瓶颈拆碎、把架构效率压进底层的解法,才是价格战里唯一的底牌。
相关 / RELATED
JSON导出 / EXPORT
订阅 · SUBSCRIBE
每周一封信号简报,重大进展可选即时推送。