把算力预算翻十倍能撑起十倍并发,但一分钱都买不来更低的响应延迟
把算力预算翻十倍能撑起十倍并发,但一分钱都买不来更低的响应延迟。 吞吐量是水管的粗细,延迟是水流过管道的时间。 把管道加粗一千倍,一滴水从起点流到终点,依然受制于光速和物理定律。 当系统进入长链条调用的 AI 智能体时代,这个物理鸿沟正在让无数架构越跑越慢。 算力堆满,系统却卡在原地。 这要怎么解? 新的 AI 架构并没有推翻旧的物理法则。 底层的性能机器,四十年都没变过。 曾维护 Linux 内核内存系统、参与搭建分布式数据库 ScyllaDB 的架构师 Pekka Enberg 在著作《延迟》里把这套底层机制讲透。 分布式系统专家 Bilgin Ibryam 将它与现代 AI 架构对照,拆解出跨越两代软件的底层规律。 第一台机器,叫数据亲和与消灭「搬运税」。 芯片完成一次数学运算只需要纳秒级时间,系统绝大部分耗时都在等数据搬运。 几十年前操作系统用零拷贝和本地内存共置,省掉网络和磁盘之间来回倒手的耗时。 今天大模型每一次提问如果从头计算上下文,就是在重复交一次昂贵的搬运税。 前缀缓存(Prefix Caching)把注意力机制的键值对常驻在显存里,谁要用谁直接读,直接免去了重复搬运和计算。 第二台机器,叫推测执行(Speculative Execution)。 串行依赖是延迟的天敌:第二步必须等待第一步的结果,算力再大也只能空转。 CPU 四十年前就用分支预测打破了这个僵局:不等判断完成,先挑概率最高的分支往前算。 现代大模型的推测解码(Speculative Decoding)完全复刻了这套逻辑: 让轻量的小模型以极高速度草拟后续词元,主模型在单一时钟周期内一次性并行校验。 猜对了直接采纳,猜错了推倒重来。 串行等待的死锁,被改写成了并行验证。 第三台机器,叫尾延迟放大与感知隐藏。 根据排队论与利特尔法则(Little's Law),系统单点的尾部延迟会在调用链中指数级放大。 一个独立接口的 99 分位数延迟如果只有一秒,在连续调用十次工具的智能体系统里,遭遇严重卡顿的概率会直接飙升到近 10%。 聪明的架构不跟物理定律硬碰硬。 它把延迟隐藏在人类的感知阈值之后。 流式传输把首字响应时间(TTFT)压进人类神经反应的 200 毫秒以内。 只要字符吐出的速度稳定在每秒 20 到 30 个词,符合人眼的阅读节奏,背后长达十秒的完整生成在用户感知里就是零等待。 系统设计的残酷规律向来如此: 吞吐量是金钱问题,可以用预算和服务器堆出来。 延迟是物理问题,只能用精巧的结构绕过去。 从内核内存页,到分布式数据库,再到大模型的注意力机制。 堆算力只能掩盖平庸的设计。 真正拉开系统差距的,永远是谁看清了那道物理瓶颈,然后用结构一步跨了过去。
引用 / CITATIONS
No citations exported.
导出 / EXPORT
订阅 · SUBSCRIBE
新的深度解读发布时,会在每周简报里送到你邮箱。