科技·via

AT&T 刚交出了一份反直觉的算力账本

AT&T 刚交出了一份反直觉的算力账本。 他们把十万名员工写代码的 AI 成本,一口气砍掉了 56%。 而代码生成的整体质量,仅仅下降了 2%。 这是一个日均吞吐 450 亿个 Token 的庞大系统。 面对成千上万名工程师高频的日常调用。 他们是怎么在保住智力水准的同时,把账单切掉大半的? 很多人以为他们换掉了顶尖大模型。 还有人猜测他们给员工的使用额度下了硬性死命令。 都不是。 他们只是在整个系统的入口处,装上了一个精准的交通警察。 这台机器叫动态模型路由。 过去两年,多数企业接入大模型的方式大多相当粗放。 不管员工是做底层系统的复杂重构,还是仅仅查一个语法错误、给函数写两行注释。 所有请求,一律原封不动打包,送进最昂贵的商业旗舰模型里。 这就像开着重型卡车去街角买一包口香糖。 事是办成了,但油钱贵得不可思议。 在这种单一大模型的调用结构下,企业支付的大部分账单,都是在为过剩的智力交税。 AT&T 拆掉了这个大一统的黑箱。 他们在内部系统 Ask AT&T 里,接入了开源网关工具 LiteLLM。 任何一条员工发出的提示词,在触达模型之前,先由网关做一层实时的复杂度判定。 如果只是常规的代码摘要、格式整理或者基础语法查询。 系统会直接把任务分流给轻量级的开源模型。 比如 Meta 的 Llama、Google 的 Gemma,或者英伟达的 Nemotron。 这些调用的推理成本,只有顶级商业模型的几十分之一。 只有当任务真正涉及复杂逻辑、多步代码推理或者跨模块架构设计时。 路由器才会把请求交给 OpenAI 和 Anthropic 的顶级旗舰。 这套打法在学术界早有理论验证。 斯坦福大学在 2023 年就提出过级联路由框架 FrugalGPT。 他们用实测数据证明了一件事: 真实场景里超过 70% 的用户请求,低成本的小模型完全有能力独立交付。 AT&T 负责员工 AI 工具的副总裁 Mark Austin 透露。 目前他们内部已有 40% 的查询被成功分流给开源模型。 接下来的目标是把这个比例推到 60% 至 70%。 甚至在一些针对电信业务微调的专有场景中,推理成本直接压缩了 90%。 整个行业一直在为跑分榜上的参数差距焦虑。 今天哪家大模型多刷了两分,明天谁的单次调用价格又成了焦点。 但企业落地真正的算力壁垒,从来不看谁采购了最贵的大模型。 看的是谁先搭出了那台精细分流的调度机器。 当你不再用同一把大锤去砸所有的核桃。 企业的 AI 账本才算真正落到了地上。

相关 / RELATED

JSON

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封信号简报,重大进展可选即时推送。

不追踪打开与点击,一键退订。 或用 RSS · 详情