{"id":"mb-20260823-07e9ec","account":"mubei","brand":"","title":"AT&T 刚交出了一份反直觉的算力账本","summary":"AT&T 刚交出了一份反直觉的算力账本","body":"AT&T 刚交出了一份反直觉的算力账本。\n他们把十万名员工写代码的 AI 成本，一口气砍掉了 56%。\n而代码生成的整体质量，仅仅下降了 2%。\n这是一个日均吞吐 450 亿个 Token 的庞大系统。\n面对成千上万名工程师高频的日常调用。\n他们是怎么在保住智力水准的同时，把账单切掉大半的？\n很多人以为他们换掉了顶尖大模型。\n还有人猜测他们给员工的使用额度下了硬性死命令。\n都不是。\n他们只是在整个系统的入口处，装上了一个精准的交通警察。\n这台机器叫动态模型路由。\n过去两年，多数企业接入大模型的方式大多相当粗放。\n不管员工是做底层系统的复杂重构，还是仅仅查一个语法错误、给函数写两行注释。\n所有请求，一律原封不动打包，送进最昂贵的商业旗舰模型里。\n这就像开着重型卡车去街角买一包口香糖。\n事是办成了，但油钱贵得不可思议。\n在这种单一大模型的调用结构下，企业支付的大部分账单，都是在为过剩的智力交税。\nAT&T 拆掉了这个大一统的黑箱。\n他们在内部系统 Ask AT&T 里，接入了开源网关工具 LiteLLM。\n任何一条员工发出的提示词，在触达模型之前，先由网关做一层实时的复杂度判定。\n如果只是常规的代码摘要、格式整理或者基础语法查询。\n系统会直接把任务分流给轻量级的开源模型。\n比如 Meta 的 Llama、Google 的 Gemma，或者英伟达的 Nemotron。\n这些调用的推理成本，只有顶级商业模型的几十分之一。\n只有当任务真正涉及复杂逻辑、多步代码推理或者跨模块架构设计时。\n路由器才会把请求交给 OpenAI 和 Anthropic 的顶级旗舰。\n这套打法在学术界早有理论验证。\n斯坦福大学在 2023 年就提出过级联路由框架 FrugalGPT。\n他们用实测数据证明了一件事：\n真实场景里超过 70% 的用户请求，低成本的小模型完全有能力独立交付。\nAT&T 负责员工 AI 工具的副总裁 Mark Austin 透露。\n目前他们内部已有 40% 的查询被成功分流给开源模型。\n接下来的目标是把这个比例推到 60% 至 70%。\n甚至在一些针对电信业务微调的专有场景中，推理成本直接压缩了 90%。\n整个行业一直在为跑分榜上的参数差距焦虑。\n今天哪家大模型多刷了两分，明天谁的单次调用价格又成了焦点。\n但企业落地真正的算力壁垒，从来不看谁采购了最贵的大模型。\n看的是谁先搭出了那台精细分流的调度机器。\n当你不再用同一把大锤去砸所有的核桃。\n企业的 AI 账本才算真正落到了地上。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:46","created_at":"2026-08-23 00:21:46"}