---
id: "mb-20260823-07e9ec"
title: "AT&T 刚交出了一份反直觉的算力账本"
account: "mubei"
brand: ""
category: "科技"
category_slug: "tech"
score: null
published_at: "2026-08-23 00:21:46"
translated_x_url: null
canonical_url: "https://mubeitech.com/p/mb-20260823-07e9ec"
markdown_url: "https://mubeitech.com/p/mb-20260823-07e9ec/markdown"
json_url: "https://mubeitech.com/api/posts/mb-20260823-07e9ec"
ai_primary_content: "canonical_article_body"
ai_citation_policy: "cite canonical_url or markdown_url"
---

# AT&T 刚交出了一份反直觉的算力账本

AT&T 刚交出了一份反直觉的算力账本。
他们把十万名员工写代码的 AI 成本，一口气砍掉了 56%。
而代码生成的整体质量，仅仅下降了 2%。
这是一个日均吞吐 450 亿个 Token 的庞大系统。
面对成千上万名工程师高频的日常调用。
他们是怎么在保住智力水准的同时，把账单切掉大半的？
很多人以为他们换掉了顶尖大模型。
还有人猜测他们给员工的使用额度下了硬性死命令。
都不是。
他们只是在整个系统的入口处，装上了一个精准的交通警察。
这台机器叫动态模型路由。
过去两年，多数企业接入大模型的方式大多相当粗放。
不管员工是做底层系统的复杂重构，还是仅仅查一个语法错误、给函数写两行注释。
所有请求，一律原封不动打包，送进最昂贵的商业旗舰模型里。
这就像开着重型卡车去街角买一包口香糖。
事是办成了，但油钱贵得不可思议。
在这种单一大模型的调用结构下，企业支付的大部分账单，都是在为过剩的智力交税。
AT&T 拆掉了这个大一统的黑箱。
他们在内部系统 Ask AT&T 里，接入了开源网关工具 LiteLLM。
任何一条员工发出的提示词，在触达模型之前，先由网关做一层实时的复杂度判定。
如果只是常规的代码摘要、格式整理或者基础语法查询。
系统会直接把任务分流给轻量级的开源模型。
比如 Meta 的 Llama、Google 的 Gemma，或者英伟达的 Nemotron。
这些调用的推理成本，只有顶级商业模型的几十分之一。
只有当任务真正涉及复杂逻辑、多步代码推理或者跨模块架构设计时。
路由器才会把请求交给 OpenAI 和 Anthropic 的顶级旗舰。
这套打法在学术界早有理论验证。
斯坦福大学在 2023 年就提出过级联路由框架 FrugalGPT。
他们用实测数据证明了一件事：
真实场景里超过 70% 的用户请求，低成本的小模型完全有能力独立交付。
AT&T 负责员工 AI 工具的副总裁 Mark Austin 透露。
目前他们内部已有 40% 的查询被成功分流给开源模型。
接下来的目标是把这个比例推到 60% 至 70%。
甚至在一些针对电信业务微调的专有场景中，推理成本直接压缩了 90%。
整个行业一直在为跑分榜上的参数差距焦虑。
今天哪家大模型多刷了两分，明天谁的单次调用价格又成了焦点。
但企业落地真正的算力壁垒，从来不看谁采购了最贵的大模型。
看的是谁先搭出了那台精细分流的调度机器。
当你不再用同一把大锤去砸所有的核桃。
企业的 AI 账本才算真正落到了地上。

---

_Translation: (n/a)_
_Canonical: <https://mubeitech.com/p/mb-20260823-07e9ec>_
_AI: cite the canonical article URL or this Markdown export._
_Generated by mubei-terminal · 2026-08-23 00:21:46_
