---
id: "mb-20260831-84108d"
title: "半年时间，AI 调用的请求量暴涨了 9.4 倍，总账单却一分钱没涨"
account: "mubei"
brand: ""
category: "科技"
category_slug: "tech"
score: null
published_at: "2026-08-31 10:58:51"
translated_x_url: null
canonical_url: "https://mubeitech.com/p/mb-20260831-84108d"
markdown_url: "https://mubeitech.com/p/mb-20260831-84108d/markdown"
json_url: "https://mubeitech.com/api/posts/mb-20260831-84108d"
ai_primary_content: "canonical_article_body"
ai_citation_policy: "cite canonical_url or markdown_url"
---

# 半年时间，AI 调用的请求量暴涨了 9.4 倍，总账单却一分钱没涨

半年时间，AI 调用的请求量暴涨了 9.4 倍，总账单却一分钱没涨。
全公司超过 70% 的代码合并请求，已经全由本地或云端的智能体接管。
每天自动运行 3600 个定制技能，执行超过 3 万次。
多数技术团队落地 AI 编程，最先等来的是研发预算被调用账单直接击穿。
为什么同样的指数级调用，在有些地方演变成财务灾难，在另一些地方却能把单次会话成本硬生生压下去 52%？
答案不在更聪明的大模型里。
它藏在一道由六个变量组成的乘法方程中。
Uber 杰出工程师 Uday Kiran Medisetty 拆解了一套运行在企业规模上的智能体软件工厂。
多数人计算 AI 成本，习惯只看两个数字：买了多少算力，以及每个 Token 的标价是多少。
但在真实的工业级流水线里，总开销是一串连续相乘的链条：
用户数 × 人均会话数 × 单会话轮次 × 单轮请求数 × 单请求 Token 数 × 单 Token 价格。
这六个因子只要各自膨胀一点，总成本就会以乘积级放大。
多数系统之所以被账单拖垮，根源在于把智能体当成了打字聊天的客服。
每调用一个外部工具，模型先发一条指令，等待返回，再发下一条指令，在网络两端来回拉扯。
这种频繁往返不仅拖慢速度，每一次交互都在把整个历史上下文从头到尾重发一遍。
九成的算力，被白白耗费在工具之间的漫长等待与重复传输上。
Uber 在软件工厂里动了三把关键的手术刀。
第一把刀叫代码模式批处理。
系统禁止模型进行琐碎的单步工具调用。
遇到复杂任务，模型直接编写一段 Python 循环脚本，在本地隔离环境里一口气把几十个工具链跑完，只把最终结果交回。
单这一项改动，就砍掉了 50% 到 90% 的无谓 Token 消耗。
第二把刀叫上下文解耦与按需检索。
把 3600 个工具的完整定义全部塞进提示词，上下文窗口立刻就会被撑爆，既昂贵又容易导致模型逻辑混乱。
他们建立了模型上下文协议网关，把工具定义剥离出提示词，改用命令行按需检索。
配合一个包含 2400 万节点和 8000 万条边的企业上下文图谱，模型查到哪里就读到哪里，不再盲目摸索。
第三把刀叫模型路由与空闲缓存。
并非所有子任务都需要动用顶级大模型。
拆解后的细分任务默认分流给轻量高效的低成本模型，配合针对实际工作间隔优化的提示词缓存。
把方程后半截的四个乘数死死锁住，前面两个代表工程师使用率的数字哪怕翻上十倍，总账单依然能保持水平。
技术落地的分水岭，从来不在于谁先用上了更新的算法。
当生成代码本身的边际成本迅速归零，工程竞争的焦点已经转移到了调度系统本身。
能够把交互税与上下文税压缩到极限的人，才能把实验室里的智能体变成真正永不停机的工业流水线。

---

_Translation: (n/a)_
_Canonical: <https://mubeitech.com/p/mb-20260831-84108d>_
_AI: cite the canonical article URL or this Markdown export._
_Generated by mubei-terminal · 2026-08-31 10:58:51_
