科技·via

半年时间,AI 调用的请求量暴涨了 9.4 倍,总账单却一分钱没涨

半年时间,AI 调用的请求量暴涨了 9.4 倍,总账单却一分钱没涨。 全公司超过 70% 的代码合并请求,已经全由本地或云端的智能体接管。 每天自动运行 3600 个定制技能,执行超过 3 万次。 多数技术团队落地 AI 编程,最先等来的是研发预算被调用账单直接击穿。 为什么同样的指数级调用,在有些地方演变成财务灾难,在另一些地方却能把单次会话成本硬生生压下去 52%? 答案不在更聪明的大模型里。 它藏在一道由六个变量组成的乘法方程中。 Uber 杰出工程师 Uday Kiran Medisetty 拆解了一套运行在企业规模上的智能体软件工厂。 多数人计算 AI 成本,习惯只看两个数字:买了多少算力,以及每个 Token 的标价是多少。 但在真实的工业级流水线里,总开销是一串连续相乘的链条: 用户数 × 人均会话数 × 单会话轮次 × 单轮请求数 × 单请求 Token 数 × 单 Token 价格。 这六个因子只要各自膨胀一点,总成本就会以乘积级放大。 多数系统之所以被账单拖垮,根源在于把智能体当成了打字聊天的客服。 每调用一个外部工具,模型先发一条指令,等待返回,再发下一条指令,在网络两端来回拉扯。 这种频繁往返不仅拖慢速度,每一次交互都在把整个历史上下文从头到尾重发一遍。 九成的算力,被白白耗费在工具之间的漫长等待与重复传输上。 Uber 在软件工厂里动了三把关键的手术刀。 第一把刀叫代码模式批处理。 系统禁止模型进行琐碎的单步工具调用。 遇到复杂任务,模型直接编写一段 Python 循环脚本,在本地隔离环境里一口气把几十个工具链跑完,只把最终结果交回。 单这一项改动,就砍掉了 50% 到 90% 的无谓 Token 消耗。 第二把刀叫上下文解耦与按需检索。 把 3600 个工具的完整定义全部塞进提示词,上下文窗口立刻就会被撑爆,既昂贵又容易导致模型逻辑混乱。 他们建立了模型上下文协议网关,把工具定义剥离出提示词,改用命令行按需检索。 配合一个包含 2400 万节点和 8000 万条边的企业上下文图谱,模型查到哪里就读到哪里,不再盲目摸索。 第三把刀叫模型路由与空闲缓存。 并非所有子任务都需要动用顶级大模型。 拆解后的细分任务默认分流给轻量高效的低成本模型,配合针对实际工作间隔优化的提示词缓存。 把方程后半截的四个乘数死死锁住,前面两个代表工程师使用率的数字哪怕翻上十倍,总账单依然能保持水平。 技术落地的分水岭,从来不在于谁先用上了更新的算法。 当生成代码本身的边际成本迅速归零,工程竞争的焦点已经转移到了调度系统本身。 能够把交互税与上下文税压缩到极限的人,才能把实验室里的智能体变成真正永不停机的工业流水线。

相关 / RELATED

JSON

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封信号简报,重大进展可选即时推送。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情