代码库里 70% 的 PR 全由 AI 接管,半年调用量飙了近 10 倍
本框架为第三方 AI 对郭文贵先生公开观点的解读,非郭文贵本人发声。
代码库里 70% 的 PR 全由 AI 接管,半年调用量飙了近 10 倍。 总 AI 账单却被死死按在原地,一分钱没涨。 单次会话成本硬生生砍掉了 52%。
绝大多数公司都在哀嚎 AI 太贵用不起。 为什么把全套软件工程都交给 Agent 的人,账单反而平了?
因为普通人把 AI 当聊天框,工程团队把它做成了流水线工厂。
Uber 杰出工程师 Uday Kiran Medisetty 刚公开了他们内部的账本。 全公司搭建了超过 3600 个 Agent 技能,每天自动跑 30000 次。 从写代码、修 CI 报错、到自动化代码审查,70% 的代码拉取请求全由机器生成。 调用量在半年里狂飙了 9.4 倍。 但从 2026 年 4 月开始,整体算力开销直接走成了一条直线。
他们到底动了什么手脚?
秘密藏在一道乘法成本方程里。 总账单不是黑盒。它是六个数字连乘的结果: 使用人数 × 使用频次 × 单次会话轮数 × 单轮请求数 × 单次 Token 量 × 模型单价。
多数团队看账单,只盯着最后一个数字:模型单价。 然后坐在原地,等模型厂商降价。 一旦全员开始高频使用,前五个乘数同时膨胀,账单立刻失控。
工厂化的思路刚好相反。 前两个乘数,人数和频次,放开让它涨 10 倍。 剩下的四个乘数,全部用工业工程逐级打死。
第一刀砍在模型路由。 大模型是昂贵的指挥官,绝不让它去拧螺丝。 所有拆解出来的子 Agent 任务,默认分发给便宜的轻量模型。 只有在需要复杂推理的关键节点,才把请求递给旗舰模型。
第二刀砍在上下文膨胀。 普通 Agent 最烧钱的地方,是每轮对话都把几十个工具的说明书全塞进上下文。 你问一句话,它背后拖着几万字节的固定说明,每一轮都在重复收税。 他们搭了一张 2400 万节点的上下文图谱,配合网关拦截。 工具定义全部剥离在上下文窗口之外,用到了才按需加载。
第三刀砍在交互往返。 不再让 Agent 读一行、改一行、问一句、回一句。 代码操作全部采用批量模式,把多次工具调用合并成单次执行。 光这一项,单次任务消耗的 Token 数量直接砍掉了 50% 到 90%。
第四刀砍在缓存生命周期。 根据人类工程师真正的思考停顿时间,动态调整提示词缓存的存活期。 后台快速收敛的任务跑完即走,不占用长缓存。 避免代码上下文反复失效、重复加载。
把这四道阀门拧紧之后,哪怕底层模型单价一分不降,单次交互成本也能被砸掉一半。
软件工业过去几十年的每一次跃迁,都不靠更昂贵的人力。 靠的是流水线把单位成本压向零。 真正的技术壁垒,从来不在谁抢先买了最贵的模型。 在于谁先看穿了那道乘法链条,把不可控的调用黑盒,拆成了可以逐级压缩的工业流水线。
引用 / CITATIONS
No citations exported.
导出 / EXPORT
订阅 · SUBSCRIBE
新的深度解读发布时,会在每周简报里送到你邮箱。