给五千名工程师配上 AI,只用了四个月,一整年的预算直接打穿
给五千名工程师配上 AI,只用了四个月,一整年的预算直接打穿。 钱花去哪了? 公司在内部挂了个排行榜,按算力消耗给各个团队排名。 谁烧的 token 最多,谁就是拥抱新技术的标兵。 这家公司叫 Uber。 到了四月份,财务看着见底的账户直发懵。 更尴尬的是下一幕。 Uber 总裁兼首席运营官 Andrew Macdonald 站在台上公开承认: 算力消耗像坐了火箭,可交付给乘客和司机的产品,没有任何变好的迹象。
硅谷给这种疯狂刷量的现象起了个名字,叫 tokenmaxxing。 管理层想鼓励大家用新工具,但不知道怎么衡量生产力,于是拿算力消耗做考核。 当消耗本身变成了目标,古德哈特定律立刻生效。 大家为了在排行榜上冲进前列,不管什么鸡毛蒜皮的小活,都拉着 AI 跑一圈。
但如果全怪工程师摸鱼,那就把事情看浅了。 很多时候,企业工具的水管结构,从一开始就在推着所有人浪费。 大家以为工程师在用前沿模型攻克什么技术难关。 语言学习软件 Promova 的技术负责人跑去查后台,当场傻眼。 员工在用最昂贵、参数最大的顶级模型干什么? 在查收日常邮件。 在给两行周报改错别字。 为什么会这样? 很多企业版 AI 工具一装上,默认选中的就是最贵的 Claude Opus。 默认开启最高档的深度思考,上下文窗口默认直接拉到 100 万 token。 写代码的人顺手一点就开始对话,没人会特意去修改复杂的后台参数。 每一次按回车,后台都在调用顶配大炮轰蚊子。
更致命的断层,发生在财务账本上。 过去几十年,企业首席财务官习惯了传统的软件成本结构。 按人头买断工位,一个工位每月固定几十美元,全年的开销一眼望到底。 智能体彻底砸碎了这个规律。 它的计费逻辑完全变成了水表和电表。 同一个工程师坐在同一台电脑前,如果只是让 AI 自动补全两行代码,账单可能只有两分钱; 要是开了几个并行智能体做底层架构迁移,几千美元眼都不眨就划走了。 根据 Gartner 的预测,2026 年全球企业在智能体软件上的开支会冲到 2070 亿美元,比去年猛增 139%。 大钱像瀑布一样砸进去,可到底有多少钱换回了真金白银的产出? 多写了几行代码,系统崩溃率降了吗? 代码提交量上去了,用户体验变好了吗? 几乎没人能拿出硬核证据。 于是整个行业开始急刹车。 微软在自己的体验与设备部门,直接砍掉了 Claude Code 的许可证。 多邻国原本打算把 AI 使用量挂钩到员工绩效考核,被内部抗议到狼狈撤回。
账单爆表之后,大厂的本能反应是设卡限额。 Uber 连夜下令:每名员工在每个智能体工具上,每月支出上限封死在 1500 美元。 直接设个配额上限,就能解决问题吗? 开源软件巨头 SUSE 的技术总经理 Rick Spencer 说了句大实话: 看到账单暴涨,第一反应不该是一刀切减少使用。 如果一个工程师烧了一万六千美元的算力,给公司省下了十万美元的研发成本,这种使用必须大力鼓励。 用多用少从来不是分水岭。 这笔算力能不能咬合在具体的业务价值上,才是分水岭。
到底怎么用才能算得过来账? 司法调查平台 Everlaw 拿出了全行业罕见的硬账本。 他们对核心 Java 基础设施做重构,整个项目一共消耗了 3500 美元的算力。 换来的回报是什么? 原本需要 9.5 个月的工程周期,被硬生生压缩到了 2.5 个月。 花了 3500 美元,抢回来了整整 7 个月的高级工程师工时。 Everlaw 同样设置了个人额度,但机制完全不同。 工程师只要额度见底,给技术支持团队发一封只有一句话的申请邮件,当天额度就能直接翻倍。 额度在这里是一盏异常报警灯,专抓跑冒滴漏,绝不卡死正常业务。
那些白白流失的冤枉钱,到底该怎么堵? 解铃还须系铃人,必须把水管重接一遍。 不能把模型选择权直接扔给前端写提示词的员工。 只要把选择权交给个人,出于习惯,大家永远会选最顶配、最昂贵的模型。 成熟的解法是在中间层架设自动路由代理。 查收邮件、格式转换、简单补全,系统自动分流给便宜迅速的轻量模型; 只有遇到复杂的系统重构和深层逻辑推演,才放行给顶配模型的深度思考模式。 把消耗当成果,买来的只是一张糊弄管理层的虚假繁荣。 算力从来只是汽油。 如果底盘没有挂上轮子,油门踩得再响,车也只是在泥潭里空转。
引用 / CITATIONS
No citations exported.
同领域解读 / AI & LLMS
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封科技与 AI 深度解读,周一发出。不受审查,带出处,可核查。