一个月烧掉 150 万美元算力,账单是全公司员工工资总和的整整 10 倍
一个月烧掉 150 万美元算力,账单是全公司员工工资总和的整整 10 倍。 平均每个工程师,一天要在后台吃掉 10 亿到 20 亿个 token。 招进来的顶尖工程师没有创造对应的高产出,反而成了吞噬预算的无底洞。 这是硅谷做大模型评测的创业公司 Vals AI,最近做的一场真人极限测试。 首席执行官 Rayan Krishnan 给技术团队开了无限额度。 他允许所有人放开手脚,无限制调用大模型写代码。 他原本想看看,当算力彻底管够时,顶级程序员的生产力能飙到多高。 结果生产力有没有暴涨还很难说,财务账单先被打穿了。 整整 150 万美元。 这笔开销比当月发给所有员工的薪资总额,还要贵出十倍。 为什么算力管够,换来的却是一场失控的财务灾难? 是工程师写了太复杂的代码,还是手里的工具出了问题? 答案出在一种反常的心理状态上。 Rayan Krishnan 把它叫作工程师的焦虑义务感。 当整个行业都在鼓吹全力烧算力的 tokenmaxxing 时,技术团队产生了一种奇特的职场恐慌。 哪怕只有一个钟头没让模型在后台狂奔,工程师就会觉得自己偷了懒,正在被时代甩开。 原本花五分钟能理顺的业务逻辑,非要放任一个自主代理在网上到处乱撞。 两行代码就能搞定的判断,非要让模型生成一大段脚本,再派另外两个模型在旁边互相挑错。 随着多轮对话不断堆叠,上下文窗口像滚雪球一样膨胀。 工程师在工位上喝着咖啡,后台的脚本已经在死循环里撞墙了几百次。 算力看似没有门槛,人的精力却全被拴在给机器排查幻觉的泥潭里。 一场本该提升效率的实验,演变成了表演性质的算力大胃王比赛。 一个人一天怎么可能处理得完 20 亿个 token 的有效信息? 既然都在空转,为什么成本会高到比员工工资还贵十倍? 因为背后还藏着第二台机器:计费模式的激励倒错。 主流的大模型 API,普遍采用按 token 计费的现收现付制。 在这套商业规则里,模型供应商的利益,和你的使用效率是根本对立的。 你的脚本在死循环里多跑一轮,供应商在月底就能多收一笔真金白银。 他们没有任何动力提醒你精简上下文,反而乐于看到提示词越堆越厚。 客户的每一次低效浪费,都会变成供应商财报上的营业收入。 但 Vals AI 在测试里,撞见了一个意料之外的反差。 团队测试了 Cognition 推出的智能体 Devin,发现它的代币消耗克制得出奇。 同样是处理复杂的工程任务,为什么它反而最省 token? 秘密全在收费方式上。 Devin 采用的是固定月费的订阅制。 一旦商业逻辑从按量计费变成一口价订阅,游戏规则瞬间反转了。 模型跑出来的每一分边际算力成本,全部要由软件开发商自己掏腰包。 这时候,厂商的利益才真正跟客户站到了一起。 他们必须拼命在系统底层做工程优化。 他们必须做提示词缓存,必须做精确的上下文裁剪,必须卡死代理人无意义的盲目探索。 用最少的算力帮客户把任务交割完毕,厂商自己才能保住利润空间。 两种计费模式,拉出了两条截然相反的工程演进路线。 按量付费把成本风险全推给买单的客户,放大了人在焦虑中的无序暴食。 固定订阅逼着厂商在算法和工程上拧干水分,把虚高的泡沫挤回理性的轨道。 当整个行业还在把算力消耗量当成前沿指标来比拼时,这笔 150 万美元的账单给所有人上了一课。 消耗多少算力算不上成果,最终交付的工程质量才是成果。 连专业的模型评测公司,放开额度一个月都要被账单逼到紧急叫停。 普通团队盲目跟风,无非是用自己的真金白银,去替上游消化过剩的算力泡沫。 当一个工具能让你在几分钟内烧光上千美元,它考验的就不再是技术信仰,是工程自律。 无限的算力没有消灭低效。 它只是让漫无目的的浪费,换上了一副看起来格外勤奋的面具。
引用 / CITATIONS
No citations exported.
同领域解读 / BUSINESS & INVESTING
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封科技与 AI 深度解读,周一发出。不受审查,带出处,可核查。