真把前沿的 AI 大脑装进人形机器人的肚子里
真把前沿的 AI 大脑装进人形机器人的肚子里, 它的电池大概只能撑几分钟。 光是这一颗芯片要吃的电,就超过了整台机器人的功耗上限。
人形机器人身上的动力电池,容量通常只有 2 度电。 全身几十个关节一起动起来,正常功耗也就几百瓦。 机房里跑前沿大模型的一颗英伟达 Blackwell 芯片呢? 单颗功耗就在 1200 到 1400 瓦之间。 而且它必须泡在液冷机架里散热。 要是真把这颗芯片焊在机器人肚子里, 就算它扛得动沉重的液冷水箱,几分钟就会把电池彻底吸干。
换上专门给机器人设计的端侧芯片行不行? 英伟达端侧最顶配的芯片是 Jetson Thor。 它的功耗确实压到了 40 到 130 瓦。 但代价是算力断崖式缩水。 Thor 的算力,还不到单颗 B300 的十四分之一。 现在的机器人前沿模型有多吃算力? 看一眼目前领跑竞技场的 DreamZero。 这是一个 140 亿参数的世界动作模型。 它靠实时的视频扩散算法,去推演物理世界的后续动作。 为了跑到每秒 7 次动作推演的基本门槛, 在机房里必须用两颗 GB200 芯片并联才能跑顺。 如果强行把这个模型塞进机器人身上的 Thor 芯片, 推理速度会直接跌破每秒 1 次。 机器人每走半步就得僵住发呆一整秒,连走路都会卡成幻灯片。
算力塞不进身体,机器人到底该在哪里思考? 答案是把脑子拆成两层。 一层叫动作层,也就是快脑。 它留在机器人身体内部,以每秒上百赫兹的频率运转。 专门负责底层的电机扭矩、关节角度和防跌倒平衡。 这一层绝不能断,也经不起哪怕几毫秒的延迟。 另一层叫规划层,也就是慢脑。 它搬出机器人身体,直接放进机房的数据中心。 它负责看懂摄像头画面、理解空间关系,每秒只需要更新一到两次。 为什么慢脑可以放出去? 慢脑不用去算每一个瞬时角度。 它交出的是一整段连续的“动作块”。 一次推理,就能管够未来 1.6 秒的连续行动。 机器人一边照着手头的规划动作, 一边通过无线网络向机房请求下一段。 在厂区内 10 毫秒的网络往返延迟下, 慢脑完全吃得下无线传输的微小抖动。 快脑手头永远有动作可做,绝不会突然僵在半空。
把慢脑移进机房,还解开了一本更残酷的半导体账本。 很多人直觉上觉得,给每台机器人肚子里装一颗芯片才叫完整产品。 但在晶圆代工厂眼里,这是一场先进制程产能的争夺战。 以前的机器人芯片用的是三星较旧的工艺。 现在的 Jetson Thor 已经追到了台积电的 4 纳米节点。 下一代更要跟机房旗舰芯片一起抢 3 纳米和 2 纳米。 可是英伟达卖数据中心 GPU 的毛利率在 75% 到 80% 之间, 卖端侧机器人芯片的毛利率只有 60% 出头。 台积电的高端晶圆就那么多。 谁出价高、利润厚,产能就给谁。 端侧芯片在代工厂排队永远在最末尾。
更关键的是硅片利用率。 半导体分析机构 SemiAnalysis 用一台真实的 B300 运行 DreamZero 做了测算。 采用时分复用,让多台机器人排队共享单颗 B300 的算力。 在 1.6 秒的动作预算线内,单颗 B300 的 99 分位响应时间是 1.16 秒。 刚好能稳稳伺候 7 台机器人,全程零丢包、零卡顿。 这意味着,一台装了 8 颗 B300 芯片的机房服务器, 就能同时扛起 56 台人形机器人的慢脑。 对比直接买 56 块独立的 Jetson Thor 焊在每台机器人身上, 临界点在这里出现了: 只要 1 颗机房芯片能同时带 7 台机器人, 集中式方案消耗的台积电先进晶圆面积,就比每台机器人装一颗芯片还要少。 如果只看内存,只要带 5 台以上,消耗的内存晶圆也更省。
机器人的脑子到底该放哪? 这从来不是什么路线信仰。 决定大脑位置的,纯粹是场景能给出的物理预算。 在有稳定高带宽覆盖的工厂车间和仓储物流中心, 1 台服务器管 56 台机器人的方案,在算力上限和总拥有成本上都是降维打击。 只有当机器人孤身走进断网的深山矿井、地下洞穴或救援废墟, 它才不得不退回那颗功耗受限、算力拮据的端侧小脑壳。
引用 / CITATIONS
No citations exported.
同领域解读 / AI & LLMS
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封科技与 AI 深度解读,周一发出。不受审查,带出处,可核查。