深度解读芯片与硬件generatedpublished

卡马克拆解英伟达机器人芯片:为什么128GB显存有118GB用不上?

实时控制带宽墙与多用途芯片复用错配机制

给一台人形机器人配 128 GB 的大显存, 里面有 118 GB 都是花高价买来的摆设。 只要机器人想在现实世界里实时保持平衡, 它身上的控制模型,最多只能用到 10 GB。 谁要是把这 128 GB 显存全部塞满, 机器人迈出一步就得在原地卡顿半秒,当场摔倒。

这笔反常识的物理账, 被传奇程序员约翰·卡马克直接摆上了台面。 英伟达面向人形机器人推出的旗舰芯片 Jetson Thor,配了整整 128 GB 内存。 但这颗芯片的内存带宽,每秒只有 273 GB。 很多人挑选硬件习惯先看容量, 却忽略了一个最底层的物理常识: 容量只决定你能装进多少参数, 带宽才决定你能以多快的速度把参数读进计算核心。

人在现实世界里活动, 需要机器人的大脑以多快的频率做决策? 至少要达到每秒 20 到 30 次,也就是接近 30 帧的控制频率。 每一次感知到动作的闭环延迟,必须压在 33 毫秒以内。 一旦反应速度慢过这个时间, 地面稍微出现一块凸起的石头, 在身体还没来得及调整脚踝扭矩之前, 整台几十公斤重的金属骨架就已经砸在水泥地上了。

那机器人能不能像云端大模型那样, 把几十个用户的请求攒在一起批量处理? 完全不能。 机房里的服务器可以靠大批次推理, 让成百上千个提问共享同一遍模型读取,把带宽压力分摊掉。 但现实中的机器人只有一具肉身。 它的双目摄像头和关节传感器送进来的信号,永远是单样本输入。 这种实时控制属于严格的单批次推理。 机器人每做出一次动作决策, 芯片就必须把整个模型的权重参数,顺着内存通道完整地搬运进计算核心一遍。

把两个硬指标放在一起算一笔账: 芯片每秒最多只能搬运 273 GB 数据。 如果要满足每秒 27 到 30 次的动作推演, 留给每次推演搬运的模型数据上限是多少? 273 除以 27,结果刚好是 10 GB。 哪怕把频率降低到勉强能维持防跌倒的 20 帧, 能调用的模型权重极限,也只有 13 GB。 这是一道由物理电路锁死的算术铁壁。 没有任何提示词工程或代码魔改能逾越过去。

如果开发者完全照着宣传买单, 真给机器人灌进去一个 70 GB 的具身大模型,会发生什么? 在这根每秒 273 GB 的数据吸管里, 光是把这 70 GB 的参数完整读进计算单元, 就要耗去整整 256 毫秒。 机器人的反应频率会瞬间跌破每秒 4 次。 就如同一个人在悬崖边单腿站立, 眼睛明明看见重心已经偏了, 肢体神经却要等上四分之一秒才开始发力。 在动态运动控制里,这种延迟只会带来彻底的机体失稳。

既然实时控制只能吃下 10 GB 权重, 英伟达为什么还要给这颗芯片焊上昂贵的 128 GB 内存? 答案藏在功耗预算与商业复用的妥协里。 作为装在机器人躯干里的芯片, 它的散热和电池空间被卡得极死。 Jetson Thor 的整卡功耗被硬性限制在 40 瓦到 130 瓦之间。 在这个严苛的能耗区间里, 它根本装不下数据中心里那些带宽动辄数千 GB 的高带宽内存。 高带宽内存价格高昂,发热量惊人, 机器人小巧的冷却风扇和锂电池组根本无法承受。 工程师只能退回移动设备成熟的低功耗 LPDDR5X 颗粒。 而在 256 位的位宽物理限制下, 这种颗粒能挤出来的带宽上限,就是每秒 273 GB。

更深层的原因在于芯片的商业复用。 英伟达造这颗代号为 GB10 的硅片,并不是单独卖给机器人厂商的。 它还要被装进微型工作站,卖给桌面端做本地 AI 开发的程序员。 在办公桌前写代码或者做文档总结, 用户根本不在意模型是每秒吐出 30 个字还是 8 个字。 屏幕前的文字每秒蹦出来几个,使用体验就已经足够流畅。 开发者最渴求的,是显存越大越好, 好把整整几百亿参数的模型完整放进本地硬件。 为了迎合这个庞大的桌面开发市场, 英伟达顺理成章地把容量拉到了满血的 128 GB。 同一块硅片,兼顾两套完全不同的商业叙事。 对于坐在桌子前的开发者来说,128 GB 是实打实的资产; 但只要把同一颗芯片塞进需要实时平衡的人形机器人肚子里, 这就变成了一场荒谬的硬件错配。 昂贵的大内存真金白银地买了单, 狭窄的带宽却在物理上判了它死刑, 让其中 90% 以上的显存空间在实时控制中彻底沦为空转。

有人也许会设想:把多出来的显存用来跑双脑架构行不行? 让 10 GB 的小模型负责手脚平衡, 剩下的一百多 GB 显存装进一个庞大的视觉模型, 让它以每秒一次的慢速度负责看路和规划? 这个架构在理论上很自洽, 但一旦落实到物理硅片上,立刻会撞上带宽争抢。 芯片的总带宽就只有每秒 273 GB。 那个庞大的慢思考模型一旦开始读取数据, 就会瞬间把数据通道挤爆。 负责毫秒级平衡的快思考模型就会遭遇严重的延迟抖动。 在物理机械的控制闭环里, 哪怕出现十几毫秒的信号延迟, 传导到几十个伺服电机上,就是足以导致摔倒的剧烈机械震颤。

在物理世界里运行具身智能, 模型规模从来不是想做多大就能做多大。 决定机器人行动上限的, 从来不是规格表上印着的显存容量有多惊人。 真正卡死动作边界的, 是控制频率与物理带宽之间那道冷酷的除法。 把云端机房堆参数的惯性照搬到钢铁骨架身上, 换不来更灵巧的肢体反应, 只会让昂贵的高速内存, 变成一堆在现实世界里永远无法被调用的沉默晶体管。

引用 / CITATIONS

No citations exported.

同领域解读 / CHIPS & HARDWARE

查看全部「芯片与硬件」解读 →

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封独立、不受审查的科技与 AI 深度评论,周一发出。带出处,可核查。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情