{"id":"mb-20260911-a50724","kind":"deep","title":"卡马克拆解英伟达机器人芯片：为什么128GB显存有118GB用不上？","summary":"针对英伟达为人形机器人打造的旗舰芯片Jetson Thor，传奇程序员约翰·卡马克指出了一道冷酷的物理算术题：在单批次实时运动控制下，受限于每秒273GB的内存带宽，为了达到防跌倒所需的30帧决策频率，模型权重最多只能用到10GB。芯片所搭载的128GB大内存，实质上是英伟达为了兼顾桌面开发者市场而做出的妥协，导致高额硬件成本在实体机器人控制中严重空转。","body":"给一台人形机器人配 128 GB 的大显存，\n里面有 118 GB 都是花高价买来的摆设。\n只要机器人想在现实世界里实时保持平衡，\n它身上的控制模型，最多只能用到 10 GB。\n谁要是把这 128 GB 显存全部塞满，\n机器人迈出一步就得在原地卡顿半秒，当场摔倒。\n\n这笔反常识的物理账，\n被传奇程序员约翰·卡马克直接摆上了台面。\n英伟达面向人形机器人推出的旗舰芯片 Jetson Thor，配了整整 128 GB 内存。\n但这颗芯片的内存带宽，每秒只有 273 GB。\n很多人挑选硬件习惯先看容量，\n却忽略了一个最底层的物理常识：\n容量只决定你能装进多少参数，\n带宽才决定你能以多快的速度把参数读进计算核心。\n\n人在现实世界里活动，\n需要机器人的大脑以多快的频率做决策？\n至少要达到每秒 20 到 30 次，也就是接近 30 帧的控制频率。\n每一次感知到动作的闭环延迟，必须压在 33 毫秒以内。\n一旦反应速度慢过这个时间，\n地面稍微出现一块凸起的石头，\n在身体还没来得及调整脚踝扭矩之前，\n整台几十公斤重的金属骨架就已经砸在水泥地上了。\n\n那机器人能不能像云端大模型那样，\n把几十个用户的请求攒在一起批量处理？\n完全不能。\n机房里的服务器可以靠大批次推理，\n让成百上千个提问共享同一遍模型读取，把带宽压力分摊掉。\n但现实中的机器人只有一具肉身。\n它的双目摄像头和关节传感器送进来的信号，永远是单样本输入。\n这种实时控制属于严格的单批次推理。\n机器人每做出一次动作决策，\n芯片就必须把整个模型的权重参数，顺着内存通道完整地搬运进计算核心一遍。\n\n把两个硬指标放在一起算一笔账：\n芯片每秒最多只能搬运 273 GB 数据。\n如果要满足每秒 27 到 30 次的动作推演，\n留给每次推演搬运的模型数据上限是多少？\n273 除以 27，结果刚好是 10 GB。\n哪怕把频率降低到勉强能维持防跌倒的 20 帧，\n能调用的模型权重极限，也只有 13 GB。\n这是一道由物理电路锁死的算术铁壁。\n没有任何提示词工程或代码魔改能逾越过去。\n\n如果开发者完全照着宣传买单，\n真给机器人灌进去一个 70 GB 的具身大模型，会发生什么？\n在这根每秒 273 GB 的数据吸管里，\n光是把这 70 GB 的参数完整读进计算单元，\n就要耗去整整 256 毫秒。\n机器人的反应频率会瞬间跌破每秒 4 次。\n就如同一个人在悬崖边单腿站立，\n眼睛明明看见重心已经偏了，\n肢体神经却要等上四分之一秒才开始发力。\n在动态运动控制里，这种延迟只会带来彻底的机体失稳。\n\n既然实时控制只能吃下 10 GB 权重，\n英伟达为什么还要给这颗芯片焊上昂贵的 128 GB 内存？\n答案藏在功耗预算与商业复用的妥协里。\n作为装在机器人躯干里的芯片，\n它的散热和电池空间被卡得极死。\nJetson Thor 的整卡功耗被硬性限制在 40 瓦到 130 瓦之间。\n在这个严苛的能耗区间里，\n它根本装不下数据中心里那些带宽动辄数千 GB 的高带宽内存。\n高带宽内存价格高昂，发热量惊人，\n机器人小巧的冷却风扇和锂电池组根本无法承受。\n工程师只能退回移动设备成熟的低功耗 LPDDR5X 颗粒。\n而在 256 位的位宽物理限制下，\n这种颗粒能挤出来的带宽上限，就是每秒 273 GB。\n\n更深层的原因在于芯片的商业复用。\n英伟达造这颗代号为 GB10 的硅片，并不是单独卖给机器人厂商的。\n它还要被装进微型工作站，卖给桌面端做本地 AI 开发的程序员。\n在办公桌前写代码或者做文档总结，\n用户根本不在意模型是每秒吐出 30 个字还是 8 个字。\n屏幕前的文字每秒蹦出来几个，使用体验就已经足够流畅。\n开发者最渴求的，是显存越大越好，\n好把整整几百亿参数的模型完整放进本地硬件。\n为了迎合这个庞大的桌面开发市场，\n英伟达顺理成章地把容量拉到了满血的 128 GB。\n同一块硅片，兼顾两套完全不同的商业叙事。\n对于坐在桌子前的开发者来说，128 GB 是实打实的资产；\n但只要把同一颗芯片塞进需要实时平衡的人形机器人肚子里，\n这就变成了一场荒谬的硬件错配。\n昂贵的大内存真金白银地买了单，\n狭窄的带宽却在物理上判了它死刑，\n让其中 90% 以上的显存空间在实时控制中彻底沦为空转。\n\n有人也许会设想：把多出来的显存用来跑双脑架构行不行？\n让 10 GB 的小模型负责手脚平衡，\n剩下的一百多 GB 显存装进一个庞大的视觉模型，\n让它以每秒一次的慢速度负责看路和规划？\n这个架构在理论上很自洽，\n但一旦落实到物理硅片上，立刻会撞上带宽争抢。\n芯片的总带宽就只有每秒 273 GB。\n那个庞大的慢思考模型一旦开始读取数据，\n就会瞬间把数据通道挤爆。\n负责毫秒级平衡的快思考模型就会遭遇严重的延迟抖动。\n在物理机械的控制闭环里，\n哪怕出现十几毫秒的信号延迟，\n传导到几十个伺服电机上，就是足以导致摔倒的剧烈机械震颤。\n\n在物理世界里运行具身智能，\n模型规模从来不是想做多大就能做多大。\n决定机器人行动上限的，\n从来不是规格表上印着的显存容量有多惊人。\n真正卡死动作边界的，\n是控制频率与物理带宽之间那道冷酷的除法。\n把云端机房堆参数的惯性照搬到钢铁骨架身上，\n换不来更灵巧的肢体反应，\n只会让昂贵的高速内存，\n变成一堆在现实世界里永远无法被调用的沉默晶体管。","topic":"卡马克拆解英伟达机器人芯片：为什么128GB显存有118GB用不上？","frame_type":["实时控制带宽墙与多用途芯片复用错配","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-09-11 09:55:51","legal_anchor_count":0,"transcript_citation_count":0}