科技·via

把一个 3130 亿参数的庞然大物,塞进一台只有 8GB 内存的 MacBook 里运转

把一个 3130 亿参数的庞然大物,塞进一台只有 8GB 内存的 MacBook 里运转。 按照过去的算力常识,313B 模型哪怕压缩到极限制式,至少也需要 160GB 显存。 8GB 内存,连这个模型权重文件的零头都装不下。 但这套系统不仅没有爆内存崩溃,运行所需的常驻内存甚至只要 5.14GB。 在配备 64GB 内存的笔记本上,它每秒能稳稳吐出接近 4 个 token。 苹果的统一内存物理定律失效了吗? 它是怎么在一台消费级笔记本上,把过去需要机房集群才能跑的庞然大物转起来的? 答案不在更贵的硬件芯片里。 在一台被重新设计的软件机器里。 权重感知流式分页机制。 开发者马可·班比尼(Marco Bambini)写了一个用纯 C 语言构建、零第三方依赖的开源推理引擎 WARP。 在这之前,他已经用这套引擎在 Mac 上跑通了 2.78 万亿参数的 Kimi K3 模型。 这套引擎真正击穿的,是整个行业对大模型推理的一条思维惯性。 过去大家默认:要在本地跑大模型,必须把所有权重一股脑全部塞进物理内存。 如果内存装不下,交给操作系统的虚拟内存去硬盘交换,系统就会瞬间卡死。 因为操作系统的分页机制是盲目的。 它根本不知道神经网络在下一毫秒要算什么,频繁触发缺页中断,读盘延迟会把生成速度直接砸到每秒 0.01 个字。 但今天的超大模型,底层架构早就变了。 无论是万亿参数的 Kimi K3,还是 3130 亿参数的 GLM-5.3-Flash,它们都是混合专家模型。 混合专家模型有一个决定性的物理特性:激活稀疏性。 虽然模型总参数高达几千亿甚至上万亿,但当它处理某一个特定的词时,真正被激活的专家可能只有百分之几。 绝大多数参数,在当下的那一瞬间根本不需要参与运算。 看到这个特性,WARP 做了三件极其精巧的事。 第一件,主干常驻。 它把注意力层、基础嵌入层这些每次运算都必不可少的共享骨干,常驻在物理内存中。 对 3130 亿参数的 GLM-5.3-Flash 来说,这个核心骨干只有 5.14GB。 一台最普通的 8GB 笔记本,刚好能把它稳稳托住。 第二件,前瞻路由与流式预取。 现代苹果电脑的固态硬盘,顺序读取速度高达每秒数吉字节。 WARP 设计了一套前瞻路由器。 当系统正在计算第 N 层的时候,路由器就已经提前算出了下一层需要哪几个专家。 它抢在计算发生前,把那几个特定的专家张量从固态硬盘里异步流式读出来,用完立刻释放。 硬盘读盘与芯片计算,在时间线上被完全重叠覆盖。 第三件,专家局部性缓存。 如果你的电脑有 64GB 内存,剩余的空闲空间就会被自动用作动态专家缓存。 人类的自然语言具有天然的语义局部性。 上一个词调用了负责代码或逻辑推理的专家,接下来的一串词大概率还会继续复用它。 只要命中了内存缓存,连读盘的步骤都被彻底省去。 整个行业过去两年都在陷入一种硬件堆料的军备竞赛。 大家以为要在本地跑动前沿智能,唯一的出路就是买更贵的工作站、插满大显存计算卡、或者向云端机房交高昂的接口费。 但只要推理软件真正理解了神经网络的稀疏几何结构,显存与硬盘之间那道不可逾越的鸿沟就消失了。 它把一个原本绝望的显存容量死结,转化成了一个优雅的固态硬盘吞吐与路由预测问题。 技术的范式转移,往往不靠更暴力的硬件堆叠。 它发生在有人看穿了新算法的物理本质,然后给操作系统那套几十年前的古老齿轮,重新写了一套匹配现代智能的规则。 当几千亿参数的顶尖模型不再被锁在数据中心的机柜里,能够顺着普通背包里的固态硬盘静静流淌时,算力垄断的围墙其实已经被推开了一条缝隙。

相关 / RELATED

JSON

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封信号简报,重大进展可选即时推送。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情