一台只有 32GB 内存的家用电脑,把 122B 甚至万亿参数的大模型跑了起来
一台只有 32GB 内存的家用电脑,把 122B 甚至万亿参数的大模型跑了起来。 按照过去的规矩,这根本不可能。 一个 122B 的模型,哪怕经过量化压缩,权重体积也远超 60GB。 万亿参数的巨无霸,动辄需要几百 GB 的存储空间。 32GB 内存放不下,系统会直接报错崩溃。 就算强行开虚拟内存,速度也会跌到每秒零点几个词,整台电脑卡死在漫长的等待里。 为什么过去跑大模型,必须把所有参数死死塞进内存? 因为早期的稠密模型,每生成一个词,全身上下几百亿个参数都必须参与一遍运算。 但现在的混合专家模型,彻底改变了底层的运算结构。 2017 年计算机学者 Noam Shazeer 等人提出稀疏门控机制时,就立下了一个物理事实: 模型虽然挂着上百个专家网络,但面对任何一个具体的词,真正被激活干活的,只有其中的两到四个。 超过 90% 的参数,在这一瞬间其实都在沉睡。 既然绝大部分参数在这一秒根本用不上,为什么非要把它们全部常驻在昂贵的内存里? 瓶颈从来不在算力。瓶颈在存储层级之间的数据调度。 苹果团队在 2023 年的那篇论文《LLM in a flash》里,就指明过这个方向:把闪存当仓库,把内存当流水线。 最近在开发者社区跑通的 MoE-Direct,把这台机器彻底落到了消费级硬件上。 它做的事情极度精巧,核心只有三步。 第一步,把模型的张量数据重新打包,严格按照 4 KiB 的物理扇区对齐。 第二步,彻底绕过操作系统的虚拟内存和页缓存,直接用底层输入输出通道与 PCIe 5.0 固态硬盘对话。 过去虚拟内存卡死,是因为操作系统内核在盲目猜你需要什么数据,频繁触发缺页中断和锁竞争。 绕过操作系统之后,推理引擎自己接管了一切。 第三步,搭建固态硬盘、内存与显卡显存的三级流水线。 当上一层网络正在显卡里运算时,路由器已经算出了下一层需要哪几个专家。 固态硬盘以每秒数吉字节的高速,提前把这几个激活专家的权重拉进内存缓存池。 算完即走,按需更替。 实测下来,在一台配着 32GB 内存和单张 RTX 5080 的普通电脑上,Qwen3.5-122B 跑出了每秒 5.6 个词的速度,比传统内存映射快了 2.3 倍。 甚至连万亿参数级的 Kimi K2.6,都能以每秒 1 个词的速度稳定输出。 这不再是理论上的可行性探讨。这是消费级硬件对算力垄断的一次实质性突围。 过去大家以为,本地运行顶级模型唯一的出路,就是花几万美金去买海量显存和专业工作站。 真正的技术分野,从来不在于无休止地堆砌物理硬件。 当摸清了算法底层的稀疏规律,把沉睡的固态硬盘吞吐通道变成算力的延伸,那堵看似不可逾越的内存高墙,自然就不复存在了。
引用 / CITATIONS
No citations exported.
导出 / EXPORT
订阅 · SUBSCRIBE
新的深度解读发布时,会在每周简报里送到你邮箱。