{"id":"mb-20260830-c3897d","kind":"deep","title":"一台只有 32GB 内存的家用电脑，把 122B 甚至万亿参数的大模型跑了起来","summary":"一台只有 32GB 内存的家用电脑，把 122B 甚至万亿参数的大模型跑了起来","body":"一台只有 32GB 内存的家用电脑，把 122B 甚至万亿参数的大模型跑了起来。\n按照过去的规矩，这根本不可能。\n一个 122B 的模型，哪怕经过量化压缩，权重体积也远超 60GB。\n万亿参数的巨无霸，动辄需要几百 GB 的存储空间。\n32GB 内存放不下，系统会直接报错崩溃。\n就算强行开虚拟内存，速度也会跌到每秒零点几个词，整台电脑卡死在漫长的等待里。\n为什么过去跑大模型，必须把所有参数死死塞进内存？\n因为早期的稠密模型，每生成一个词，全身上下几百亿个参数都必须参与一遍运算。\n但现在的混合专家模型，彻底改变了底层的运算结构。\n2017 年计算机学者 Noam Shazeer 等人提出稀疏门控机制时，就立下了一个物理事实：\n模型虽然挂着上百个专家网络，但面对任何一个具体的词，真正被激活干活的，只有其中的两到四个。\n超过 90% 的参数，在这一瞬间其实都在沉睡。\n既然绝大部分参数在这一秒根本用不上，为什么非要把它们全部常驻在昂贵的内存里？\n瓶颈从来不在算力。瓶颈在存储层级之间的数据调度。\n苹果团队在 2023 年的那篇论文《LLM in a flash》里，就指明过这个方向：把闪存当仓库，把内存当流水线。\n最近在开发者社区跑通的 MoE-Direct，把这台机器彻底落到了消费级硬件上。\n它做的事情极度精巧，核心只有三步。\n第一步，把模型的张量数据重新打包，严格按照 4 KiB 的物理扇区对齐。\n第二步，彻底绕过操作系统的虚拟内存和页缓存，直接用底层输入输出通道与 PCIe 5.0 固态硬盘对话。\n过去虚拟内存卡死，是因为操作系统内核在盲目猜你需要什么数据，频繁触发缺页中断和锁竞争。\n绕过操作系统之后，推理引擎自己接管了一切。\n第三步，搭建固态硬盘、内存与显卡显存的三级流水线。\n当上一层网络正在显卡里运算时，路由器已经算出了下一层需要哪几个专家。\n固态硬盘以每秒数吉字节的高速，提前把这几个激活专家的权重拉进内存缓存池。\n算完即走，按需更替。\n实测下来，在一台配着 32GB 内存和单张 RTX 5080 的普通电脑上，Qwen3.5-122B 跑出了每秒 5.6 个词的速度，比传统内存映射快了 2.3 倍。\n甚至连万亿参数级的 Kimi K2.6，都能以每秒 1 个词的速度稳定输出。\n这不再是理论上的可行性探讨。这是消费级硬件对算力垄断的一次实质性突围。\n过去大家以为，本地运行顶级模型唯一的出路，就是花几万美金去买海量显存和专业工作站。\n真正的技术分野，从来不在于无休止地堆砌物理硬件。\n当摸清了算法底层的稀疏规律，把沉睡的固态硬盘吞吐通道变成算力的延伸，那堵看似不可逾越的内存高墙，自然就不复存在了。","topic":"一台只有 32GB 内存的家用电脑，把 122B 甚至万亿参数的大模型跑了起来","frame_type":["分级流水线存储与稀疏专家直通加载（Tiered","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-08-30 21:58:24","legal_anchor_count":0,"transcript_citation_count":0}