越来越多人开始在桌面上摆一台巴掌大的 Mac mini
越来越多人开始在桌面上摆一台巴掌大的 Mac mini。 不为了剪视频,也不为了日常办公。 他们把这台几百美元、功耗只有几十瓦的小铁盒,当成了 24 小时常开的本地 AI 节点。 上面跑着 27B、32B 参数的开源大模型,甚至自主接管桌面的智能体。 很多人觉得不可思议。 在过去的认知里,跑大模型必须靠插满厚重显卡、风扇狂转、动辄耗电上千瓦的巨型工作站。 为什么一台消费级小主机,突然成了本地 AI 的首选? 是苹果偷偷塞进了什么毁天灭地的算力? 还是整个算力硬件的评价标准,一开始就看错了方向? 把大语言模型的运行逻辑拆到底层,会看到一条支配了计算机工业三十年的物理铁律。 内存墙。 1995 年,两位计算机学者 Wulf 与 McKee 在论文里写下一个预言。 处理器的运算速度每隔一段时间就会暴涨,但从内存搬运数据的通道,速度提升远远跟不上算力的膨胀。 最后芯片大部分时间不是在计算,是在原地干等数据送过来。 大语言模型把这堵墙撞得彻底显形。 大模型每生成一个词,都必须把几十 GB 的参数权重在内存里完整扫描一遍。 决定本地大模型能不能跑、能跑多快的,从来不是芯片堆了多少万亿次浮点算力。 第一是显存能不能完整装下模型,第二是数据从内存喂进计算单元的速度有多快。 这是一场纯粹受制于内存带宽的物理游戏。 看一看传统个人电脑是怎么搭建的。 CPU 插在主板上,旁边插着系统内存。 独立显卡插在扩展槽里,自带一块独立显存。 两块存储之间,隔着一条狭窄的 PCIe 通道。 消费级显卡把显存卡死在 16GB 到 24GB。 一张 24GB 显存的显卡,售价轻松超过 1600 美元。 想在本地跑一个 32B 或 70B 的高质量模型,显存瞬间被撑爆。 一旦把溢出的参数借调到系统内存,数据就必须在 PCIe 通道上来回疯狂倒腾。 每秒几十 GB 的通道带宽瞬间堵塞,生成速度直接暴跌到每秒挤出两三个字。 如果想在传统体系里彻底解决显存容量,只能加钱去买数千甚至数万美元的企业级专业卡。 苹果走了一条完全不同的架构路线。 统一内存架构。 它把高带宽内存颗粒直接封装在芯片基板上,CPU、GPU 和神经网络引擎共享同一池内存。 这里没有物理隔离的显存和内存。 也没有跨总线倒运数据的过路费。 只要给这台小电脑选配 32GB 或 64GB 内存,系统就能把绝大部分内存直接划拨给图形核心当显存使用。 这就是零拷贝。 一台不到一千美元、待机功耗只有十几瓦的小盒子,在可寻址显存容量上,直接跨过了万元级独立显卡的物理门槛。 它没有咆哮的风扇,不需要昂贵的水冷,安静吞下了过去只有服务器机架才能消化的模型权重。 很多人还在盯着芯片有多少核心、跑分榜排第几。 硬件世界真正的代际跨越,往往不发生在算力堆砌最凶猛的正面战场。 而在谁先绕开了那条收了三十年过路费的老瓶颈。 当别人还在为搬运数据交税的时候,有人已经在零阻力的通道里跑完全程。
引用 / CITATIONS
No citations exported.
导出 / EXPORT
订阅 · SUBSCRIBE
新的深度解读发布时,会在每周简报里送到你邮箱。