苹果发布了搭载 M6 芯片的新款 Mac mini,以及最高支持 512GB 统一内存的 M5 Ultra Mac St
苹果发布了搭载 M6 芯片的新款 Mac mini,以及最高支持 512GB 统一内存的 M5 Ultra Mac Studio。
科技圈被官方公布的一组数据刷屏。
在本地运行大语言模型时,M6 的提示词处理速度比 M1 快了 13.5 倍,比上一代 M4 也快了 4.8 倍。
很多人第一反应是苹果又在常规地堆叠 CPU 和 GPU 核心。
但看一眼芯片参数,核心数量并没有发生翻倍式的暴涨。
一台体积只有巴掌大的桌面主机,为什么能在本地跑大模型这件事上跑出几倍的跳跃?
要理解这个跃迁,得先看清大模型在硬件底层被收取的两张残酷账单。
本地跑大模型的过程,物理上被切成了截然不同的两个阶段。
第一张账单,叫首字预填。
当你把一份上万字的长文档、或者一个庞大的代码库丢给大模型,在它吐出第一个字之前,必须先把这些上下文全部消化一遍。
这个过程需要海量的密集矩阵乘法运算。
它完全受限于芯片的纯算力。
过去 Mac 在本地 AI 领域最常被诟病的,就是这个首字延迟。
因为缺乏专门针对大模型矩阵运算的硬件单元,以前的芯片在处理长提示词时往往要卡顿很久。
这一次苹果在台积电 2nm 工艺的 M6 上做了一次关键手术。
它把神经网络引擎升级到了双 16 核,同时在 GPU 核心内部直接塞进了专用的神经加速器。
首字预填的纯算力瓶颈,被这套定制硬件直接抹平。
但更难啃的,是第二张账单。
它叫逐字生成。
当大模型吐出第一个字之后,底层的游戏规则瞬间变了。
每在屏幕上生成一个词,硬件就必须把整个模型的几十亿甚至几百亿个参数,从内存里完整读取一遍。
生成一百个词,就得把整个模型完整搬运一百次。
这时候算力再强也没用。
芯片算得再快,大部分时间都在空转,苦苦等待数据从内存管道里运过来。
这就是 1995 年计算机科学家 William Wulf 和 Sally McKee 在论文里命名的内存墙。
在传统 PC 架构里,这道墙几乎是一道无解的死局。
想要速度快,就得用独立显卡的显存。
但消费级显卡被厂商牢牢锁死在 24GB 显存的天花板上。
只要模型体量稍微大一点,显存立刻爆掉。
想跑更大的模型,要么去买几万美元一张的企业级计算卡,要么把模型塞进电脑的普通内存里。
而普通内存走主板总线传输,带宽通常只有每秒几十 GB,跑起来慢如蜗牛。
苹果的解法,是从第一天就押注的统一内存架构。
CPU、GPU 和神经网络引擎坐在同一块基板上,共用同一个高带宽内存池,省掉了所有跨硬件的搬运开销。
M6 把基础内存带宽拉到了每秒 170GB。
顶配的 M5 Ultra 更是直接把显存级的统一内存堆到了 512GB。
过去需要一整个机架、耗资数万美元才能勉强装下的千亿参数大模型,现在被塞进了一台放在桌上的个人电脑里。
很多人以为个人电脑跑 AI 是一场单看算力数字的军备竞赛。
底层的硬件逻辑却给出了完全不同的答案。
本地 AI 真正的门槛,从来不单是芯片的峰值算力有多高。
在于谁能用最优雅的架构,同时拆掉首字计算的算力墙,与逐字生成的内存墙。
当个人桌面以极低的功耗和体积跨过这两道坎时,算力的重心已经悄悄开始从云端数据中心,向每一个开发者的桌面倾斜。
引用 / CITATIONS
No citations exported.
导出 / EXPORT
订阅 · SUBSCRIBE
新的深度解读发布时,会在每周简报里送到你邮箱。