{"id":"mb-20260830-46fb44","kind":"deep","title":"苹果发布了搭载 M6 芯片的新款 Mac mini，以及最高支持 512GB 统一内存的 M5 Ultra Mac St","summary":"苹果发布了搭载 M6 芯片的新款 Mac mini，以及最高支持 512GB 统一内存的 M5 Ultra Mac St","body":"苹果发布了搭载 M6 芯片的新款 Mac mini，以及最高支持 512GB 统一内存的 M5 Ultra Mac Studio。\n\n科技圈被官方公布的一组数据刷屏。\n\n在本地运行大语言模型时，M6 的提示词处理速度比 M1 快了 13.5 倍，比上一代 M4 也快了 4.8 倍。\n\n很多人第一反应是苹果又在常规地堆叠 CPU 和 GPU 核心。\n\n但看一眼芯片参数，核心数量并没有发生翻倍式的暴涨。\n\n一台体积只有巴掌大的桌面主机，为什么能在本地跑大模型这件事上跑出几倍的跳跃？\n\n要理解这个跃迁，得先看清大模型在硬件底层被收取的两张残酷账单。\n\n本地跑大模型的过程，物理上被切成了截然不同的两个阶段。\n\n第一张账单，叫首字预填。\n\n当你把一份上万字的长文档、或者一个庞大的代码库丢给大模型，在它吐出第一个字之前，必须先把这些上下文全部消化一遍。\n\n这个过程需要海量的密集矩阵乘法运算。\n\n它完全受限于芯片的纯算力。\n\n过去 Mac 在本地 AI 领域最常被诟病的，就是这个首字延迟。\n\n因为缺乏专门针对大模型矩阵运算的硬件单元，以前的芯片在处理长提示词时往往要卡顿很久。\n\n这一次苹果在台积电 2nm 工艺的 M6 上做了一次关键手术。\n\n它把神经网络引擎升级到了双 16 核，同时在 GPU 核心内部直接塞进了专用的神经加速器。\n\n首字预填的纯算力瓶颈，被这套定制硬件直接抹平。\n\n但更难啃的，是第二张账单。\n\n它叫逐字生成。\n\n当大模型吐出第一个字之后，底层的游戏规则瞬间变了。\n\n每在屏幕上生成一个词，硬件就必须把整个模型的几十亿甚至几百亿个参数，从内存里完整读取一遍。\n\n生成一百个词，就得把整个模型完整搬运一百次。\n\n这时候算力再强也没用。\n\n芯片算得再快，大部分时间都在空转，苦苦等待数据从内存管道里运过来。\n\n这就是 1995 年计算机科学家 William Wulf 和 Sally McKee 在论文里命名的内存墙。\n\n在传统 PC 架构里，这道墙几乎是一道无解的死局。\n\n想要速度快，就得用独立显卡的显存。\n\n但消费级显卡被厂商牢牢锁死在 24GB 显存的天花板上。\n\n只要模型体量稍微大一点，显存立刻爆掉。\n\n想跑更大的模型，要么去买几万美元一张的企业级计算卡，要么把模型塞进电脑的普通内存里。\n\n而普通内存走主板总线传输，带宽通常只有每秒几十 GB，跑起来慢如蜗牛。\n\n苹果的解法，是从第一天就押注的统一内存架构。\n\nCPU、GPU 和神经网络引擎坐在同一块基板上，共用同一个高带宽内存池，省掉了所有跨硬件的搬运开销。\n\nM6 把基础内存带宽拉到了每秒 170GB。\n\n顶配的 M5 Ultra 更是直接把显存级的统一内存堆到了 512GB。\n\n过去需要一整个机架、耗资数万美元才能勉强装下的千亿参数大模型，现在被塞进了一台放在桌上的个人电脑里。\n\n很多人以为个人电脑跑 AI 是一场单看算力数字的军备竞赛。\n\n底层的硬件逻辑却给出了完全不同的答案。\n\n本地 AI 真正的门槛，从来不单是芯片的峰值算力有多高。\n\n在于谁能用最优雅的架构，同时拆掉首字计算的算力墙，与逐字生成的内存墙。\n\n当个人桌面以极低的功耗和体积跨过这两道坎时，算力的重心已经悄悄开始从云端数据中心，向每一个开发者的桌面倾斜。","topic":"苹果发布了搭载 M6 芯片的新款 Mac mini，以及最高支持 512GB 统一内存的 M5 Ultra Mac St","frame_type":["大模型双相推理瓶颈（首字预填算力墙与逐字生成内存","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-08-30 21:54:10","legal_anchor_count":0,"transcript_citation_count":0}