本地运行的 AI 模型,已经能把 89% 的日常问答和逻辑推理,解决得和云端顶级旗舰模型一样好
本地运行的 AI 模型,已经能把 89% 的日常问答和逻辑推理,解决得和云端顶级旗舰模型一样好。 这不是小范围测试的体感。 斯坦福大学与 Together AI 追踪测试了 20 多个本地模型,跑了超过 100 万条真实用户提问。 2023 年,本地模型的匹配率还只有 23.2%。 2025 年,飙升到 71.3%。 到了 2026 年,这个数字直接跨过了 89%。 很多人以为,这只是小模型在死记硬背参数。 决定胜负的其实不是参数规模。 真正推动这场迁移的,是一台在半导体历史上运转了六十年的老机器。 这台机器叫库梅定律(Koomey's Law)。 物理学家乔纳森·库梅(Jonathan Koomey)总结过半导体历史上的一条硬规律:每消耗一焦耳能量所能完成的计算量,每 1.57 年就会翻一倍。 六十年前,正是这条能效曲线,把占满一整间机房的 IBM 大型机,一步步压缩成了桌上的个人电脑,最后塞进了每个人的口袋。 如今,同样的物理轨迹落到了 AI 头上。 风险投资人 Tomasz Tunguz 梳理过一组数据:过去两年,本地 AI 模型的每瓦智能暴增了 5.3 倍。 其中算法和架构优化贡献了 3.1 倍。 芯片硬件能效提升贡献了 1.7 倍。 当每瓦电量能榨出的智能以这种斜率狂飙,算力就不再必须依附于集中式的数据中心。 过去三年,科技巨头向公众灌输的叙事是一场无限膨胀的云端军备竞赛。 上千亿美元砸进算力中心,电力消耗直逼核电站。 所有人似乎都只能通过网络,向少数几个中心服务器租用智慧。 但计算技术的发展史,从来不倾向于把所有人永远锁在中心机房。 耗费数万张芯片的基座训练,以及极限前沿的科研探索,确实属于云端剩下的 11%。 可普通人 89% 的日常需求,根本不需要把数据送到半个地球之外去排队。 本地芯片免去了跨网络搬运数据的延迟和带宽税。 个人数据完整留在本地设备,隐私不用交出。 更关键的是,边际电费和推理成本被直接打到了接近于零。 云端巨头靠垄断算力向全社会收租的护城河,正在被终端芯片的能效曲线一点点抽空。 技术史上最剧烈的权力转移,从来不在谁拥有最大的中央机房。 在能效曲线什么时候把昂贵的特权,压缩成手边触手可及的日常工具。 当曾经属于超级计算机的智能被无声塞进个人终端,中心化的算力霸权,往往就是这样从底层被彻底解构的。
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封信号简报,重大进展可选即时推送。