一颗只要 10 美元的单片机芯片,完全脱离互联网,在本地跑起了一个 1.35 亿参数的大语言模型
一颗只要 10 美元的单片机芯片,完全脱离互联网,在本地跑起了一个 1.35 亿参数的大语言模型。 没有连云端,没有偷偷调用接口。 但它回答一个简单的问题,需要整整 45 分钟。 很多人把它当成极客圈的搞笑整活。 觉得这颗只有 240MHz 主频的便宜芯片太弱,跑大模型纯属自讨苦吃。 表面看确实如此。 但如果顺着这 45 分钟的耗时去查账,会发现一个让整个 AI 行业都尴尬的真相。 这颗芯片没有在拼命计算。 在漫长的 45 分钟里,它的双核处理器有超过九成的时间在完全空转,饥饿地等待数据喂进来。 为什么算力明明闲着,文字却吐不出来? 是这颗芯片算力太低,还是我们一直把大模型推理真正的成本算错了地方? 把这块开发板放到显微镜下,会看到一台支配着今天所有 AI 硬件的物理机器。 计算访存比瓶颈。 实验的开发者 Dsn Industries 用的是一块常见的 ESP32-S3 开发板。 板载只有 8MB 的外部扩展内存 PSRAM。 而他选用的模型 SmolLM-135M,即便做了 4 比特 INT4 量化,体积依然有 74MB。 74MB 的模型塞不进 8MB 的内存。 工程上的解法很直接:把模型文件放进一张外接 MicroSD 存储卡里。 芯片每推理一个字,就通过串行外设接口 SPI,从存储卡里把模型的一层权重读进内存。 算完这一层,立刻把内存清空,再去读下一层。 整整 30 层网络,像流水线一样一层层从存储卡里往芯片里搬。 问题恰恰出在这条流水线上。 大模型的自回归生成,遵循一条残酷的物理铁律。 只要输出批次是 1,模型每生成一个新词,整个 74MB 的权重就必须在芯片总线里完整刷一遍。 ESP32 的 SPI 接口读存储卡,极限速度只有每秒 2MB 左右。 把 74MB 的数据搬一遍,光是路上花的时间就固定在 37 秒。 这意味着,芯片生成一个字,光是把数据从卡里搬到内存,就需要近 40 秒。 吐出一句 60 个字的完整回答,什么都不算,光搬运数据就要花掉 40 分钟。 2009 年加州大学伯克利分校的计算机学者 Samuel Williams 提出了著名的屋顶模型 Roofline Model。 他用一套数学公式定义了芯片的算力天花板。 处理器的极限主频并不能决定系统性能,起决定作用的是计算访存比。 如果每个字节的数据搬进芯片后,只参与一次简单的浮点乘法,算力核心就会被活活饿死在等待访存的路上。 这颗 10 美元的芯片,实际上扒掉了现代 AI 硬件最贵的那层外衣。 它证明了一件反直觉的事。 大模型推理从来不缺算力。 哪怕是一颗只有 240MHz、售价只有两杯咖啡钱的廉价微控制器,算力也足以完成 Transformer 的所有注意力矩阵计算。 真正卡死一切的,是把海量参数搬进算力单元的那条物理通道。 在数据中心里,英伟达售价数万美元的 H100 芯片,靠着每秒 3.35TB 带宽的高带宽显存 HBM 疯狂对抗这道高墙。 在桌面角落里,这颗 10 美元的单片机,因为每秒 2MB 的存储卡通道被按在地上摩擦。 两者的差价有几千倍。 但它们撞上的,是同一堵叫做内存墙的物理铁壁。 这也是为什么同一个开发团队,把更小的 28M 参数模型直接放进片内内存运行时,生成速度直接飙升到了每秒 9 个字。 速度能暴涨数百倍,核心就在于直接省去了那笔昂贵的跨总线搬运税。 端侧智能与边缘计算的未来,从来不靠给单片机堆叠更高的主频。 破局的关键,在于谁能通过极低比特架构、模型压缩或者存内计算,把数据搬运的物理损耗彻底抹平。 当算力已经廉价到十美元就能随手买到,限制人工智能走进每一个电饭煲和传感器的,到底是一颗芯片的智慧,还是人类至今没修好的那条微观数据公路?
引用 / CITATIONS
No citations exported.
导出 / EXPORT
订阅 · SUBSCRIBE
新的深度解读发布时,会在每周简报里送到你邮箱。