{"id":"mb-20260905-f25015","kind":"deep","title":"一颗只要 10 美元的单片机芯片，完全脱离互联网，在本地跑起了一个 1.35 亿参数的大语言模型","summary":"一颗只要 10 美元的单片机芯片，完全脱离互联网，在本地跑起了一个 1.35 亿参数的大语言模型","body":"一颗只要 10 美元的单片机芯片，完全脱离互联网，在本地跑起了一个 1.35 亿参数的大语言模型。\n没有连云端，没有偷偷调用接口。\n但它回答一个简单的问题，需要整整 45 分钟。\n很多人把它当成极客圈的搞笑整活。\n觉得这颗只有 240MHz 主频的便宜芯片太弱，跑大模型纯属自讨苦吃。\n表面看确实如此。\n但如果顺着这 45 分钟的耗时去查账，会发现一个让整个 AI 行业都尴尬的真相。\n这颗芯片没有在拼命计算。\n在漫长的 45 分钟里，它的双核处理器有超过九成的时间在完全空转，饥饿地等待数据喂进来。\n为什么算力明明闲着，文字却吐不出来？\n是这颗芯片算力太低，还是我们一直把大模型推理真正的成本算错了地方？\n把这块开发板放到显微镜下，会看到一台支配着今天所有 AI 硬件的物理机器。\n计算访存比瓶颈。\n实验的开发者 Dsn Industries 用的是一块常见的 ESP32-S3 开发板。\n板载只有 8MB 的外部扩展内存 PSRAM。\n而他选用的模型 SmolLM-135M，即便做了 4 比特 INT4 量化，体积依然有 74MB。\n74MB 的模型塞不进 8MB 的内存。\n工程上的解法很直接：把模型文件放进一张外接 MicroSD 存储卡里。\n芯片每推理一个字，就通过串行外设接口 SPI，从存储卡里把模型的一层权重读进内存。\n算完这一层，立刻把内存清空，再去读下一层。\n整整 30 层网络，像流水线一样一层层从存储卡里往芯片里搬。\n问题恰恰出在这条流水线上。\n大模型的自回归生成，遵循一条残酷的物理铁律。\n只要输出批次是 1，模型每生成一个新词，整个 74MB 的权重就必须在芯片总线里完整刷一遍。\nESP32 的 SPI 接口读存储卡，极限速度只有每秒 2MB 左右。\n把 74MB 的数据搬一遍，光是路上花的时间就固定在 37 秒。\n这意味着，芯片生成一个字，光是把数据从卡里搬到内存，就需要近 40 秒。\n吐出一句 60 个字的完整回答，什么都不算，光搬运数据就要花掉 40 分钟。\n2009 年加州大学伯克利分校的计算机学者 Samuel Williams 提出了著名的屋顶模型 Roofline Model。\n他用一套数学公式定义了芯片的算力天花板。\n处理器的极限主频并不能决定系统性能，起决定作用的是计算访存比。\n如果每个字节的数据搬进芯片后，只参与一次简单的浮点乘法，算力核心就会被活活饿死在等待访存的路上。\n这颗 10 美元的芯片，实际上扒掉了现代 AI 硬件最贵的那层外衣。\n它证明了一件反直觉的事。\n大模型推理从来不缺算力。\n哪怕是一颗只有 240MHz、售价只有两杯咖啡钱的廉价微控制器，算力也足以完成 Transformer 的所有注意力矩阵计算。\n真正卡死一切的，是把海量参数搬进算力单元的那条物理通道。\n在数据中心里，英伟达售价数万美元的 H100 芯片，靠着每秒 3.35TB 带宽的高带宽显存 HBM 疯狂对抗这道高墙。\n在桌面角落里，这颗 10 美元的单片机，因为每秒 2MB 的存储卡通道被按在地上摩擦。\n两者的差价有几千倍。\n但它们撞上的，是同一堵叫做内存墙的物理铁壁。\n这也是为什么同一个开发团队，把更小的 28M 参数模型直接放进片内内存运行时，生成速度直接飙升到了每秒 9 个字。\n速度能暴涨数百倍，核心就在于直接省去了那笔昂贵的跨总线搬运税。\n端侧智能与边缘计算的未来，从来不靠给单片机堆叠更高的主频。\n破局的关键，在于谁能通过极低比特架构、模型压缩或者存内计算，把数据搬运的物理损耗彻底抹平。\n当算力已经廉价到十美元就能随手买到，限制人工智能走进每一个电饭煲和传感器的，到底是一颗芯片的智慧，还是人类至今没修好的那条微观数据公路？","topic":"一颗只要 10 美元的单片机芯片，完全脱离互联网，在本地跑起了一个 1.35 亿参数的大语言模型","frame_type":["计算访存比瓶颈与自回归搬运税","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-09-05 07:31:38","legal_anchor_count":0,"transcript_citation_count":0}