科技·via

在一颗售价不足一美元、内存只有 520 KB 的单片机芯片上,跑通了生成逼真人脸的 Transformer 图像模型

在一颗售价不足一美元、内存只有 520 KB 的单片机芯片上,跑通了生成逼真人脸的 Transformer 图像模型。 跑图、扩散算法、生成式 AI,过去被默认必须依赖上百瓦功耗和几十 GB 显存的顶级显卡。 开发者 cpldcpu 发布的开源项目,把一套完整的潜在流变换器塞进了一块树莓派 RP2350 微控制器里。 这颗芯片的片上静态内存(SRAM)只有 520 KB。 就算把整个模型压榨到 240 万参数并做 8 位整数(int8)量化,权重依然占满 2.4 MB。 内存比模型体积小了近五倍,芯片在物理上根本装不下这个模型。 算力只有 150 MHz 的微控制器,凭什么在 20 秒内凭空画出一张 128x128 像素的人脸? 拆开这个系统,会看到一台极度精巧的软硬件协同机器。 这台机器的名字,叫流式权重重叠与激活稀疏化。 它的第一重齿轮,是打破微型尺度上的内存墙。 传统的深度学习推理,必须把模型权重完整载入内存等待调用。 在这颗微控制器上,开发者设计了一套双缓冲流式管道。 利用芯片内置的直接内存访问(DMA)通道,在 CPU 计算当前网络层的前向传播时,DMA 在后台悄悄从外部闪存中拉取下一层的权重数据。 数据搬运与数学计算在时间线上严密重叠。 内存永远只保留当前极小片段的计算上下文,芯片不再需要装下整个模型,只需要成为一条吞吐权重的流水线。 它的第二重齿轮,是用数学结构给极其孱弱的算力减负。 微控制器没有专门的张量加速核心,每一次矩阵乘法都要靠通用寄存器逐点计算。 模型在架构中引入了平方整流函数(ReLU²)作为激活函数。 这个激活函数在数学上具有极强的稀疏诱导特性,能把特征图中绝大多数微小激活值直接压成精确的零。 推理引擎在执行点积时,只要检测到输入为零,就直接跳过整组乘加指令。 庞大的计算量在进入底层汇编前,被数学结构提前过滤掉了大半。 它的第三重齿轮,是流匹配(Flow Matching)对扩散轨迹的几何压缩。 传统的扩散去噪路径是高度弯曲的随机曲线,需要几十甚至上百步采样迭代。 基于整流流和零初始化自适应归一化(AdaLN-Zero)的架构,把高维潜在空间中的去噪路径拉成了一条接近笔直的向量场。 采样步数被压缩到极限,配合无分类器引导(CFG),在极小的潜在空间维度下牢牢锁住了面部特征的保真度。 算力狂欢的时代,很多人习惯用百倍的显存和电费去掩盖工程上的粗糙。 当算力和内存被物理边界压制到极限,真正的工程智慧才会显现出来。 顶级的技术突破,往往不在于堆砌了多少亿个参数。 在于如何用最克制的数学设计和最极限的硬件调度,把原本属于超级计算机的算法,精准雕刻进一颗几块钱的沙子芯片里。

相关 / RELATED

JSON

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封信号简报,重大进展可选即时推送。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情