{"id":"mb-20260904-be14fa","kind":"deep","title":"一位硬件工程师做了一套反常识的 AI 识别系统","summary":"一位硬件工程师做了一套反常识的 AI 识别系统","body":"一位硬件工程师做了一套反常识的 AI 识别系统。\n整个系统里没有 CPU，没有操作系统，没有一行在运行中执行的代码。\n从摄像头抓取图像，到完成分类识别，全程只用了 0.51 毫秒。\n没有软件，AI 到底在靠什么做计算？\n为什么把所有指令全部拔掉，计算反而变得奇快无比？\n这背后触碰到的是计算机体系结构里统治了八十年的那台老机器。\n冯·诺依曼架构的指令周期。\n1945 年，约翰·冯·诺依曼确立了现代计算机的基本范式：计算和存储分开。\n计算机要执行任务，必须重复一套固定的循环：去内存取指令，把指令翻译成动作，读取数据，送进运算器执行。\n这套设计统治了世界八十年。\n它也给每一次计算，都收了一笔昂贵的过路费。\n今天我们跑大模型，哪怕用上了最顶级的算力卡，底下依然压着厚厚的一沓软件栈。\n操作系统在管理进程，框架在调度显存，驱动层在分发线程，硬件则在一遍又一遍地重复取指令和译码。\n算力芯片很大一部分功耗和时间，没有花在数学运算本身上，花在了这套庞大的指挥系统上。\n工程师 Zakriya Paracha 在一块 Xilinx Artix-7 芯片上，把这套指挥系统连根拔起。\n这套架构叫纯硬件数据流，也叫空间计算。\n他在 PyTorch 里训练好识别模型，把参数全部量化成 8 位整数 INT8。\n权重体积从 98KB 压缩到 25KB，准确率只损失了 0.18%，稳定在 94.57%。\n关键的一步在这里。\n他没有把这些权重交给任何处理器去读取，用 Verilog 硬件描述语言，直接在芯片内部合成了物理电路。\n25KB 的参数被直接烧进片上的块状内存 Block RAM。\n摄像头由硬件状态机在上电时直接配置，没有微控制器，没有驱动程序。\n像素数据一进来，立刻顺着一条 7 级的物理硬件流水线向前流动。\n乘法器和加法器在硅片上按阵列排开，数据流到哪里，哪里的晶体管就直接翻转。\n整个推演过程一共花了 50,984 个时钟周期。\n算完的那一瞬间，信号直接点亮了外接的七段数码管。\n没有操作系统抢占时间，没有显存搬运阻塞，没有不可预测的延迟抖动。\n传统计算里，芯片是舞台，软件是剧本，处理器是按剧本一句句念台词的演员。\n当舞台、剧本、演员分离开的时候，每一句台词都要经过漫长的传达。\n纯硬件逻辑把剧本直接刻进了舞台的物理骨架里。\n电流接通的那一刻，物理连线本身就是算式。\n这不是芯片在计算神经网络。\n芯片本身，就是那个神经网络。\n当全行业的 AI 模型越来越大、软件栈越来越重、数据中心被功耗和延迟逼入墙角的时候，最快的一条路往往不在更复杂的编译器里。\n把八十年来层层堆叠的指令脱掉，让电流在硅片上自然流淌，才是计算最本真的速度。","topic":"一位硬件工程师做了一套反常识的 AI 识别系统","frame_type":["冯·诺依曼指令周期 vs 空间计算硬件数据流","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-09-04 20:42:01","legal_anchor_count":0,"transcript_citation_count":0}