---
id: "mb-20260904-be14fa"
kind: "deep"
title: "一位硬件工程师做了一套反常识的 AI 识别系统"
topic: "一位硬件工程师做了一套反常识的 AI 识别系统"
source_type: "generated"
status: "published"
generated_at: "2026-09-04 20:42:01"
frame_type: ["冯·诺依曼指令周期 vs 空间计算硬件数据流", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# 一位硬件工程师做了一套反常识的 AI 识别系统

一位硬件工程师做了一套反常识的 AI 识别系统。
整个系统里没有 CPU，没有操作系统，没有一行在运行中执行的代码。
从摄像头抓取图像，到完成分类识别，全程只用了 0.51 毫秒。
没有软件，AI 到底在靠什么做计算？
为什么把所有指令全部拔掉，计算反而变得奇快无比？
这背后触碰到的是计算机体系结构里统治了八十年的那台老机器。
冯·诺依曼架构的指令周期。
1945 年，约翰·冯·诺依曼确立了现代计算机的基本范式：计算和存储分开。
计算机要执行任务，必须重复一套固定的循环：去内存取指令，把指令翻译成动作，读取数据，送进运算器执行。
这套设计统治了世界八十年。
它也给每一次计算，都收了一笔昂贵的过路费。
今天我们跑大模型，哪怕用上了最顶级的算力卡，底下依然压着厚厚的一沓软件栈。
操作系统在管理进程，框架在调度显存，驱动层在分发线程，硬件则在一遍又一遍地重复取指令和译码。
算力芯片很大一部分功耗和时间，没有花在数学运算本身上，花在了这套庞大的指挥系统上。
工程师 Zakriya Paracha 在一块 Xilinx Artix-7 芯片上，把这套指挥系统连根拔起。
这套架构叫纯硬件数据流，也叫空间计算。
他在 PyTorch 里训练好识别模型，把参数全部量化成 8 位整数 INT8。
权重体积从 98KB 压缩到 25KB，准确率只损失了 0.18%，稳定在 94.57%。
关键的一步在这里。
他没有把这些权重交给任何处理器去读取，用 Verilog 硬件描述语言，直接在芯片内部合成了物理电路。
25KB 的参数被直接烧进片上的块状内存 Block RAM。
摄像头由硬件状态机在上电时直接配置，没有微控制器，没有驱动程序。
像素数据一进来，立刻顺着一条 7 级的物理硬件流水线向前流动。
乘法器和加法器在硅片上按阵列排开，数据流到哪里，哪里的晶体管就直接翻转。
整个推演过程一共花了 50,984 个时钟周期。
算完的那一瞬间，信号直接点亮了外接的七段数码管。
没有操作系统抢占时间，没有显存搬运阻塞，没有不可预测的延迟抖动。
传统计算里，芯片是舞台，软件是剧本，处理器是按剧本一句句念台词的演员。
当舞台、剧本、演员分离开的时候，每一句台词都要经过漫长的传达。
纯硬件逻辑把剧本直接刻进了舞台的物理骨架里。
电流接通的那一刻，物理连线本身就是算式。
这不是芯片在计算神经网络。
芯片本身，就是那个神经网络。
当全行业的 AI 模型越来越大、软件栈越来越重、数据中心被功耗和延迟逼入墙角的时候，最快的一条路往往不在更复杂的编译器里。
把八十年来层层堆叠的指令脱掉，让电流在硅片上自然流淌，才是计算最本真的速度。

_Rendered by mubei-terminal._
