DEEPgeneratedpublished

一位硬件工程师做了一套反常识的 AI 识别系统

冯·诺依曼指令周期 vs 空间计算硬件数据流机制

一位硬件工程师做了一套反常识的 AI 识别系统。 整个系统里没有 CPU,没有操作系统,没有一行在运行中执行的代码。 从摄像头抓取图像,到完成分类识别,全程只用了 0.51 毫秒。 没有软件,AI 到底在靠什么做计算? 为什么把所有指令全部拔掉,计算反而变得奇快无比? 这背后触碰到的是计算机体系结构里统治了八十年的那台老机器。 冯·诺依曼架构的指令周期。 1945 年,约翰·冯·诺依曼确立了现代计算机的基本范式:计算和存储分开。 计算机要执行任务,必须重复一套固定的循环:去内存取指令,把指令翻译成动作,读取数据,送进运算器执行。 这套设计统治了世界八十年。 它也给每一次计算,都收了一笔昂贵的过路费。 今天我们跑大模型,哪怕用上了最顶级的算力卡,底下依然压着厚厚的一沓软件栈。 操作系统在管理进程,框架在调度显存,驱动层在分发线程,硬件则在一遍又一遍地重复取指令和译码。 算力芯片很大一部分功耗和时间,没有花在数学运算本身上,花在了这套庞大的指挥系统上。 工程师 Zakriya Paracha 在一块 Xilinx Artix-7 芯片上,把这套指挥系统连根拔起。 这套架构叫纯硬件数据流,也叫空间计算。 他在 PyTorch 里训练好识别模型,把参数全部量化成 8 位整数 INT8。 权重体积从 98KB 压缩到 25KB,准确率只损失了 0.18%,稳定在 94.57%。 关键的一步在这里。 他没有把这些权重交给任何处理器去读取,用 Verilog 硬件描述语言,直接在芯片内部合成了物理电路。 25KB 的参数被直接烧进片上的块状内存 Block RAM。 摄像头由硬件状态机在上电时直接配置,没有微控制器,没有驱动程序。 像素数据一进来,立刻顺着一条 7 级的物理硬件流水线向前流动。 乘法器和加法器在硅片上按阵列排开,数据流到哪里,哪里的晶体管就直接翻转。 整个推演过程一共花了 50,984 个时钟周期。 算完的那一瞬间,信号直接点亮了外接的七段数码管。 没有操作系统抢占时间,没有显存搬运阻塞,没有不可预测的延迟抖动。 传统计算里,芯片是舞台,软件是剧本,处理器是按剧本一句句念台词的演员。 当舞台、剧本、演员分离开的时候,每一句台词都要经过漫长的传达。 纯硬件逻辑把剧本直接刻进了舞台的物理骨架里。 电流接通的那一刻,物理连线本身就是算式。 这不是芯片在计算神经网络。 芯片本身,就是那个神经网络。 当全行业的 AI 模型越来越大、软件栈越来越重、数据中心被功耗和延迟逼入墙角的时候,最快的一条路往往不在更复杂的编译器里。 把八十年来层层堆叠的指令脱掉,让电流在硅片上自然流淌,才是计算最本真的速度。

引用 / CITATIONS

No citations exported.

导出 / EXPORT

订阅 · SUBSCRIBE

新的深度解读发布时,会在每周简报里送到你邮箱。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情