DEEPgeneratedpublished

单颗芯片一秒钟生成一万四千个 token,功耗只有两百瓦

权重物理硬化与内存墙穿透机制

单颗芯片一秒钟生成一万四千个 token,功耗只有两百瓦。 这个速度,是 ChatGPT 运行速度的一百倍。 但人类的眼睛,一秒钟最多只能看进去十个词。 给人类用的对话框,为什么要飙到这种音速? 难道是造芯片的人疯了,要把算力浪费在没人看得见的狂奔上? 把这笔物理账拆到底,会看到一台正在把整个算力世界颠覆的机器。 权重硬化与内存墙穿透。 过去三十年,整个半导体行业一直被一道无形的物理铁律卡着喉咙。 1995 年,计算机学者沃尔夫与麦基在论文里给它起了一个名字:内存墙。 芯片算得再快,只要数据不能及时喂进计算核心,算力就只能在原地空转。 在传统 GPU 上跑大模型推理,算力其实是在被严重浪费的。 大模型每吐出一个词,GPU 就必须把几十亿个参数从外部的高带宽内存 HBM 里完整搬运一遍。 结果是,显卡九成以上的电力和时间,根本没在做数学运算。 它一直在等内存把数据从总线上搬运过来。 整个行业为这笔搬运税,付出了几千亿美元的电费和显卡采购成本。 芯片架构老兵 Ljubisa Bajic 创立的 Taalas,选了一条近乎暴力的捷径。 既然在总线上搬运太慢,那就彻底不要搬运。 在芯片制造的最后工序里,工程师把 Llama 3.1 8B 模型的几十亿个权重参数,直接做成了顶层金属互连线的物理结构。 参数被永久蚀刻在了硅片的物理晶体管上。 芯片本身就是模型。 没有动态加载,没有高带宽内存调度,数据搬运的物理延迟直接清零。 这颗叫 HC1 的芯片,一秒钟直接轰出了一万四千到一万七千个 token。 代价是绝对的刚性。 每一颗芯片生来就只能跑这一个模型,参数哪怕只修改一个权重,整批芯片就得重新蚀刻金属层。 这种完全锁死通用性的架构,看起来像是在倒退。 但前 Stability AI 创始人 Emad Mostaque 在 Peter McCormack 的播客里点出了真正的盲区。 一秒一万四千个词,不是为了让人类用肉眼去阅读。 它是为了让 AI 智能体之间以机器速度直接对话。 当未来的智能系统需要在一秒钟内完成几千步思维树推演、自我博弈和多智能体协同,人类的阅读速度就成了无关紧要的参数。 只有彻底砸碎内存搬运枷锁的硬化芯片,才能支撑起这种毫秒级的机器世界。 真正的技术跨越,从来不在旧跑道上把通用显卡堆得越来越庞大。 在于谁看透了物理瓶颈的极限,然后亲手把多余的灵活性砍掉,换取通往下一个时代的极端速度。

引用 / CITATIONS

No citations exported.

导出 / EXPORT

订阅 · SUBSCRIBE

新的深度解读发布时,会在每周简报里送到你邮箱。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情