{"id":"mb-20260831-0fcf57","kind":"deep","title":"单颗芯片一秒钟生成一万四千个 token，功耗只有两百瓦","summary":"单颗芯片一秒钟生成一万四千个 token，功耗只有两百瓦","body":"单颗芯片一秒钟生成一万四千个 token，功耗只有两百瓦。\n这个速度，是 ChatGPT 运行速度的一百倍。\n但人类的眼睛，一秒钟最多只能看进去十个词。\n给人类用的对话框，为什么要飙到这种音速？\n难道是造芯片的人疯了，要把算力浪费在没人看得见的狂奔上？\n把这笔物理账拆到底，会看到一台正在把整个算力世界颠覆的机器。\n权重硬化与内存墙穿透。\n过去三十年，整个半导体行业一直被一道无形的物理铁律卡着喉咙。\n1995 年，计算机学者沃尔夫与麦基在论文里给它起了一个名字：内存墙。\n芯片算得再快，只要数据不能及时喂进计算核心，算力就只能在原地空转。\n在传统 GPU 上跑大模型推理，算力其实是在被严重浪费的。\n大模型每吐出一个词，GPU 就必须把几十亿个参数从外部的高带宽内存 HBM 里完整搬运一遍。\n结果是，显卡九成以上的电力和时间，根本没在做数学运算。\n它一直在等内存把数据从总线上搬运过来。\n整个行业为这笔搬运税，付出了几千亿美元的电费和显卡采购成本。\n芯片架构老兵 Ljubisa Bajic 创立的 Taalas，选了一条近乎暴力的捷径。\n既然在总线上搬运太慢，那就彻底不要搬运。\n在芯片制造的最后工序里，工程师把 Llama 3.1 8B 模型的几十亿个权重参数，直接做成了顶层金属互连线的物理结构。\n参数被永久蚀刻在了硅片的物理晶体管上。\n芯片本身就是模型。\n没有动态加载，没有高带宽内存调度，数据搬运的物理延迟直接清零。\n这颗叫 HC1 的芯片，一秒钟直接轰出了一万四千到一万七千个 token。\n代价是绝对的刚性。\n每一颗芯片生来就只能跑这一个模型，参数哪怕只修改一个权重，整批芯片就得重新蚀刻金属层。\n这种完全锁死通用性的架构，看起来像是在倒退。\n但前 Stability AI 创始人 Emad Mostaque 在 Peter McCormack 的播客里点出了真正的盲区。\n一秒一万四千个词，不是为了让人类用肉眼去阅读。\n它是为了让 AI 智能体之间以机器速度直接对话。\n当未来的智能系统需要在一秒钟内完成几千步思维树推演、自我博弈和多智能体协同，人类的阅读速度就成了无关紧要的参数。\n只有彻底砸碎内存搬运枷锁的硬化芯片，才能支撑起这种毫秒级的机器世界。\n真正的技术跨越，从来不在旧跑道上把通用显卡堆得越来越庞大。\n在于谁看透了物理瓶颈的极限，然后亲手把多余的灵活性砍掉，换取通往下一个时代的极端速度。","topic":"单颗芯片一秒钟生成一万四千个 token，功耗只有两百瓦","frame_type":["权重物理硬化与内存墙穿透","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-08-31 06:21:53","legal_anchor_count":0,"transcript_citation_count":0}