一台 4700 美元的个人电脑,能在本地跑动参数量上千亿的顶级大模型
一台 4700 美元的个人电脑,能在本地跑动参数量上千亿的顶级大模型。 跑出 47 tok/s 的推理速度,还顶着 400k 的超长上下文。 很多人的第一反应是:这肯定把模型压成了人工智障。 在过去的认知里,把超大模型塞进个人电脑,唯一的方法是死磕量化。 把权重从 16 位浮点数一路压到 4 位、3 位,甚至 2 位。 但单维度的压缩很快就会撞墙。 位宽压得太狠,量化误差指数级爆发,模型直接开始胡言乱语。 另一条路是剪枝。 可传统密集模型的剪枝同样行不通:零散剔除的权重破坏了规整的矩阵结构,显卡根本跑不出硬件加速。 两边都走不通,很多人便认定:顶级算力永远只能锁在云端机房。 为什么 4700 美元的桌面设备能把这堵墙撞碎? 因为真正的突破,从来不在单一维度上硬挤。 它把两台方向完全不同的压缩机器叠在了一起。 这台机器叫正交压缩。 混合专家模型架构给算法提供了一个前所未有的结构切口。 在这种架构里,模型是由数十个甚至上百个细分专家组成的网络。 每生成一个词,真正被激活的只有少数几个专家。 开源开发者 0xSero 借助 REAP 专家激活剪枝算法,先给所有专家跑了一轮校准。 算法找出了那些在绝大多数任务中几乎从不响应的低频专家,整块剥离。 整整 18.5% 的结构冗余被干脆利落地砍掉,而每个词调用的核心专家预算完好无损。 这是第一步:在结构维度上剔除闲置专家。 紧接着,在剩下的骨干专家身上,套上 turboderp 开发的 EXL3 算法,进行 3-bit 精度量化。 这是第二步:在数值维度上压缩权重的位宽。 两个动作是正交的。 剪枝清理的是结构冗余,量化清理的是数值冗余。 因为攻击的是两个互不干扰的独立维度,两者的压缩收益直接相乘,却避开了单一技术推向极限时的崩塌风险。 显存占用被砍掉了一大截,每秒吞吐量却保住了。 算力行业过去几年一直在制造一种云端垄断的恐慌。 数千亿美元砸进集中式算力中心,普通人似乎只能按字数向云端服务器交租。 但计算技术的演进,从来不会单向偏向中心化。 算法在正交维度的每一次解耦,都在以乘数效应拉低硬件的成本底线。 当一台桌面级的消费硬件,就能流畅运转过去需要整个机架才能支撑的智能。 算力的主权,就不再只能被锁在巨头的数据中心里。 决定智能普及速度的,不只是巨头烧了多少资本开支。 更在底层算法如何把昂贵的门槛,一步步砸进每个普通开发者的书桌。
相关 / RELATED
JSON- MLisa Su手里那台巴掌大的小机器,能跑2000亿参数的大模型。 但它最吓人的地方,是悄悄把AI的“产权关系”给改了。…
- M科技本地运行的 AI 模型,已经能把 89% 的日常问答和逻辑推理,解决得和云端顶级旗舰模型一样好
- M你的电脑,以后不只是拿来跑本地模型了。 它会变成一个微型的算力节点。 门槛有多高? 在Buzz里点一下鼠标就行。 打开开…
- M大模型圈的桌子被谷歌直接掀了。 怎么回事? 排在全球AI排行榜第三的模型,你家书桌上的普通电脑就能跑。 这头刚放出的开源…
- M把128GB统一内存塞进轻薄本,英伟达发布 RTX Spark 超级芯片,直接重塑 Windows PC 的天花板。 里…
- M坐 11 个小时的跨洋飞机,你愿意花 25 美元连那个又慢又卡的机上 WiFi 吗? 一位中共国开发者给出了一个非常硬核…
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封信号简报,重大进展可选即时推送。