{"source":{"id":"mb-20260828-1e424a","title":"在一颗售价不足一美元、内存只有 520 KB 的单片机芯片上，跑通了生成逼真人脸的 Transformer 图像模型","url":"https://mubeitech.com/p/mb-20260828-1e424a"},"method":"semantic-similarity","count":6,"items":[{"rank":1,"id":"mb-20260823-f590d9","account":"mubei","brand":"","title":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型","summary":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型","body":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型。\n跑出 47 tok/s 的推理速度，还顶着 400k 的超长上下文。\n很多人的第一反应是：这肯定把模型压成了人工智障。\n在过去的认知里，把超大模型塞进个人电脑，唯一的方法是死磕量化。\n把权重从 16 位浮点数一路压到 4 位、3 位，甚至 2 位。\n但单维度的压缩很快就会撞墙。\n位宽压得太狠，量化误差指数级爆发，模型直接开始胡言乱语。\n另一条路是剪枝。\n可传统密集模型的剪枝同样行不通：零散剔除的权重破坏了规整的矩阵结构，显卡根本跑不出硬件加速。\n两边都走不通，很多人便认定：顶级算力永远只能锁在云端机房。\n为什么 4700 美元的桌面设备能把这堵墙撞碎？\n因为真正的突破，从来不在单一维度上硬挤。\n它把两台方向完全不同的压缩机器叠在了一起。\n这台机器叫正交压缩。\n混合专家模型架构给算法提供了一个前所未有的结构切口。\n在这种架构里，模型是由数十个甚至上百个细分专家组成的网络。\n每生成一个词，真正被激活的只有少数几个专家。\n开源开发者 0xSero 借助 REAP 专家激活剪枝算法，先给所有专家跑了一轮校准。\n算法找出了那些在绝大多数任务中几乎从不响应的低频专家，整块剥离。\n整整 18.5% 的结构冗余被干脆利落地砍掉，而每个词调用的核心专家预算完好无损。\n这是第一步：在结构维度上剔除闲置专家。\n紧接着，在剩下的骨干专家身上，套上 turboderp 开发的 EXL3 算法，进行 3-bit 精度量化。\n这是第二步：在数值维度上压缩权重的位宽。\n两个动作是正交的。\n剪枝清理的是结构冗余，量化清理的是数值冗余。\n因为攻击的是两个互不干扰的独立维度，两者的压缩收益直接相乘，却避开了单一技术推向极限时的崩塌风险。\n显存占用被砍掉了一大截，每秒吞吐量却保住了。\n算力行业过去几年一直在制造一种云端垄断的恐慌。\n数千亿美元砸进集中式算力中心，普通人似乎只能按字数向云端服务器交租。\n但计算技术的演进，从来不会单向偏向中心化。\n算法在正交维度的每一次解耦，都在以乘数效应拉低硬件的成本底线。\n当一台桌面级的消费硬件，就能流畅运转过去需要整个机架才能支撑的智能。\n算力的主权，就不再只能被锁在巨头的数据中心里。\n决定智能普及速度的，不只是巨头烧了多少资本开支。\n更在底层算法如何把昂贵的门槛，一步步砸进每个普通开发者的书桌。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:49","created_at":"2026-08-23 00:21:49","url":"https://mubeitech.com/p/mb-20260823-f590d9","markdown_url":"https://mubeitech.com/p/mb-20260823-f590d9/markdown"},{"rank":2,"id":"mb-20260827-d0ae18","account":"mubei","brand":"","title":"把一个 3130 亿参数的庞然大物，塞进一台只有 8GB 内存的 MacBook 里运转","summary":"把一个 3130 亿参数的庞然大物，塞进一台只有 8GB 内存的 MacBook 里运转","body":"把一个 3130 亿参数的庞然大物，塞进一台只有 8GB 内存的 MacBook 里运转。\n按照过去的算力常识，313B 模型哪怕压缩到极限制式，至少也需要 160GB 显存。\n8GB 内存，连这个模型权重文件的零头都装不下。\n但这套系统不仅没有爆内存崩溃，运行所需的常驻内存甚至只要 5.14GB。\n在配备 64GB 内存的笔记本上，它每秒能稳稳吐出接近 4 个 token。\n苹果的统一内存物理定律失效了吗？\n它是怎么在一台消费级笔记本上，把过去需要机房集群才能跑的庞然大物转起来的？\n答案不在更贵的硬件芯片里。\n在一台被重新设计的软件机器里。\n权重感知流式分页机制。\n开发者马可·班比尼（Marco Bambini）写了一个用纯 C 语言构建、零第三方依赖的开源推理引擎 WARP。\n在这之前，他已经用这套引擎在 Mac 上跑通了 2.78 万亿参数的 Kimi K3 模型。\n这套引擎真正击穿的，是整个行业对大模型推理的一条思维惯性。\n过去大家默认：要在本地跑大模型，必须把所有权重一股脑全部塞进物理内存。\n如果内存装不下，交给操作系统的虚拟内存去硬盘交换，系统就会瞬间卡死。\n因为操作系统的分页机制是盲目的。\n它根本不知道神经网络在下一毫秒要算什么，频繁触发缺页中断，读盘延迟会把生成速度直接砸到每秒 0.01 个字。\n但今天的超大模型，底层架构早就变了。\n无论是万亿参数的 Kimi K3，还是 3130 亿参数的 GLM-5.3-Flash，它们都是混合专家模型。\n混合专家模型有一个决定性的物理特性：激活稀疏性。\n虽然模型总参数高达几千亿甚至上万亿，但当它处理某一个特定的词时，真正被激活的专家可能只有百分之几。\n绝大多数参数，在当下的那一瞬间根本不需要参与运算。\n看到这个特性，WARP 做了三件极其精巧的事。\n第一件，主干常驻。\n它把注意力层、基础嵌入层这些每次运算都必不可少的共享骨干，常驻在物理内存中。\n对 3130 亿参数的 GLM-5.3-Flash 来说，这个核心骨干只有 5.14GB。\n一台最普通的 8GB 笔记本，刚好能把它稳稳托住。\n第二件，前瞻路由与流式预取。\n现代苹果电脑的固态硬盘，顺序读取速度高达每秒数吉字节。\nWARP 设计了一套前瞻路由器。\n当系统正在计算第 N 层的时候，路由器就已经提前算出了下一层需要哪几个专家。\n它抢在计算发生前，把那几个特定的专家张量从固态硬盘里异步流式读出来，用完立刻释放。\n硬盘读盘与芯片计算，在时间线上被完全重叠覆盖。\n第三件，专家局部性缓存。\n如果你的电脑有 64GB 内存，剩余的空闲空间就会被自动用作动态专家缓存。\n人类的自然语言具有天然的语义局部性。\n上一个词调用了负责代码或逻辑推理的专家，接下来的一串词大概率还会继续复用它。\n只要命中了内存缓存，连读盘的步骤都被彻底省去。\n整个行业过去两年都在陷入一种硬件堆料的军备竞赛。\n大家以为要在本地跑动前沿智能，唯一的出路就是买更贵的工作站、插满大显存计算卡、或者向云端机房交高昂的接口费。\n但只要推理软件真正理解了神经网络的稀疏几何结构，显存与硬盘之间那道不可逾越的鸿沟就消失了。\n它把一个原本绝望的显存容量死结，转化成了一个优雅的固态硬盘吞吐与路由预测问题。\n技术的范式转移，往往不靠更暴力的硬件堆叠。\n它发生在有人看穿了新算法的物理本质，然后给操作系统那套几十年前的古老齿轮，重新写了一套匹配现代智能的规则。\n当几千亿参数的顶尖模型不再被锁在数据中心的机柜里，能够顺着普通背包里的固态硬盘静静流淌时，算力垄断的围墙其实已经被推开了一条缝隙。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-27 21:12:44","created_at":"2026-08-27 21:12:44","url":"https://mubeitech.com/p/mb-20260827-d0ae18","markdown_url":"https://mubeitech.com/p/mb-20260827-d0ae18/markdown"},{"rank":3,"id":"mb-20260828-5faee8","account":"mubei","brand":"","title":"一个刷爆海外开发者圈子的匿名模型，所有流量全跑在被技术限制的国产芯片上","summary":"一个刷爆海外开发者圈子的匿名模型，所有流量全跑在被技术限制的国产芯片上","body":"一个刷爆海外开发者圈子的匿名模型，所有流量全跑在被技术限制的国产芯片上。\n开测那几天，有人猜它是微软的新架构，有人猜它是硅谷哪家顶尖实验室在放风。\n没人想到这台代号 Ox Alpha 的机器，底层连一张顶规的海外显卡都没用。\n谜底揭开，它是智谱的 GLM-5.3-Flash。\n许多人立刻去算它的商业账：香港上市股价涨了九倍，去年研发砸了 32 亿，亏损 47 亿。\n但金融数字只是表象。\n真正致命的问题只有一个：\n在显存容量和传输带宽双重受限的硬件上，怎么抗住上万亿次的高并发调用？\n很多人以为大模型推理拼的是纯算力。\n算力其实早就不是唯一的瓶颈。\n真正的死穴在显存带宽，计算机科学界早在 1995 年就给它起好了名字：内存墙。\nWulf 和 McKee 在那篇经典论文里指出的困境，在大模型时代被放大了上万倍。\n传统大模型每吐出一个字，就必须把几千亿个参数和之前所有的对话记录，从显存完完整整搬进计算核心一遍。\n计算核心只花了极少时间运算，剩下大半时间全在干等数据从显存搬过来。\n上下文拉得越长，要搬运的键值缓存就越臃肿。\n这笔搬运税，在顶规显卡上可以用极高规格的高带宽内存硬抗。\n可一旦芯片的带宽和互联被卡死，硬扛的代价就是延迟爆炸和成本失控。\n既然硬件层面的路被堵上了，这台机器是怎么绕过去的？\n答案不是去硬拼更快的芯片。\n是把注意力机制的数学逻辑重写了一遍。\n它用了 3200 亿的总参数，但每一次只激活其中的 180 亿。\n更关键的一步在架构层：用线性注意力和稀疏注意力交替堆叠。\n它把原本需要随对话长度无限膨胀的键值缓存，压缩成了固定体积的状态。\n搬运税直接被砍掉了大半。\n硬件不够快，就让软件要搬的数据变少。\n显存通道窄，就让流过去的信息变轻。\n技术的演进往往就是这样。\n当充足的算力唾手可得时，所有人都会选择用最粗暴的方式堆参数、堆显卡。\n只有当物理边界被彻底焊死的时候，真正的架构重构才会被逼出来。\n究竟是算力过剩催生出更聪明的算法，还是算力匮乏逼出了更锋利的刀刃？","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-28 16:48:38","created_at":"2026-08-28 16:48:38","url":"https://mubeitech.com/p/mb-20260828-5faee8","markdown_url":"https://mubeitech.com/p/mb-20260828-5faee8/markdown"},{"rank":4,"id":"2055130148614050264","account":"mubei","brand":"@mubei","title":"英伟达刚用 4-bit 精度，跑完了一个 120 亿参数大模型的预训练。 喂进去的数据量是 10 万亿 token。 以…","summary":"英伟达刚用 4-bit 精度，跑完了一个 120 亿参数大模型的预训练。 喂进去的数据量是 10 万亿 token。 以前硅谷大厂卷模型，训练精度底线死死卡在 8-bit 甚至 16-bit。 谁都知道把数据精度再砍一半能省下海量显存。 但没人敢在预训练阶段碰 4-bit。 只要…","body":"英伟达刚用 4-bit 精度，跑完了一个 120 亿参数大模型的预训练。\n喂进去的数据量是 10 万亿 token。\n\n以前硅谷大厂卷模型，训练精度底线死死卡在 8-bit 甚至 16-bit。\n谁都知道把数据精度再砍一半能省下海量显存。\n但没人敢在预训练阶段碰 4-bit。\n只要精度压到这个级别，模型训练就会极度不稳定，直接崩溃不收敛。\n\n英伟达这次交了底牌，发了一套基于 NVFP4 格式的训练法。\n他们把解决路径拆成了具体动作。\n用随机阿达马变换把区块异常值按住。\n上二维量化控制前向和反向传播的误差。\n再配合随机舍入算法去抓取无偏梯度。\n\n这套操作做完，长程训练稳住了。\n实测跑出来的 MMLU-pro 测试成绩是 62.58%。\n作为对照，用传统 8-bit 精度跑出的基线成绩是 62.62%。\n两者只差了不到 0.05 个百分点。\n\n精度少了一半，准确率几乎毫发无损。\n这意味着同样的硬件，显存消耗直接砍半，算力性能翻了两到三倍。\n英伟达已经把核心代码在 Transformer Engine 里加了支持。\n下一代万亿参数模型的算力入场券，就这么被强行打了个对折。","category":"科技","score":83.3,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-05-15 06:24:35","created_at":"2026-05-15T05:36:24+02:00","url":"https://mubeitech.com/p/2055130148614050264","markdown_url":"https://mubeitech.com/p/2055130148614050264/markdown"},{"rank":5,"id":"2056329013971517735","account":"mubei","brand":"@mubei","title":"拔掉网线，全程断网单机运行 2000 亿参数的 AI 模型。 跑这套系统的设备有多大？ 一只手就能稳稳托住。 AMD 拿…","summary":"拔掉网线，全程断网单机运行 2000 亿参数的 AI 模型。 跑这套系统的设备有多大？ 一只手就能稳稳托住。 AMD 拿出了目前全球最小的 AI 开发系统。 苏姿丰直接把这台主机端了出来。 里面塞进了他们最高端的 Ryzen AI Max 处理器。 搭配的是 128GB 高速统一…","body":"拔掉网线，全程断网单机运行 2000 亿参数的 AI 模型。\n跑这套系统的设备有多大？\n一只手就能稳稳托住。\n\nAMD 拿出了目前全球最小的 AI 开发系统。\n苏姿丰直接把这台主机端了出来。\n里面塞进了他们最高端的 Ryzen AI Max 处理器。\n搭配的是 128GB 高速统一内存。\n\n算力能装进巴掌大小的空间，靠的是底层架构设计。\n这 128GB 内存由 CPU、GPU 和 NPU 三方直接共享。\n省去了数据在不同模块间来回搬运的损耗。\n系统整体性能被大幅拉升。\n硬生生把跑大型 AI 模型的算力，压缩进了一台微型桌面台式机里。\n\n大模型的硬件门槛正在被物理击穿。\n跑千亿参数模型曾经必须依赖庞大的云端机房。\n现在直接变成了摆在桌面上的一台离线私有设备。","category":"科技","score":83.3,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-05-18 12:07:21","created_at":"2026-05-18T13:00:16+02:00","url":"https://mubeitech.com/p/2056329013971517735","markdown_url":"https://mubeitech.com/p/2056329013971517735/markdown"},{"rank":6,"id":"2066276671586513317","account":"mubei","brand":"@mubei","title":"Lisa Su手里那台巴掌大的小机器，能跑2000亿参数的大模型。 但它最吓人的地方，是悄悄把AI的“产权关系”给改了。…","summary":"Lisa Su手里那台巴掌大的小机器，能跑2000亿参数的大模型。 但它最吓人的地方，是悄悄把AI的“产权关系”给改了。 来，聊聊我们以前是怎么被“云端大厂”拿捏的。 以前你用ChatGPT或者Claude，本质上都是在“租”。 模型在别人机房里。 算力在别人账本上。 上下文在别…","body":"Lisa Su手里那台巴掌大的小机器，能跑2000亿参数的大模型。\n但它最吓人的地方，是悄悄把AI的“产权关系”给改了。\n\n来，聊聊我们以前是怎么被“云端大厂”拿捏的。\n以前你用ChatGPT或者Claude，本质上都是在“租”。\n模型在别人机房里。\n算力在别人账本上。\n上下文在别人服务器里。\n价格、限额、审查、封号、降智，全在平台一句话。\n你以为自己买的是“智能”，其实买的是一段随时能被掐断的“临时通行权”。\n\n现在，这个权力结构开始塌方了。\n2026年，AMD现场演示了一个名场面：\n四台手掌大小的Ryzen AI Max+ 395小盒子，通过llama.cpp RPC组成了本地集群。\n直接在本地，断网跑起了1T（一万亿）参数级别的Kimi K2.5。\n大模型正在从昂贵的数据中心，疯狂往你的书桌上回流。\n\n这背后，是一个被撞了三十年的“内存墙”。\n1995年，学术界就提过一个概念：Hitting the Memory Wall（撞上内存墙）。\n意思很简单：芯片算得越来越快，内存喂数据的速度却跟不上。\n跑AI最怕这个。\n模型权重太大，每生成一个字，都要把海量参数从内存里“搬”出来走一遍。\n数据在路上堵车，芯片再强，也只能干等。\n\n所以，本地跑大AI的瓶颈在内存，不在算力。\nAMD这台小机器，真正的杀手锏是128GB的统一内存。\nCPU、GPU和NPU不再分家，不用来回倒数据，直接共用一个超高速的大池子。\n这相当于把最昂贵的“数据搬运税”，一刀砍没了。\n\n再加上GGUF量化技术，把模型从16位压缩到4位、5位，牺牲一点点精度，换来体积暴缩。\n配合Mixture of Experts（混合专家模型），比如Qwen3-235B，看似是个2350亿参数的怪兽，其实每次推理只激活22B。\n一减一加。\n“能不能跑大模型”的门槛，直接从“你有没有一整个数据中心”，变成了“你有没有一个足够大的本地内存池”。\n\n这就是权力的重新洗牌。\n云端AI像自来水。\n你随用随付，看似方便。\n但水表在别人手里，水质随时被过滤，想停你水就停你水。\n本地AI像自家发电机。\n买的时候贵一点，用起来麻烦一点。\n但一旦转起来，开不开、跑什么、数据留给谁，全是你说了算。\n\nAI正在从“服务”退回到“资产”。\n服务的核心是访问权。\n资产的核心是所有权。\n只有当大模型能装进你的机器，数据能留在你的硬盘，你和你的小公司，才算第一次真正拥有了自己的“智能主权”。\n\n下次再看到有博主晒“本地跑大模型”，别光跟着起哄看每秒跑多少个字。\n问三个问题：\n它绕开了哪堵内存墙？\nIt把谁的“租赁收入”，变成了我的“固定资产”？\n它把哪一部分智能，从科技巨头手里抢回了用户手里？\n\n能回答这三个问题的本地AI，才不是玩具。\n它是一场数字维度的私有化运动。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2066441685450490184","translated_status_id":"2066441685450490184","published_at":"2026-06-15 08:43:42","created_at":"2026-06-15T10:36:16.892351","url":"https://mubeitech.com/p/2066276671586513317","markdown_url":"https://mubeitech.com/p/2066276671586513317/markdown"}]}