{"source":{"id":"mb-20260827-d0ae18","title":"把一个 3130 亿参数的庞然大物，塞进一台只有 8GB 内存的 MacBook 里运转","url":"https://mubeitech.com/p/mb-20260827-d0ae18"},"method":"semantic-similarity","count":6,"items":[{"rank":1,"id":"mb-20260823-f590d9","account":"mubei","brand":"","title":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型","summary":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型","body":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型。\n跑出 47 tok/s 的推理速度，还顶着 400k 的超长上下文。\n很多人的第一反应是：这肯定把模型压成了人工智障。\n在过去的认知里，把超大模型塞进个人电脑，唯一的方法是死磕量化。\n把权重从 16 位浮点数一路压到 4 位、3 位，甚至 2 位。\n但单维度的压缩很快就会撞墙。\n位宽压得太狠，量化误差指数级爆发，模型直接开始胡言乱语。\n另一条路是剪枝。\n可传统密集模型的剪枝同样行不通：零散剔除的权重破坏了规整的矩阵结构，显卡根本跑不出硬件加速。\n两边都走不通，很多人便认定：顶级算力永远只能锁在云端机房。\n为什么 4700 美元的桌面设备能把这堵墙撞碎？\n因为真正的突破，从来不在单一维度上硬挤。\n它把两台方向完全不同的压缩机器叠在了一起。\n这台机器叫正交压缩。\n混合专家模型架构给算法提供了一个前所未有的结构切口。\n在这种架构里，模型是由数十个甚至上百个细分专家组成的网络。\n每生成一个词，真正被激活的只有少数几个专家。\n开源开发者 0xSero 借助 REAP 专家激活剪枝算法，先给所有专家跑了一轮校准。\n算法找出了那些在绝大多数任务中几乎从不响应的低频专家，整块剥离。\n整整 18.5% 的结构冗余被干脆利落地砍掉，而每个词调用的核心专家预算完好无损。\n这是第一步：在结构维度上剔除闲置专家。\n紧接着，在剩下的骨干专家身上，套上 turboderp 开发的 EXL3 算法，进行 3-bit 精度量化。\n这是第二步：在数值维度上压缩权重的位宽。\n两个动作是正交的。\n剪枝清理的是结构冗余，量化清理的是数值冗余。\n因为攻击的是两个互不干扰的独立维度，两者的压缩收益直接相乘，却避开了单一技术推向极限时的崩塌风险。\n显存占用被砍掉了一大截，每秒吞吐量却保住了。\n算力行业过去几年一直在制造一种云端垄断的恐慌。\n数千亿美元砸进集中式算力中心，普通人似乎只能按字数向云端服务器交租。\n但计算技术的演进，从来不会单向偏向中心化。\n算法在正交维度的每一次解耦，都在以乘数效应拉低硬件的成本底线。\n当一台桌面级的消费硬件，就能流畅运转过去需要整个机架才能支撑的智能。\n算力的主权，就不再只能被锁在巨头的数据中心里。\n决定智能普及速度的，不只是巨头烧了多少资本开支。\n更在底层算法如何把昂贵的门槛，一步步砸进每个普通开发者的书桌。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:49","created_at":"2026-08-23 00:21:49","url":"https://mubeitech.com/p/mb-20260823-f590d9","markdown_url":"https://mubeitech.com/p/mb-20260823-f590d9/markdown"},{"rank":2,"id":"2066276671586513317","account":"mubei","brand":"@mubei","title":"Lisa Su手里那台巴掌大的小机器，能跑2000亿参数的大模型。 但它最吓人的地方，是悄悄把AI的“产权关系”给改了。…","summary":"Lisa Su手里那台巴掌大的小机器，能跑2000亿参数的大模型。 但它最吓人的地方，是悄悄把AI的“产权关系”给改了。 来，聊聊我们以前是怎么被“云端大厂”拿捏的。 以前你用ChatGPT或者Claude，本质上都是在“租”。 模型在别人机房里。 算力在别人账本上。 上下文在别…","body":"Lisa Su手里那台巴掌大的小机器，能跑2000亿参数的大模型。\n但它最吓人的地方，是悄悄把AI的“产权关系”给改了。\n\n来，聊聊我们以前是怎么被“云端大厂”拿捏的。\n以前你用ChatGPT或者Claude，本质上都是在“租”。\n模型在别人机房里。\n算力在别人账本上。\n上下文在别人服务器里。\n价格、限额、审查、封号、降智，全在平台一句话。\n你以为自己买的是“智能”，其实买的是一段随时能被掐断的“临时通行权”。\n\n现在，这个权力结构开始塌方了。\n2026年，AMD现场演示了一个名场面：\n四台手掌大小的Ryzen AI Max+ 395小盒子，通过llama.cpp RPC组成了本地集群。\n直接在本地，断网跑起了1T（一万亿）参数级别的Kimi K2.5。\n大模型正在从昂贵的数据中心，疯狂往你的书桌上回流。\n\n这背后，是一个被撞了三十年的“内存墙”。\n1995年，学术界就提过一个概念：Hitting the Memory Wall（撞上内存墙）。\n意思很简单：芯片算得越来越快，内存喂数据的速度却跟不上。\n跑AI最怕这个。\n模型权重太大，每生成一个字，都要把海量参数从内存里“搬”出来走一遍。\n数据在路上堵车，芯片再强，也只能干等。\n\n所以，本地跑大AI的瓶颈在内存，不在算力。\nAMD这台小机器，真正的杀手锏是128GB的统一内存。\nCPU、GPU和NPU不再分家，不用来回倒数据，直接共用一个超高速的大池子。\n这相当于把最昂贵的“数据搬运税”，一刀砍没了。\n\n再加上GGUF量化技术，把模型从16位压缩到4位、5位，牺牲一点点精度，换来体积暴缩。\n配合Mixture of Experts（混合专家模型），比如Qwen3-235B，看似是个2350亿参数的怪兽，其实每次推理只激活22B。\n一减一加。\n“能不能跑大模型”的门槛，直接从“你有没有一整个数据中心”，变成了“你有没有一个足够大的本地内存池”。\n\n这就是权力的重新洗牌。\n云端AI像自来水。\n你随用随付，看似方便。\n但水表在别人手里，水质随时被过滤，想停你水就停你水。\n本地AI像自家发电机。\n买的时候贵一点，用起来麻烦一点。\n但一旦转起来，开不开、跑什么、数据留给谁，全是你说了算。\n\nAI正在从“服务”退回到“资产”。\n服务的核心是访问权。\n资产的核心是所有权。\n只有当大模型能装进你的机器，数据能留在你的硬盘，你和你的小公司，才算第一次真正拥有了自己的“智能主权”。\n\n下次再看到有博主晒“本地跑大模型”，别光跟着起哄看每秒跑多少个字。\n问三个问题：\n它绕开了哪堵内存墙？\nIt把谁的“租赁收入”，变成了我的“固定资产”？\n它把哪一部分智能，从科技巨头手里抢回了用户手里？\n\n能回答这三个问题的本地AI，才不是玩具。\n它是一场数字维度的私有化运动。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2066441685450490184","translated_status_id":"2066441685450490184","published_at":"2026-06-15 08:43:42","created_at":"2026-06-15T10:36:16.892351","url":"https://mubeitech.com/p/2066276671586513317","markdown_url":"https://mubeitech.com/p/2066276671586513317/markdown"},{"rank":3,"id":"2070963984388251736","account":"mubei","brand":"@mubei","title":"坐 11 个小时的跨洋飞机，你愿意花 25 美元连那个又慢又卡的机上 WiFi 吗？ 一位中共国开发者给出了一个非常硬核…","summary":"坐 11 个小时的跨洋飞机，你愿意花 25 美元连那个又慢又卡的机上 WiFi 吗？ 一位中共国开发者给出了一个非常硬核的答案。 他不买。他利用这段完全没有网络的时间，在自己的 MacBook 上本地运行 Llama 70B 大模型，把积压的任务队列给干完了。 很多人觉得在电脑本…","body":"坐 11 个小时的跨洋飞机，你愿意花 25 美元连那个又慢又卡的机上 WiFi 吗？\n\n一位中共国开发者给出了一个非常硬核的答案。\n他不买。他利用这段完全没有网络的时间，在自己的 MacBook 上本地运行 Llama 70B 大模型，把积压的任务队列给干完了。\n\n很多人觉得在电脑本地跑大模型只是极客的\"炫技\"。\n但这件事，撕开了本地大模型真正的战略意义。\n它第一次把 AI 生产力，从云端订阅、网络连接和平台许可的捆绑里，彻底解放了出来。\n\n过程非常丝滑。\n他带了一台 64GB 内存的 MacBook Pro M4。\n没有网络，不调任何云端 API，不连 OpenAI 或 Anthropic 的服务器。\n电脑里只跑着一个通过 llama.cpp 运行的本地 Llama 3.3 70B 模型，以及一个自己写的编排脚本。\n\n起飞前，他给这个本地系统输入了一段极其清醒的系统提示词：\n\"你是一个单机运行的离线编排器，没有网络。\n你拥有的资源只有本地目录、localhost:8080 上的 Llama 70B 服务器，以及 3 小时 21 分钟的初始电池预算。\n去处理任务队列，完成一个就保存一个，每 12 个任务存一次档。\n电池低于 5% 就暂停，等换好电池再恢复。\"\n\n大模型非常清楚自己的处境。\nIt 知道在未来的 11 个小时里，自己处于断网状态，电量和内存都是有限的，而且人类在降落前不会插手。\n\n于是系统开始单机循环：从队列取任务、本地推理、保存成果、写下存档点。\n根据他晒出的日志，在 6 万左右的上下文下，生成速度达到了每秒 71 个 token，内存占用了 48.6 GiB。\n当电量掉到 5% 以下时，系统自动暂停，等他插上外接充电宝，系统又无缝从上一个存档点恢复，继续往下啃任务。\n等飞机落地时，整条任务队列已经全部跑完。\n\n窗外是云海，小桌板上是一台 MacBook、两个终端窗口，和一个默默运转的 localhost 服务器。\n这才是真正有锋芒的生产力工具。\n\n过去我们被规训得太久，以为没有了网线，没有了向硅谷大厂按月付账的订阅费，AI 就会变成一堆废铁。\n但当 70B 级别的大模型可以被塞进个人电脑，在万米高空、零网络、零服务器成本的情况下稳定产出时，规则就变了。\nAI 的下半场，在昂贵的云端巨兽身上，更在这些被彻底解放出来、随时随地都能自我运转的本地终端里。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2071167056439845195","translated_status_id":"2071167056439845195","published_at":"2026-06-28 09:41:21","created_at":"2026-06-28T11:17:47+02:00","url":"https://mubeitech.com/p/2070963984388251736","markdown_url":"https://mubeitech.com/p/2070963984388251736/markdown"},{"rank":4,"id":"2080394326744400301","account":"mubei","brand":"@mubei","title":"你的电脑，以后不只是拿来跑本地模型了。 它会变成一个微型的算力节点。 门槛有多高？ 在Buzz里点一下鼠标就行。 打开开…","summary":"你的电脑，以后不只是拿来跑本地模型了。 它会变成一个微型的算力节点。 门槛有多高？ 在Buzz里点一下鼠标就行。 打开开关，你本地部署的大模型，立刻就能对Agent（智能体）和其他人开放。 看看这台机器的底子。 苹果M5 Max芯片，配上128GB的AI专属内存。 这个级别的个人…","body":"你的电脑，以后不只是拿来跑本地模型了。\n它会变成一个微型的算力节点。\n\n门槛有多高？\n在Buzz里点一下鼠标就行。\n打开开关，你本地部署的大模型，立刻就能对Agent（智能体）和其他人开放。\n\n看看这台机器的底子。\n苹果M5 Max芯片，配上128GB的AI专属内存。\n这个级别的个人硬件能装下什么？\n48GB的Qwen3，47GB的Qwen2.5-72B，还有43GB的Llama-3.3和DeepSeek-R1。\n一排重磅的开源大模型，在这台电脑上全部显示“完美适配”。\n\n把这些庞然大物塞进个人电脑，绝不是为了当单机玩具。\n真正厉害的是它的底层调度机制。\n一旦开启共享，你的Agent会自动去网络池子里，挑那个最大、最合适的模型来干活。\n\n这是一种全新的玩法。\n你的闲置算力，变成了整个网络的推理资源。\n算力不再只锁在云端大厂的机房里。\n只要你愿意，你的电脑就是下一台服务器。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2080465507065495817","translated_status_id":"2080465507065495817","published_at":"2026-07-24 00:06:47","created_at":"2026-07-24T02:01:17+02:00","url":"https://mubeitech.com/p/2080394326744400301","markdown_url":"https://mubeitech.com/p/2080394326744400301/markdown"},{"rank":5,"id":"mb-20260822-7f8f71","account":"mubei","brand":"","title":"本地运行的 AI 模型，已经能把 89% 的日常问答和逻辑推理，解决得和云端顶级旗舰模型一样好","summary":"本地运行的 AI 模型，已经能把 89% 的日常问答和逻辑推理，解决得和云端顶级旗舰模型一样好","body":"本地运行的 AI 模型，已经能把 89% 的日常问答和逻辑推理，解决得和云端顶级旗舰模型一样好。\n这不是小范围测试的体感。\n斯坦福大学与 Together AI 追踪测试了 20 多个本地模型，跑了超过 100 万条真实用户提问。\n2023 年，本地模型的匹配率还只有 23.2%。\n2025 年，飙升到 71.3%。\n到了 2026 年，这个数字直接跨过了 89%。\n很多人以为，这只是小模型在死记硬背参数。\n决定胜负的其实不是参数规模。\n真正推动这场迁移的，是一台在半导体历史上运转了六十年的老机器。\n这台机器叫库梅定律（Koomey's Law）。\n物理学家乔纳森·库梅（Jonathan Koomey）总结过半导体历史上的一条硬规律：每消耗一焦耳能量所能完成的计算量，每 1.57 年就会翻一倍。\n六十年前，正是这条能效曲线，把占满一整间机房的 IBM 大型机，一步步压缩成了桌上的个人电脑，最后塞进了每个人的口袋。\n如今，同样的物理轨迹落到了 AI 头上。\n风险投资人 Tomasz Tunguz 梳理过一组数据：过去两年，本地 AI 模型的每瓦智能暴增了 5.3 倍。\n其中算法和架构优化贡献了 3.1 倍。\n芯片硬件能效提升贡献了 1.7 倍。\n当每瓦电量能榨出的智能以这种斜率狂飙，算力就不再必须依附于集中式的数据中心。\n过去三年，科技巨头向公众灌输的叙事是一场无限膨胀的云端军备竞赛。\n上千亿美元砸进算力中心，电力消耗直逼核电站。\n所有人似乎都只能通过网络，向少数几个中心服务器租用智慧。\n但计算技术的发展史，从来不倾向于把所有人永远锁在中心机房。\n耗费数万张芯片的基座训练，以及极限前沿的科研探索，确实属于云端剩下的 11%。\n可普通人 89% 的日常需求，根本不需要把数据送到半个地球之外去排队。\n本地芯片免去了跨网络搬运数据的延迟和带宽税。\n个人数据完整留在本地设备，隐私不用交出。\n更关键的是，边际电费和推理成本被直接打到了接近于零。\n云端巨头靠垄断算力向全社会收租的护城河，正在被终端芯片的能效曲线一点点抽空。\n技术史上最剧烈的权力转移，从来不在谁拥有最大的中央机房。\n在能效曲线什么时候把昂贵的特权，压缩成手边触手可及的日常工具。\n当曾经属于超级计算机的智能被无声塞进个人终端，中心化的算力霸权，往往就是这样从底层被彻底解构的。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-22 17:07:24","created_at":"2026-08-22 17:07:24","url":"https://mubeitech.com/p/mb-20260822-7f8f71","markdown_url":"https://mubeitech.com/p/mb-20260822-7f8f71/markdown"},{"rank":6,"id":"mb-20260827-46d0c4","account":"mubei","brand":"","title":"从 A100 到 B200，显卡的张量计算吞吐暴涨了 7.2 倍","summary":"从 A100 到 B200，显卡的张量计算吞吐暴涨了 7.2 倍","body":"从 A100 到 B200，显卡的张量计算吞吐暴涨了 7.2 倍。\n但机箱里卡和卡之间的通信通道，只提升了 3 倍。\n跨机柜的互连网络，更是只涨了 2 倍。\n这道越撕越大的剪刀差，把整个算力工业逼到了墙角。\n今天大模型训练和推理的真正瓶颈，早就不在单张显卡算得多快。\n在卡和卡之间的数据通道有多窄。\n如果你直接用官方默认的 PyTorch 和 NCCL 组合去跑分布式任务，整套集群的实际性能，连理论通信屋顶线的一半都跑不到。\n一半的硬件算力，纯粹在原地干等数据搬运。\n既然通道不够宽，为什么不能在写代码的时候，把数据搬运和核心计算在时间上彻底叠在一起？\n只要重叠得足够精妙，计算的时间就能把通信的等待完全吃掉。\n顶尖的系统工程师确实做到了。\nTogether AI 的 Simran Arora 团队写出了 ParallelKittens，只往单卡算子里加了十几行底层原语，直接走 NVLink 调度硬件，在生产环境里把性能拉满，跑进了 Together AI 和 Cursor 的核心系统。\n真正的硬仗在后面。\n如果把这套多卡调优的任务，交给今天最顶尖的代码大模型，它能写得出来吗？\n答案打碎了很多人对 AI 编程的幻想。\n研究团队建了一个包含 87 道工业级多卡难题的基准 ParallelKernelBench。\n给模型一份没优化的基础代码和物理硬件拓扑图，让它写出直接操控 NVLink 搬运数据的 CUDA 算子。\n最强的前沿大模型单次上阵，87 道题里只写对了 28 道。\n这 28 道里，真正跑得比基线更快的，只有 22 道。\n哪怕给它疯狂采样、多抽几次结果，正确题数也只能勉强摸到 36 道。\n既写对又跑得更快的比例，被死死钉在 31% 附近。\n哪怕给它配上完整的多轮智能体环境，给它命令行终端去反复试错调试，最终也只停留在 35 道。\n大模型到底卡死在哪里？\n很多人以为是它写不好复杂的 CUDA 语法。\n完全猜错了。\n大模型其实格外擅长语法，编译报错只要让它重试一次就能修正。\n真正让它全线崩溃的，是一张它脑子里根本不存在的硬件物理拓扑图。\n要写出极致的多卡算子，程序员必须在硬件物理层做精细的三重权衡。\n第一重，是卡与卡之间通信顺序的时序编排。\n第二重，是海量数据在多张卡之间的切分与重组逻辑。\n第三重，是物理搬运路径的取舍。\n到底该走专用的硬件拷贝引擎，还是调用张量内存加速器 TMA，或者直接把数据塞进寄存器级别传输？\n每一种路径的延迟、带宽占用和流式多处理器开销，全都不一样。\n大模型之所以能写对前面两成题目，是因为那些模式在开源互联网上被反复写过，它只是在记忆里匹配既有模版。\n一旦面对真实的硬件物理瓶颈，需要根据显卡拓扑结构去推演数据流的碰撞与等待，它就彻底失去了方向。\n它背得下世界上所有的编程语法。\n但它从未真正理解过物理世界的电子和光子，是怎样在硅片与铜线之间穿梭的。\n软件层面的代码生成，只要逻辑闭环、通过单元测试就能交差。\n但当 AI 试图去优化物理世界的极端性能，一切语法技巧都会在硬件的物理铁律面前现出原形。\n算力跑得越快，通信的阻力就越致命。\n那些能够把代码写得符合语法的系统，永远只是第一步。\n真正能把几十万颗芯片捏成一台巨型计算机的，永远是对物理极限和空间拓扑的深刻理解。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-27 21:12:42","created_at":"2026-08-27 21:12:42","url":"https://mubeitech.com/p/mb-20260827-46d0c4","markdown_url":"https://mubeitech.com/p/mb-20260827-46d0c4/markdown"}]}