{"source":{"id":"2039834243598025082","title":"跑不动几千亿参数的大模型怎么办？ 借别人的闲置显卡拼一拼。 Jack Dorsey 的 Block 刚刚发布了 mesh…","url":"https://mubeitech.com/p/2039834243598025082"},"method":"semantic-similarity","count":6,"items":[{"rank":1,"id":"2039860001267908756","account":"mubei","brand":"@mubei","title":"大模型圈的桌子被谷歌直接掀了。 怎么回事？ 排在全球AI排行榜第三的模型，你家书桌上的普通电脑就能跑。 这头刚放出的开源…","summary":"大模型圈的桌子被谷歌直接掀了。 怎么回事？ 排在全球AI排行榜第三的模型，你家书桌上的普通电脑就能跑。 这头刚放出的开源怪兽叫Gemma 4。 它的身形只有区区310亿参数。 跟它同台竞技的，全是几千亿甚至上万亿参数的巨无霸。 那些庞然大物就算你花几十万买设备都带不动。 Gemm…","body":"大模型圈的桌子被谷歌直接掀了。\n怎么回事？\n排在全球AI排行榜第三的模型，你家书桌上的普通电脑就能跑。\n\n这头刚放出的开源怪兽叫Gemma 4。\n它的身形只有区区310亿参数。\n跟它同台竞技的，全是几千亿甚至上万亿参数的巨无霸。\n那些庞然大物就算你花几十万买设备都带不动。\nGemma 4硬是靠着小体格打出了降维暴击。\n\n它还有20亿和40亿参数的微型版。\n专门给你塞进手机和树莓派用的。\n拔掉网线。\n完全离线运行。\n延迟无限接近于零。\n视觉、音频和智能体工作流统统原生支持。\n\n别再迷信那些靠疯狂堆料建机房的科技巨头了。\n把算力锁在云端收割订阅费的吃相，今天被彻底撕开了一道口子。\n硅谷的封闭花园里，有人把技术主导权的钥匙扔到了平民的大街上。\n属于普通人的私人算力节点，现在已经全部插上了电。","category":"其它","score":100,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-04-03 11:13:31","created_at":"2026-04-03T12:37:29.067429","url":"https://mubeitech.com/p/2039860001267908756","markdown_url":"https://mubeitech.com/p/2039860001267908756/markdown"},{"rank":2,"id":"2066276671586513317","account":"mubei","brand":"@mubei","title":"Lisa Su手里那台巴掌大的小机器，能跑2000亿参数的大模型。 但它最吓人的地方，是悄悄把AI的“产权关系”给改了。…","summary":"Lisa Su手里那台巴掌大的小机器，能跑2000亿参数的大模型。 但它最吓人的地方，是悄悄把AI的“产权关系”给改了。 来，聊聊我们以前是怎么被“云端大厂”拿捏的。 以前你用ChatGPT或者Claude，本质上都是在“租”。 模型在别人机房里。 算力在别人账本上。 上下文在别…","body":"Lisa Su手里那台巴掌大的小机器，能跑2000亿参数的大模型。\n但它最吓人的地方，是悄悄把AI的“产权关系”给改了。\n\n来，聊聊我们以前是怎么被“云端大厂”拿捏的。\n以前你用ChatGPT或者Claude，本质上都是在“租”。\n模型在别人机房里。\n算力在别人账本上。\n上下文在别人服务器里。\n价格、限额、审查、封号、降智，全在平台一句话。\n你以为自己买的是“智能”，其实买的是一段随时能被掐断的“临时通行权”。\n\n现在，这个权力结构开始塌方了。\n2026年，AMD现场演示了一个名场面：\n四台手掌大小的Ryzen AI Max+ 395小盒子，通过llama.cpp RPC组成了本地集群。\n直接在本地，断网跑起了1T（一万亿）参数级别的Kimi K2.5。\n大模型正在从昂贵的数据中心，疯狂往你的书桌上回流。\n\n这背后，是一个被撞了三十年的“内存墙”。\n1995年，学术界就提过一个概念：Hitting the Memory Wall（撞上内存墙）。\n意思很简单：芯片算得越来越快，内存喂数据的速度却跟不上。\n跑AI最怕这个。\n模型权重太大，每生成一个字，都要把海量参数从内存里“搬”出来走一遍。\n数据在路上堵车，芯片再强，也只能干等。\n\n所以，本地跑大AI的瓶颈在内存，不在算力。\nAMD这台小机器，真正的杀手锏是128GB的统一内存。\nCPU、GPU和NPU不再分家，不用来回倒数据，直接共用一个超高速的大池子。\n这相当于把最昂贵的“数据搬运税”，一刀砍没了。\n\n再加上GGUF量化技术，把模型从16位压缩到4位、5位，牺牲一点点精度，换来体积暴缩。\n配合Mixture of Experts（混合专家模型），比如Qwen3-235B，看似是个2350亿参数的怪兽，其实每次推理只激活22B。\n一减一加。\n“能不能跑大模型”的门槛，直接从“你有没有一整个数据中心”，变成了“你有没有一个足够大的本地内存池”。\n\n这就是权力的重新洗牌。\n云端AI像自来水。\n你随用随付，看似方便。\n但水表在别人手里，水质随时被过滤，想停你水就停你水。\n本地AI像自家发电机。\n买的时候贵一点，用起来麻烦一点。\n但一旦转起来，开不开、跑什么、数据留给谁，全是你说了算。\n\nAI正在从“服务”退回到“资产”。\n服务的核心是访问权。\n资产的核心是所有权。\n只有当大模型能装进你的机器，数据能留在你的硬盘，你和你的小公司，才算第一次真正拥有了自己的“智能主权”。\n\n下次再看到有博主晒“本地跑大模型”，别光跟着起哄看每秒跑多少个字。\n问三个问题：\n它绕开了哪堵内存墙？\nIt把谁的“租赁收入”，变成了我的“固定资产”？\n它把哪一部分智能，从科技巨头手里抢回了用户手里？\n\n能回答这三个问题的本地AI，才不是玩具。\n它是一场数字维度的私有化运动。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2066441685450490184","translated_status_id":"2066441685450490184","published_at":"2026-06-15 08:43:42","created_at":"2026-06-15T10:36:16.892351","url":"https://mubeitech.com/p/2066276671586513317","markdown_url":"https://mubeitech.com/p/2066276671586513317/markdown"},{"rank":3,"id":"2070963984388251736","account":"mubei","brand":"@mubei","title":"坐 11 个小时的跨洋飞机，你愿意花 25 美元连那个又慢又卡的机上 WiFi 吗？ 一位中共国开发者给出了一个非常硬核…","summary":"坐 11 个小时的跨洋飞机，你愿意花 25 美元连那个又慢又卡的机上 WiFi 吗？ 一位中共国开发者给出了一个非常硬核的答案。 他不买。他利用这段完全没有网络的时间，在自己的 MacBook 上本地运行 Llama 70B 大模型，把积压的任务队列给干完了。 很多人觉得在电脑本…","body":"坐 11 个小时的跨洋飞机，你愿意花 25 美元连那个又慢又卡的机上 WiFi 吗？\n\n一位中共国开发者给出了一个非常硬核的答案。\n他不买。他利用这段完全没有网络的时间，在自己的 MacBook 上本地运行 Llama 70B 大模型，把积压的任务队列给干完了。\n\n很多人觉得在电脑本地跑大模型只是极客的\"炫技\"。\n但这件事，撕开了本地大模型真正的战略意义。\n它第一次把 AI 生产力，从云端订阅、网络连接和平台许可的捆绑里，彻底解放了出来。\n\n过程非常丝滑。\n他带了一台 64GB 内存的 MacBook Pro M4。\n没有网络，不调任何云端 API，不连 OpenAI 或 Anthropic 的服务器。\n电脑里只跑着一个通过 llama.cpp 运行的本地 Llama 3.3 70B 模型，以及一个自己写的编排脚本。\n\n起飞前，他给这个本地系统输入了一段极其清醒的系统提示词：\n\"你是一个单机运行的离线编排器，没有网络。\n你拥有的资源只有本地目录、localhost:8080 上的 Llama 70B 服务器，以及 3 小时 21 分钟的初始电池预算。\n去处理任务队列，完成一个就保存一个，每 12 个任务存一次档。\n电池低于 5% 就暂停，等换好电池再恢复。\"\n\n大模型非常清楚自己的处境。\nIt 知道在未来的 11 个小时里，自己处于断网状态，电量和内存都是有限的，而且人类在降落前不会插手。\n\n于是系统开始单机循环：从队列取任务、本地推理、保存成果、写下存档点。\n根据他晒出的日志，在 6 万左右的上下文下，生成速度达到了每秒 71 个 token，内存占用了 48.6 GiB。\n当电量掉到 5% 以下时，系统自动暂停，等他插上外接充电宝，系统又无缝从上一个存档点恢复，继续往下啃任务。\n等飞机落地时，整条任务队列已经全部跑完。\n\n窗外是云海，小桌板上是一台 MacBook、两个终端窗口，和一个默默运转的 localhost 服务器。\n这才是真正有锋芒的生产力工具。\n\n过去我们被规训得太久，以为没有了网线，没有了向硅谷大厂按月付账的订阅费，AI 就会变成一堆废铁。\n但当 70B 级别的大模型可以被塞进个人电脑，在万米高空、零网络、零服务器成本的情况下稳定产出时，规则就变了。\nAI 的下半场，在昂贵的云端巨兽身上，更在这些被彻底解放出来、随时随地都能自我运转的本地终端里。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2071167056439845195","translated_status_id":"2071167056439845195","published_at":"2026-06-28 09:41:21","created_at":"2026-06-28T11:17:47+02:00","url":"https://mubeitech.com/p/2070963984388251736","markdown_url":"https://mubeitech.com/p/2070963984388251736/markdown"},{"rank":4,"id":"mb-20260823-f590d9","account":"mubei","brand":"","title":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型","summary":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型","body":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型。\n跑出 47 tok/s 的推理速度，还顶着 400k 的超长上下文。\n很多人的第一反应是：这肯定把模型压成了人工智障。\n在过去的认知里，把超大模型塞进个人电脑，唯一的方法是死磕量化。\n把权重从 16 位浮点数一路压到 4 位、3 位，甚至 2 位。\n但单维度的压缩很快就会撞墙。\n位宽压得太狠，量化误差指数级爆发，模型直接开始胡言乱语。\n另一条路是剪枝。\n可传统密集模型的剪枝同样行不通：零散剔除的权重破坏了规整的矩阵结构，显卡根本跑不出硬件加速。\n两边都走不通，很多人便认定：顶级算力永远只能锁在云端机房。\n为什么 4700 美元的桌面设备能把这堵墙撞碎？\n因为真正的突破，从来不在单一维度上硬挤。\n它把两台方向完全不同的压缩机器叠在了一起。\n这台机器叫正交压缩。\n混合专家模型架构给算法提供了一个前所未有的结构切口。\n在这种架构里，模型是由数十个甚至上百个细分专家组成的网络。\n每生成一个词，真正被激活的只有少数几个专家。\n开源开发者 0xSero 借助 REAP 专家激活剪枝算法，先给所有专家跑了一轮校准。\n算法找出了那些在绝大多数任务中几乎从不响应的低频专家，整块剥离。\n整整 18.5% 的结构冗余被干脆利落地砍掉，而每个词调用的核心专家预算完好无损。\n这是第一步：在结构维度上剔除闲置专家。\n紧接着，在剩下的骨干专家身上，套上 turboderp 开发的 EXL3 算法，进行 3-bit 精度量化。\n这是第二步：在数值维度上压缩权重的位宽。\n两个动作是正交的。\n剪枝清理的是结构冗余，量化清理的是数值冗余。\n因为攻击的是两个互不干扰的独立维度，两者的压缩收益直接相乘，却避开了单一技术推向极限时的崩塌风险。\n显存占用被砍掉了一大截，每秒吞吐量却保住了。\n算力行业过去几年一直在制造一种云端垄断的恐慌。\n数千亿美元砸进集中式算力中心，普通人似乎只能按字数向云端服务器交租。\n但计算技术的演进，从来不会单向偏向中心化。\n算法在正交维度的每一次解耦，都在以乘数效应拉低硬件的成本底线。\n当一台桌面级的消费硬件，就能流畅运转过去需要整个机架才能支撑的智能。\n算力的主权，就不再只能被锁在巨头的数据中心里。\n决定智能普及速度的，不只是巨头烧了多少资本开支。\n更在底层算法如何把昂贵的门槛，一步步砸进每个普通开发者的书桌。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:49","created_at":"2026-08-23 00:21:49","url":"https://mubeitech.com/p/mb-20260823-f590d9","markdown_url":"https://mubeitech.com/p/mb-20260823-f590d9/markdown"},{"rank":5,"id":"2080394326744400301","account":"mubei","brand":"@mubei","title":"你的电脑，以后不只是拿来跑本地模型了。 它会变成一个微型的算力节点。 门槛有多高？ 在Buzz里点一下鼠标就行。 打开开…","summary":"你的电脑，以后不只是拿来跑本地模型了。 它会变成一个微型的算力节点。 门槛有多高？ 在Buzz里点一下鼠标就行。 打开开关，你本地部署的大模型，立刻就能对Agent（智能体）和其他人开放。 看看这台机器的底子。 苹果M5 Max芯片，配上128GB的AI专属内存。 这个级别的个人…","body":"你的电脑，以后不只是拿来跑本地模型了。\n它会变成一个微型的算力节点。\n\n门槛有多高？\n在Buzz里点一下鼠标就行。\n打开开关，你本地部署的大模型，立刻就能对Agent（智能体）和其他人开放。\n\n看看这台机器的底子。\n苹果M5 Max芯片，配上128GB的AI专属内存。\n这个级别的个人硬件能装下什么？\n48GB的Qwen3，47GB的Qwen2.5-72B，还有43GB的Llama-3.3和DeepSeek-R1。\n一排重磅的开源大模型，在这台电脑上全部显示“完美适配”。\n\n把这些庞然大物塞进个人电脑，绝不是为了当单机玩具。\n真正厉害的是它的底层调度机制。\n一旦开启共享，你的Agent会自动去网络池子里，挑那个最大、最合适的模型来干活。\n\n这是一种全新的玩法。\n你的闲置算力，变成了整个网络的推理资源。\n算力不再只锁在云端大厂的机房里。\n只要你愿意，你的电脑就是下一台服务器。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2080465507065495817","translated_status_id":"2080465507065495817","published_at":"2026-07-24 00:06:47","created_at":"2026-07-24T02:01:17+02:00","url":"https://mubeitech.com/p/2080394326744400301","markdown_url":"https://mubeitech.com/p/2080394326744400301/markdown"},{"rank":6,"id":"2068591534736551972","account":"mubei","brand":"@mubei","title":"特斯拉找到了一个办法：不建任何一个传统数据中心，直接搞出全球最大的AI超级计算机。 现在整个AI行业其实已经撞墙了。 卡…","summary":"特斯拉找到了一个办法：不建任何一个传统数据中心，直接搞出全球最大的AI超级计算机。 现在整个AI行业其实已经撞墙了。 卡脖子的不是芯片，是电力。 建AI数据中心最痛苦的不是买卡，而是排队等电网审批，动辄要等好几年。 比如 OpenAI 和甲骨文（Oracle）那个庞大的“星际之门…","body":"特斯拉找到了一个办法：不建任何一个传统数据中心，直接搞出全球最大的AI超级计算机。\n\n现在整个AI行业其实已经撞墙了。\n卡脖子的不是芯片，是电力。\n建AI数据中心最痛苦的不是买卡，而是排队等电网审批，动辄要等好几年。\n比如 OpenAI 和甲骨文（Oracle）那个庞大的“星际之门”（Stargate）计划，打算砸5000亿美元，就为了搞出7吉瓦（GW）的电力容量，而且还要等好多年才能上线。\n\n结果马斯克低头一看：我手里不就正好有7吉瓦吗？\n特斯拉遍布全球的超级充电站网络，电是现成的，地是现成的，电网连接和许可证全是现成的。\n在 2026 年 6 月 18 日，特斯拉悄悄申请了一个叫“MEGAPOD”的商标。\n这玩意儿就是个模块化的AI数据中心硬件，设计出来就是为了直接往现有的超充站里“插拔”。\n不用买地，不用去电网排队，直接在自家现成的基础设施上“嫁接”算力。\n\n但这只是开胃菜，真正恐怖的在后面。\n你买的特斯拉，平均有 95% 的时间都是停在车库里吃灰的。\n而每辆现代特斯拉身上，其实都装着为了自动驾驶而设计的强悍AI芯片。\n马斯克要把这千百万辆停在路边、插着电、自带液冷系统的“休眠电脑”，全部连成一个巨大的分布式超算中心。\n\n这笔账算起来很吓人。\n如果特斯拉汽车达到1亿辆，每辆车贡献1千瓦的算力，那就是100吉瓦（GW）的AI处理能力。\n这个数字能把目前地球上所有数据中心加起来全部吊打。\n最绝的是，这些设备的场地费、硬件费、冷却费，用户在买车的时候已经自己付过了。\n\n以后你晚上睡觉，把车停在车库里插上电，就能把闲置算力租给特斯拉。\n醒来一看，昨晚车子自己打工赚了零花钱，或者直接抵扣了FSD的订阅费。\n你的车子不再是落地贬值的铁皮，它成了停在车库里帮你赚钱的资产。\n\n这就是维度的碾压。\n当硅谷巨头们还在辛辛苦苦砸半万亿美金去跟政府磨电网、建厂房的时候，特斯拉已经把全人类的车库变成了它的液冷服务器机架。\n别人在拼命造一个集中式的神，而马斯克正在把整个地球物理级地网络化。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2068981486083060195","translated_status_id":"2068981486083060195","published_at":"2026-06-22 08:52:57","created_at":"2026-06-22T10:51:31.337587","url":"https://mubeitech.com/p/2068591534736551972","markdown_url":"https://mubeitech.com/p/2068591534736551972/markdown"}]}