{"source":{"id":"2039860001267908756","title":"大模型圈的桌子被谷歌直接掀了。 怎么回事？ 排在全球AI排行榜第三的模型，你家书桌上的普通电脑就能跑。 这头刚放出的开源…","url":"https://mubeitech.com/p/2039860001267908756"},"method":"semantic-similarity","count":6,"items":[{"rank":1,"id":"2066276671586513317","account":"mubei","brand":"@mubei","title":"Lisa Su手里那台巴掌大的小机器，能跑2000亿参数的大模型。 但它最吓人的地方，是悄悄把AI的“产权关系”给改了。…","summary":"Lisa Su手里那台巴掌大的小机器，能跑2000亿参数的大模型。 但它最吓人的地方，是悄悄把AI的“产权关系”给改了。 来，聊聊我们以前是怎么被“云端大厂”拿捏的。 以前你用ChatGPT或者Claude，本质上都是在“租”。 模型在别人机房里。 算力在别人账本上。 上下文在别…","body":"Lisa Su手里那台巴掌大的小机器，能跑2000亿参数的大模型。\n但它最吓人的地方，是悄悄把AI的“产权关系”给改了。\n\n来，聊聊我们以前是怎么被“云端大厂”拿捏的。\n以前你用ChatGPT或者Claude，本质上都是在“租”。\n模型在别人机房里。\n算力在别人账本上。\n上下文在别人服务器里。\n价格、限额、审查、封号、降智，全在平台一句话。\n你以为自己买的是“智能”，其实买的是一段随时能被掐断的“临时通行权”。\n\n现在，这个权力结构开始塌方了。\n2026年，AMD现场演示了一个名场面：\n四台手掌大小的Ryzen AI Max+ 395小盒子，通过llama.cpp RPC组成了本地集群。\n直接在本地，断网跑起了1T（一万亿）参数级别的Kimi K2.5。\n大模型正在从昂贵的数据中心，疯狂往你的书桌上回流。\n\n这背后，是一个被撞了三十年的“内存墙”。\n1995年，学术界就提过一个概念：Hitting the Memory Wall（撞上内存墙）。\n意思很简单：芯片算得越来越快，内存喂数据的速度却跟不上。\n跑AI最怕这个。\n模型权重太大，每生成一个字，都要把海量参数从内存里“搬”出来走一遍。\n数据在路上堵车，芯片再强，也只能干等。\n\n所以，本地跑大AI的瓶颈在内存，不在算力。\nAMD这台小机器，真正的杀手锏是128GB的统一内存。\nCPU、GPU和NPU不再分家，不用来回倒数据，直接共用一个超高速的大池子。\n这相当于把最昂贵的“数据搬运税”，一刀砍没了。\n\n再加上GGUF量化技术，把模型从16位压缩到4位、5位，牺牲一点点精度，换来体积暴缩。\n配合Mixture of Experts（混合专家模型），比如Qwen3-235B，看似是个2350亿参数的怪兽，其实每次推理只激活22B。\n一减一加。\n“能不能跑大模型”的门槛，直接从“你有没有一整个数据中心”，变成了“你有没有一个足够大的本地内存池”。\n\n这就是权力的重新洗牌。\n云端AI像自来水。\n你随用随付，看似方便。\n但水表在别人手里，水质随时被过滤，想停你水就停你水。\n本地AI像自家发电机。\n买的时候贵一点，用起来麻烦一点。\n但一旦转起来，开不开、跑什么、数据留给谁，全是你说了算。\n\nAI正在从“服务”退回到“资产”。\n服务的核心是访问权。\n资产的核心是所有权。\n只有当大模型能装进你的机器，数据能留在你的硬盘，你和你的小公司，才算第一次真正拥有了自己的“智能主权”。\n\n下次再看到有博主晒“本地跑大模型”，别光跟着起哄看每秒跑多少个字。\n问三个问题：\n它绕开了哪堵内存墙？\nIt把谁的“租赁收入”，变成了我的“固定资产”？\n它把哪一部分智能，从科技巨头手里抢回了用户手里？\n\n能回答这三个问题的本地AI，才不是玩具。\n它是一场数字维度的私有化运动。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2066441685450490184","translated_status_id":"2066441685450490184","published_at":"2026-06-15 08:43:42","created_at":"2026-06-15T10:36:16.892351","url":"https://mubeitech.com/p/2066276671586513317","markdown_url":"https://mubeitech.com/p/2066276671586513317/markdown"},{"rank":2,"id":"mb-20260823-f590d9","account":"mubei","brand":"","title":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型","summary":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型","body":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型。\n跑出 47 tok/s 的推理速度，还顶着 400k 的超长上下文。\n很多人的第一反应是：这肯定把模型压成了人工智障。\n在过去的认知里，把超大模型塞进个人电脑，唯一的方法是死磕量化。\n把权重从 16 位浮点数一路压到 4 位、3 位，甚至 2 位。\n但单维度的压缩很快就会撞墙。\n位宽压得太狠，量化误差指数级爆发，模型直接开始胡言乱语。\n另一条路是剪枝。\n可传统密集模型的剪枝同样行不通：零散剔除的权重破坏了规整的矩阵结构，显卡根本跑不出硬件加速。\n两边都走不通，很多人便认定：顶级算力永远只能锁在云端机房。\n为什么 4700 美元的桌面设备能把这堵墙撞碎？\n因为真正的突破，从来不在单一维度上硬挤。\n它把两台方向完全不同的压缩机器叠在了一起。\n这台机器叫正交压缩。\n混合专家模型架构给算法提供了一个前所未有的结构切口。\n在这种架构里，模型是由数十个甚至上百个细分专家组成的网络。\n每生成一个词，真正被激活的只有少数几个专家。\n开源开发者 0xSero 借助 REAP 专家激活剪枝算法，先给所有专家跑了一轮校准。\n算法找出了那些在绝大多数任务中几乎从不响应的低频专家，整块剥离。\n整整 18.5% 的结构冗余被干脆利落地砍掉，而每个词调用的核心专家预算完好无损。\n这是第一步：在结构维度上剔除闲置专家。\n紧接着，在剩下的骨干专家身上，套上 turboderp 开发的 EXL3 算法，进行 3-bit 精度量化。\n这是第二步：在数值维度上压缩权重的位宽。\n两个动作是正交的。\n剪枝清理的是结构冗余，量化清理的是数值冗余。\n因为攻击的是两个互不干扰的独立维度，两者的压缩收益直接相乘，却避开了单一技术推向极限时的崩塌风险。\n显存占用被砍掉了一大截，每秒吞吐量却保住了。\n算力行业过去几年一直在制造一种云端垄断的恐慌。\n数千亿美元砸进集中式算力中心，普通人似乎只能按字数向云端服务器交租。\n但计算技术的演进，从来不会单向偏向中心化。\n算法在正交维度的每一次解耦，都在以乘数效应拉低硬件的成本底线。\n当一台桌面级的消费硬件，就能流畅运转过去需要整个机架才能支撑的智能。\n算力的主权，就不再只能被锁在巨头的数据中心里。\n决定智能普及速度的，不只是巨头烧了多少资本开支。\n更在底层算法如何把昂贵的门槛，一步步砸进每个普通开发者的书桌。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:49","created_at":"2026-08-23 00:21:49","url":"https://mubeitech.com/p/mb-20260823-f590d9","markdown_url":"https://mubeitech.com/p/mb-20260823-f590d9/markdown"},{"rank":3,"id":"2080394326744400301","account":"mubei","brand":"@mubei","title":"你的电脑，以后不只是拿来跑本地模型了。 它会变成一个微型的算力节点。 门槛有多高？ 在Buzz里点一下鼠标就行。 打开开…","summary":"你的电脑，以后不只是拿来跑本地模型了。 它会变成一个微型的算力节点。 门槛有多高？ 在Buzz里点一下鼠标就行。 打开开关，你本地部署的大模型，立刻就能对Agent（智能体）和其他人开放。 看看这台机器的底子。 苹果M5 Max芯片，配上128GB的AI专属内存。 这个级别的个人…","body":"你的电脑，以后不只是拿来跑本地模型了。\n它会变成一个微型的算力节点。\n\n门槛有多高？\n在Buzz里点一下鼠标就行。\n打开开关，你本地部署的大模型，立刻就能对Agent（智能体）和其他人开放。\n\n看看这台机器的底子。\n苹果M5 Max芯片，配上128GB的AI专属内存。\n这个级别的个人硬件能装下什么？\n48GB的Qwen3，47GB的Qwen2.5-72B，还有43GB的Llama-3.3和DeepSeek-R1。\n一排重磅的开源大模型，在这台电脑上全部显示“完美适配”。\n\n把这些庞然大物塞进个人电脑，绝不是为了当单机玩具。\n真正厉害的是它的底层调度机制。\n一旦开启共享，你的Agent会自动去网络池子里，挑那个最大、最合适的模型来干活。\n\n这是一种全新的玩法。\n你的闲置算力，变成了整个网络的推理资源。\n算力不再只锁在云端大厂的机房里。\n只要你愿意，你的电脑就是下一台服务器。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2080465507065495817","translated_status_id":"2080465507065495817","published_at":"2026-07-24 00:06:47","created_at":"2026-07-24T02:01:17+02:00","url":"https://mubeitech.com/p/2080394326744400301","markdown_url":"https://mubeitech.com/p/2080394326744400301/markdown"},{"rank":4,"id":"2056329013971517735","account":"mubei","brand":"@mubei","title":"拔掉网线，全程断网单机运行 2000 亿参数的 AI 模型。 跑这套系统的设备有多大？ 一只手就能稳稳托住。 AMD 拿…","summary":"拔掉网线，全程断网单机运行 2000 亿参数的 AI 模型。 跑这套系统的设备有多大？ 一只手就能稳稳托住。 AMD 拿出了目前全球最小的 AI 开发系统。 苏姿丰直接把这台主机端了出来。 里面塞进了他们最高端的 Ryzen AI Max 处理器。 搭配的是 128GB 高速统一…","body":"拔掉网线，全程断网单机运行 2000 亿参数的 AI 模型。\n跑这套系统的设备有多大？\n一只手就能稳稳托住。\n\nAMD 拿出了目前全球最小的 AI 开发系统。\n苏姿丰直接把这台主机端了出来。\n里面塞进了他们最高端的 Ryzen AI Max 处理器。\n搭配的是 128GB 高速统一内存。\n\n算力能装进巴掌大小的空间，靠的是底层架构设计。\n这 128GB 内存由 CPU、GPU 和 NPU 三方直接共享。\n省去了数据在不同模块间来回搬运的损耗。\n系统整体性能被大幅拉升。\n硬生生把跑大型 AI 模型的算力，压缩进了一台微型桌面台式机里。\n\n大模型的硬件门槛正在被物理击穿。\n跑千亿参数模型曾经必须依赖庞大的云端机房。\n现在直接变成了摆在桌面上的一台离线私有设备。","category":"科技","score":83.3,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-05-18 12:07:21","created_at":"2026-05-18T13:00:16+02:00","url":"https://mubeitech.com/p/2056329013971517735","markdown_url":"https://mubeitech.com/p/2056329013971517735/markdown"},{"rank":5,"id":"2039834243598025082","account":"mubei","brand":"@mubei","title":"跑不动几千亿参数的大模型怎么办？ 借别人的闲置显卡拼一拼。 Jack Dorsey 的 Block 刚刚发布了 mesh…","summary":"跑不动几千亿参数的大模型怎么办？ 借别人的闲置显卡拼一拼。 Jack Dorsey 的 Block 刚刚发布了 mesh-llm。 这是一个完全去中心化的 P2P 算力网络。 专门帮普通人跑巨型开源 AI 模型。 没有中央服务器。 也不需要去大厂租昂贵的云服务。 你的闲置 GPU…","body":"跑不动几千亿参数的大模型怎么办？\n借别人的闲置显卡拼一拼。\n\nJack Dorsey 的 Block 刚刚发布了 mesh-llm。\n这是一个完全去中心化的 P2P 算力网络。\n专门帮普通人跑巨型开源 AI 模型。\n没有中央服务器。\n也不需要去大厂租昂贵的云服务。\n\n你的闲置 GPU 可以立刻变成分布式计算节点。\n节点之间直接通信。\n用 Nostr 协议在网络里寻找彼此。\n底层基于最硬核的 llama.cpp 构建。\n代码全部遵循 MIT 协议开源。\n\n这套运作逻辑和比特币一模一样。\n完全开放，零门槛接入。\n没人能封锁你的账号。\n也没人能拔掉整个网络的网线。\n\n硅谷的云厂商还在疯狂囤积算力建围墙。\n真正的极客已经开始从底层拆解算力垄断。\n巨头们最怕的永远不是另一个巨头。\n而是这种一旦蔓延就无法被关停的去中心化野草。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2040021225179611486","translated_status_id":"2040021225179611486","published_at":"2026-04-03 10:39:55","created_at":"2026-04-03T12:37:23.536124","url":"https://mubeitech.com/p/2039834243598025082","markdown_url":"https://mubeitech.com/p/2039834243598025082/markdown"},{"rank":6,"id":"mb-20260822-7f8f71","account":"mubei","brand":"","title":"本地运行的 AI 模型，已经能把 89% 的日常问答和逻辑推理，解决得和云端顶级旗舰模型一样好","summary":"本地运行的 AI 模型，已经能把 89% 的日常问答和逻辑推理，解决得和云端顶级旗舰模型一样好","body":"本地运行的 AI 模型，已经能把 89% 的日常问答和逻辑推理，解决得和云端顶级旗舰模型一样好。\n这不是小范围测试的体感。\n斯坦福大学与 Together AI 追踪测试了 20 多个本地模型，跑了超过 100 万条真实用户提问。\n2023 年，本地模型的匹配率还只有 23.2%。\n2025 年，飙升到 71.3%。\n到了 2026 年，这个数字直接跨过了 89%。\n很多人以为，这只是小模型在死记硬背参数。\n决定胜负的其实不是参数规模。\n真正推动这场迁移的，是一台在半导体历史上运转了六十年的老机器。\n这台机器叫库梅定律（Koomey's Law）。\n物理学家乔纳森·库梅（Jonathan Koomey）总结过半导体历史上的一条硬规律：每消耗一焦耳能量所能完成的计算量，每 1.57 年就会翻一倍。\n六十年前，正是这条能效曲线，把占满一整间机房的 IBM 大型机，一步步压缩成了桌上的个人电脑，最后塞进了每个人的口袋。\n如今，同样的物理轨迹落到了 AI 头上。\n风险投资人 Tomasz Tunguz 梳理过一组数据：过去两年，本地 AI 模型的每瓦智能暴增了 5.3 倍。\n其中算法和架构优化贡献了 3.1 倍。\n芯片硬件能效提升贡献了 1.7 倍。\n当每瓦电量能榨出的智能以这种斜率狂飙，算力就不再必须依附于集中式的数据中心。\n过去三年，科技巨头向公众灌输的叙事是一场无限膨胀的云端军备竞赛。\n上千亿美元砸进算力中心，电力消耗直逼核电站。\n所有人似乎都只能通过网络，向少数几个中心服务器租用智慧。\n但计算技术的发展史，从来不倾向于把所有人永远锁在中心机房。\n耗费数万张芯片的基座训练，以及极限前沿的科研探索，确实属于云端剩下的 11%。\n可普通人 89% 的日常需求，根本不需要把数据送到半个地球之外去排队。\n本地芯片免去了跨网络搬运数据的延迟和带宽税。\n个人数据完整留在本地设备，隐私不用交出。\n更关键的是，边际电费和推理成本被直接打到了接近于零。\n云端巨头靠垄断算力向全社会收租的护城河，正在被终端芯片的能效曲线一点点抽空。\n技术史上最剧烈的权力转移，从来不在谁拥有最大的中央机房。\n在能效曲线什么时候把昂贵的特权，压缩成手边触手可及的日常工具。\n当曾经属于超级计算机的智能被无声塞进个人终端，中心化的算力霸权，往往就是这样从底层被彻底解构的。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-22 17:07:24","created_at":"2026-08-22 17:07:24","url":"https://mubeitech.com/p/mb-20260822-7f8f71","markdown_url":"https://mubeitech.com/p/mb-20260822-7f8f71/markdown"}]}