{"source":{"id":"2056329013971517735","title":"拔掉网线，全程断网单机运行 2000 亿参数的 AI 模型。 跑这套系统的设备有多大？ 一只手就能稳稳托住。 AMD 拿…","url":"https://mubeitech.com/p/2056329013971517735"},"method":"semantic-similarity","count":6,"items":[{"rank":1,"id":"2066276671586513317","account":"mubei","brand":"@mubei","title":"Lisa Su手里那台巴掌大的小机器，能跑2000亿参数的大模型。 但它最吓人的地方，是悄悄把AI的“产权关系”给改了。…","summary":"Lisa Su手里那台巴掌大的小机器，能跑2000亿参数的大模型。 但它最吓人的地方，是悄悄把AI的“产权关系”给改了。 来，聊聊我们以前是怎么被“云端大厂”拿捏的。 以前你用ChatGPT或者Claude，本质上都是在“租”。 模型在别人机房里。 算力在别人账本上。 上下文在别…","body":"Lisa Su手里那台巴掌大的小机器，能跑2000亿参数的大模型。\n但它最吓人的地方，是悄悄把AI的“产权关系”给改了。\n\n来，聊聊我们以前是怎么被“云端大厂”拿捏的。\n以前你用ChatGPT或者Claude，本质上都是在“租”。\n模型在别人机房里。\n算力在别人账本上。\n上下文在别人服务器里。\n价格、限额、审查、封号、降智，全在平台一句话。\n你以为自己买的是“智能”，其实买的是一段随时能被掐断的“临时通行权”。\n\n现在，这个权力结构开始塌方了。\n2026年，AMD现场演示了一个名场面：\n四台手掌大小的Ryzen AI Max+ 395小盒子，通过llama.cpp RPC组成了本地集群。\n直接在本地，断网跑起了1T（一万亿）参数级别的Kimi K2.5。\n大模型正在从昂贵的数据中心，疯狂往你的书桌上回流。\n\n这背后，是一个被撞了三十年的“内存墙”。\n1995年，学术界就提过一个概念：Hitting the Memory Wall（撞上内存墙）。\n意思很简单：芯片算得越来越快，内存喂数据的速度却跟不上。\n跑AI最怕这个。\n模型权重太大，每生成一个字，都要把海量参数从内存里“搬”出来走一遍。\n数据在路上堵车，芯片再强，也只能干等。\n\n所以，本地跑大AI的瓶颈在内存，不在算力。\nAMD这台小机器，真正的杀手锏是128GB的统一内存。\nCPU、GPU和NPU不再分家，不用来回倒数据，直接共用一个超高速的大池子。\n这相当于把最昂贵的“数据搬运税”，一刀砍没了。\n\n再加上GGUF量化技术，把模型从16位压缩到4位、5位，牺牲一点点精度，换来体积暴缩。\n配合Mixture of Experts（混合专家模型），比如Qwen3-235B，看似是个2350亿参数的怪兽，其实每次推理只激活22B。\n一减一加。\n“能不能跑大模型”的门槛，直接从“你有没有一整个数据中心”，变成了“你有没有一个足够大的本地内存池”。\n\n这就是权力的重新洗牌。\n云端AI像自来水。\n你随用随付，看似方便。\n但水表在别人手里，水质随时被过滤，想停你水就停你水。\n本地AI像自家发电机。\n买的时候贵一点，用起来麻烦一点。\n但一旦转起来，开不开、跑什么、数据留给谁，全是你说了算。\n\nAI正在从“服务”退回到“资产”。\n服务的核心是访问权。\n资产的核心是所有权。\n只有当大模型能装进你的机器，数据能留在你的硬盘，你和你的小公司，才算第一次真正拥有了自己的“智能主权”。\n\n下次再看到有博主晒“本地跑大模型”，别光跟着起哄看每秒跑多少个字。\n问三个问题：\n它绕开了哪堵内存墙？\nIt把谁的“租赁收入”，变成了我的“固定资产”？\n它把哪一部分智能，从科技巨头手里抢回了用户手里？\n\n能回答这三个问题的本地AI，才不是玩具。\n它是一场数字维度的私有化运动。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2066441685450490184","translated_status_id":"2066441685450490184","published_at":"2026-06-15 08:43:42","created_at":"2026-06-15T10:36:16.892351","url":"https://mubeitech.com/p/2066276671586513317","markdown_url":"https://mubeitech.com/p/2066276671586513317/markdown"},{"rank":2,"id":"2061509361470497138","account":"mubei","brand":"@mubei","title":"把128GB统一内存塞进轻薄本，英伟达发布 RTX Spark 超级芯片，直接重塑 Windows PC 的天花板。 里…","summary":"把128GB统一内存塞进轻薄本，英伟达发布 RTX Spark 超级芯片，直接重塑 Windows PC 的天花板。 里面装的是 Blackwell RTX GPU 和 Grace CPU。 加上这128GB的统一内存，这台机器能直接在本地跑起巨大的 AI 模型。 速度极快，且数…","body":"把128GB统一内存塞进轻薄本，英伟达发布 RTX Spark 超级芯片，直接重塑 Windows PC 的天花板。\n\n里面装的是 Blackwell RTX GPU 和 Grace CPU。\n加上这128GB的统一内存，这台机器能直接在本地跑起巨大的 AI 模型。\n速度极快，且数据完全私密。\n不再需要把敏感素材传给云端，你的笔记本就是一个算力堡垒。\n\n用 AI 创作的门槛，被直接踩平了。\n觉得 ComfyUI 节点太复杂、太反人类，可以直接让内置的 AI 代理 OpenClaw 替你干活。\n输入几句话，它自己去调参数、写提示词。\n从一张草图生成材质效果，再直接用它做起始帧生成视频，全部本地一气呵成。\n\n创作者的性能瓶颈也被碾碎了。\n靠着这巨大的内存，你能直接剪辑 12K 4:2:2 的视频。\n或者渲染高达 90GB 的巨型场景。\n在 Blender 里，有了 DLSS 4.5 光线重建技术的加持。\n你在场景里随意拖动，就能实时看到几乎等同于最终渲染的画质。\n\n至于游戏，那可是英伟达的老本行。\n《心灵杀手 2》、Pragmata 等游戏，直接在 1600p 分辨率下光追全开。\nDLSS 4.5 里的新 Transformer 模型，把环境细节拉到了新高度。\n更别说它原生支持带有反作弊系统的多人联机游戏。\n\n真正的个人计算新形态已经来了。\n不再依赖网络带宽，不再忍受云端延迟。\n装载这颗芯片的新型轻薄本和紧凑型台式机，今年秋天就会出货。\n本地算力的狂欢，正式开场。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2061535841252425750","translated_status_id":"2061535841252425750","published_at":"2026-06-01 18:54:08","created_at":"2026-06-01T20:47:19.993247","url":"https://mubeitech.com/p/2061509361470497138","markdown_url":"https://mubeitech.com/p/2061509361470497138/markdown"},{"rank":3,"id":"2080394326744400301","account":"mubei","brand":"@mubei","title":"你的电脑，以后不只是拿来跑本地模型了。 它会变成一个微型的算力节点。 门槛有多高？ 在Buzz里点一下鼠标就行。 打开开…","summary":"你的电脑，以后不只是拿来跑本地模型了。 它会变成一个微型的算力节点。 门槛有多高？ 在Buzz里点一下鼠标就行。 打开开关，你本地部署的大模型，立刻就能对Agent（智能体）和其他人开放。 看看这台机器的底子。 苹果M5 Max芯片，配上128GB的AI专属内存。 这个级别的个人…","body":"你的电脑，以后不只是拿来跑本地模型了。\n它会变成一个微型的算力节点。\n\n门槛有多高？\n在Buzz里点一下鼠标就行。\n打开开关，你本地部署的大模型，立刻就能对Agent（智能体）和其他人开放。\n\n看看这台机器的底子。\n苹果M5 Max芯片，配上128GB的AI专属内存。\n这个级别的个人硬件能装下什么？\n48GB的Qwen3，47GB的Qwen2.5-72B，还有43GB的Llama-3.3和DeepSeek-R1。\n一排重磅的开源大模型，在这台电脑上全部显示“完美适配”。\n\n把这些庞然大物塞进个人电脑，绝不是为了当单机玩具。\n真正厉害的是它的底层调度机制。\n一旦开启共享，你的Agent会自动去网络池子里，挑那个最大、最合适的模型来干活。\n\n这是一种全新的玩法。\n你的闲置算力，变成了整个网络的推理资源。\n算力不再只锁在云端大厂的机房里。\n只要你愿意，你的电脑就是下一台服务器。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2080465507065495817","translated_status_id":"2080465507065495817","published_at":"2026-07-24 00:06:47","created_at":"2026-07-24T02:01:17+02:00","url":"https://mubeitech.com/p/2080394326744400301","markdown_url":"https://mubeitech.com/p/2080394326744400301/markdown"},{"rank":4,"id":"16749040","account":"mubei","brand":"@mubei","title":"本地运行AI的门槛，可能已经不是显卡了。 14 MB。 这是微型模型 Cactus Needle 2 的体积。 一共45…","summary":"本地运行AI的门槛，可能已经不是显卡了。 14 MB。 这是微型模型 Cactus Needle 2 的体积。 一共4500万个参数。 想跑动它，需要什么配置？ 大约 28 MB 的运行内存。 不需要显卡，不需要网络，甚至都不需要一台正经电脑。 别误会，它不是用来替代大模型帮你写…","body":"本地运行AI的门槛，可能已经不是显卡了。\n\n14 MB。\n这是微型模型 Cactus Needle 2 的体积。\n一共4500万个参数。\n\n想跑动它，需要什么配置？\n大约 28 MB 的运行内存。\n不需要显卡，不需要网络，甚至都不需要一台正经电脑。\n\n别误会，它不是用来替代大模型帮你写文章的。\n它的定位很明确：一个边缘设备上的微型智能体。\n主要干一件事：在本地调用工具，控制设备。\n\n把AI塞进各种微小硬件里，以前总得算计算力和内存。\n现在，没借口了。","category":"其它","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-11 21:32:43","created_at":"2026-08-11T23:22:15+02:00","url":"https://mubeitech.com/p/16749040","markdown_url":"https://mubeitech.com/p/16749040/markdown"},{"rank":5,"id":"mb-20260823-f590d9","account":"mubei","brand":"","title":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型","summary":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型","body":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型。\n跑出 47 tok/s 的推理速度，还顶着 400k 的超长上下文。\n很多人的第一反应是：这肯定把模型压成了人工智障。\n在过去的认知里，把超大模型塞进个人电脑，唯一的方法是死磕量化。\n把权重从 16 位浮点数一路压到 4 位、3 位，甚至 2 位。\n但单维度的压缩很快就会撞墙。\n位宽压得太狠，量化误差指数级爆发，模型直接开始胡言乱语。\n另一条路是剪枝。\n可传统密集模型的剪枝同样行不通：零散剔除的权重破坏了规整的矩阵结构，显卡根本跑不出硬件加速。\n两边都走不通，很多人便认定：顶级算力永远只能锁在云端机房。\n为什么 4700 美元的桌面设备能把这堵墙撞碎？\n因为真正的突破，从来不在单一维度上硬挤。\n它把两台方向完全不同的压缩机器叠在了一起。\n这台机器叫正交压缩。\n混合专家模型架构给算法提供了一个前所未有的结构切口。\n在这种架构里，模型是由数十个甚至上百个细分专家组成的网络。\n每生成一个词，真正被激活的只有少数几个专家。\n开源开发者 0xSero 借助 REAP 专家激活剪枝算法，先给所有专家跑了一轮校准。\n算法找出了那些在绝大多数任务中几乎从不响应的低频专家，整块剥离。\n整整 18.5% 的结构冗余被干脆利落地砍掉，而每个词调用的核心专家预算完好无损。\n这是第一步：在结构维度上剔除闲置专家。\n紧接着，在剩下的骨干专家身上，套上 turboderp 开发的 EXL3 算法，进行 3-bit 精度量化。\n这是第二步：在数值维度上压缩权重的位宽。\n两个动作是正交的。\n剪枝清理的是结构冗余，量化清理的是数值冗余。\n因为攻击的是两个互不干扰的独立维度，两者的压缩收益直接相乘，却避开了单一技术推向极限时的崩塌风险。\n显存占用被砍掉了一大截，每秒吞吐量却保住了。\n算力行业过去几年一直在制造一种云端垄断的恐慌。\n数千亿美元砸进集中式算力中心，普通人似乎只能按字数向云端服务器交租。\n但计算技术的演进，从来不会单向偏向中心化。\n算法在正交维度的每一次解耦，都在以乘数效应拉低硬件的成本底线。\n当一台桌面级的消费硬件，就能流畅运转过去需要整个机架才能支撑的智能。\n算力的主权，就不再只能被锁在巨头的数据中心里。\n决定智能普及速度的，不只是巨头烧了多少资本开支。\n更在底层算法如何把昂贵的门槛，一步步砸进每个普通开发者的书桌。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:49","created_at":"2026-08-23 00:21:49","url":"https://mubeitech.com/p/mb-20260823-f590d9","markdown_url":"https://mubeitech.com/p/mb-20260823-f590d9/markdown"},{"rank":6,"id":"2050387634091168184","account":"mubei","brand":"@mubei","title":"英伟达的本地 AI 推理盒子 DGX Spark 卖 4699 美元。 因为全球内存荒，前阵子刚涨了 700 刀。 AM…","summary":"英伟达的本地 AI 推理盒子 DGX Spark 卖 4699 美元。 因为全球内存荒，前阵子刚涨了 700 刀。 AMD 看准机会，直接掀桌子。 6 月，AMD 要推一台叫 Halo Box 的 Mini PC。 死磕平价个人推理市场。 价格预估两千到三千美元之间。 硬件参数直…","body":"英伟达的本地 AI 推理盒子 DGX Spark 卖 4699 美元。\n因为全球内存荒，前阵子刚涨了 700 刀。\nAMD 看准机会，直接掀桌子。\n\n6 月，AMD 要推一台叫 Halo Box 的 Mini PC。\n死磕平价个人推理市场。\n价格预估两千到三千美元之间。\n\n硬件参数直接顶格。\nRyzen AI MAX+ 395 芯片，16 核 Zen 5 加上 40 组 RDNA 3.5 核心。\n最要命的是那 128GB 的 LPDDR5X-8533 统一内存。\n这台不到三千刀的小黑盒，能在本地硬啃 2000 亿参数的 AI 模型。\n软件层面全盘接入 ROCm，首发直接给满模型优化。\n\n为什么挑这个时候动手？\n现在内存颗粒厂全在疯狂造 HBM 供数据中心，消费级内存价格一路狂飙。\n英伟达顶不住成本涨价。\nAMD 却靠着供应链的话语权拿到了足够的内存配额。\n赶在涨价潮彻底失控前，卡死这块高内存 AI 主机的生态位。\n\n桌面级 AI 开发市场的肉搏战，现在才刚开始。","category":"其它","score":100,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-05-03 13:34:36","created_at":"2026-05-03T15:33:09.023720","url":"https://mubeitech.com/p/2050387634091168184","markdown_url":"https://mubeitech.com/p/2050387634091168184/markdown"}]}