{"source":{"id":"mb-20260829-e4e799","title":"让全世界闲置的手机在晚上插着电，连成一台超级计算机跑大模型，还能每天给机主发钱","url":"https://mubeitech.com/p/mb-20260829-e4e799"},"method":"semantic-similarity","count":6,"items":[{"rank":1,"id":"mb-20260827-db52ed","account":"mubei","brand":"","title":"每天吞吐 18.4 万亿个 Token 的大模型推理市场，正撕开一条极度残酷的价值断层","summary":"每天吞吐 18.4 万亿个 Token 的大模型推理市场，正撕开一条极度残酷的价值断层","body":"每天吞吐 18.4 万亿个 Token 的大模型推理市场，正撕开一条极度残酷的价值断层。\n一边吞下了全网超过 50% 的流量，最后只分到不到 5% 的钱。\n一边只跑了 3.8% 的 Token，却卷走了全行业将近 30% 的现金流。\n这笔账是怎么算出来的？\n云成本分析平台 Vantage 的创始人 Ben Schaechter，把大模型聚合路由平台 OpenRouter 上 103 家供应商、242 个模型的每日真实消耗翻译成了美元账单。\n整个市场每天在这个平台上烧掉 1700 万美元，年化支出超过 62 亿美元。\n但掀开总账看流水，里面的贫富差距让人触目惊心。\n托管开源权重的算力供应商，正在海量吞吐中走向集体失血。\n小米、腾讯、DeepInfra、Novita 这些服务商，每天扛着数万亿级别的 Token 洪峰。\n但它们的平均定价，已经被杀到了每百万 Token 只要 0.18 美元，有的甚至低到 0.04 美元。\n跑了全网大半的流量，每天进账只有区区几万到十几万美元。\n反观另一头。\nAnthropic 的前沿模型，在平台上占的 Token 份额只有 3.8%。\n但它通过 AWS Bedrock、自身平台和直接接口，每天从这个池子里卷走 459 万美元，年化现金流接近 17 亿美元。\nOpenAI 拿了 6.9% 的流量，每天分走 326 万美元。\n为什么干最多苦力的算力商分不到钱，而少数几个寡头可以用个位数的流量卷走六成以上的利润？\n底下运转的，是一台经济学在一百多年前就写明了的冰冷机器。\n伯特兰商品化陷阱。\n1883 年，法国经济学家约瑟夫·伯特兰提出了一个著名的悖论：\n只要市场上存在两家以上生产完全同质化产品的厂商，而且消费者的转换成本为零，价格战就会瞬间爆发，直到把价格压到边际成本为止。\n此时哪怕市场需求再庞大，所有超额利润也会彻底归零。\n这正是开源模型托管商今天面对的死局。\n当开源模型的权重对所有人公开，各家算力商部署的模型完全一样。\n而 OpenRouter 这类聚合路由器，把所有模型封装进了统一的标准接口。\n对开发者而言，切换供应商的成本变成了零，只需要在代码里改一行配置，甚至让路由器自动挑最便宜的节点。\n于是上百家算力商瞬间跌进了伯特兰价格战的绞肉机。\n显卡是买来的，电力是硬成本，代码是开源的，接口是通用的。\n没有任何一家敢提价一分钱，因为只要贵了 0.01 美元，路由算法就会在下一毫秒把所有流量切给隔壁。\n它们成了彻底的算力苦力，在边际成本的泥潭里互砍到皮包骨头。\n真正能逃脱这台绞肉机的，只有不可替代的前沿独占能力。\n开发者用 Claude Opus 或 GPT-5，是因为市面上没有第二家能托管完全相同的专有智能。\n这种不可替代性，让闭源寡头拥有绝对的定价权，可以把价格定在每百万 Token 6 到 8 美元，相当于开源托管价格的 40 倍到 100 倍。\n标准化接口让流量变得极其廉价，却让真正的垄断壁垒变得更加昂贵。\n算力本身从来不是护城河。\n当底层工具把一切搬运成本降为零的时候，跑在上面的同质化资产就会被无情清空溢价。\n最终能留在牌桌上数钱的，永远不是替别人搬砖的通道，是那块别人搬不走的石头。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-27 22:36:41","created_at":"2026-08-27 22:36:41","url":"https://mubeitech.com/p/mb-20260827-db52ed","markdown_url":"https://mubeitech.com/p/mb-20260827-db52ed/markdown"},{"rank":2,"id":"mb-20260827-c46740","account":"mubei","brand":"","title":"训一个几千亿参数的大模型，上万张最顶级的显卡，有一大半时间根本没在算","summary":"训一个几千亿参数的大模型，上万张最顶级的显卡，有一大半时间根本没在算","body":"训一个几千亿参数的大模型，上万张最顶级的显卡，有一大半时间根本没在算。\n算力租金按秒扣费，电表飞速打转，机房风扇震耳欲聋。\n但芯片的浮点运算单元，却在成片成片地熄火发呆。\n业界的真实数字冷冰冰摆在那里。\n哪怕是顶尖实验室，模型算力利用率通常也只有 35% 到 43%。\n剩下的六成算力，蒸发去了哪里？\n是算法写得太慢，还是代码逻辑不够优化？\n为什么在 Python 里写得整整齐齐的线性代码，扔进上万张显卡之后，会碎成一地残渣？\n这台让万亿资本买来的算力大面积瘫痪的机器，叫通信重叠与关键路径气泡。\n要看懂这台机器，先看单张显卡和集群的本质区别。\n单张显卡训练很简单：数据喂进显存，核心埋头计算。\n但千亿参数的大模型，根本塞不进任何单张显卡的显存。\n工程师必须把模型生生切碎，分摊到几千甚至上万张显卡上。\n张量并行把每一层的矩阵乘法横竖切开。\n全分片数据并行把模型参数、梯度和优化器状态彻底剥离。\n专家并行和上下文并行把海量参数和数十万字的序列切散。\n这种切分带来了一个致命代价。\n任何一张显卡想要算下一层网络，必须先等别的显卡把中间结果传过来。\n在硬件底层，显卡从来不是按代码顺序单线推进的。\n它跑在两条平行的硬件轨道上。\n一条是负责矩阵乘法的高速计算流。\n一条是负责跨卡数据搬运的通信流。\n这两条轨道在时间线上贴身肉搏。\n最理想的状态，是当前层在计算流里疯狂运转时，下一层要用的参数已经在通信流里提前搬运完毕。\n这在工程上叫计算与通信重叠。\n只要算力跑完的瞬间数据刚好到位，跨卡通信的耗时就被彻底藏在计算背后。\n但物理现实没有这么仁慈。\n跨机柜的光纤只要有一丝抖动，或者层与层之间的依赖拓扑解不开，通信就会慢上几个微秒。\n一旦计算流算完了，而通信流的数据还没送达，硬件同步机制会瞬间踩下急刹车。\n在底层的执行轨迹图上，显卡会留下一大片空白。\n工程上把这片空白叫气泡。\n只要这个气泡落在了决定整体速度的关键路径上，几万张每小时烧掉几万美元的显卡，就必须集体陪着它原地发呆。\nAI 研究者 Vlad Savinov 拆解过 PyTorch 官方分布式训练框架 torchtitan 的真实底层轨迹。\n把掩盖在代码背后的底层事件拉平在时间轴上，才能看清真相。\n算力根本不是平铺直叙的流水线，是一张充满阻塞、等待与抢跑的有向无环图。\nMeta 训练 4050 亿参数的 Llama 3.1 时，动用了 1.6 万张 H100 显卡。\n即便用尽了交错流水线调度、异步张量并行与微块切分，把能重叠的通信全部塞进计算缝隙，整体算力利用率依然被锁在 40% 左右。\n这就是为什么 AI 军备竞赛的底层法则正在发生质变。\n很多人看算力竞争，习惯盯着谁买了十万张显卡，以为算力是简单的乘法累加。\n在超大规模分布式系统里，算力遵循的是残酷的拓扑规律。\n芯片堆得越多，通信复杂度的爆炸速度就越快，时间轴上的气泡就越难被压平。\n真正拉开顶尖实验室差距的，从来不是买显卡的支票厚度。\n是在微秒级的时间轴上，把跨卡通信死死压进计算缝隙里的工程编排能力。\n谁能把通信完全藏进阴影里，谁就能用一半的芯片跑出对手两倍的速度。\n藏不住通信的，买再多显卡，也不过是在高昂的电费账单里，养了一大堆在网线面前排队发呆的昂贵发热器。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-27 11:28:33","created_at":"2026-08-27 11:28:33","url":"https://mubeitech.com/p/mb-20260827-c46740","markdown_url":"https://mubeitech.com/p/mb-20260827-c46740/markdown"},{"rank":3,"id":"mb-20260828-b06641","account":"mubei","brand":"","title":"曾把全行业逼到斩杀线上的低价神话，自己先扛不住峰值流量涨价了","summary":"曾把全行业逼到斩杀线上的低价神话，自己先扛不住峰值流量涨价了","body":"曾把全行业逼到斩杀线上的低价神话，自己先扛不住峰值流量涨价了。\n2026 年 8 月，大模型 API 历史上第一次出现了错峰用电式的分时加价。\n过去跑上几十轮智能体任务的低价红利，瞬间被翻倍的账单打回原形。\n但就在行业集体上调调用费的当口，阿里和智谱同日放出了新模型。\n定价没有跟涨，反而直接砍到了前代模型的十分之一。\n为什么当所有人都以为降价只能靠烧钱倒贴时，有人却能越压越低？\n是巨头家底厚敢于流血补贴，还是大模型的成本逻辑从根上被换掉了？\n把这笔账顺着物理极限拆到底，会看到一台正在重塑整个 AI 产业的冷酷机器。\n架构级算力解耦。\n2026 年，超大规模云厂商在推理上的资本开支，历史上第一次超过了训练开支。\n过去的竞赛，比的是谁能堆出更大的参数规模和更高的跑分。\n只要买得起上万张算力卡，参数就能翻倍。\n现在的真实战场，彻底转移到了每一个智能体任务的落地成本。\n当一个任务需要模型自主调用几十次工具、吞吐上百万 token 上下文时，哪怕每百万 token 差几分钱，乘上循环深度都会变成难以承受的开销。\n靠资本补贴降价的模式，在万亿级真实调用的冲击下，必然会撞上财务斩杀线。\n唯一的生路，是在底层架构上把计算量、数据搬运和显存占用三者彻底解开。\n第一个瓶颈是注意力机制的二次方计算税。\n序列越长，计算量呈二次方暴涨。\n更致命的是数据搬运：预填充阶段卡算力，逐字解码阶段卡显存带宽。\n传统稀疏注意力为了找出哪些上下文重要，本身还要跑一套索引计算，序列越长，索引自身的开销越重。\nQwen3.8-Flash 采用的解法，是门控 Delta 网络与自研 QSA 稀疏注意力的混合结构。\n四分之三的层用线性注意力压缩隐状态，四分之一的全局层用 QSA。\nQSA 直接在微型块级别估算重要性，把寻找上下文的索引成本一并压缩掉。\n在 100 万 token 上下文下，预填充提速 7.6 倍，解码提速 4.9 倍。\n智谱 GLM-5.3-Flash 则用稀疏与线性混合架构配上 IndexPool，把 4 个索引缓存向量聚合成 1 个，注意力计算量直接压低了 3 倍。\n第二个瓶颈是显存墙对大参数的锁死。\n大模型需要海量参数承载知识，但参数越多，显存开销越恐怖。\n传统混合专家虽然降低了每次激活的参数量，却依然要把所有参数常驻在昂贵的 GPU 显存里。\nQwen3.8-Flash 在总参数 125B、激活仅 6B 的基础上，额外开辟了一个 51B 的局部短语嵌入表。\n这 51B 参数只取决于输入的文字序列，在模型开始计算前就能确定寻址。\n它们被直接存放在廉价的主机内存，通过异步预取和计算并行重叠，完全不占用 GPU 显存，也不消耗每 token 的矩阵乘预算。\n参数变大了，知识变多了，昂贵的显存税却被绕了过去。\n第三个瓶颈是残差连接的单车道拥堵。\n过去十年，所有网络层都在共享同一条残差流。\n网络越深，早期输入的关键信息越容易在深层被混合稀释。\n新架构把残差流拆解成四条并行车道，通过门控机制让模型动态分流。\n早期信息获得了一条直通深层的专用通道，让 6B 或 18B 的小激活参数爆发出比肩数百亿参数的推理表现。\n配合将动量矩阵正交化的 Muon 优化器，训练开销直接降至前代九分之一。\n在工程落地端，智谱甚至用国产芯片集群承载了数万亿 token 的盲测流量，把多模态编码、预填充和解码拆成独立工作池，端到端性能拉升 3 倍，单 token 成本追平主流英伟达 GPU。\n这推翻了行业过去对算力需求的悲观预期。\n很多人以为模型变便宜会让 GPU 需求见顶。\n杰文斯悖论给出了相反的答案：当每次调用的边际成本逼近零，省下的预算不会被收回，会催生百倍、千倍的智能体自主运行。\n大模型的竞争指标，已经从每百万 token 单价，彻底转向了单次任务的完成成本。\n靠资本补贴撑起来的低价，总有被流量反噬的一天。\n把物理瓶颈拆碎、把架构效率压进底层的解法，才是价格战里唯一的底牌。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-28 12:02:19","created_at":"2026-08-28 12:02:19","url":"https://mubeitech.com/p/mb-20260828-b06641","markdown_url":"https://mubeitech.com/p/mb-20260828-b06641/markdown"},{"rank":4,"id":"2039834243598025082","account":"mubei","brand":"@mubei","title":"跑不动几千亿参数的大模型怎么办？ 借别人的闲置显卡拼一拼。 Jack Dorsey 的 Block 刚刚发布了 mesh…","summary":"跑不动几千亿参数的大模型怎么办？ 借别人的闲置显卡拼一拼。 Jack Dorsey 的 Block 刚刚发布了 mesh-llm。 这是一个完全去中心化的 P2P 算力网络。 专门帮普通人跑巨型开源 AI 模型。 没有中央服务器。 也不需要去大厂租昂贵的云服务。 你的闲置 GPU…","body":"跑不动几千亿参数的大模型怎么办？\n借别人的闲置显卡拼一拼。\n\nJack Dorsey 的 Block 刚刚发布了 mesh-llm。\n这是一个完全去中心化的 P2P 算力网络。\n专门帮普通人跑巨型开源 AI 模型。\n没有中央服务器。\n也不需要去大厂租昂贵的云服务。\n\n你的闲置 GPU 可以立刻变成分布式计算节点。\n节点之间直接通信。\n用 Nostr 协议在网络里寻找彼此。\n底层基于最硬核的 llama.cpp 构建。\n代码全部遵循 MIT 协议开源。\n\n这套运作逻辑和比特币一模一样。\n完全开放，零门槛接入。\n没人能封锁你的账号。\n也没人能拔掉整个网络的网线。\n\n硅谷的云厂商还在疯狂囤积算力建围墙。\n真正的极客已经开始从底层拆解算力垄断。\n巨头们最怕的永远不是另一个巨头。\n而是这种一旦蔓延就无法被关停的去中心化野草。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2040021225179611486","translated_status_id":"2040021225179611486","published_at":"2026-04-03 10:39:55","created_at":"2026-04-03T12:37:23.536124","url":"https://mubeitech.com/p/2039834243598025082","markdown_url":"https://mubeitech.com/p/2039834243598025082/markdown"},{"rank":5,"id":"mb-20260828-277f87","account":"mubei","brand":"","title":"一个月 231 美元的 AI 订阅费，最后被压成了一张 4 块钱的电费单","summary":"一个月 231 美元的 AI 订阅费，最后被压成了一张 4 块钱的电费单","body":"一个月 231 美元的 AI 订阅费，最后被压成了一张 4 块钱的电费单。\n六个按月扣款的软件：ChatGPT Plus、Claude Pro、Midjourney、ElevenLabs、Perplexity、Cursor。\n只要你按停扣费，所有的工具瞬间消失，哪怕你已经连着交了三年。\n更别说你的每一行代码、每一段财务草稿、每一个半成熟的想法，都在往别人的服务器上送。\nSiraj Raval 做了个实验。\n他把这六个订阅全部退订。\n用一台 64GB 内存的普通笔记本，把整套生产力工具全部搬到了本地。\n跑了一个月，实测耗电成本：4 美元。\n很多人以为把前沿模型搬回本地，需要买一整个机房的显卡。\n为什么一台普通的消费级笔记本，能吃掉一个两百多美元的软件组合？\n因为数字世界里有一台运转了十年的商业机器，正在被物理定律撞出裂缝。\n这台机器叫「智力地租」。\n过去十年，软件行业最赚钱的商业模式是 SaaS。\n平台搭好一套云端系统，把工具切成碎片，按月向用户收租。\n在算力稀缺、模型庞大的时期，这种租赁是成立的。\n用户没有硬件跑大模型，只能向云端交过路费。\n但经济学里有一条硬规律：当一项生产力工具的边际运行成本被压缩到接近零，收租模式就会开始瓦解。\n经济学家杰里米·里夫金（Jeremy Rifkin）在 2014 年出版的《零边际成本社会》里，写过这条定律。\n只要生产资料的分发与运行成本逼近于零，中心化的租赁壁垒就必然向分布式的个人所有权让位。\n过去两年，三件事撞在了一起。\n一是开源模型的高密度突破。\nDeepSeek 等开源权重通过架构优化，把过去动辄几千亿参数的推理能力，压缩进了消费级硬件能承受的尺寸。\n二是量化技术与统一内存的成熟。\n开源社区的 GGUF 格式配合 Ollama 这类本地运行时，让 CPU 和 GPU 可以直接共用笔记本内存，绕开了昂贵的数据搬运税。\n三是开源工具链的完整闭环。\nOpen WebUI 接管日常对话。\nContinue 把代码助手直接接进编辑器，自动补全、重构逻辑，没有速率上限，也没有排队等待。\nwhisper.cpp 在本地转录每一场会议录音。\nPiper 负责毫秒级语音合成。\nComfyUI 在本地显卡上几十秒渲染出一张高清图片。\n本地智能体抓取网络数据撞上 403 封锁，用住宅代理按流量走，花几块钱就能解决。\n每天早上 7 点，本地脚本自动读取 RSS 订阅，两分钟生成晨报。\n白天每一通电话的录音，自动转录并沉淀进个人知识库。\n最关键的转变，甚至不在那笔省下来的钱。\n在安全感。\n当数据彻底不出这台机器，你不再对草稿、账目、商业机密做自我审查。\n你拥有的是完全属于自己的生产资料，不用看任何云端平台的封禁脸色。\n这并不意味着云端算力明天就会消失。\n客观事实依然清晰：在最难的 10% 极端任务上，比如超长链条的复杂推理、冷门生僻的底层代码排错，顶尖的闭源云端模型仍然更有优势。\n但这恰恰给出了一个明确的分水岭。\n那些最复杂的极端难题，留给按量计费的云端接口，用一次付几分钱。\n剩下 90% 占据日常大半时间的常规劳动，已经被开源生态完全推平了门槛。\n从「按月租用智力」，到「在本地拥有算力」。\n当一项技术的运行成本被彻底击穿，任何试图依靠垄断算力按月收租的高墙，最后都会被一张薄薄的电费单慢慢拆解。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-28 12:02:20","created_at":"2026-08-28 12:02:20","url":"https://mubeitech.com/p/mb-20260828-277f87","markdown_url":"https://mubeitech.com/p/mb-20260828-277f87/markdown"},{"rank":6,"id":"mb-20260823-ce0400","account":"mubei","brand":"","title":"一个独立开发者让 4 个 AI 智能体连续运转了 4 周","summary":"一个独立开发者让 4 个 AI 智能体连续运转了 4 周","body":"一个独立开发者让 4 个 AI 智能体连续运转了 4 周。\n任务是反编译 2009 年的经典游戏《使命召唤：现代战争2》。\n整个过程烧掉了 2350 亿个 Token。\n产生了大大小小超过 2GB 的会话日志。\n如果按大模型的官方 API 标价计费，这笔算力开销折合 85207 美元。\n当他把这 2GB 的运行日志完整导出来逐行审计时。\n当下 AI 圈子里最流行的一批架构直觉，被几乎全盘推翻。\n\n现在的工程师习惯怎么搭多智能体？\n疯狂派生子智能体去查资料，免得污染母体的上下文。\n给智能体塞满详尽的提示词，反复告诫它什么能做、什么不能做。\n迷信更贵、参数更大的模型，觉得写代码必须用顶配。\n\n但 2350 亿个 Token 跑出来的真实数据，完全是另一回事。\n\n子智能体并没有提升效率，反而在疯狂制造内耗。\n很多人以为把任务切给子智能体，母体能保持干净。\n日志审计却发现，子智能体从大文件里读取的内容，有 54.7% 是纯粹的重复数据。\n一个记录项目进度的 STATUS.md 文件，被 21 个子智能体来回读了 28 次。\n不同子智能体重复读取同一份文件的中位间隔，只有 35 分钟。\n如果让母体自己查，文件一直在上下文缓存里，根本不需要反复重新加载。\n子智能体之间没有共享记忆，隔离上下文省下的空间，全变成了成倍交纳的重复读取税。\n作者把子智能体彻底关掉之后，团队的日均提交量没有下滑，反而从 243 次跳升到了 311 次。\n\n靠提示词规劝智能体，几乎全在白费力气。\n智能体写完几行代码，就会忍不住在本地跑一遍耗时 4 分钟的完整测试。\n开发者在提示词里严厉禁止它本地测试，要求全部交给云端流水线。\n智能体最多听话 5 分钟，随后立刻故态复萌。\n要求它说话简短、要求它提交后不要反复确认任务，只要经过几次上下文压缩，这些规则就会被彻底抛到脑后。\n软性的语言规劝，在长周期自主运行的系统里毫无约束力。\n最终起效的只有机械阻断：直接在底层代码里把本地测试的执行入口封死，改用网页钩子在报错时被动唤醒。\n管住机器不能靠讲道理，只能靠物理开关。\n\n决定系统质量上限的，甚至不是写代码的工人。\n测试显示，用昂贵的 Opus 5 写代码，编译失败率高达 23.9%，每小时只能提交 1.6 次。\n换成便宜轻快的 Sonnet 5，失败率降到 9.1%，每小时提交 6.1 次。\n如果按每个提交的代码缺陷率来算，两个模型其实都在 19% 左右，干活犯错的概率不相上下。\n真正的分野发生在审查岗位上。\n让 Sonnet 担任监督员审查代码，能抓出 19.6% 的缺陷。\n换成 Opus 担任监督员，抓出的缺陷率只有 14.3%。\n把更聪明、更贵的模型放在写代码的位置，收益极低。\n把对细节最敏锐的模型放在审查哨位上，才能兜住整个系统的底。\n\n烧掉 2350 亿个 Token，换来的是一套格外朴素的工程常识：\n砍掉没有共享记忆的子节点。\n用物理阻断代替语言教育。\n把审查哨位摆在开发之前。\n拖垮智能体系统的，往往不是模型的智力上限。\n是人类凭空搭出来的复杂架构，正在暗中向算力征收高额的混乱税。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:50","created_at":"2026-08-23 00:21:50","url":"https://mubeitech.com/p/mb-20260823-ce0400","markdown_url":"https://mubeitech.com/p/mb-20260823-ce0400/markdown"}]}