{"source":{"id":"mb-20260828-b06641","title":"曾把全行业逼到斩杀线上的低价神话，自己先扛不住峰值流量涨价了","url":"https://mubeitech.com/p/mb-20260828-b06641"},"method":"semantic-similarity","count":6,"items":[{"rank":1,"id":"mb-20260827-db52ed","account":"mubei","brand":"","title":"每天吞吐 18.4 万亿个 Token 的大模型推理市场，正撕开一条极度残酷的价值断层","summary":"每天吞吐 18.4 万亿个 Token 的大模型推理市场，正撕开一条极度残酷的价值断层","body":"每天吞吐 18.4 万亿个 Token 的大模型推理市场，正撕开一条极度残酷的价值断层。\n一边吞下了全网超过 50% 的流量，最后只分到不到 5% 的钱。\n一边只跑了 3.8% 的 Token，却卷走了全行业将近 30% 的现金流。\n这笔账是怎么算出来的？\n云成本分析平台 Vantage 的创始人 Ben Schaechter，把大模型聚合路由平台 OpenRouter 上 103 家供应商、242 个模型的每日真实消耗翻译成了美元账单。\n整个市场每天在这个平台上烧掉 1700 万美元，年化支出超过 62 亿美元。\n但掀开总账看流水，里面的贫富差距让人触目惊心。\n托管开源权重的算力供应商，正在海量吞吐中走向集体失血。\n小米、腾讯、DeepInfra、Novita 这些服务商，每天扛着数万亿级别的 Token 洪峰。\n但它们的平均定价，已经被杀到了每百万 Token 只要 0.18 美元，有的甚至低到 0.04 美元。\n跑了全网大半的流量，每天进账只有区区几万到十几万美元。\n反观另一头。\nAnthropic 的前沿模型，在平台上占的 Token 份额只有 3.8%。\n但它通过 AWS Bedrock、自身平台和直接接口，每天从这个池子里卷走 459 万美元，年化现金流接近 17 亿美元。\nOpenAI 拿了 6.9% 的流量，每天分走 326 万美元。\n为什么干最多苦力的算力商分不到钱，而少数几个寡头可以用个位数的流量卷走六成以上的利润？\n底下运转的，是一台经济学在一百多年前就写明了的冰冷机器。\n伯特兰商品化陷阱。\n1883 年，法国经济学家约瑟夫·伯特兰提出了一个著名的悖论：\n只要市场上存在两家以上生产完全同质化产品的厂商，而且消费者的转换成本为零，价格战就会瞬间爆发，直到把价格压到边际成本为止。\n此时哪怕市场需求再庞大，所有超额利润也会彻底归零。\n这正是开源模型托管商今天面对的死局。\n当开源模型的权重对所有人公开，各家算力商部署的模型完全一样。\n而 OpenRouter 这类聚合路由器，把所有模型封装进了统一的标准接口。\n对开发者而言，切换供应商的成本变成了零，只需要在代码里改一行配置，甚至让路由器自动挑最便宜的节点。\n于是上百家算力商瞬间跌进了伯特兰价格战的绞肉机。\n显卡是买来的，电力是硬成本，代码是开源的，接口是通用的。\n没有任何一家敢提价一分钱，因为只要贵了 0.01 美元，路由算法就会在下一毫秒把所有流量切给隔壁。\n它们成了彻底的算力苦力，在边际成本的泥潭里互砍到皮包骨头。\n真正能逃脱这台绞肉机的，只有不可替代的前沿独占能力。\n开发者用 Claude Opus 或 GPT-5，是因为市面上没有第二家能托管完全相同的专有智能。\n这种不可替代性，让闭源寡头拥有绝对的定价权，可以把价格定在每百万 Token 6 到 8 美元，相当于开源托管价格的 40 倍到 100 倍。\n标准化接口让流量变得极其廉价，却让真正的垄断壁垒变得更加昂贵。\n算力本身从来不是护城河。\n当底层工具把一切搬运成本降为零的时候，跑在上面的同质化资产就会被无情清空溢价。\n最终能留在牌桌上数钱的，永远不是替别人搬砖的通道，是那块别人搬不走的石头。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-27 22:36:41","created_at":"2026-08-27 22:36:41","url":"https://mubeitech.com/p/mb-20260827-db52ed","markdown_url":"https://mubeitech.com/p/mb-20260827-db52ed/markdown"},{"rank":2,"id":"2068767074663690502","account":"mubei","brand":"@mubei","title":"“模型，已经不再是产品了。” 说这话的，是 OpenAI 的联合创始人 Greg Brockman，和 Perplexi…","summary":"“模型，已经不再是产品了。” 说这话的，是 OpenAI 的联合创始人 Greg Brockman，和 Perplexity 的老板 Aravind Srinivas。 按理说，最希望“模型就是产品”的，应该是这些头部大模型厂商。 但现在，大家都回过神来了。 如果你只是个转售大模…","body":"“模型，已经不再是产品了。”\n\n说这话的，是 OpenAI 的联合创始人 Greg Brockman，和 Perplexity 的老板 Aravind Srinivas。\n按理说，最希望“模型就是产品”的，应该是这些头部大模型厂商。\n但现在，大家都回过神来了。\n如果你只是个转售大模型 Token 的二道贩子，你根本没有壁垒，因为模型终究会沦为便宜的“大宗商品”。\n\n现在真正的产品，叫“编排系统”（Orchestration System）。\n说白了，就是把一个大模型，装进一套“智能体马鞍”（Agent Harness）里。\n\n什么是 Agent Harness？\n\n就是一套运转规则。\n决定这个智能体怎么跑循环、怎么拆解任务、什么时候调用工具、什么时候召唤子智能体。\n光有聪明的脑子（模型）没用，你得有手、有脚、有工作流，才能把脑力变现。\n\n这里面，还藏着一个杀手级的行业竞争差。\n为什么独立编排系统（比如 Perplexity）能跟大厂抗衡？\n因为门户之见。\n你绝不可能在 Anthropic 的 Claude Code 里，看到 OpenAI 的 GPT-5；\n你也绝不可能在 OpenAI 的产品里，调用 Claude 3.5。\n但第三方的编排系统可以。\n它可以在不同的任务节点，调用最合适、最便宜的模型，把效率压榨到极致。\n\n所以，未来的 AI 竞争，拼的是一个终极指标：\nToken Value Per Watt Per User（单用户、单瓦特功耗下，所产出的 Token 价值）。\n\n算力的底层是电力，电力是不可逾越的物理限制。\n谁能用最少的电，帮用户跑出最值钱的输出，谁就握着终极定价权。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2068992951938585041","translated_status_id":"2068992951938585041","published_at":"2026-06-22 09:11:51","created_at":"2026-06-22T11:10:45.506141","url":"https://mubeitech.com/p/2068767074663690502","markdown_url":"https://mubeitech.com/p/2068767074663690502/markdown"},{"rank":3,"id":"mb-20260823-07e9ec","account":"mubei","brand":"","title":"AT&T 刚交出了一份反直觉的算力账本","summary":"AT&T 刚交出了一份反直觉的算力账本","body":"AT&T 刚交出了一份反直觉的算力账本。\n他们把十万名员工写代码的 AI 成本，一口气砍掉了 56%。\n而代码生成的整体质量，仅仅下降了 2%。\n这是一个日均吞吐 450 亿个 Token 的庞大系统。\n面对成千上万名工程师高频的日常调用。\n他们是怎么在保住智力水准的同时，把账单切掉大半的？\n很多人以为他们换掉了顶尖大模型。\n还有人猜测他们给员工的使用额度下了硬性死命令。\n都不是。\n他们只是在整个系统的入口处，装上了一个精准的交通警察。\n这台机器叫动态模型路由。\n过去两年，多数企业接入大模型的方式大多相当粗放。\n不管员工是做底层系统的复杂重构，还是仅仅查一个语法错误、给函数写两行注释。\n所有请求，一律原封不动打包，送进最昂贵的商业旗舰模型里。\n这就像开着重型卡车去街角买一包口香糖。\n事是办成了，但油钱贵得不可思议。\n在这种单一大模型的调用结构下，企业支付的大部分账单，都是在为过剩的智力交税。\nAT&T 拆掉了这个大一统的黑箱。\n他们在内部系统 Ask AT&T 里，接入了开源网关工具 LiteLLM。\n任何一条员工发出的提示词，在触达模型之前，先由网关做一层实时的复杂度判定。\n如果只是常规的代码摘要、格式整理或者基础语法查询。\n系统会直接把任务分流给轻量级的开源模型。\n比如 Meta 的 Llama、Google 的 Gemma，或者英伟达的 Nemotron。\n这些调用的推理成本，只有顶级商业模型的几十分之一。\n只有当任务真正涉及复杂逻辑、多步代码推理或者跨模块架构设计时。\n路由器才会把请求交给 OpenAI 和 Anthropic 的顶级旗舰。\n这套打法在学术界早有理论验证。\n斯坦福大学在 2023 年就提出过级联路由框架 FrugalGPT。\n他们用实测数据证明了一件事：\n真实场景里超过 70% 的用户请求，低成本的小模型完全有能力独立交付。\nAT&T 负责员工 AI 工具的副总裁 Mark Austin 透露。\n目前他们内部已有 40% 的查询被成功分流给开源模型。\n接下来的目标是把这个比例推到 60% 至 70%。\n甚至在一些针对电信业务微调的专有场景中，推理成本直接压缩了 90%。\n整个行业一直在为跑分榜上的参数差距焦虑。\n今天哪家大模型多刷了两分，明天谁的单次调用价格又成了焦点。\n但企业落地真正的算力壁垒，从来不看谁采购了最贵的大模型。\n看的是谁先搭出了那台精细分流的调度机器。\n当你不再用同一把大锤去砸所有的核桃。\n企业的 AI 账本才算真正落到了地上。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:46","created_at":"2026-08-23 00:21:46","url":"https://mubeitech.com/p/mb-20260823-07e9ec","markdown_url":"https://mubeitech.com/p/mb-20260823-07e9ec/markdown"},{"rank":4,"id":"mb-20260823-338c21","account":"mubei","brand":"","title":"两个月时间，AI 行业的底层权力结构被悄悄颠覆了","summary":"两个月时间，AI 行业的底层权力结构被悄悄颠覆了","body":"两个月时间，AI 行业的底层权力结构被悄悄颠覆了。\n2026 年 6 月，在 Vercel 的开发网关上，开源模型的 Token 处理量只占 28.4%。\n到了 8 月下旬，这个数字直接飙升到了 62%。\n闭源巨头筑起的技术高墙，在真实流量面前几乎被瞬间冲垮。\n最诡异的地方在于，与此同时，OpenAI 和 Anthropic 的营收还在加速增长。\n一边是顶尖实验室账面收入创新高，一边是实际调用份额被开源模型成倍蚕食。\n这到底是在繁荣，还是在退潮？\n要看懂这场无声的剧变，必须搬出商业史上最经典的一台冰冷机器。\n哈佛商学院克里斯坦森在 2003 年提出的「利润守恒定律」。\n这一定律揭示过一个残酷的商业铁律。\n当一个价值链中的某个核心环节被标准化、模块化和大宗商品化时，这个环节的暴利就会迅速蒸发。\n但利润本身不会凭空消失。\n它必然会迁移到产业链相邻的、最稀缺且不可替代的环节。\n过去两年，整个科技圈都在押注「模型即终局」。\n所有人都以为，掌握最强大脑的模型厂商，会通吃整条产业链的超额利润。\n现实的技术演进却走了一条相反的路。\n开源模型迅速跨过了「足够好用」的工程临界点。\n对企业和开发者来说，绝大多数日常任务根本不需要调用昂贵的顶级前沿模型。\n更关键的推手是网关层的解耦。\n一旦统一接口将底层模型彻底抽象化，更换模型的切换成本瞬间归零。\n大模型从一种不可替代的神秘智慧，迅速退化成了随取随用的廉价电力。\n模型层的模块化一旦完成，利润守恒定律立刻无情启动。\n暴利开始向产业链的两端极速迁移。\n一端向着底层的物理硬件逃逸。\n杰文斯悖论在这里彻底显形：单次调用的成本越便宜，全球激发的调用总量就越呈指数级爆发。\n模型厂商降价内卷省下来的每一分钱，最终都原封不动变成了对英伟达芯片、高带宽内存、先进封装和电力能源的刚性采购。\n另一端向着顶层的专属工作流逃逸。\n单纯提供通用算力的模型没有护城河，只有把模型深度嵌入私有业务流程、掌握专有数据和验证体系的应用，才能守住高毛利。\n夹在中间的纯模型层，正在被两头挤压成利润最薄的过路管道。\n顶尖实验室依然可以烧掉数百亿美元训练下一代前沿模型。\n但在开源生态的贴身紧逼下，任何性能领先的商业溢价窗口，都会被迅速拉平。\n最赚钱的生意，从来不在被迅速商品化的中间层。\n当一种技术变得像自来水一样普及，真正拿走全部利润的，永远是底层的自来水管网，和顶层用自来水酿造出高附加值产品的人。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 18:17:13","created_at":"2026-08-23 18:17:13","url":"https://mubeitech.com/p/mb-20260823-338c21","markdown_url":"https://mubeitech.com/p/mb-20260823-338c21/markdown"},{"rank":5,"id":"mb-20260827-c46740","account":"mubei","brand":"","title":"训一个几千亿参数的大模型，上万张最顶级的显卡，有一大半时间根本没在算","summary":"训一个几千亿参数的大模型，上万张最顶级的显卡，有一大半时间根本没在算","body":"训一个几千亿参数的大模型，上万张最顶级的显卡，有一大半时间根本没在算。\n算力租金按秒扣费，电表飞速打转，机房风扇震耳欲聋。\n但芯片的浮点运算单元，却在成片成片地熄火发呆。\n业界的真实数字冷冰冰摆在那里。\n哪怕是顶尖实验室，模型算力利用率通常也只有 35% 到 43%。\n剩下的六成算力，蒸发去了哪里？\n是算法写得太慢，还是代码逻辑不够优化？\n为什么在 Python 里写得整整齐齐的线性代码，扔进上万张显卡之后，会碎成一地残渣？\n这台让万亿资本买来的算力大面积瘫痪的机器，叫通信重叠与关键路径气泡。\n要看懂这台机器，先看单张显卡和集群的本质区别。\n单张显卡训练很简单：数据喂进显存，核心埋头计算。\n但千亿参数的大模型，根本塞不进任何单张显卡的显存。\n工程师必须把模型生生切碎，分摊到几千甚至上万张显卡上。\n张量并行把每一层的矩阵乘法横竖切开。\n全分片数据并行把模型参数、梯度和优化器状态彻底剥离。\n专家并行和上下文并行把海量参数和数十万字的序列切散。\n这种切分带来了一个致命代价。\n任何一张显卡想要算下一层网络，必须先等别的显卡把中间结果传过来。\n在硬件底层，显卡从来不是按代码顺序单线推进的。\n它跑在两条平行的硬件轨道上。\n一条是负责矩阵乘法的高速计算流。\n一条是负责跨卡数据搬运的通信流。\n这两条轨道在时间线上贴身肉搏。\n最理想的状态，是当前层在计算流里疯狂运转时，下一层要用的参数已经在通信流里提前搬运完毕。\n这在工程上叫计算与通信重叠。\n只要算力跑完的瞬间数据刚好到位，跨卡通信的耗时就被彻底藏在计算背后。\n但物理现实没有这么仁慈。\n跨机柜的光纤只要有一丝抖动，或者层与层之间的依赖拓扑解不开，通信就会慢上几个微秒。\n一旦计算流算完了，而通信流的数据还没送达，硬件同步机制会瞬间踩下急刹车。\n在底层的执行轨迹图上，显卡会留下一大片空白。\n工程上把这片空白叫气泡。\n只要这个气泡落在了决定整体速度的关键路径上，几万张每小时烧掉几万美元的显卡，就必须集体陪着它原地发呆。\nAI 研究者 Vlad Savinov 拆解过 PyTorch 官方分布式训练框架 torchtitan 的真实底层轨迹。\n把掩盖在代码背后的底层事件拉平在时间轴上，才能看清真相。\n算力根本不是平铺直叙的流水线，是一张充满阻塞、等待与抢跑的有向无环图。\nMeta 训练 4050 亿参数的 Llama 3.1 时，动用了 1.6 万张 H100 显卡。\n即便用尽了交错流水线调度、异步张量并行与微块切分，把能重叠的通信全部塞进计算缝隙，整体算力利用率依然被锁在 40% 左右。\n这就是为什么 AI 军备竞赛的底层法则正在发生质变。\n很多人看算力竞争，习惯盯着谁买了十万张显卡，以为算力是简单的乘法累加。\n在超大规模分布式系统里，算力遵循的是残酷的拓扑规律。\n芯片堆得越多，通信复杂度的爆炸速度就越快，时间轴上的气泡就越难被压平。\n真正拉开顶尖实验室差距的，从来不是买显卡的支票厚度。\n是在微秒级的时间轴上，把跨卡通信死死压进计算缝隙里的工程编排能力。\n谁能把通信完全藏进阴影里，谁就能用一半的芯片跑出对手两倍的速度。\n藏不住通信的，买再多显卡，也不过是在高昂的电费账单里，养了一大堆在网线面前排队发呆的昂贵发热器。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-27 11:28:33","created_at":"2026-08-27 11:28:33","url":"https://mubeitech.com/p/mb-20260827-c46740","markdown_url":"https://mubeitech.com/p/mb-20260827-c46740/markdown"},{"rank":6,"id":"16564496","account":"mubei","brand":"@mubei","title":"大模型竞争的风向变了。 不拼跑分，开始往死里卷价格。 GPT-5.6系列大降价。 轻量级的Luna模型，价格一口气砍掉8…","summary":"大模型竞争的风向变了。 不拼跑分，开始往死里卷价格。 GPT-5.6系列大降价。 轻量级的Luna模型，价格一口气砍掉80%。 处理一百万个输入token，现在只要0.2美元，输出只要1.2美元。 中端的Terra模型降价20%，降到了输入2美元、输出12美元。 顶配的Sol模型…","body":"大模型竞争的风向变了。\n不拼跑分，开始往死里卷价格。\n\nGPT-5.6系列大降价。\n轻量级的Luna模型，价格一口气砍掉80%。\n处理一百万个输入token，现在只要0.2美元，输出只要1.2美元。\n中端的Terra模型降价20%，降到了输入2美元、输出12美元。\n\n顶配的Sol模型换了个打法。\n它在API里加了一个“快速模式”。\n多花一倍的钱，速度最高能飙升2.5倍，智力水平完全不打折。\n\n同等智能的调用成本，被生生砸到了一个新台阶。\n过去那些因为太贵、开发者舍不得跑的海量任务。\n现在终于可以放开手脚，当成日常操作随便跑了。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2082970809845375398","translated_status_id":"2082970809845375398","published_at":"2026-07-30 23:02:23","created_at":"2026-07-31T00:54:16+02:00","url":"https://mubeitech.com/p/16564496","markdown_url":"https://mubeitech.com/p/16564496/markdown"}]}