{"source":{"id":"raw_708f235ce731aad8","title":"OpenAI 刚发布了新模型 GPT-6 Astra。 黄仁勋发推文祝贺，顺手扔了一颗深水炸弹： AGI 已经到了。 接…","url":"https://mubeitech.com/p/raw_708f235ce731aad8"},"method":"semantic-similarity","count":5,"items":[{"rank":1,"id":"mb-20260830-a41049","account":"mubei","brand":"","title":"把一个前沿大模型的调用成本砍掉 80%，不是打价格战，也不是买到了更便宜的显卡","summary":"把一个前沿大模型的调用成本砍掉 80%，不是打价格战，也不是买到了更便宜的显卡","body":"把一个前沿大模型的调用成本砍掉 80%，不是打价格战，也不是买到了更便宜的显卡。\n是一台更强的模型，在生产环境里直接重写了它的底层 GPU 算子。\n为什么真实的自我进化，不是科幻小说里的超级大脑空转哲学，是它直接接管了人类工程师的编译器？\n这台机器叫架构级递归自我提升。\n过去优化一套大模型的推理栈，需要顶尖工程师对着硬件手册，花上几周时间一行一行调校 CUDA 内核。\n稍微改错一个显存地址，整个生产集群就会当场瘫痪。\n但在 OpenAI 内部，最前沿的 Sol 模型开始直接观测运行中的 Luna。\n它在毫秒级的运行轨迹里寻找指令冗余，自主重构数据流，把 GPU 的硬件利用率压榨到极限。\n短短三个月，整个推理速度提升了 60%，运行成本直接跳水 80%。\n最顶尖的智能，直接变成了下一代模型的算力折扣。\n这推导出了一条极其残酷的工业规律：六个月前沿通缩。\n今天坐在算力顶峰、调用一次贵得令人咋舌的前沿模型，六个月之后，就会被这套自我优化机制压缩成廉价甚至免费的基础设施。\nReplit 已经在免费模式里分发 Luna。\n为什么这种自我优化的飞轮，只有极少数团队转得起来？\n早在 ChatGPT 改变世界前整整一年，DeepMind 内部就已经跑着一个几乎一模一样的对话模型 LMChat。\n创意密度极高，模型已经能生成连贯且有用的文本，但它被死死锁在实验室里不敢发布。\n因为传统科技巨头把前沿技术的不稳定，当成了必须层层审批的合规风险与声誉坏账。\nOpenAI 走了一条完全相反的路。\nCodex 负责人 Tibo Sottiaux 桌上有一个实体的重置按钮。\n系统挂了、体验不达预期，产品负责人不需要找财务部开会，不需要找市场部审批，随时按下去，直接把使用额度全额赔给开发者。\n零摩擦的产品补偿，把本该招致愤怒的技术故障，变成了数千万开发者在生产环境里为模型纠错的默契。\n真实世界的海量代码反馈喂给模型，最强的模型反手重构底层的算力基础设施，更便宜高效的算力再吸引更庞大的调用。\n这三个齿轮咬合在一起，才把大模型推向了极速时代。\n当 Token 生成速度拔高 10 到 14 倍，当计算的延迟逼近人类大脑的单线程心流，单机笔记本电脑的性能上限被瞬间击穿。\n算力的瓶颈不再是模型生成得有多慢，变成了网络请求和工具调用的物理开销。\n真正的技术代差，从来不在谁在公关稿里宣布了多大的模型参数。\n在于谁先让模型学会了优化自己的身体，然后把省下来的每一个美分，以最快的速度变成砸向对手的白菜价智能。\n只有当智能开始自举，算力才会真正像水和电一样，漫进每一个普通人的生活里。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-30 21:53:54","created_at":"2026-08-30 21:53:54","url":"https://mubeitech.com/p/mb-20260830-a41049","markdown_url":"https://mubeitech.com/p/mb-20260830-a41049/markdown"},{"rank":2,"id":"2061973589583155218","account":"mubei","brand":"@mubei","title":"“2026年你想买算力？祝你好运，要是知道哪有卖的，麻烦告诉我。” 连 OpenAI 的 CFO Sarah Friar…","summary":"“2026年你想买算力？祝你好运，要是知道哪有卖的，麻烦告诉我。” 连 OpenAI 的 CFO Sarah Friar 都在公开场合这样诉苦。 结果旁边人冷不丁补了一刀：“马斯克那儿有啊。” 这背后，是几周前马斯克干了一件“杀人诛心”的事。 他发现自己手头的算力居然过剩了，于是…","body":"“2026年你想买算力？祝你好运，要是知道哪有卖的，麻烦告诉我。”\n连 OpenAI 的 CFO Sarah Friar 都在公开场合这样诉苦。\n结果旁边人冷不丁补了一刀：“马斯克那儿有啊。”\n\n这背后，是几周前马斯克干了一件“杀人诛心”的事。\n他发现自己手头的算力居然过剩了，于是转手卖了出去。\n卖给谁了？卖给了 OpenAI 最大的死敌 Anthropic。\n纯粹就是为了恶心 Sam Altman。\n连 Sarah 都只能苦笑承认：“讽刺的是，马斯克竟然成了唯一算力过剩的人。”\n\n算力到底有多要命？\nOpenAI 亲口承认，那个曾震撼全球的视频模型 Sora，现在推进得极其痛苦。\n为什么？因为视频太吃算力了。\n为了保住核心项目，他们不得不做出“非常艰难的选择”。\n连 OpenAI 这种级别的巨头，在算力面前都没有余粮，而且到了 2027 年，情况依然不会缓解。\n\n这背后透露出的，是算力作为战略资源的真实格局。\nSarah 讲透了当前的两套玩法：\nAI 算力分两种，训练和推理。\n用来“炼大模型”的训练算力，必须全部留在美国本土。\n因为美国政府已经明确表态，这是一种“国家资产”。\n但用来跑日常应用的推理算力，可以推向全球，去支撑更实时的智能体互动。\n\n科技巨头们早已看清，未来不是低头按手机屏幕的时代。\n多模态已经来了，人类将直接和 AI 对话。\n但这一切的基础，依然是最原始的硬件底座。\n马斯克用多余的算力精准资敌，OpenAI 缺算力缺到不敢放开跑 Sora。\n这就是 AI 战争最残酷的现实：算力就是霸权。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2062452923712373216","translated_status_id":"2062452923712373216","published_at":"2026-06-04 08:12:46","created_at":"2026-06-04T10:08:05.025325","url":"https://mubeitech.com/p/2061973589583155218","markdown_url":"https://mubeitech.com/p/2061973589583155218/markdown"},{"rank":3,"id":"2059986678262235405","account":"mubei","brand":"@mubei","title":"Anthropic CEO Dario Amodei 最意外的事，是公众还没意识到 AI 指数曲线快跑到最后一段了。 他…","summary":"Anthropic CEO Dario Amodei 最意外的事，是公众还没意识到 AI 指数曲线快跑到最后一段了。 他说，过去三年，底层技术大体按他的预期前进。 模型从聪明高中生，走到聪明大学生，再走到开始做 PhD 和专业工作的水平。 在代码领域，甚至已经越过这个线。 真正让…","body":"Anthropic CEO Dario Amodei 最意外的事，是公众还没意识到 AI 指数曲线快跑到最后一段了。\n\n他说，过去三年，底层技术大体按他的预期前进。\n模型从聪明高中生，走到聪明大学生，再走到开始做 PhD 和专业工作的水平。\n在代码领域，甚至已经越过这个线。\n\n真正让他惊讶的，是外面的人还在吵同一批旧政治议题。\n新剧集。\n新表情包。\n明星互撕。\n选举新闻。\n人类历史级别的生产力迁移，反而像背景噪音一样被滑过去。\n\n他的底层判断很朴素。\n早在 2017 年，GPT-1 刚出来时，他写过一个想法，叫 Big Blob of Compute Hypothesis。\n大意是，别太迷信聪明技巧。\n真正长期起作用的，是几件笨东西。\n\n原始算力有多少。\n数据量有多少。\n数据分布够不够广。\n训练时间够不够长。\n目标函数能不能一路扩展。\n数值稳定性能不能撑住那团巨大的计算流。\n\n这套逻辑，后来在预训练 scaling law 里跑通了。\n现在 Anthropic 看到，RL 也在走类似路线。\n先在数学竞赛题上训练。\n再扩到代码。\n再扩到更多任务。\n模型能力会随着训练时间呈现近似对数线性提升。\n\n有人质疑，这不像人类学习。\n人类不用看几万亿个 token，也不用烧掉几十亿美元算力，才会用 Excel、PowerPoint、浏览器。\n如果 AI 真有人的学习核心，为什么还要建这么多强化学习环境？\n\nDario 的回答有意思。\n这个谜题存在，但可能没那么致命。\n人脑出生时已经带着进化给的先验。\n语言模型从随机权重开始，像一张更空的白纸。\n\n所以预训练和 RL，更像夹在人类进化与人类学习之间的一层东西。\n模型先用天量数据长出先验。\n再靠长上下文，在具体任务里快速适应。\n当上下文长度到一百万级别时，推理成本成了主要阻碍，学习能力本身已经开始显形。\n\n这就是很多人低估 AI 的地方。\n他们以为差距在于知道哪个工具火。\n真正的差距在于，谁已经把工具嵌进工作流，谁还把它当搜索框、玩具、聊天窗口。\n\n大多数人只用了 10%。\n少数人正在把 100% 的工作方式重写一遍。\n\n下一轮阶层分化，未必先发生在公司估值表里。\n它会先发生在同一间办公室里，发生在两个看似职位相同的人之间。\n一个人在操作软件。\n另一个人在调度计算。","category":"其它","score":100,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-05-28 16:01:27","created_at":"2026-05-28T17:58:23.017496","url":"https://mubeitech.com/p/2059986678262235405","markdown_url":"https://mubeitech.com/p/2059986678262235405/markdown"},{"rank":4,"id":"raw_15664e857d3b36ee","account":"mubei","brand":"@mubei","title":"Anthropic 一家做大模型的软件公司，正在把 15 个吉瓦（GW）的算力直接压给博通的专用芯片。 15 个吉瓦是什…","summary":"Anthropic 一家做大模型的软件公司，正在把 15 个吉瓦（GW）的算力直接压给博通的专用芯片。 15 个吉瓦是什么概念？ 相当于 15 座大型核电站机组的满负荷输出，或者整座纽约市在用电高峰时的全部电力负荷。 这家原本给谷歌和亚马逊做模型的软件实验室，2027 年要部署…","body":"Anthropic 一家做大模型的软件公司，正在把 15 个吉瓦（GW）的算力直接压给博通的专用芯片。\n15 个吉瓦是什么概念？\n相当于 15 座大型核电站机组的满负荷输出，或者整座纽约市在用电高峰时的全部电力负荷。\n这家原本给谷歌和亚马逊做模型的软件实验室，2027 年要部署 5 个吉瓦的 TPU v8i，2028 年还要再追加 10 个吉瓦。\n它将一举超过谷歌，变成博通全球最大的定制芯片客户。\n另一边的 OpenAI 也在干同一件事。\nOpenAI 自研的第一代推理专用芯片 Jalapeño 刚刚开始量产出货，2027 年要部署 1.3 个吉瓦，2028 年目标直接拉到 5 个吉瓦以上。\n华尔街大部分人还在盯着英伟达卖了多少张通用显卡。\n为什么两家最顶尖的模型公司，算力规模一旦冲到吉瓦级别，都不约而同绕开了英伟达？\n答案藏在半导体物理与电网配电的一条硬约束里：定制硅分流。\n算力扩张到了吉瓦这个量级，真正的瓶颈早就不是买芯片的预算，是变电站的审批和电网的物理承载力。\n电力成了限制智能扩张的硬天花板。\n英伟达的通用显卡为了兼顾各种科学计算、图形渲染和前沿算法探索，芯片上留了大量冗余电路、复杂的通用调度模块和高精度计算单元。\n这些通用设计，每分每秒都在耗电。\n但当模型架构在工业级推理场景下固定下来，每天要处理几十亿次请求时，那些为了通用性保留的电路就变成了纯粹的电力浪费。\n专用芯片做的事情，是把所有多余的电路全部砍掉。\n它把模型最核心的矩阵乘法和数据传输通道直接固化在硅片上。\n在固定的电力预算下，专用芯片的能效比可以达到通用显卡的 2 到 3 倍。\n同样是一座 5 吉瓦的数据中心，用专用芯片能跑出来的推理吞吐量，能翻上一倍到两倍。\n省下几十亿美元电费只是附带结果，更关键的是直接突破了电网给每个数据中心划定的功率死线。\n很多人会问：既然是自研芯片，为什么它们都要找博通？\n因为把数十万颗芯片连在一起，算力只占一半，另一半全在高速互联。\n芯片算得再快，数据如果卡在传输通道上，芯片就会在空转中白白烧电。\n博通手里握着全球顶级的 SerDes 高速接口技术、Tomahawk 交换机芯片和先进封装连接专利。\n模型公司负责出算法架构，博通负责把这些计算核心用极低延迟的高速通道绑成一个庞大的算力集群。\n这条路径让模型公司同时甩掉了两道枷锁：一道是第三方通用芯片 70% 以上的毛利溢价，另一道是公有云厂商层层加价的租赁成本。\n算力竞赛的底层规则已经变了。\n探索期买通用显卡找方向，规模化部署就必须走专用芯片抢电网。\n未来的顶级人工智能竞争，不看谁囤了更多显卡。\n看谁能把变电站输进来的每一瓦电力，以最高的效率换成智能。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2095429617913930059","translated_status_id":"2095429617913930059","published_at":"2026-09-03 10:27:47","created_at":"2026-09-03T10:27:47.421982","url":"https://mubeitech.com/p/raw_15664e857d3b36ee","markdown_url":"https://mubeitech.com/p/raw_15664e857d3b36ee/markdown"},{"rank":5,"id":"mb-20260831-a7f9a4","account":"mubei","brand":"","title":"OpenAI 悄悄买下了几万台苹果 Mac mini 和 Mac Studio","summary":"OpenAI 悄悄买下了几万台苹果 Mac mini 和 Mac Studio","body":"OpenAI 悄悄买下了几万台苹果 Mac mini 和 Mac Studio。\n同一时间，Anthropic 在亚马逊云上整机架地包租苹果电脑。\n全世界最顶尖的 AI 实验室，突然开始像网吧老板一样囤积家用台式机。\n这很反常。\n所有人都以为，训练顶级 AI 的标配是液冷机房、核电站和几万张英伟达 H100 显卡。\n如果只是缺算力，为什么要买这堆几百美元一台的消费级盒子？\n因为 AI 正在撞上一堵新墙。\n这台机器叫：环境交互瓶颈。\n过去两年，大模型在做的事情叫预训练。\n它在读人类写好的静态网页、论文和代码。\n那些数据早就躺在硬盘里，几万张英伟达显卡只需要全力做矩阵乘法。\n但如果你想训一个能替人类干活的电脑操作智能体，静态数据彻底归零了。\n互联网上没有任何一个现成的数据集，能记录鼠标点错之后弹出的系统报错怎么关。\nAI 想学会操作电脑，就必须自己坐到电脑前面。\n它得看一眼屏幕，按一次键盘，点一下鼠标，看系统怎么反应，再决定下一步。\n在强化学习里，这叫动作与反馈的闭环。\n训练数据不再从硬盘里读取。\n它来自真实的操作系统，靠 AI 一次次乱点、试错、崩溃，现场生成。\n有人会问：为什么不在机房的服务器里，虚拟出几万个桌面系统？\n这里卡着两道硬锁。\n第一道是法律锁。\n苹果的软件许可协议第 2 条写得清清楚楚：macOS 严禁在非苹果硬件上虚拟化运行。\n全球估值最高的 AI 公司，也无法合规地用机房里的服务器模拟出合法的苹果桌面。\n第二道是硬件架构锁。\n一个操作桌面的智能体，既要处理实时的屏幕图像，又要调度系统底层的各种事件，还要在本地加载模型。\n传统服务器架构里，数据要在处理器和显卡之间来回搬运，单台功耗动辄上千瓦。\n苹果芯片的统一内存架构，让处理器和图形核心共用同一池内存。\n一台 Mac mini 功耗只有几十瓦，静音，不占地，开机就是一个天然完整的真实操作系统。\n把几万台 Mac 连成集群，不是为了拼算力峰值。\n这是在物理世界里，硬生生给 AI 搭建的一个超大规模数字驾驶练习场。\n算力的游戏规则变了。\n以前拼的是谁的大脑算得更快。\n现在拼的是谁能提供更多、更便宜、更真实的操作系统，让 AI 去试错。\n英伟达的大算力机房负责让 AI 学会思考。\n桌上这堆不起眼的小方盒子，负责让 AI 学会替人类干活。\n当所有人的目光还在盯着天价的特种显卡时，真正的瓶颈，已经悄悄转移到了物理世界最基础的执行环境里。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-31 10:58:53","created_at":"2026-08-31 10:58:53","url":"https://mubeitech.com/p/mb-20260831-a7f9a4","markdown_url":"https://mubeitech.com/p/mb-20260831-a7f9a4/markdown"}]}