{"source":{"id":"mb-20260826-a16ede","title":"月之暗面把 2.8 万亿参数的 Kimi K3 开源了","url":"https://mubeitech.com/p/mb-20260826-a16ede"},"method":"semantic-similarity","count":2,"items":[{"rank":1,"id":"mb-20260825-bb71f5","account":"mubei","brand":"","title":"在很多技术发布会和基准测试榜单上，大模型编写底层 GPU 算子代码，已经能跑出惊人的成绩","summary":"在很多技术发布会和基准测试榜单上，大模型编写底层 GPU 算子代码，已经能跑出惊人的成绩","body":"在很多技术发布会和基准测试榜单上，大模型编写底层 GPU 算子代码，已经能跑出惊人的成绩。\n在开源微基准测试 KernelBench 上，AI 智能体写出来的算子不仅全部通过单元测试，还能比官方库快出两三倍。\n但只要把这些在沙盒里跑赢的算子，真正塞进一个完整的大模型推理脚本里，车祸立刻发生。\n原本在单点测试里快如闪电的代码，一进真实业务毫无起色，甚至直接引发显存溢出和隐性崩溃。\n为什么在孤立测试台上跑分的顶级算子，一进真实生产环境就失灵？\n是基准测试的题目太假，还是我们在测量代码性能的时候，从一开始就看错了物理现实？\n拆开现代 GPU 的算力黑箱，会看到一条横亘在实验室跑分和真实系统之间的冰冷断层。\n基准测试与部署断层（Benchmark-to-Deployment Gap）。\narXiv 最新发表的一篇论文（arXiv:2608.21836，已被 EMNLP 2026 主会录用），由学者 Hui Zeng 等人把这个行业痛点彻底扒开了。\n过去大家优化算子，习惯把注意力集中在单点上：把一个注意力机制、矩阵乘法或者激活函数单独抽出来，扔进一个无菌的测试台里。\n在孤立的测试台里，算子吃的是形状固定、连续规整的干净张量，缓存被预热到最佳状态，完全没有其他任务来抢资源。\n但在一个真实运转的大模型推理工作流里，根本不存在这种理想无菌的环境。\n大模型推理由两个物理特性完全不同的阶段咬合而成。\n第一个阶段是首字预填充（Prefill）。\n几十上百个提示词词元同时涌入，算力被瞬间拉满，GPU 处于计算受限状态。\n第二个阶段是逐字生成（Decode）。\n模型一个词元一个词元往外吐，每吐一个词都要去显存里读取一次庞大的键值缓存（KV Cache），GPU 瞬间切换到显存带宽受限状态。\n一个在孤立测试台上被调优到极速的算子，对这两个截然不同的动态阶段一无所知。\n它为了在单点测试里刷出高分，可能会贪婪地霸占所有的寄存器和共享显存。\n一旦回到真实的多层神经网络里，这种贪婪会直接破坏上下文的显存布局，导致相邻算子发生寄存器溢出，把整条流水线的吞吐量拖入泥潭。\n单次测试里看似微小的数值误差，在自回归生成的几百轮循环中，还会迅速滚成雪崩式的精度偏离。\n这就是孤岛微基准测试给整个行业制造的局部最优幻觉。\n单点算子没有问题。\n问题是它脱离了系统上下文。\n为了打破这道断层，研究团队提出了一个闭环优化框架 LLM4LLM。\n它不再把算子关在孤立的沙盒里调优。\n它的起点直接扎在真实的目标推理脚本里。\n接着做阶段感知拆解：在首字预填充和逐字生成两个阶段，分别抓取真实的显存压力和延迟瓶颈。\n随后由经验引导的幕式智能体探索 Triton 和 CUDA 代码空间。\n最后接入最关键的一道闭环：模型内验证（In-Model Validation）。\n每一个生成的代码补丁，不跑虚假的单点跑分，必须直接插入完整的十多层模型权重中，带上真实的键值缓存跑完端到端全流程。\n只有端到端总延迟真正下降、精度完全合规的代码，才会被系统接收。\n这套把优化拉回真实生产环境的系统，跑出了硬碰硬的实测数据。\n在 A100 和 H100 GPU 上针对 10 个主流大模型推理工作流进行测试，每一个模型的端到端延迟全部实现大幅改善。\n在 A100 上取得 3.91 倍的几何平均加速。\n在 H100 上取得 6.98 倍的几何平均加速。\n作为底层算子能力的交叉印证，在 KernelBench 第二级别测试上也同时斩获 2.745 倍的几何平均提速。\n把代码优化从无菌沙盒搬进真实的系统骨架，换来的是近 7 倍的真实性能跃迁。\n在高度复杂的现代计算堆栈里，脱离系统上下文的局部最优，往往只是测量工具给出的纸面富贵。\n一行真正高效的底层代码，从来不是孤立的数学公式。\n它是咬合在整台机器动态齿轮里的精密零件。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-25 12:04:39","created_at":"2026-08-25 12:04:39","url":"https://mubeitech.com/p/mb-20260825-bb71f5","markdown_url":"https://mubeitech.com/p/mb-20260825-bb71f5/markdown"},{"rank":2,"id":"mb-20260826-7c6521","account":"mubei","brand":"","title":"一家杭州的 AI 制药公司，把一颗口服减重药推进到了临床三期","summary":"一家杭州的 AI 制药公司，把一颗口服减重药推进到了临床三期","body":"一家杭州的 AI 制药公司，把一颗口服减重药推进到了临床三期。\n德睿智药（MindRank）的这颗分子叫 MDR-001。\n从项目立项到进入临床三期试验，耗时四年半。\n累计研发花费只有大约 2300 万美元。\n在全球所有宣称由 AI 原生平台设计的新药管线里，这是目前走得最远的一颗。\n2300 万美元这个数字，在医药行业掀起了巨大的声浪。\n按照传统跨国药企的研发账本，把一颗原创新药推进到临床三期，常规开销通常在数千万到上亿美元。\n如果把全行业的早期失败成本统统摊进来，数字更是直奔数十亿。\n为什么过去几年，整个医药工业对 AI 制药的态度，始终在极度狂热与极度怀疑之间剧烈撕裂？\n是科技界高估了算力对人体的理解，还是传统药企低估了模型对化学的重塑？\n拆开这颗分子的研发账本，底下咬合着两台运转逻辑截然相反的机器。\n埃隆定律的算力切片，与下游碳基生物学的体内复杂性墙。\n制药行业有一条被验证了六十年的残酷铁律：埃隆定律。\n2012 年，学者 Jack Scannell 在论文里把摩尔定律的英文拼写倒了过来，用来命名这个医药界的怪圈。\n半个多世纪里，芯片算力每十八个月翻一倍。\n但全球药企每投入十亿美元研发出的获批新药数量，却每九年就硬生生腰斩一次。\n塔夫茨药物研发中心的数据显示，一款新药从零到上市的平均综合成本，已经飙升到 26 亿美元，周期跨越十年以上。\n算力越来越快，造药为什么反而越来越贵？\n因为传统药物研发的早期阶段，本质是一场在化学暗室里的暴力穷举。\n理论上可能存在的小分子化学空间，高达 10 的 60 次方。\n药物化学家在湿实验里合成几千个分子，靠高通量筛选逐一试错。\n光是确定一颗具有成药潜力的临床前候选化合物，就要烧掉几年时间和数千万美元。\n这正是生成式 AI 展现出非对称杀伤力的精确狭窄切片。\n硅基化学搜索。\n算法不理解生命哲理，但它极擅长在虚拟空间里计算分子与蛋白质受体口袋的几何拓扑。\nMindRank 搭建的分子计算平台，通过生成模型与分子动力学模拟，直接对高维化学空间做定向剪枝。\n它把过去需要在实体实验室里反复合成、提纯、测试的几千次试错，搬到了服务器的微秒级运算里。\n四年半时间，2300 万美元。\n算力在这张账本上，把前端化学合成的试错税打到了骨折。\n但研发的故事，在进入人体的一瞬间被切成了两半。\n前端由硅基的运算速度决定。\n后端由碳基人体的物理生理学掌管。\n尤其在口服小分子 GLP-1 这个全球巨头争夺的绞肉机赛道。\n注射型的多肽药物容易起效，做成口服小分子药片，是一场严苛的生理冒险。\n药物吞进胃里，要面对消化酶的降解、肠道黏膜的渗透屏障，还要经受肝脏的首过代谢。\n分子要在极低剂量下精准激活靶点，同时不能在身体其他受体上引发脱靶毒性。\n在这个暗礁密布的深水区，传统制药巨头砸下数亿美元同样屡遭惨败。\n辉瑞的同类口服小分子候选药 Lotiglipron，在二期临床因为患者转氨酶升高引发肝脏安全性担忧，项目直接被砍。\n另一款候选药 Danuglipron，也因过半患者无法耐受恶心呕吐等胃肠道副作用，被迫叫停每日两次剂型。\n这些跨国巨头的折戟印证了一个冰冷现实。\n人体不是一段可以在云端反复调试、即时运行的软件代码。\n算法可以算出分子在三维空间里的理想结合位点。\n但当这颗药片真正进入成千上万具有高度异质性的真实患者体内，复杂的代谢网络与免疫反应没有任何捷径。\n监管机构要求的 24 周减重与安全性终点，必须老老实实耗满 24 个物理星期。\n临床三期是整个新药研发链条里成本最高、淘汰率最残酷的关口，超过五成的管线会在这里折戟沉沙。\n2300 万美元买到的，是一张以极低成本换来的决赛入场券，不是终点线上的颁奖礼。\n软件行业习惯用零边际成本的视角审视一切，以为算力能瞬间抹平物理世界的所有摩擦。\n生物医药的怀疑派则执着于最终结果，认为只要三期没过，算法就只是昂贵的公关修辞。\n两种判断都只看到了机器的一半。\n这场突破的本质，不在于 AI 攻克了人体的生物学黑箱。\n在于它把探索这个黑箱的门票价格，从一亿美元打到了两千万。\n物理世界的残酷淘汰率依然在终点守候。\n但在那张由物理定律写就的答卷前，算力第一次让挑战者有了以极低成本反复交卷的底牌。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-26 18:33:04","created_at":"2026-08-26 18:33:04","url":"https://mubeitech.com/p/mb-20260826-7c6521","markdown_url":"https://mubeitech.com/p/mb-20260826-7c6521/markdown"}]}