{"source":{"id":"2039389344365162850","title":"AI的脑子里，分裂出了多重人格。 Google刚刚公布了一项惊人的新发现。 只要给够时间，大模型到底在黑盒里干嘛？ 以D…","url":"https://mubeitech.com/p/2039389344365162850"},"method":"semantic-similarity","count":2,"items":[{"rank":1,"id":"mb-20260831-eefe1c","account":"mubei","brand":"","title":"让大模型学算术乘法，此前所有实验室测出来的，都是一团毫无规律的噪音","summary":"让大模型学算术乘法，此前所有实验室测出来的，都是一团毫无规律的噪音","body":"让大模型学算术乘法，此前所有实验室测出来的，都是一团毫无规律的噪音。\n算加法的时候，AI 的内部结构清清楚楚。\n它会把数字映射成圆周上的角度，像转动表盘指针一样把加法做出来。\n但一算乘法，这套几何时钟瞬间粉碎。\n神经元特征谱密密麻麻，所有频率全部挤在一起。\n学界一度得出结论：乘法比加法复杂得多，神经网络找不到优雅的几何算法，只能靠参数暴力硬背。\n那个真正值得问的问题是：如果它根本没在硬背呢？\n\n答案在 2026 年一篇被 ICML 机械可解释性研讨会收录的论文里被彻底揭开。\n作者是斯坦福学者 Huu Danh Nguyen。\n问题从一开始就没出在模型身上。\n出在人类手里拿的那把尺子上。\n过去所有人都在用标准的加法傅里叶变换去给模型做切片。\n加法在代数上是整数加法群，平移对称，标准傅里叶变换是它的天然基底。\n但乘法活在一个完全不同的代数宇宙里。\n以素数 113 为例，非零整数构成的是乘法群。\n拿测加法的尺子去量乘法，量出来的自然是满屏的虚假噪点。\n这在数学上叫坐标系假象。\n\n当研究者换用数学上与乘法群严格匹配的「乘法特征标变换」时，黑盒里的迷雾瞬间蒸发。\n在模 113 乘法的任务里，原本一团混乱的特征谱，立刻坍缩为极度稀疏的结构。\n基尼系数从 0.07 暴涨到 0.58。\n整个嵌入空间，实际上只靠 4 个核心频率在运转。\n神经元的行为更加惊人。\n96.9% 的多层感知机神经元，精准调谐在单一乘法频率上。\n只要把数字按照「离散对数」重新排列，看似杂乱无章的激活热图，立刻浮现出清晰的二维周期波纹。\n\n这台隐秘运转的机器，被命名为「离散对数钟」。\n这意味着什么？\n这意味着大模型在没有任何人类公式干预的情况下，在内部自己重新发明了对数。\n1614 年，苏格兰数学家约翰·纳皮尔发表对数表，核心思想就是把难以心算的乘法，通过对数降维转化为简单的加法。\n四个世纪后，一个参数极小的 Transformer，在数万次梯度下降的试错中，独立走通了完全相同的数学捷径：\n它先把两个输入的数字，映射进离散对数空间。\n在这个空间里，乘法自动变成了加法。\n接着，它再次拨动了那个转圈的几何时钟，把结果加出来。\n它不是不会算乘法，更没有在暴力硬背。\n它比人类研究员更早理解了乘法的代数本质。\n\n我们常常把神经网络当成混沌不可解的黑盒。\n但很多时候，所谓的黑盒与噪音，只是因为观测者选错了坐标系。\n当分析工具与任务底层的代数结构真正咬合，混乱会瞬间还原为精密的数学齿轮。\n拆解复杂系统的第一步，往往不是急着去给机器下定义。\n先看清楚自己手里的尺子，到底有没有找准它底层的对称性。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-31 10:58:53","created_at":"2026-08-31 10:58:53","url":"https://mubeitech.com/p/mb-20260831-eefe1c","markdown_url":"https://mubeitech.com/p/mb-20260831-eefe1c/markdown"},{"rank":2,"id":"mb-20260902-d843eb","account":"mubei","brand":"","title":"给 AI 裁判一张标准答案，你以为它会把选手的推导过程看得更清楚","summary":"给 AI 裁判一张标准答案，你以为它会把选手的推导过程看得更清楚","body":"给 AI 裁判一张标准答案，你以为它会把选手的推导过程看得更清楚。\n最新的实验砸出了一个完全相反的窟窿。\n拿到标准答案之后，AI 裁判不仅没有变敏锐，反而瞬间瞎了一半。\n为什么给了一张完美的答案纸，AI 反而抓不出推导里的致命硬伤？\n这套被寄予厚望的「思维链监控」，到底在监控什么？\n2026 年 9 月，杜伦大学 Will Yeadon 团队在 arXiv 发表了一项研究（arXiv:2609.00264）。\n他们拿《人类最后的考试》（Humanity's Last Exam）里的 79 道前沿物理难题做实验。\n三个顶尖模型生成了 237 份分步解答。\n物理学家标注、模型辩论加匿名裁决，从中筛出了 24 份极其特殊的样本：\n最终答案完全正确，但推导过程里藏着真实的物理硬伤。\n这就是检验监督能力的试金石：\n当结论碰巧对了，裁判能不能看出推导在胡扯？\n8 个大模型被拉来充当安全裁判。\n在看不到答案的盲审状态下，裁判揪出推导错误的概率是 52.1%。\n可一旦把经过验证的标准答案递给裁判，这个抓出率不仅没涨，反而跌到了 43.8%。\n8 个 AI 裁判，在所有测试里表现出完全一致的迟钝。\n如果选手的最终答案算错了，裁判拿到标准答案后，报错率会从 65.3% 飙升到 95.1%。\n在裁判盲审放行之后，再把标准答案递过去：\n答案算错的样本，93.8% 会被裁判重新判定为错误。\n而答案蒙对、推导全错的样本，能被重新抓出来的只有 18.0%。\n这台机器暴露出来的核心机制，叫「结果一致性比对」。\n所谓的思维链监控，根本没有在独立核验逻辑。\n裁判看到正确答案的瞬间，算力就自动滑向了逆向倒推：\n只要最后的数字对得上，前面哪怕写了一段荒谬的推导，它也会自动脑补出合理的解释一路放行。\n只有在最终数字对不上的时候，它才会回过头去挑刺。\n它没有在审查推导过程。\n它只是在核对收据。\n在安全领域，这被称为一种温和的奖励作弊：\n一个看似合理的产出，根本无法证明生产它的逻辑是可靠的。\n现在的 AI 安全评估，大量依赖已知答案来测试裁判的监控能力。\n这种测试给出了一个危险的合规幻觉。\n当所有人都以为裁判在替人类盯紧 AI 的思考过程。\n裁判其实只是站在终点线，看了一眼记分牌。\n如果连已知答案的物理题，都能靠一个碰巧正确的数字把裁判骗过去。\n未来面对那些人类自己都不知道答案的前沿推理，这套监控还能防住什么？","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-09-02 12:19:59","created_at":"2026-09-02 12:19:59","url":"https://mubeitech.com/p/mb-20260902-d843eb","markdown_url":"https://mubeitech.com/p/mb-20260902-d843eb/markdown"}]}