{"id":"mb-20260901-995023","account":"mubei","brand":"","title":"很多大模型厂商都有一个心照不宣的安全共识","summary":"很多大模型厂商都有一个心照不宣的安全共识","body":"很多大模型厂商都有一个心照不宣的安全共识。\n只要把权重参数、计算梯度和内部激活值锁在服务器深处，外界就只能隔着 API 看到输出结果。\n你最多只能通过海量问答去模仿它的语言风格。\n想把底层的几何骨架直接偷走，数学上不可能。\n这个守护了整个 AI 产业几年的安全假设，刚刚被击穿了。\n来自美国国家标准与技术研究院（NIST）和密歇根理工大学的两位安全学者，在 arXiv 上公开了一篇最新论文。\n他们仅仅向黑盒 API 发送了 8193 次普通的输入探测。\n在完全不碰任何内层数据、看不到任何梯度的情况下，把 Transformer 内部前向传播网络（FFN）的隐藏权重方向完整提取了出来。\n重构出的参数方向，余弦对齐度超过了 0.94。\n拿这套提取出来的骨架直接去拟合一个替代模型，与原模型的一致性超过 93%，任务性能差距不到 0.9%。\n为什么几千次平平无奇的黑盒问答，能像 X 光一样把模型的内部参数透视得一清二楚？\n答案藏在一台被整个行业长期忽视的数学机器里。\n曲率密码分析。\n现在的现代主流大模型，为了让训练过程更平稳，几乎全面弃用了老式带有生硬折角的 ReLU 激活函数。\n换上的是 GELU 和 SiLU 这类平滑的光滑激活函数。\n光滑意味着连续。\n在微积分里，光滑同时意味着一件极其致命的事。\n它的二阶导数处处存在。\n在几何上，这个二阶导数描述的物理特征，叫曲率。\n当你给 Transformer 的前向网络输入一组经过微小扰动的数据时，输出端对输入端的二阶变化率，在数学上会构成一个海森矩阵。\n关键就在这里。\n前向网络内部每一层隐藏的输入权重，都会在二阶导数里留下一组秩一对称因子。\n无论你从黑盒外面输入什么测试向量，观测到的每一个海森矩阵，本质上都只是这同一组核心权重方向的不同比例混合物。\n输入不同的测试点，只是在给这组隐藏权重拍摄不同角度的曲率切片。\n研究人员把这个黑盒测绘过程，转化成了一个部分对称张量分解问题。\n通过设计精巧的向量输出模板复用技术，探测查询的计算成本被直接压低了 16 倍。\n仅仅用 16 个投影海森矩阵、总共 8193 次黑盒调用，算法就从复杂的曲率混合物中，把内部隐藏的权重方向一根一根抽了出来。\n在独立训练的 Vision Transformer 视觉模型上：\nGELU 激活函数下，95.1% 的内部权重方向对齐度突破了 0.90。\nSiLU 激活函数下，91.9% 的权重方向同样被精准捕获。\n这种穿透力不挑层数，在模型所有的 Transformer 模块上完全稳定复现。\n有人曾试图在 API 层面筑起防线。\n比如把输出的小数点做截断舍入，或者在返回结果里加入高斯随机噪声。\n但攻击者只要自适应调整数值差分的探测步长，权重对齐度立刻重新飙回 0.96 和 0.93。\n只要 API 还在返回连续的浮点数值，防线就在数学上不攻自破。\n过去行业习惯把安全建立在行为隔离上。\n以为把参数装进黑盒、把激活函数磨平，就能抹掉内部的一切几何痕迹。\n现代密码学的第一性原理却给出了相反的裁决。\n那个为了加速优化而刻意引入的光滑特性，反向变成了一条泄露内部骨架的高灵敏天线。\n行为上的黑盒封装，挡不住几何层面的二阶泄漏。\n只要物理系统的输出还在遵循平滑的数学曲率，内部的秘密，就已经写在外部的每一次微小震颤里了。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-09-01 14:49:02","created_at":"2026-09-01 14:49:02"}