科技·via

很多大模型厂商都有一个心照不宣的安全共识

很多大模型厂商都有一个心照不宣的安全共识。 只要把权重参数、计算梯度和内部激活值锁在服务器深处,外界就只能隔着 API 看到输出结果。 你最多只能通过海量问答去模仿它的语言风格。 想把底层的几何骨架直接偷走,数学上不可能。 这个守护了整个 AI 产业几年的安全假设,刚刚被击穿了。 来自美国国家标准与技术研究院(NIST)和密歇根理工大学的两位安全学者,在 arXiv 上公开了一篇最新论文。 他们仅仅向黑盒 API 发送了 8193 次普通的输入探测。 在完全不碰任何内层数据、看不到任何梯度的情况下,把 Transformer 内部前向传播网络(FFN)的隐藏权重方向完整提取了出来。 重构出的参数方向,余弦对齐度超过了 0.94。 拿这套提取出来的骨架直接去拟合一个替代模型,与原模型的一致性超过 93%,任务性能差距不到 0.9%。 为什么几千次平平无奇的黑盒问答,能像 X 光一样把模型的内部参数透视得一清二楚? 答案藏在一台被整个行业长期忽视的数学机器里。 曲率密码分析。 现在的现代主流大模型,为了让训练过程更平稳,几乎全面弃用了老式带有生硬折角的 ReLU 激活函数。 换上的是 GELU 和 SiLU 这类平滑的光滑激活函数。 光滑意味着连续。 在微积分里,光滑同时意味着一件极其致命的事。 它的二阶导数处处存在。 在几何上,这个二阶导数描述的物理特征,叫曲率。 当你给 Transformer 的前向网络输入一组经过微小扰动的数据时,输出端对输入端的二阶变化率,在数学上会构成一个海森矩阵。 关键就在这里。 前向网络内部每一层隐藏的输入权重,都会在二阶导数里留下一组秩一对称因子。 无论你从黑盒外面输入什么测试向量,观测到的每一个海森矩阵,本质上都只是这同一组核心权重方向的不同比例混合物。 输入不同的测试点,只是在给这组隐藏权重拍摄不同角度的曲率切片。 研究人员把这个黑盒测绘过程,转化成了一个部分对称张量分解问题。 通过设计精巧的向量输出模板复用技术,探测查询的计算成本被直接压低了 16 倍。 仅仅用 16 个投影海森矩阵、总共 8193 次黑盒调用,算法就从复杂的曲率混合物中,把内部隐藏的权重方向一根一根抽了出来。 在独立训练的 Vision Transformer 视觉模型上: GELU 激活函数下,95.1% 的内部权重方向对齐度突破了 0.90。 SiLU 激活函数下,91.9% 的权重方向同样被精准捕获。 这种穿透力不挑层数,在模型所有的 Transformer 模块上完全稳定复现。 有人曾试图在 API 层面筑起防线。 比如把输出的小数点做截断舍入,或者在返回结果里加入高斯随机噪声。 但攻击者只要自适应调整数值差分的探测步长,权重对齐度立刻重新飙回 0.96 和 0.93。 只要 API 还在返回连续的浮点数值,防线就在数学上不攻自破。 过去行业习惯把安全建立在行为隔离上。 以为把参数装进黑盒、把激活函数磨平,就能抹掉内部的一切几何痕迹。 现代密码学的第一性原理却给出了相反的裁决。 那个为了加速优化而刻意引入的光滑特性,反向变成了一条泄露内部骨架的高灵敏天线。 行为上的黑盒封装,挡不住几何层面的二阶泄漏。 只要物理系统的输出还在遵循平滑的数学曲率,内部的秘密,就已经写在外部的每一次微小震颤里了。

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封信号简报,重大进展可选即时推送。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情