科技·via

把价值数亿美元的顶尖大模型部署在第三方云端,最怕的不是服务器宕机

把价值数亿美元的顶尖大模型部署在第三方云端,最怕的不是服务器宕机。 是最值钱的模型权重被黑客通过普通的对话接口神不知鬼不觉地偷走。 在黑客眼里,每一次生成的词元,都是夹带私货的绝佳载体。 只要在输出词的选择上悄悄植入隐写术,就能把几十亿参数的代码像蚂蚁搬家一样抽空。 为了防住这种内鬼窃密,AI 安全界部署了一套看似固若金汤的数学警察。 只要把服务器的输出结果和官方基准模型对齐,对不上的直接报警。 但这里碰上了一个无法消除的物理硬伤。 显卡在并行计算浮点数时,天生存在不确定性。 哪怕完全相同的提示词和随机种子,因为多线程加法顺序的微小差异,输出结果也会出现轻微抖动。 如果把验证卡得太死,正常的硬件噪声就会引发海量误报。 如果把口子放宽,黑客就会钻进这层公差里肆意偷渡。 安全专家用耿贝尔分布设计了一套抖动宽容机制,在良性对话下把窃密通道压慢了两百倍以上。 这道被数学证明过的绝对防线,为什么会在现实中瞬间崩塌? 2026 年 8 月,学者 Nikita Kezins 在一篇 arXiv 论文里揭开了这台机器的致命软肋。 这台藏在提示词背后的攻击机器,叫对抗性熵膨胀。 耿贝尔推理验证之所以能在实验室里生效,是因为它建立在一个脆弱的假设上。 它假定攻击者只是个被动等回答的用户,面对的都是语法通顺的良性对话。 当输入是一句日常对话时,模型对下一个词的预测高度确定,输出熵极低。 在这种状态下,被系统判定为合法硬件抖动的容许词集合极度狭窄,可能只有一两个候选词。 黑客根本没有多余的空间去编码权重信息。 但真实的攻击者拥有对输入端提示词的完全控制权。 Kezins 设计了一种专门破坏语法结构、字符拼写和语系连续性的对抗性提示词。 当一串被刻意打乱结构的混乱输入喂进模型,语言模型原本的语义预测链路被瞬间击穿。 模型陷入了巨大的认知困惑。 输出概率分布从原本尖锐的高峰被强行压平,每个词元的输出熵剧烈膨胀。 这时候,原本为了宽容硬件抖动而设定的验证算法,被这股膨胀的熵彻底带偏。 系统认为模型在极度不确定时出现波动是合理的,于是把原本狭窄的容许词集合瞬间放宽了几十倍。 那扇原本只能通过几粒沙子的狭窄防线,被直接撑成了一条宽阔的隐蔽信道。 黑客顺理成章地在这个被合法化的大集合里自由挑选词元,将窃密数据堂而皇之地伪装成硬件噪声。 实验覆盖了从 10 亿到 320 亿参数的六款主流指令微调模型,跨越三个独立的随机种子。 在字符级与语系级破坏提示词的冲击下,攻击者每生成一个词元所能窃取的比特数直接翻倍。 原本号称超过两百倍的窃密减速防线,被暴力腰斩至 60 到 118 倍。 只要输入端由攻击者掌握,静态校准的数学防线就成了一纸空文。 很多安全协议在设计时,习惯把硬件的物理公差当成一个恒定不变的客观常数。 他们忽略了容纳这层公差的防御阈值,其实一直受制于输入数据的分布。 当输入端的不确定性可以被对手恶意放大,任何基于良性环境校准的静态防御都会沦为对手借力的跳板。 真正的系统韧性,从来不能指望一条一成不变的安全边界。 只有把抖动宽容的标尺与每一个词元的局部输出熵进行动态绑定,才能把被对手撑大的隐蔽信道重新锁死。

相关 / RELATED

JSON

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封信号简报,重大进展可选即时推送。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情