科技·via

把一段 AI 文本的水印检出率从 188 降到 0,不需要改动任何一个肉眼可见的字

把一段 AI 文本的水印检出率从 188 降到 0,不需要改动任何一个肉眼可见的字。 一行内容都没删。 词序一个都没换。 连排版在屏幕上的显示都一模一样。 为什么发在顶级期刊上的 AI 水印技术,会脆到这种地步? 这是大模型安全领域最滑稽也最致命的盲区。 它的名字叫分词去同步。 2024 年底,DeepMind 在《自然》(Nature)杂志上发表了一项重磅研究。 这项被称为 SynthID-Text 的技术,被看作解决 AI 内容滥用风险的行业标杆。 主流大模型大规模集成了它,各大监管机构在制定 AI 合规法案时,也把它当作可落地的技术支柱。 它的数学原理设计得环环相扣。 在模型生成文本的每一毫秒,系统利用密钥和上下文,通过锦标赛采样(Tournament Sampling)对候选词施加极微小的概率偏置。 人读起来毫无感知,文本质量完全不打折。 只要拿着专属密钥的检测器扫一遍,系统就能在连续的词元序列里,精准把 AI 痕迹抓出来。 在 192 个检测窗口里,能精准命中 188 个特征点。 可这套看似固若金汤的数学防线,有一个致命的前提假设。 它默认人类肉眼看到的文字,和算法读到的词元,是同一种东西。 现代大模型的底层分词器,用的是字节对编码(BPE)。 分词器不认人类的语法和字形,它只认底层的字节组合。 只要一段连续的字母频繁出现,算法就会把它们贪婪合并成一个独立的词元编号(Token ID)。 这就给攻破水印留下了一条近乎透明的后门。 你不需要做复杂的语义重写,不需要用另一个模型去洗稿。 只需要在英文字母之间,塞进像 U+034F(字形连接符)或 U+FE00(变体选择符)这样的零宽不可见字符。 现代操作系统和浏览器渲染文字时,会自动忽略这些零宽字符。 在读者眼里,文章的字形、空格、排版没有任何改变。 在底层分词器眼里,原本平滑的字节序列被硬生生切碎了。 一个原本能被识别为单个词元的常用词,被强行拆解成好几个完全陌生的碎片编码。 检测器依赖的上下文特征链条,在第一个不可见字符插入的瞬间就全面断裂。 统计特征消失了。 原本高达 188/192 的高危告警,瞬间跌成了 0/192 的绝对白名单。 整套由顶尖学者搭建的统计防线,在几个不可见字符面前彻底失效。 这暴露了大模型治理最深层的矛盾。 人类在屏幕上消费的是字符和语义。 大模型在服务器里运算的是分词编号。 当监管、立法和安全方案把信任押在底层的分词序列上,任何一个利用渲染层与分词层脱钩的技巧,都能让所有合规检测形同虚设。 最脆弱的安全漏洞,从来不是数学公式算错了。 保护的那个抽象层,在现实世界里根本没人活着。

相关 / RELATED

JSON

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封信号简报,重大进展可选即时推送。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情