{"id":"mb-20260827-f59273","account":"mubei","brand":"","title":"把一段 AI 文本的水印检出率从 188 降到 0，不需要改动任何一个肉眼可见的字","summary":"把一段 AI 文本的水印检出率从 188 降到 0，不需要改动任何一个肉眼可见的字","body":"把一段 AI 文本的水印检出率从 188 降到 0，不需要改动任何一个肉眼可见的字。\n一行内容都没删。\n词序一个都没换。\n连排版在屏幕上的显示都一模一样。\n为什么发在顶级期刊上的 AI 水印技术，会脆到这种地步？\n这是大模型安全领域最滑稽也最致命的盲区。\n它的名字叫分词去同步。\n2024 年底，DeepMind 在《自然》（Nature）杂志上发表了一项重磅研究。\n这项被称为 SynthID-Text 的技术，被看作解决 AI 内容滥用风险的行业标杆。\n主流大模型大规模集成了它，各大监管机构在制定 AI 合规法案时，也把它当作可落地的技术支柱。\n它的数学原理设计得环环相扣。\n在模型生成文本的每一毫秒，系统利用密钥和上下文，通过锦标赛采样（Tournament Sampling）对候选词施加极微小的概率偏置。\n人读起来毫无感知，文本质量完全不打折。\n只要拿着专属密钥的检测器扫一遍，系统就能在连续的词元序列里，精准把 AI 痕迹抓出来。\n在 192 个检测窗口里，能精准命中 188 个特征点。\n可这套看似固若金汤的数学防线，有一个致命的前提假设。\n它默认人类肉眼看到的文字，和算法读到的词元，是同一种东西。\n现代大模型的底层分词器，用的是字节对编码（BPE）。\n分词器不认人类的语法和字形，它只认底层的字节组合。\n只要一段连续的字母频繁出现，算法就会把它们贪婪合并成一个独立的词元编号（Token ID）。\n这就给攻破水印留下了一条近乎透明的后门。\n你不需要做复杂的语义重写，不需要用另一个模型去洗稿。\n只需要在英文字母之间，塞进像 U+034F（字形连接符）或 U+FE00（变体选择符）这样的零宽不可见字符。\n现代操作系统和浏览器渲染文字时，会自动忽略这些零宽字符。\n在读者眼里，文章的字形、空格、排版没有任何改变。\n在底层分词器眼里，原本平滑的字节序列被硬生生切碎了。\n一个原本能被识别为单个词元的常用词，被强行拆解成好几个完全陌生的碎片编码。\n检测器依赖的上下文特征链条，在第一个不可见字符插入的瞬间就全面断裂。\n统计特征消失了。\n原本高达 188/192 的高危告警，瞬间跌成了 0/192 的绝对白名单。\n整套由顶尖学者搭建的统计防线，在几个不可见字符面前彻底失效。\n这暴露了大模型治理最深层的矛盾。\n人类在屏幕上消费的是字符和语义。\n大模型在服务器里运算的是分词编号。\n当监管、立法和安全方案把信任押在底层的分词序列上，任何一个利用渲染层与分词层脱钩的技巧，都能让所有合规检测形同虚设。\n最脆弱的安全漏洞，从来不是数学公式算错了。\n保护的那个抽象层，在现实世界里根本没人活着。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-27 22:36:43","created_at":"2026-08-27 22:36:43"}