1.9亿次暗道偷运:Anthropic 报告揭开国产大模型“蒸馏超车”的技术真相
你在国内大模型里敲下一行字,真正替你写出答案的,可能是旧金山的 Claude。 这不是段子。 2026 年 5 月到 7 月,几家国内头部大模型实验室,偷偷给 Anthropic 发了近 1.9 亿次请求。 Anthropic 的服务根本没对中国大陆开放。 这 1.9 亿次请求是怎么进去的? 工业级偷运。 阿里一家就占了 1.51 亿次。 为了绕开风控,他们动用了大约 3500 个虚假账号。 全部挂着美国各地的家庭宽带住宅代理 IP,绑着临时邮箱和虚拟信用卡。 高峰期一天往 Claude 的接口里灌近 300 万次提问。 目的只有一个:抓取 Claude 的深度推理过程,拿回去训练自己的通义千问。 更绝的是月之暗面,也就是做 Kimi 的那家公司。 他们动用了 5380 个虚假账号,三个月发了超过 2300 万次请求。 他们的操作甚至省去了中转: 国内用户在 Kimi 里提问,系统在后台悄悄把问题转包给 Claude,拿到答案再吐给用户。 用户以为自己在用国产自研的大模型。 结果自己的商业代码、公司机密,甚至监控记录,全被原封不动送进了旧金山的服务器。 还有 DeepSeek,7 月短短 14 天里跑了 1210 万次交互。 小米则把自家 MiMo 模型的用户聊天记录录下来,直接灌给 Claude 生产训练数据。 为什么要冒这么大风险,花这么大阵仗去刷对手的模型? 买不起芯片,还是算力不够? 两样都缺。 但最致命的,是人工智能研发里的成本剪刀差。 从零训练一个前沿大模型到底有多难? Anthropic 研发一个版本,要烧几万张顶级芯片,耗费数亿美元,在黑暗里做无数次失败实验。 这种探索成本,大部分团队根本承受不起。 更别说在先进制程芯片封锁下,国内根本拿不到大规模的高端算力。 于是有人盯上了捷径:知识蒸馏。 在算法里,蒸馏本来是个正经技术。 大模型当老师,小模型当学生。 老师把自己嚼碎的逻辑和思维链吐出来,小模型跟着背,就能用极小的体积跑出不错的效果。 但在商业竞争里,这套技术被玩成了无本万利的不对称套利。 你自己不用花几亿美元去探路。 对手花巨资探索出来的推理链条、编程能力和逻辑结构,全成了现成的高质量数据。 只要把吸管插进对手的服务器,就能把对方几十亿美元的研发成果,低成本抽回自己的模型里。 国内大模型动不动宣传跑分达到 Claude 的 95%,训练成本只有几十分之一。 这是技术突破吗? 不是。 这是把别人的探索成本,变成了自己的免费饲料。 偷点数据,至于惊动美国最高安全部门吗? 2026 年 9 月 8 日,美国国家安全局 NSA、网络安全和基础设施安全局 CISA 与联邦调查局 FBI 破天荒发了联合预警。 因为这里出现了一个巨大的结构漏洞:安全脱壳。 Anthropic 训练 Claude,最耗费心力和算力的环节之一,是安全对齐。 他们花大代价给模型装刹车片,防止它生成生化武器配方、网络攻击代码、协助跨境监控。 可当国内实验室拿 Claude 的输出去蒸馏时,发生了一件可怕的事: 他们只抽取了 Claude 顶级的编程能力和推理逻辑,把 Anthropic 辛苦装上的安全防线全部剥离了。 他们拿到了一把顶级锋利的智能手术刀,却把止血钳和安全阀全拆了。 这种没有任何安全防护的高能力模型,如果被接入敏感系统,会发生什么? 这才是西方情报机构真正紧张的地方。 这不是版权纠纷,这是双用途技术管制的防线被直接打穿了。 这种抄近道的繁荣,能撑多久? 蒸馏最大的技术宿命,是它永远无法超越被蒸馏的对象。 学生背熟了老师的考卷,能考高分,但他永远学不会老师发现新知识的方法。 它能无限逼近已有的边界,却永远不可能推开新的大门。 更现实的代价是:一旦对方收紧风控、封死住宅代理、给输出结果下毒,或者切断整个接口生态呢? 寄生在别人探索成果上的繁荣,瞬间就会陷入断粮。 国内天天在喊全面自研、弯道超车。 可如果连通往终点的每一步台阶,都是深更半夜去偷别人的施工图, 这种领先,到底是缩短了差距,还是把自己的底层创新能力彻底锁死在了寄生链里?
引用 / CITATIONS
No citations exported.
同领域解读 / AI & LLMS
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封独立、不受审查的科技与 AI 深度评论,周一发出。带出处,可核查。