科技·via

2025 年初只占 1.0% 的一种代码合并文风,到 2026 年中拿下了 GitHub 45% 的江山

2025 年初只占 1.0% 的一种代码合并文风,到 2026 年中拿下了 GitHub 45% 的江山。 最显眼的特征,是所有人都在高频重复同一个词:load-bearing(承重)。 连英文破折号的出现频率,都在一年半里暴涨了 600 多倍。 数据分析师 Louis Abraham 用算法聚类了数万份提交记录,发现全网代码说明最终全被归进了八个模版。 没有人统一下发过格式规范。 是所有人在呼叫 Claude 写代码时,模型自己锁死了这批词汇。 为什么大模型总在翻来覆去用这几个词? 参数上的采样温度调得再高,也冲不破底层的数学漏斗。 第一层收敛来自偏好对齐。 为了保证回答严谨、专业、像个顶级工程师,强化学习在奖励函数里把概率空间狠狠压缩,模型本能地把概率压在少数高安全权重的词汇上。 但真正致命的第二层收敛,来自大厂正在推行的一项防伪技术。 Anthropic 计划给 Claude 接入 Google 的 SynthID-Text 隐形水印。 2024 年 10 月,Google 在 Nature 上发表了这套水印的底层论文。 论文里坦白了一个关键的技术妥协:跨响应多样性降低(reduction to inter-response diversity)。 这台水印机器是怎么工作的? 它不在生成完文本后改字,而是在每一个词采样的瞬间介入。 算法把前面已经生成的词当成伪随机种子,在候选词表里进行打分,强行把符合水印特征的词选出来。 它的目标是在几百个词里埋下一串人类看不见、但统计学能鉴定的数学指纹。 但这笔交易的代价非常残酷。 当同一个问题被多次提问时,水印算法为了保证指纹不丢,会把原本发散的词汇选择强行拉回固定的几条轨道。 不同的回答,在底层数学上被捏成了同一种形状。 一个荒谬的闭环在这里形成了。 AI 在没有被加水印前,就已经因为对齐策略陷入了严重的词汇垄断。 而人类为了抓出 AI 所发明的防伪水印,却是一台在算法层面进一步消灭多样性的压缩机。 越想在文本里埋下可追踪的防伪标记,模型吐出的句子就越发整齐划一。 技术没有打破单调的魔咒,只是把语言的贫瘠做成了标准配置。 当全球近一半的代码说明都被套进同一套词汇模具,我们失去的究竟是辨别机器的难度,还是公共语言里原本该有的野性与生机?

相关 / RELATED

JSON

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封信号简报,重大进展可选即时推送。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情