{"id":"mb-20260827-c53980","account":"mubei","brand":"","title":"2025 年初只占 1.0% 的一种代码合并文风，到 2026 年中拿下了 GitHub 45% 的江山","summary":"2025 年初只占 1.0% 的一种代码合并文风，到 2026 年中拿下了 GitHub 45% 的江山","body":"2025 年初只占 1.0% 的一种代码合并文风，到 2026 年中拿下了 GitHub 45% 的江山。\n最显眼的特征，是所有人都在高频重复同一个词：load-bearing（承重）。\n连英文破折号的出现频率，都在一年半里暴涨了 600 多倍。\n数据分析师 Louis Abraham 用算法聚类了数万份提交记录，发现全网代码说明最终全被归进了八个模版。\n没有人统一下发过格式规范。\n是所有人在呼叫 Claude 写代码时，模型自己锁死了这批词汇。\n为什么大模型总在翻来覆去用这几个词？\n参数上的采样温度调得再高，也冲不破底层的数学漏斗。\n第一层收敛来自偏好对齐。\n为了保证回答严谨、专业、像个顶级工程师，强化学习在奖励函数里把概率空间狠狠压缩，模型本能地把概率压在少数高安全权重的词汇上。\n但真正致命的第二层收敛，来自大厂正在推行的一项防伪技术。\nAnthropic 计划给 Claude 接入 Google 的 SynthID-Text 隐形水印。\n2024 年 10 月，Google 在 Nature 上发表了这套水印的底层论文。\n论文里坦白了一个关键的技术妥协：跨响应多样性降低（reduction to inter-response diversity）。\n这台水印机器是怎么工作的？\n它不在生成完文本后改字，而是在每一个词采样的瞬间介入。\n算法把前面已经生成的词当成伪随机种子，在候选词表里进行打分，强行把符合水印特征的词选出来。\n它的目标是在几百个词里埋下一串人类看不见、但统计学能鉴定的数学指纹。\n但这笔交易的代价非常残酷。\n当同一个问题被多次提问时，水印算法为了保证指纹不丢，会把原本发散的词汇选择强行拉回固定的几条轨道。\n不同的回答，在底层数学上被捏成了同一种形状。\n一个荒谬的闭环在这里形成了。\nAI 在没有被加水印前，就已经因为对齐策略陷入了严重的词汇垄断。\n而人类为了抓出 AI 所发明的防伪水印，却是一台在算法层面进一步消灭多样性的压缩机。\n越想在文本里埋下可追踪的防伪标记，模型吐出的句子就越发整齐划一。\n技术没有打破单调的魔咒，只是把语言的贫瘠做成了标准配置。\n当全球近一半的代码说明都被套进同一套词汇模具，我们失去的究竟是辨别机器的难度，还是公共语言里原本该有的野性与生机？","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-27 22:36:40","created_at":"2026-08-27 22:36:40"}