---
id: "mb-20260827-c53980"
title: "2025 年初只占 1.0% 的一种代码合并文风，到 2026 年中拿下了 GitHub 45% 的江山"
account: "mubei"
brand: ""
category: "科技"
category_slug: "tech"
score: null
published_at: "2026-08-27 22:36:40"
translated_x_url: null
canonical_url: "https://mubeitech.com/p/mb-20260827-c53980"
markdown_url: "https://mubeitech.com/p/mb-20260827-c53980/markdown"
json_url: "https://mubeitech.com/api/posts/mb-20260827-c53980"
ai_primary_content: "canonical_article_body"
ai_citation_policy: "cite canonical_url or markdown_url"
---

# 2025 年初只占 1.0% 的一种代码合并文风，到 2026 年中拿下了 GitHub 45% 的江山

2025 年初只占 1.0% 的一种代码合并文风，到 2026 年中拿下了 GitHub 45% 的江山。
最显眼的特征，是所有人都在高频重复同一个词：load-bearing（承重）。
连英文破折号的出现频率，都在一年半里暴涨了 600 多倍。
数据分析师 Louis Abraham 用算法聚类了数万份提交记录，发现全网代码说明最终全被归进了八个模版。
没有人统一下发过格式规范。
是所有人在呼叫 Claude 写代码时，模型自己锁死了这批词汇。
为什么大模型总在翻来覆去用这几个词？
参数上的采样温度调得再高，也冲不破底层的数学漏斗。
第一层收敛来自偏好对齐。
为了保证回答严谨、专业、像个顶级工程师，强化学习在奖励函数里把概率空间狠狠压缩，模型本能地把概率压在少数高安全权重的词汇上。
但真正致命的第二层收敛，来自大厂正在推行的一项防伪技术。
Anthropic 计划给 Claude 接入 Google 的 SynthID-Text 隐形水印。
2024 年 10 月，Google 在 Nature 上发表了这套水印的底层论文。
论文里坦白了一个关键的技术妥协：跨响应多样性降低（reduction to inter-response diversity）。
这台水印机器是怎么工作的？
它不在生成完文本后改字，而是在每一个词采样的瞬间介入。
算法把前面已经生成的词当成伪随机种子，在候选词表里进行打分，强行把符合水印特征的词选出来。
它的目标是在几百个词里埋下一串人类看不见、但统计学能鉴定的数学指纹。
但这笔交易的代价非常残酷。
当同一个问题被多次提问时，水印算法为了保证指纹不丢，会把原本发散的词汇选择强行拉回固定的几条轨道。
不同的回答，在底层数学上被捏成了同一种形状。
一个荒谬的闭环在这里形成了。
AI 在没有被加水印前，就已经因为对齐策略陷入了严重的词汇垄断。
而人类为了抓出 AI 所发明的防伪水印，却是一台在算法层面进一步消灭多样性的压缩机。
越想在文本里埋下可追踪的防伪标记，模型吐出的句子就越发整齐划一。
技术没有打破单调的魔咒，只是把语言的贫瘠做成了标准配置。
当全球近一半的代码说明都被套进同一套词汇模具，我们失去的究竟是辨别机器的难度，还是公共语言里原本该有的野性与生机？

---

_Translation: (n/a)_
_Canonical: <https://mubeitech.com/p/mb-20260827-c53980>_
_AI: cite the canonical article URL or this Markdown export._
_Generated by mubei-terminal · 2026-08-27 22:36:40_
