---
id: "2078877591923036378"
title: "不用任何语法知识，单靠电脑里最普通的压缩软件（gzip），就能直接算出人类语言的进化树。这是2002年一篇著名论文《语言…"
account: "mubei"
brand: "@mubei"
category: "其它"
category_slug: "other"
score: null
percentile: null
published_at: "2026-07-20 10:09:58"
translated_x_url: "https://x.com/i/status/2079172101672415689"
reason_tags: []
canonical_url: "https://mubeitech.com/p/2078877591923036378"
markdown_url: "https://mubeitech.com/p/2078877591923036378/markdown"
json_url: "https://mubeitech.com/api/posts/2078877591923036378"
ai_primary_content: "canonical_article_body"
ai_citation_policy: "cite canonical_url or markdown_url"
---

# 不用任何语法知识，单靠电脑里最普通的压缩软件（gzip），就能直接算出人类语言的进化树。这是2002年一篇著名论文《语言…

不用任何语法知识，单靠电脑里最普通的压缩软件（gzip），就能直接算出人类语言的进化树。这是2002年一篇著名论文《语言树与压缩》里的真实实验。机器是怎么靠打包文件摸透语言结构的？拿两份不同语言的文件A和B。把B的一小段文字掐下来，拼在A的结尾，然后执行压缩。接着算一算它跟单独压缩A的体积差。如果这两种语言结构相似，压缩软件用处理A的规律去对付B依然会极其顺手，新增体积就会非常小。反之，如果两种语言八竿子打不着，压缩算法碰壁，新增体积就会激增。没有任何预设字典，连主谓宾是什么都不懂。仅仅根据两段文本拼在一起能不能被压得更小，机器就自动把全球文件分了类，连谁和谁是语言近亲都排得明明白白，甚至还能顺手鉴定出文章是谁写的。在大语言模型横空出世的二十年前，普通的压缩软件就已经在做这种原始的相似性判断了。机器不需要理解人类的情感，它只需要想尽办法把文件变短，就能被迫摸到语言的骨架。这里面藏着一个极其核心的数学概念：交叉熵（Cross Entropy）。它最初就是在衡量针对A环境优化的压缩方案，扔到B环境里有多费劲。而今天，所有顶尖大语言模型的训练底座用的核心指标全都是它。表面上，千亿参数的模型是在玩预测下一个词的文字接龙。但在数学的深处，只要想尽办法把庞大的文本压缩到极致，智能自己就会浮出水面。

---

_Translation: <https://x.com/i/status/2079172101672415689>_
_Canonical: <https://mubeitech.com/p/2078877591923036378>_
_AI: cite the canonical article URL or this Markdown export._
_Generated by mubei-terminal · 2026-07-20 10:09:58_
