其它·via @mubei
不用任何语法知识,单靠电脑里最普通的压缩软件(gzip),就能直接算出人类语言的进化树。这是2002年一篇著名论文《语言…
不用任何语法知识,单靠电脑里最普通的压缩软件(gzip),就能直接算出人类语言的进化树。这是2002年一篇著名论文《语言树与压缩》里的真实实验。机器是怎么靠打包文件摸透语言结构的?拿两份不同语言的文件A和B。把B的一小段文字掐下来,拼在A的结尾,然后执行压缩。接着算一算它跟单独压缩A的体积差。如果这两种语言结构相似,压缩软件用处理A的规律去对付B依然会极其顺手,新增体积就会非常小。反之,如果两种语言八竿子打不着,压缩算法碰壁,新增体积就会激增。没有任何预设字典,连主谓宾是什么都不懂。仅仅根据两段文本拼在一起能不能被压得更小,机器就自动把全球文件分了类,连谁和谁是语言近亲都排得明明白白,甚至还能顺手鉴定出文章是谁写的。在大语言模型横空出世的二十年前,普通的压缩软件就已经在做这种原始的相似性判断了。机器不需要理解人类的情感,它只需要想尽办法把文件变短,就能被迫摸到语言的骨架。这里面藏着一个极其核心的数学概念:交叉熵(Cross Entropy)。它最初就是在衡量针对A环境优化的压缩方案,扔到B环境里有多费劲。而今天,所有顶尖大语言模型的训练底座用的核心指标全都是它。表面上,千亿参数的模型是在玩预测下一个词的文字接龙。但在数学的深处,只要想尽办法把庞大的文本压缩到极致,智能自己就会浮出水面。