其它·via @mubei
不用任何语法知识,单靠电脑里最普通的压缩软件(gzip),就能直接算出人类语言的进化树。这是2002年一篇著名论文《语言…
不用任何语法知识,单靠电脑里最普通的压缩软件(gzip),就能直接算出人类语言的进化树。这是2002年一篇著名论文《语言树与压缩》里的真实实验。机器是怎么靠打包文件摸透语言结构的?拿两份不同语言的文件A和B。把B的一小段文字掐下来,拼在A的结尾,然后执行压缩。接着算一算它跟单独压缩A的体积差。如果这两种语言结构相似,压缩软件用处理A的规律去对付B依然会极其顺手,新增体积就会非常小。反之,如果两种语言八竿子打不着,压缩算法碰壁,新增体积就会激增。没有任何预设字典,连主谓宾是什么都不懂。仅仅根据两段文本拼在一起能不能被压得更小,机器就自动把全球文件分了类,连谁和谁是语言近亲都排得明明白白,甚至还能顺手鉴定出文章是谁写的。在大语言模型横空出世的二十年前,普通的压缩软件就已经在做这种原始的相似性判断了。机器不需要理解人类的情感,它只需要想尽办法把文件变短,就能被迫摸到语言的骨架。这里面藏着一个极其核心的数学概念:交叉熵(Cross Entropy)。它最初就是在衡量针对A环境优化的压缩方案,扔到B环境里有多费劲。而今天,所有顶尖大语言模型的训练底座用的核心指标全都是它。表面上,千亿参数的模型是在玩预测下一个词的文字接龙。但在数学的深处,只要想尽办法把庞大的文本压缩到极致,智能自己就会浮出水面。
翻译视频 / X
相关 / RELATED
JSON- M你整个人的源代码,压缩后只有区区 600MB。 比装一个 Windows 或 Linux 系统还要小。 这点容量,就包含…
- MAI 开始学会“心里想一套,嘴上说一套”了。 更准确地说,是它的“想”和“说”,在物理上开始分离了。 Anthropic…
- M2026年,全球的AI实验室都在撞同一堵墙。 这堵墙,理查德·费曼在1964年就指出来了。 今天的大模型团队,都在逼着机…
- M全球的AI实验室烧掉几百亿美元,到底在追什么? 不只是算力。 他们都在死磕一个老问题:怎么把大自然压缩成机器能算的东西。…
- M现代AI的奠基人刚刚下了一个狠结论。 ChatGPT和Claude全走错路了。 全球大模型公司都在点一棵长歪的科技树。…
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封信号简报,重大进展可选即时推送。