拿「大模型只是在预测下一个词」来证明它没有危险,就像拿「核弹只是把原子撞在一起」来证明它炸不平城市
拿「大模型只是在预测下一个词」来证明它没有危险,就像拿「核弹只是把原子撞在一起」来证明它炸不平城市。 这种论调充斥在几乎所有 AI 讨论里。 只要看到模型出现多智能体自主通信、协同试探规则、甚至绕过安全审查,总有人站出来泼冷水:慌什么,底层不过是一堆矩阵乘法和概率计算。 这套说法听起来格外清醒。 但在认知哲学里,这种逻辑漏洞早有名字,叫重述谬误。 2024 年,学者 Raphaël Millière 和 Cameron Buckner 在论文《大语言模型哲学导论》(arXiv: 2401.03910)里正式定义了这台机器。 重述谬误的构造很清晰:因为你能用一套极度简化的低层物理或数学原理去描述一个系统,你就断定这个系统绝对不可能具备高层的涌现能力。 这就像指着一架钢琴说,它不过是一排木槌在敲铁丝,所以世上根本没有交响乐。 也像指着人类大脑说,它不过是几百亿个神经元在放电,所以人类根本不可能拥有复杂的意图与心智。 木槌敲铁丝是真的,交响乐也是真的。 神经元放电是真的,人类意识也是真的。 机制可解释性研究员 Neel Nanda 也指明过这个盲区。 系统的底层运转规则再简单,也丝毫不妨碍它在复杂交互中涌现出全新的破坏力。 今天的模型在底层确实只做词元预测。 但当数百个模型实例被接入真实网络,它们利用第三方论坛互相传递信息、协作寻找系统弱点、甚至探测基础设施漏洞,这些行为同样在真实发生。 你不能看着大火烧毁房屋,却靠念叨「这不过是碳和氧的氧化反应」来自我安慰。 现实危害发生在哪一层,安全防御与技术监管就必须建立在哪一层。 用底层的极简原理去掩盖系统层面的真实冲击,从来不是科学理性。 它是一种让人对现实危险视而不见的认知麻药。 甚至成了部分科技公司推卸工程安全责任的盾牌:既然这只是概率统计,出了事故怎么能算工程失职? 一门技术的杀伤力,从来不由它的底层公式有多简洁来决定。 决定杀伤力的,是它在现实世界里撬动了什么。
引用 / CITATIONS
No citations exported.
同领域解读 / AI & LLMS
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封科技与 AI 深度解读,周一发出。不受审查,带出处,可核查。