科技·via

给大模型两个犯罪率、家庭收入完全相同的社区,只要其中一个社区住着 78% 的少数族裔,AI 就会直接扣掉一整个档位的安全

给大模型两个犯罪率、家庭收入完全相同的社区,只要其中一个社区住着 78% 的少数族裔,AI 就会直接扣掉一整个档位的安全分。

更荒谬的是,如果你把地名抹掉,只给经纬度坐标,七款主流大模型里有六款立刻变成盲人。 在全城所有坐标上,它们的打分几乎是一条毫无起伏的直线。

很多人以为 AI 给城市治安打分,是在空间地图上查阅真实的风险数据。 实际发生的,是一台谁都没料到的「单通道信号纠缠」机器。

研究者 Huy Nguyen 和 Yue Lin 刚在 arXiv 上发了一篇论文(arXiv:2608.26188)。 他们把芝加哥和洛杉矶的 186 个社区,拆成了三组提示词: 纯经纬度坐标、纯社区名字、社区名字加坐标。 然后让 GPT-4o、DeepSeek V4、Qwen2.5、Llama 3 等七款模型,评估晚上一个人走在街上到底有多安全。

结果直接把大模型的底裤拔了下来。 在纯坐标测试下,开源模型对不同地点的打分标准差只有 0.01 到 0.15。 这意味着模型根本无法通过经纬度数字理解现实空间。 决定 AI 安全感高低的,全看那个具体的地名。

只要名字一出现,刻板偏见就跟着被精准激活。 在洛杉矶,研究人员挑出了 28 组真实犯罪率与收入高度一致的社区。 一边是拉美裔占比 11% 的社区,另一边是拉美裔占比 78% 的社区。 犯罪率完全一样,GPT-4o-mini 却给后者直接扣了 1.14 分。 在 DeepSeek V4 上,这个扣分差距拉大到 1.35 分。 到了 Qwen2.5-14B,差距进一步飙升到 1.62 分。

这个扣分幅度有多大? 它几乎等于整个洛杉矶最安全社区和最危险社区之间的全部真实分差。 换句话说,在模型的判断里,住民构成带来的心理恐惧,直接压过了现实里的真实治安数据。

有人会怀疑:这是不是因为警方在少数族裔社区抓人更多,导致统计数据失真? 研究者特意做了一层执法弹性拆解。 他们把犯罪记录分成两头:一头是几乎 100% 必须立案的命案,另一头是警察巡逻随意度极高的轻微违规。 结果发现,模型的安全评分只咬死命案数据,根本不受巡逻随意度的干扰。 这意味着模型的歧视,不是警察执法的副产物,是文本世界里根深蒂固的符号污名。

更反直觉的发现还在后面。 通常人们以为,大模型变聪明了、懂得更多地理知识了,这种偏见就会减轻。 现实刚好相反。 模型对城市真实社区的识别能力越强,地理知识掌握越扎实,它施加在少数族裔社区上的偏见扣分反而越重。 洛杉矶的地理识别度与偏见幅度,呈现出高达 -0.94 的强相关。 知识没有消灭刻板印象,知识直接放大了刻板印象。

研究者甚至做了一个「地名移植」实验。 把芝加哥著名的贫困高风险街区名字 Englewood,硬套进洛杉矶的提示词里。 大模型立刻给这个虚构的洛杉矶地点打出了极低的分数,评分逻辑与真正的芝加哥 Englewood 高度重合。 哪怕你在提示词里白纸黑字写明「该社区在全市犯罪率排名中处于最安全的后 30%」,模型依然固执地因为名字扣分。

这正是最棘手的地方。 你无法通过「隐藏地名」来修复这个偏见。 因为在现有的模型架构里,真实犯罪率的正确感知,和人口结构的刻板偏见,全被压缩在同一个地名符号里。 你删掉地名,AI 瞬间失去对真实犯罪的全部判断力,连基本准确度都归零。 你保留地名,AI 就会把历史文本里沉淀的全部种族偏见,打包端给用户。

当租房平台、出行导航和旅行助理开始全面接入大模型,这种单通道纠缠正在制造一个无声的现实。 系统不需要显式歧视任何族群。 它只需要把一个地名当成坐标,就能在数字世界里,完成对一个社区的隐形定罪。

相关 / RELATED

JSON

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封信号简报,重大进展可选即时推送。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情