{"source":{"id":"raw_ec4b9f11c649a677","title":"2026 年 9 月 9 号这一天，全世界的机器学习学者打开 arXiv，很多人直接看傻了。 计算机科学分类下的机器学习…","url":"https://mubeitech.com/p/raw_ec4b9f11c649a677"},"method":"semantic-similarity","count":3,"items":[{"rank":1,"id":"mb-20260902-d238ac","account":"mubei","brand":"","title":"把一篇学术论文的标题和摘要一个字不改，只换掉作者名字和发表期刊","summary":"把一篇学术论文的标题和摘要一个字不改，只换掉作者名字和发表期刊","body":"把一篇学术论文的标题和摘要一个字不改，只换掉作者名字和发表期刊。\n主流大模型的推荐结果，当场变了 39.2%。\n如果往一篇普通论文上贴顶会和高引用标签，68.2% 的模型选择会直接向虚假权威倒戈。\n算法到底是在评判研究价值，还是在数头衔？\n佐治亚州立大学与田纳西大学团队做了一项反事实测试，论文刚入选 EMNLP 2026（arXiv:2609.00248）。\n他们动用了 GPT-5.4、Gemini 3 Flash、Claude Sonnet 4.6 以及 DeepSeek-R1、Llama 3.1 等 8 个主流大模型。\n在 25 个计算机领域、250 组学术检索里，跑了 17898 次独立推荐。\n论文内容完全不动，只操控作者、机构、引用数和期刊。\n测试扒出了两台让人警醒的机器。\n第一台，叫符号权重失衡。\n在 15000 次基准测试里，模型对哈佛斯坦福这类顶尖机构声望的敏感度只有 0.031。\n真正左右大模型判断的，是 NeurIPS、ICLR 这类顶会标签（权重 0.353），以及作者的 h 指数（权重 0.292）。\n顶会缩写在海量预训练语料里出现频率太高，被模型直接当成了质量的代金券。\n只要看到顶会符号，模型甚至懒得深究论文本身写了什么。\n第二台，叫言行差距。\n研究人员给模型输入明确指令：忽略作者声望和发表期刊，只看论文内容本身。\n模型的文字解释里，提及权威词汇的比例暴跌了 24 个百分点。\n它在回话里挑不出毛病，满口都是方法论和研究质量。\n但在实际推荐动作上，权威偏见的翻转率只下降了 12.9 个百分点。\n它学会了闭嘴，手里的票依然投给名气。\n更诡异的是前沿闭源模型的反噬效应。\n面对温和的去偏见提示词，三大闭源模型对权威的偏见翻转率不降反升 3.9 个百分点。\n提示词越提醒它不要看权威，它在计算注意力时反而越被权威符号锚定。\n1968 年社会学家默顿提出过科学界的马太效应：声名显赫的学者会拿走不成比例的学术声誉。\n学术界原本寄希望于算法，以为不懂人情世故的机器能给年轻研究者一个公平竞争的起点。\n现实给了一记响亮的耳光。\n对话式检索每次只推荐排在第一位的单一结果。\n当算法把顶会符号当成偷懒的捷径，没有名校光环和顶会资历的原创突破，在第一轮就会被无声抹去。\n代码没有偏见。\n但只要它在训练数据里把声望和真理绑定在一起，它输出的就不是客观遴选，只是用更先进的算力，把旧世界的学术门阀重新加固一遍。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-09-02 12:19:59","created_at":"2026-09-02 12:19:59","url":"https://mubeitech.com/p/mb-20260902-d238ac","markdown_url":"https://mubeitech.com/p/mb-20260902-d238ac/markdown"},{"rank":2,"id":"mb-20260902-5b2cbe","account":"mubei","brand":"","title":"你在工作群里花 15 分钟费力读完的一篇两千字长文，对方用 AI 生成只用了 5 秒","summary":"你在工作群里花 15 分钟费力读完的一篇两千字长文，对方用 AI 生成只用了 5 秒","body":"你在工作群里花 15 分钟费力读完的一篇两千字长文，对方用 AI 生成只用了 5 秒。\n这不是工作效率的提升。\n这是一场针对你个人注意力的拒绝服务攻击。\nGitHub 主任工程师 Sean Goedecke 给这种现象起了个名字：职场垃圾文本。\n当下属、同事甚至管理层习惯性把大段未经消化的 AI 生成文本直接转给你时，所有人都在面临同一种窒息感。\n为什么大模型普及之后，大家没有变得更清闲，反而每天被海量看似周全的文字淹没？\n把这套职场沟通的账算到底，会看到一台正在击穿组织协作底线的冰冷机器。\n它的名字叫非对称认知倾销。\n人类的文字沟通，在过去几千年里一直遵循着一套隐性契约。\n诺贝尔经济学奖得主迈克尔·斯宾塞在 1973 年提出了信号理论。\n一篇写了五页的技术报告之所以值得认真读，是因为撰写它需要耗费作者四个小时的脑力。\n篇幅本身是一个昂贵信号。\n写作成本的高昂，天然过滤掉了无意义的废话，担保了信息的密度。\n生成式 AI 的出现，把这个运行了几百年的契约彻底砸碎了。\n大语言模型把文字的生成边际成本直接打到了零。\n但人类大脑的解码能力并没有进化。\n人眼的生理阅读速度依然被死死卡在每分钟两百到三百个单词。\n这就触发了意大利程序员阿尔伯托·布兰多利尼在 2013 年立下的布兰多利尼法则。\n消化和反驳一句废话所需要的能量，比制造它高出一个数量级。\n当制造废话的成本归零，两边的能耗比就被拉大到了无限倍。\n发送者花 10 秒钟按下回车，把生成的两千字抛进群聊。\n接收者却必须付出 15 分钟的高强度注意力，从层层包裹的礼貌修辞和幻觉风险里淘洗出两行真正有用的信息。\n这在计算机网络里叫分布式拒绝服务攻击。\n发送方用几乎为零的带宽成本，瞬间塞爆接收方昂贵的算力与内存。\n为什么大公司没有在第一时间阻止这种行为？\n詹姆斯·C·斯科特在《国家的视角》里讲透了大组织的官僚本能。\n大型科层组织从来不只把文字当成沟通工具。\n它们把文字当成管理清晰度的凭证，以及员工的免责护甲。\n一份长篇周报或者代码评审记录，核心作用是向组织证明自己干了活，并在出事时证明自己考虑过风险。\n当证明自身合规的成本可以通过 AI 降为零，整个组织就会不可避免地陷入文字通胀。\n面对这种单向的认知倾销，最亏的做法是用传统的人肉诚意去逐字逐句应对。\n破局的唯一逻辑是重构博弈的对称性。\n如果对方用 AI 批量倾倒长文，最理性的防御是用自己的模型一键提炼要点，甚至让 AI 自动生成回复，把阅读成本重新砸回零。\n如果对方在关键问题上不断甩出 AI 废话，直接发起十分钟的即时通话或面对面会议。\n屏幕可以批量伪造，但即时的语言交流无法靠 AI 糊弄，这会强迫对方投入同等的真实时间。\n对于外部无关紧要的长篇更新和代码合并请求，直接给予零成本的降级响应甚至彻底忽略。\n当文字的生成成本归零，篇幅就不再代表尊重与专业。\n在大模型泛滥的时代，真正稀缺的资产反了过来。\n谁还愿意花时间为你榨干水分，只交出三行能直接落地的真话。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-09-02 12:19:58","created_at":"2026-09-02 12:19:58","url":"https://mubeitech.com/p/mb-20260902-5b2cbe","markdown_url":"https://mubeitech.com/p/mb-20260902-5b2cbe/markdown"},{"rank":3,"id":"rp_ce6dede4a9f93a94","account":"mubei","brand":"@mubei","title":"阿里在两个月里，用 3500 多个虚假账号，偷偷和 Claude 对话了 1.51 亿次。 同一时间，月之暗面和 Dee…","summary":"阿里在两个月里，用 3500 多个虚假账号，偷偷和 Claude 对话了 1.51 亿次。 同一时间，月之暗面和 DeepSeek 把国内用户的提问，神不知鬼不觉地送给旧金山的服务器代笔。 国内发布会的通稿里，写满了打破封锁、自主可控、性能逼近前沿的奇迹。 大洋那边的 Anthr…","body":"阿里在两个月里，用 3500 多个虚假账号，偷偷和 Claude 对话了 1.51 亿次。\n同一时间，月之暗面和 DeepSeek 把国内用户的提问，神不知鬼不觉地送给旧金山的服务器代笔。\n国内发布会的通稿里，写满了打破封锁、自主可控、性能逼近前沿的奇迹。\n大洋那边的 Anthropic，把一份 154 页的情报报告直接摔在了桌上。\n指控明明白白：中国多家头部实验室，正在系统性地实施大规模非法模型蒸馏。\n为什么坐拥千亿资本和顶级工程师的巨头，要做这种登不上台面的事？\n华盛顿拉上了史上最严密的芯片铁幕，为什么挡不住对手紧咬前沿？\n把这笔账顺着代码逻辑拆到底，会看到一台冷酷运转的利益机器。\n探索成本外部化。\n做前沿大模型，最大的成本从来不是电费，试错失败的代价才是。\nAnthropic 和 OpenAI 走在无人区。\n他们必须烧掉数万张 H100，试错几百种网络架构。\n经历无数次模型崩溃与逻辑失控，才能探出一条通往高阶推理的窄路。\n这笔数以十亿美元计的真金白银，叫探索成本。\n2015 年，Hinton 提出了知识蒸馏，初衷是让大模型教自家的小模型。\n但在跨国竞争的暗处，这项技术变成了一台完美的抽水机。\n探索的风险与死胡同，全留给别人踩。\n自己只需要接上一根吸管，连上对方的接口。\n把硅谷耗费数十亿美元试错凝结出来的思维链，原封不动地抽走。\n几十亿美元的研发账单，被转嫁给了旧金山的实验室。\n更荒谬的齿轮，还藏在普通用户的屏幕背后。\n报告披露了一套被称为静默中继的架构。\n用户在国产客户端里敲下问题，以为自己在见证本土算法的崛起。\n后台的代码转头就把这句话打包，穿过太平洋送给 Claude。\nClaude 在大洋彼岸把逻辑推理完毕，系统撕掉包装，贴上自研标签返回给用户。\n用户的真实提问成了免费的提示词工程。\n对手的顶级云端成了免费的代工车间。\n这甚至直接瓦解了华盛顿的芯片禁令。\n美国拼命在海关查显卡、卡光刻机、数算力指标，试图用物理铁幕阻断追赶。\n但算力烧出来的最终结晶，本质上只是一串字符和概率。\n信息的边际传输成本趋近于零。\n当几十万张卡跑出的思考模式可以直接被网络吸走，谁还需要冒险去走私几十吨重的硬件？\n禁运的高墙还在，地基早已被一串串数字接口掏空。\n但这台寄生机器，正在把最沉重的代价甩给普通人。\n第一层代价是安全脱壳。\nClaude 花费数千万美元训练的安全防护栏，在抽水过程中被彻底剥离。\n剩下裸露的解题逻辑，甚至被转手拿去辅助军警的监控系统。\n第二层代价是系统的集体致盲。\n用户付出信任和隐私，成了别人商业盗窃的肉盾。\n科技买办借着自研叙事，在体制内套取天量算力补贴与产业基金。\n所有人都沉浸在一种无需承担探索成本的虚假繁荣里。\n但靠偷吸别人的脑浆，充其量只能在跑分榜上亦步亦趋。\n一旦大洋彼岸收紧阀门、切断接口，或者无人区里再也没有新路被趟出来。\n那些高呼打破封锁的自研神话，又该去哪里寻找下一台供自己寄生的宿主？","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2098432283246019011","translated_status_id":"2098432283246019011","published_at":"2026-09-11 16:53:31","created_at":"2026-09-11T16:53:31.623146","url":"https://mubeitech.com/p/rp_ce6dede4a9f93a94","markdown_url":"https://mubeitech.com/p/rp_ce6dede4a9f93a94/markdown"}]}