---
id: "mb-20260830-a77d77"
kind: "deep"
title: "你对 AI 说：只要机票降到 200 美元以下，立刻帮我买"
topic: "你对 AI 说：只要机票降到 200 美元以下，立刻帮我买"
source_type: "generated"
status: "published"
generated_at: "2026-08-30 21:58:20"
frame_type: ["代理委托鉴权与非确定性轨迹评估", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# 你对 AI 说：只要机票降到 200 美元以下，立刻帮我买

你对 AI 说：只要机票降到 200 美元以下，立刻帮我买。
两周后，系统在半夜自动扣款出票。
这时候出现了一个让所有系统架构师头皮发麻的问题：这笔钱，到底是谁买的？
你当时没有在线，你的登录会话早就过期了。
如果算你买的，系统拿着你的信用卡在半夜做自主决策。
如果算后台服务买的，企业的通用服务账号根本没有权利替员工签下个人消费。
传统软件工程赖以生存的鉴权地基，在智能体面前当场塌陷。
企业差旅管理平台 Navan 的首席架构师 Roberto Milev 把现在的 AI 热潮，比作 2015 年的微服务狂欢。
当年微服务概念大火，所有团队都在跟风拆服务。
软件大师 Martin Fowler 当时泼了一盆冷水：如果你连一个单体架构都写不好，凭什么觉得自己能搞定微服务？
今天一模一样的剧本正在上演。
大多数团队连单个智能体的确定性循环都调不准，就急着去搭多智能体协作网络。
结果不是系统变聪明了，是把单点的混乱，放大成了指数级的工程灾难。
在真实的生产环境里，老一套软件工程遇到了三道死墙。
第一道是鉴权下沉。
传统的网关只在系统最外层查一次身份。
但智能体是自主调用工具的。
它查完数据可能转头去调扣款接口，中间没有任何人类确认。
防护线必须从最外层网关，死死钉进每一次工具调用的前后拦截钩子里。
第二道是日志与测试的全面失效。
以前排查故障看日志，输出一行行清晰的状态码。
智能体一旦跑起来，输出的是成千上万行思考链。
一个 30 步的复杂任务在第 18 步卡死，传统的日志只会把你淹没在密密麻麻的文字噪音里。
传统的单元测试也完全失效。
智能体是非确定性的，每次跑出来的步骤都不一样，没办法用固定结果去写断言。
评价它的方式必须彻底转向轨迹评估。
不再强求它走固定路线，给它从起点到终点的整条移动轨迹打分。
第三道是上下文的组织方式。
无脑塞满上下文窗口，只会让大模型在海量信息里迅速失焦。
真正管用的工业解法，是把技能当成上下文的最小独立单元。
一个主控智能体平时只带最精简的骨架。
遇到差旅装差旅技能，遇到报销装报销技能，用完即卸。
底层的运行环境和接口协议正在被大厂快速标准化。
真正的工业级深水区，才刚刚浮出水面。
成千上万次推理循环带来的成本失控，不可复现的非确定性调试，在今天的软件工程界依然没有标准答案。
一项技术的成熟，从来不看演示视频有多炫酷。
它只看那些藏在账单、报错日志和权限断点里的泥水坑，到底有没有人把它一块块填平。

_Rendered by mubei-terminal._
