你对 AI 说:只要机票降到 200 美元以下,立刻帮我买
你对 AI 说:只要机票降到 200 美元以下,立刻帮我买。 两周后,系统在半夜自动扣款出票。 这时候出现了一个让所有系统架构师头皮发麻的问题:这笔钱,到底是谁买的? 你当时没有在线,你的登录会话早就过期了。 如果算你买的,系统拿着你的信用卡在半夜做自主决策。 如果算后台服务买的,企业的通用服务账号根本没有权利替员工签下个人消费。 传统软件工程赖以生存的鉴权地基,在智能体面前当场塌陷。 企业差旅管理平台 Navan 的首席架构师 Roberto Milev 把现在的 AI 热潮,比作 2015 年的微服务狂欢。 当年微服务概念大火,所有团队都在跟风拆服务。 软件大师 Martin Fowler 当时泼了一盆冷水:如果你连一个单体架构都写不好,凭什么觉得自己能搞定微服务? 今天一模一样的剧本正在上演。 大多数团队连单个智能体的确定性循环都调不准,就急着去搭多智能体协作网络。 结果不是系统变聪明了,是把单点的混乱,放大成了指数级的工程灾难。 在真实的生产环境里,老一套软件工程遇到了三道死墙。 第一道是鉴权下沉。 传统的网关只在系统最外层查一次身份。 但智能体是自主调用工具的。 它查完数据可能转头去调扣款接口,中间没有任何人类确认。 防护线必须从最外层网关,死死钉进每一次工具调用的前后拦截钩子里。 第二道是日志与测试的全面失效。 以前排查故障看日志,输出一行行清晰的状态码。 智能体一旦跑起来,输出的是成千上万行思考链。 一个 30 步的复杂任务在第 18 步卡死,传统的日志只会把你淹没在密密麻麻的文字噪音里。 传统的单元测试也完全失效。 智能体是非确定性的,每次跑出来的步骤都不一样,没办法用固定结果去写断言。 评价它的方式必须彻底转向轨迹评估。 不再强求它走固定路线,给它从起点到终点的整条移动轨迹打分。 第三道是上下文的组织方式。 无脑塞满上下文窗口,只会让大模型在海量信息里迅速失焦。 真正管用的工业解法,是把技能当成上下文的最小独立单元。 一个主控智能体平时只带最精简的骨架。 遇到差旅装差旅技能,遇到报销装报销技能,用完即卸。 底层的运行环境和接口协议正在被大厂快速标准化。 真正的工业级深水区,才刚刚浮出水面。 成千上万次推理循环带来的成本失控,不可复现的非确定性调试,在今天的软件工程界依然没有标准答案。 一项技术的成熟,从来不看演示视频有多炫酷。 它只看那些藏在账单、报错日志和权限断点里的泥水坑,到底有没有人把它一块块填平。
引用 / CITATIONS
No citations exported.
导出 / EXPORT
订阅 · SUBSCRIBE
新的深度解读发布时,会在每周简报里送到你邮箱。