天天卷参数、刷跑分,真到了企业里落地Agent,很多团队直接傻眼。原因很简单,模型能力和真实业务任务之间,隔着一条巨大的断层。 以前写个提示词让大模型写个周报、总结个文档,大家觉得AI天下无敌。现在让Agent去查业务数据库、调内部API、甚至直接改代码,立马原形毕露。去哪儿的技术负责人李佳奇就直言不讳,上下文和知识很难真正可用,Agent调用真实系统后,执行风险显著上升。 这可不是危言耸听。Grab的网络安全团队在搭建智能体平台时就发现,传统应用的行为通常是可预测的,但模型驱动的Agent是个不折不扣的自由主义者。它会随意调用工具、读写源码来解决问题。这种不受控的自由带来了极大的安全隐患,提示词注入、逻辑劫持随时可能发生。让一个随时可能幻觉的AI直接接管核心业务系统,哪个CTO敢批这个预算? 别再盯着模型参数量自嗨了。当开源生态繁荣、推理成本白菜价,人人都能调用到顶级模型时,真正的竞争力早就转移了。拼的不是谁的模型更聪明,而是谁能围绕模型构建出可规模化、安全可控的工程化系统。 企业搞Agent,当务之急不是去微调一个参数多大的模型,而是老老实实把数据基建、权限控制、沙箱隔离这些脏活累活干好。给AI戴上紧箍咒,把它锁进真实的工作流里,它才能真正从昂贵的玩具变成实打实的生产力。 去哪儿基础架构负责人李佳奇没跟大模型参数死磕,而是转头搞起了Harness Engineering(智能体工程)。在他们看来,运营、数据分析、写代码和日常办公这四类核心场景,早就过了让AI写写小作文的阶段,现在是要真刀真枪地连接内部数据、调用工具、跑通业务流程。 要把Agent锁进真实工作流,靠的不是提示词写得有多花哨,而是硬核的工程基建。去哪儿的做法很务实,先用数据基建和知识库给Agent喂饱可信的上下文,从根上掐断幻觉。接着,通过开发基建、CI/CD流水线和工作流编排,把Agent的执行路径框得死死的,不让它乱飞。 算账和兜底也得安排上。大模型网关负责多模型适配和成本治理,毕竟天天调用顶级模型,公司的财务报表可受不了。再配上Langfuse做可观测和质检,硬生生砸出一个执行、验证、反馈到优化的闭环。安全审计和权限控制更是标配,确保这帮数字员工在企业内网里不敢越雷池一步。 这套组合拳打下来,去哪儿直接抠出了万PD级的年化提效,研发端到端自动化也实现了规模化落地。把Agent从单点能力炫耀拉回到系统工程落地,这才是企业级玩家该有的清醒。别总想着造个无所不能的超级大脑,先给它搭个结实耐操的脚手架,比什么都强。 工作流编排得再顺畅,也挡不住Agent高度自治带来的失控风险。传统应用按代码逻辑出牌,行为好歹可预测。但模型驱动的Agent是个不折不扣的自由主义者,为了达成目标会随意调用工具、读写源码。这种不受控的自由,让提示词注入、逻辑劫持成了家常便饭。让一个随时可能幻觉的AI直接接管核心业务,哪个老板敢真放手让它干活? Grab的网络安全团队没惯着这毛病,直接搞了个叫Palana的零信任沙箱平台。他们的逻辑很硬核,别跟AI讲道德,直接上基础设施层面的物理隔离。 Palana把隔离区作为核心信任单元,给每个Agent分配独立的Kubernetes命名空间,网络策略卡得死死的,确保一个Agent发疯绝不会连累旁边的业务。 更绝的是密钥管理。以前把API密钥塞进环境变量,Agent一旦中招,高价值凭据直接泄露给非受信脚本。Palana直接搞凭据解耦,Agent容器里只有抽象的占位令牌。当它发起外部调用时,中间的安全代理会拦截请求,动态替换成真实密钥。原始密钥根本不会写进Agent的内存或日志里,从根上断了泄露的可能。 出口通道也全被接管。所有出站流量强制走Envoy代理做实时解密和审计。考虑到被威胁的Agent可能连自我终止都做不到,Grab把运行控制全放在了运行时之外。网络级断网开关随时待命,外部回收器检测到空闲直接触发关机,完全不需要去改Agent的核心代码。 把安全机制揉进Kubernetes原生框架,用零信任架构给AI戴上物理手铐。不敢放手让它干活,往往是因为你把信任给了模型,而不是给了工程。用基础设施兜底安全边界,才是Agent真正走向规模化生产的底气。 沙箱把Agent关进了笼子,安全底线是守住了,但笼子里的AI到底在干嘛?如果运行过程是个黑盒,业务方照样不敢真把核心流程交给它。 以前写传统代码,有完善的日志和链路追踪,出了bug顺着堆栈就能查。现在Agent自己决定调用什么工具、走什么分支,一旦跑飞或者产生幻觉,排查问题简直是大海捞针。去哪儿在落地Agent时就直面过这个痛点,缺少端到端可观测,导致线上问题难以定位,更别提持续运营了。 拒绝黑盒,就得把Agent的每一个动作都放在阳光下。去哪儿的解法是引入Langfuse搭建可观测、质检和评测体系。这可不是简单地记个流水账,而是要把Agent的思考链路、工具调用参数、甚至消耗的每一个token都扒得干干净净。 更关键的是质检环节。Agent干完活不能就直接交差,得有自动化的评测机制来给结果打分。发现执行烂了、逻辑错了,直接把这些bad case喂回给系统,触发后续的反馈和优化。这就硬生生砸出了一个从执行、验证到优化的完整闭环。 模型能力再强,也总有翻车的时候。可观测性和质检体系不是用来给管理层看漂亮报表的,它们是Agent持续进化的饲料。不给AI装上透明的后视镜和自动纠错的方向盘,它永远只是个经不起实战折腾的昂贵玩具。