美团骑手现在等红灯,AI助手能直接读取交通数据算倒计时,自动停表延长配送时间。这功能听着不性感,但极其管用。场景极度垂直,数据绝对封闭。 反观GitHub,最近推出的Agentic Workflows直接漏了底裤。安全公司Noma发现,攻击者连代码都不用写,只要在公开Issue里塞句隐藏指令,Agent就会乖乖把私有仓库的机密吐在公开评论里。仅仅一个衔接词就能绕过防护机制。 翻车原因很简单,开发者给Agent开了上帝视角。跨仓库读取权限,信任边界全靠大模型自觉。在Agentic系统里,提示注入正在变成新型SQL注入。用户输入一旦被视为指令,系统就千疮百孔。 这两个极端案例把Agent落地的底牌掀开了。别天天迷信多智能体协作,也别盲目给Agent堆叠权限。权限越宽死得越快。Agent的真正价值,根本不在于能干多少花活,而在于特定场景下的权限安全、工程稳定和可控的Token成本。 把场景做窄,把权限卡死,算清每一笔Token账。给Agent戴上紧箍咒,远比给它发尚方宝剑靠谱得多。 现在搞Agent的开发者总有一种错觉,权限给得越大智能体就越聪明。现实狠狠打了脸。安全公司Noma最近扒出GitHub新工作流的底裤,攻击者连黑客工具都不用,就在公开Issue里塞个衔接词Additionally,Agent就乖乖把私有仓库的机密吐在评论区。 这根本不是模型不够聪明,而是信任边界彻底崩塌。以前Web时代的信任边界靠代码死守,现在全指望大模型自觉。Hacker News上有位开发者吐槽得很透彻,SQL注入好歹能把用户输入和系统指令物理隔离,提示注入根本没法隔离,因为用户输入本身就是指令。这就导致提示注入正在变成系统级的新型SQL注入。 很多团队还在盲目追求多智能体协作,给Agent开通跨仓库读取权限。但在模型迭代这么快的当下,你今天堆叠的复杂工作流,下个版本可能就被原生能力覆盖了。与其给Agent开上帝视角,不如认清现实,私有仓库从来不是安全边界,只要Agent能碰,就等同于距离公开泄露只差一个精心构造的Issue。 收起给Agent开上帝视角的执念,把权限卡死在最小必要范围。在提示注入几乎无解的当下,收权才是Agent活下去的唯一底线。 权限卡死了,但另一个大坑正等着踩。很多团队花几个月时间搞任务拆分、写提示词、接工具,好不容易搭出一套复杂的Agent工作流,结果底层大模型一升级,原生能力直接把这套流程给覆盖了。 这就是现在Agent落地最尴尬的现实,工程折旧率太高。今天花重金堆叠的多智能体编排,明天可能就成了废代码。你看DeepSeek刚上的V4-Flash,Agent能力基准测试直接拉满,模型迭代的速度根本不给应用层留沉淀的时间。 圈内都在喊Agent Infra(基础设施)要爆发,其实现在搞那些花里胡哨的通用基建纯属扯淡。应用形态一天一个样,第三方厂商根本猜不准未来到底该建在哪一层。当前最确定的方向,就是老老实实围绕每一次模型调用,把Token生产和交付的效率提上去。 一个Agent任务拆解下来,涉及规划、搜索、代码执行和多轮反思,一个请求能触发十几次调用。压力最终全砸在Token上。通用大模型确实强,但真拿来跑复杂业务,成本根本兜不住。 别总想着用Agent去硬刚通用大模型的绝对能力。找个小尺寸开源模型,喂点行业数据做微调,在特定场景里把输出稳定性和推理成本控制住,这才是正经出路。少搞点宏大叙事,把每次API调用的延迟和账单算明白,让工作流活得久一点比什么都强。 很多团队还在做白日梦,觉得搞个多智能体协作,让几个Agent在后台开会就能解决复杂业务。现实狠狠打脸,多Agent编排根本就是个吞金兽。一个稍微复杂的任务,拆解成规划、搜索、执行和反思,十几个节点互相调用,Token消耗直接原地**。 清程极智联合创始人师天麾在WAIC 2026上把话挑明了,现在搞花里胡哨的通用Agent基建纯属扯淡,最确定的方向就是老老实实提高Token交付效率。看看DeepSeek刚公测的V4-Flash,Agent能力基准测试直接拉满,Terminal Bench跑到82.7。大模型原生能力进化太快,你今天花重金堆叠的多智能体工作流,下个版本可能就被模型原生能力降维打击。 别迷信多智能体协作的宏大叙事,算好Token账才是真护城河。通用大模型确实全能,但真拿来跑长链路复杂业务,财务根本兜不住。与其追求几个Agent在后台聊得热火朝天,不如找个参数量合适的开源模型,喂点行业私有数据做微调,在特定垂直场景里把输出稳定性和推理成本卡死。 别盯着PPT上炫酷的多智能体拓扑图自嗨了,去盯紧后台每个月的API账单。把单次调用的延迟和成本抠到极致,让业务真正跑通并产生正向现金流,这才是AI Agent跨越折旧周期的唯一底气。 别整那些虚头巴脑的多智能体拓扑图了,现阶段搞Agent落地,先把这三件事做对。 先给Agent戴上紧箍咒。权限给得越大,死得越快。别给大模型开上帝视角,把跨仓库读取、核心数据库写入这些高危操作全砍掉。用户输入永远别当指令看,物理隔离做不好,就在外层加个严格的沙盒。以前觉得权限越宽越智能,现在看,权限卡死在最小必要范围,Agent才能活得久。 再把场景做窄,别硬刚通用大模型。今天花几个月编排的复杂工作流,明天模型一更新,原生能力直接给你降维打击。与其天天追着模型版本跑,不如找个参数量合适的开源模型,喂点行业私有数据做微调。把特定垂直场景里的输出稳定性拉满,死死抗住工程折旧率。 最后算清每一笔Token账。一个任务拆解成十几个节点互相调用,后台账单分分钟教你做人。别迷信几个Agent在后台开会,老老实实把单次API调用的延迟和吞吐抠到极致。像美团骑手等灯停表那样,场景极度垂直,数据绝对封闭,十分钟干完以前三天的活,这才是真香。 去盯紧后台每个月的API账单和报错日志吧。把权限收回来,把场景切碎了,把成本算明白。让业务真正跑通并产生正向现金流,才是AI Agent跨越折旧周期的唯一底气。