个人开发者靠 Vibe Coding 和反复调 Prompt 跑通的 demo,落到企业级交付里基本就是埋雷。一年前大家还在为 Agent 能自己拼组件兴奋,现在回头看,单纯靠玄学调优根本兜不住非确定性模型带来的隐性成本和线上故障。Thoughtworks 的 Birgitta Böckeler 在 QCon 直接把底牌亮明:Context Engineering 现在是个双向放大器,它能把规范好的工程实践成倍放大,也会把原本藏在历史代码里的架构问题瞬间喂给模型。以前丢个规则文件防 agent 忘开虚拟环境就算交差,现在面对的是 skills、MCP、subagents 混杂的上下文迷宫。 工程风险评估从来不看模型多聪明,只看三个硬指标:出错概率、影响半径、可检测性。一线实战的反馈很直观,个人写代码的效率确实上去了,但组织效能全卡在上下文对齐和排障上。当 AI 生成的代码比例突破临界值,人类对系统的掌控力必然断崖式下跌,这时候再靠感觉拼提示词,等于把生产环境当盲盒拆。Context Engineering 的分水岭在于,把原本给人看的约束文档,硬生生改造成 agent 能按需加载、可反馈优化的接口系统。 现在各家工具都在卷上下文监控面板,因为 context window 再大也经不起无脑堆料。一上来就把全量技能树和系统提示词塞满,算力成本和幻觉率只会指数级飙升。Agent 想从个人玩具变成企业基建,靠的不是模型更会猜,而是 Context Engineering 把信息边界彻底锁死。先把上下文预算算清楚,该动态加载的绝不提前暴露,该拦截的绝不放行。确定性从来不是大模型自带的天赋,是工程架构拿尺子硬量出来的。 以前往工作区根目录扔个 AGENTS.md 就算交差,现在这套粗暴做法在复杂项目里只会把上下文窗口撑爆。Anthropic 推出的 Skills 概念,核心是把臃肿的规则文件拆成模块化弹药库。真正拉开差距的不是拆分本身,而是惰性加载机制。Agent 启动时只会扫一眼 Skill 的简短描述,比如从测试环境拉取日志用于排障。模型自己判断当前任务是否需要,确认需要才去加载完整文档甚至配套的本地脚本。以前是开局把全量技能树一股脑塞进 prompt,现在是让 LLM 按业务节奏按需上膛。这种按需调度直接切断了上下文失控的源头。 上下文窗口再大也经不起无脑堆料。Birgitta 在演讲里直接甩出监控面板截图,刚开启会话还没敲几行指令,Claude Code 的上下文占用已经飙到 15%。系统提示词、内建工具列表、静态规则全在后台静默吃内存。上下文预算不是虚词,是实打实的 token 账单和推理延迟。现在 Claude Code 和 GitHub Copilot 都把上下文占用做成了可视化面板,开发者能一眼看穿是哪个模块在偷偷抢带宽。把原本给人看的约束文档,硬生生改造成带触发开关的接口系统,这才是 Context Engineering 真正长出工程骨架的标志。 指望模型自己消化海量信息本身就是个伪命题。上下文喂得太满,注意力机制必然涣散,幻觉率会跟着算力成本一起跳涨。企业级交付没空陪非确定性模型玩概率游戏,上下文预算必须卡死在业务刚需的阈值内。设计 Skill 时先算清楚 token 账,该延迟加载的绝不全量下发,该拦截的冗余信息直接掐断。把上下文调度做成硬性拦截网,Agent 的产出边界才能彻底锁死。 上下文控制只是基础,真正要跑通企业级交付,还得靠最底层的确定性约束与排障能力来兜底。Birgitta 在 QCon 上直接挑明:以后选型可能根本不在乎底层用 React 还是 Vue,决策维度会变成“有没有现成的 Harness 模板”。以前搭架构看框架生态,现在看的是安全网厚度。Harness 不是又一套脚手架,而是给 Agent 焊死的外壳。它干的事很干脆:模型吐出代码,Harness 负责跑测试、卡规范、拦截越界调用。方案 A 是继续靠人类肉眼 Review AI 生成的几千行代码,方案 B 是把工程约束改造成 Agent 能实时学习、自动反馈的拦截网。企业环境没空陪非确定性模型玩概率游戏,选 B 是唯一的活路。 非确定性模型的随机性,在个人玩具里叫惊喜,落到生产线上就是定时**。快手团队在推 RCA 排障 Agent 时碰到过最现实的困境:AI 生成的代码占比一高,人类对系统的掌控力直接断崖下跌。告警池里 75% 都是噪声,业务迭代快到根本没法预设排查路径,这时候靠人工盯盘纯属体力消耗。把原本给人看的排障手册,拆解成 Agent 可执行的确定性脚本,让系统在报错瞬间自动触发预设诊断流,排障逻辑才算真正完成迁移。工程风险评估从来不看模型多聪明,只认三个硬指标:出错概率、影响半径、可检测性。Harness 的核心就是把可检测性拉到最高,它不指望模型永远不犯错,而是确保一旦越界,流水线能立刻熔断并自动隔离故障。 别再把预算全砸在调优 Prompt 上了。企业基建的护城河从来不是模型有多灵,而是兜底机制有多硬。先实例化一套带完整测试矩阵和自动化诊断链路的 Harness,再让 Agent 进去干活,这才是把随机性彻底锁死的工程正解。