谷歌砸了7500万美元投资独立电影公司A24,却连人家核心片库的训练权都没拿到。这种看似反常的操作,其实戳破了科技圈长期以来消灭一切摩擦的执念。当AI视频生成从简单的单镜头走向复杂的场景编排时,行业里终于有人清醒过来:在创作这件事上,有些麻烦恰恰是作品长出灵魂的地方。 这种对摩擦的重新审视,刚好撞上了近期向全球大范围开放测试的谷歌Gemini Spark智能体。以前咱们写提示词,总恨不得让AI一口气包揽所有活儿。现在的Spark已经深度整合了Chrome浏览器,能直接用你保存的密码去搜航班、订机票、清理收件箱。但它偏偏在付款环节踩了刹车,把最敏感的掏钱动作交还给你,同时还加上了防提示词攻击的护城河。 这不仅仅是产品功能的更新,而是宣告了提示词工程正式分化为“执行控制”与“创作编排”两大流派。 执行控制派的核心是权限边界与安全防御。就像让AI替你订机票,你的提示词不再是教它怎么说话,而是明确划定它能干什么、绝对不能干什么。把付款环节留给自己,就是在给AI的执行力套上缰绳。 而创作编排派则完全相反,它重在节点拆解与保留判断摩擦。别把提示词写得太满,别急着去优化每一个细节。把大任务拆成一个个小节点,给AI留出试错和发挥的空间。 别再迷信一键生成所有事情的乌托邦了。把底线和钱包攥在自己手里,把创作的麻烦适度留给机器,才是当下驾驭AI Agent最清醒的活法。 拿让AI代订机票这个典型场景来拆解执行控制派的玩法。以前写提示词,总习惯丢一句帮我订张明天去北京的机票越便宜越好。现在面对Gemini Spark这种能直接读取浏览器密码、深度接管账号的智能体,这种写法简直是在裸奔。 实战写法得换个思路。先明确资源读取边界,限定它只能调用浏览器保存的常旅客信息。然后划定绝对禁区,写明禁止自动完成最终付款,遇到需要输入安全码的环节必须暂停并弹窗确认。最后设定异常熔断机制,比如若价格波动超过均价百分之二十,立即停止搜索并生成对比报告。 这根本不是在教AI怎么买票,而是在做权限的颗粒度切分。谷歌在Spark里特意把付款剥离出来交还用户,并加入防提示词攻击机制,就是基于同样的逻辑。正如OpenAI近期开源Codex Security CLI工具死磕代码级安全防御一样,执行类Agent的底线在于不越权。 在旨在消灭操作摩擦的执行任务里,我们反而要刻意保留安全摩擦。把比价和筛选的脏活累活扔给机器,但把掏钱包的权力死死攥在自己手里。执行控制派的提示词,本质上就是一份用自然语言写就的零信任安全协议。 讲完了死磕安全底线的执行控制,咱们来看看需要灵活度的创作编排。拿现在大热的AI视频生成来说,以前写提示词,恨不得把运镜轨迹、光影参数甚至人物微表情全写死。现在面对能直接从概念走到分镜的Adobe Creative Agent或是Google Flow,这种大包大揽的写法反而扼杀了惊喜。 实战写法得彻底换脑子。先做节点拆解,把一个长视频切成概念设定、分镜生成和场景延展三个独立环节。然后只设定核心基调和情绪锚点,比如明确这是一场赛博朋克风格的雨夜追逐,但别去规定雨水打在镜头上的具体折射率。最后在节点之间留白,让模型自己去推演转场和物理碰撞。 谷歌砸重金投资独立电影公司A24,图的不是现成片库,而是想弄明白电影制作中哪些摩擦必须留下。硅谷那套用软件消灭一切摩擦的逻辑,在创作领域根本行不通。你提示词写得太满,AI就成了没有灵魂的打字机。 1 拆解任务节点,把长流程切成概念、分镜、生成等独立模块。 2 设定情绪与基调锚点,克制对物理细节和运镜参数的微观控制。 3 在节点交接处留白,允许模型在转场和物理演算中产生意外惊喜。 创作类提示词从来不是写给机器的操作说明书,而是写给AI的导演阐述。把机械的执行交给模型,把审美判断的摩擦死死攥在自己手里,这才是让作品长出灵魂的捷径。 单镜头的留白只是开胃菜,真到了复杂工作流,从单点生成走向角色控制和场景编排,才是见真章的时候。看看产品边界的演进,Google Flow早就不满足于单镜头生成,直接杀入了角色控制和场景编排。Adobe也把Creative Agent塞进了Premiere和Frame.io,让用户直接从概念走到分镜,再落地成视频。面对这种量级的任务,以前那种把几百字剧情塞进一个对话框的写法,纯属给模型添堵。 实战写法得把长流程彻底切碎。先建立全局锚点,把世界观、人物特征和整体色调定死,作为后续节点的基准线。然后进入分镜拆解,把大场景切成远景交代、中景动作和特写情绪三个独立模块,每个模块只给核心动作指令。最后在节点交接处加上连贯性约束,要求雨水轨迹和人物服装在镜头切换时保持物理逻辑一致。 这种节点化拆解,正是创作编排派对付复杂任务的杀手锏。底层逻辑是一样的,代码模型从单纯补全下一行,进化到自主拆解复杂开发任务,视频编排也得走这条路。Runway那边的数据很能说明问题,把流程覆盖视频生成和语音克隆后,广告制作周期直接从几个月压缩到3小时。这种效率飞跃绝不是靠AI一口气包揽,而是靠人类把大任务切碎,喂给模型去消化。 别总幻想写一段万字长咒就能直接生成好莱坞大片。把复杂流程拆成节点,在节点交接处保留AI推演的判断摩擦,才是让复杂工作流真正跑通的硬道理。 从前面那些抠细节的实战写法跳出来,咱们横向看看这两大流派的底层逻辑,其实完全是两条平行线。 执行控制派的底色是收敛与防御。它的核心诉求是消灭操作摩擦,追求极致的确定性。就像谷歌Gemini Spark在接管浏览器帮你订机票时,死死卡住付款环节并加上防提示词攻击的护城河。你写这类提示词,本质上是在做权限的颗粒度切分,是在给机器套上零信任的缰绳。机器在这里是个绝对理性的执行者,容不得半点自由发挥,越界就是事故。 但到了创作编排派,底层逻辑完全反过来了,它的核心是发散与引导。硅谷那套用代码消灭一切摩擦的执念,在这里根本行不通。谷歌砸重金投资A24,图的就是弄明白电影制作中哪些摩擦必须留下。你写这类提示词,不是在下达死命令,而是在做导演阐述。机器在这里是个需要灵感的共创者,你刻意保留的判断摩擦,恰恰是作品长出灵魂的地方。 以前咱们总以为提示词写得越细越好,现在看完全是个误区。执行任务时,你要做的是做减法,砍掉AI的越权可能,把底线和钱包攥在自己手里;创作内容时,你要做的是做乘法,砍掉微观控制,给AI留出推演和试错的空间。 别再把这两种场景混为一谈了。让机器在安全边界内做个无情的打工仔,在创作边界外做个有灵气的合伙人,把该死的摩擦留给艺术,把绝对的掌控留给现实,这才是当下驾驭AI最清醒的活法。 理论掰扯完了,落到日常怎么练出这种提示词直觉?别去背那些千篇一律的模板,得在具体场景里刻意练习。 拿处理日常琐事来说,以前咱们让AI整理收件箱或者比价,总恨不得它一键搞定。现在得换个练法。先划定绝对禁区,明确告诉它哪些邮件不能删、哪些链接不能点。然后让它给出处理方案,但把最终的确认发送或者付款动作死死捏在自己手里。学学Gemini Spark那种克制,遇到敏感操作就踩刹车。这种刻意保留的安全摩擦,练的就是你对权限边界的敏感度。 到了内容创作这块,直觉的培养核心在于管住手。写策划案或者拆解视频分镜时,先给个核心基调和情绪锚点,让模型自己跑一版。看到它生成的东西不够完美,千万别急着去微调。就像DeepMind团队跟A24电影人合作时琢磨的那样,保留适当的麻烦,往往是作品长出判断的必经之路。你要做的是观察AI在哪卡壳了,然后针对性地补充节点约束,而不是一上来就把几百字参数全塞进去。 提示词直觉真不是玄学,无非就是知道什么时候该踩刹车,什么时候该放手。把掏钱和拍板的权力留给自己,把试错的麻烦扔给机器,在一次次人机博弈里,你自然就能摸清那个微妙的平衡点。