别管马斯克又在推特上喊SpaceX价值要超过地球了,今天AI圈真正让人倒吸一口凉气的,是OpenAI甩出的一个硬核**。就在昨天,GPT-5.6 Sol Ultra版本用不到一小时的时间,硬生生解开了一道存在半个世纪的图论难题,也就是大名鼎鼎的循环双覆盖猜想。没靠什么内部特供模型,就是公开能用的版本,自己蹬出64个子Agent并行计算,最后直接甩出一份三页PDF证明完毕。 AI解数学题大家见得多了,但这次真正让开发者们疯狂的,是OpenAI顺手放出的那份700词完整Prompt。这才是整件事的真重点。 以前我们写提示词,总喜欢当微观管理的监工,给模型定死流程,先分析再方案后验证。但面对这种路径完全未知的复杂任务,你事先写下的步骤很可能本身就是错的。模型一旦沿着错误路线狂奔,最后只会给你一份结构完整的错误答案。 OpenAI这份700词的Prompt彻底换了玩法。它根本不教模型怎么解题,不规定用什么归纳法还是流理论,而是把验收标准死死钉住。它明确告诉模型,最终结果必须满足什么条件,同时划定清晰边界,写清楚什么不算答案,禁止模型通过添加额外假设来绕道走。 驾驭顶级AI解决复杂任务的关键,早就不是规定死板的执行步骤,而在于钉死验收标准、划定清晰边界并允许模型动态探索。别再试图手把手教AI做事了,把规矩立好,然后放手让它自己找路,才是未来跟顶级模型打交道的正确姿势。 咱们直接拆开这份700词的Prompt,看看OpenAI到底是怎么给顶级模型立规矩的。核心逻辑其实就三条。 第一条,把验收标准钉死,彻底放弃过程管理。 以前写提示词,大家总习惯当包工头,先分析再方案后验证,安排得明明白白。但面对这种连人类数学家都头疼的开放问题,你定的步骤大概率是错的。OpenAI的做法是,根本不教模型怎么用归纳法或者流理论,而是反复强调最终结果必须满足什么条件。它把验收标准直接锁定在每一个有限、无桥、无自环的多重图,都必须被证明存在圈双覆盖。你只管交出符合这个标准的证明,中间怎么推导模型自己看着办。 第二条,划定清晰边界,明确告诉模型什么不算答案。 模型翻车,很多时候是因为它理解偏了,或者为了交差自己偷偷加条件。这份Prompt在正式提问前,花了大篇幅定义什么是图、什么是圈。更绝的是,它直接堵死了模型绕道的后路,明确禁止通过添加额外假设来解决问题。不能只证明三次图,不能只证明平面图,也不能假设图一定连通。把什么不算答案写得清清楚楚,模型才不会在错误的方向上狂奔。 第三条,放弃固定分工,让模型动态搜索并独立审查。 遇到复杂任务,很多人喜欢给模型设定死板的角色分工。但GPT-5.6这套玩法完全反着来。它不限制子Agent的具体任务,而是让它们动态去搜索和验证。同时在流程里设置了独立的审查机制。这就好比给模型配了一个不带偏见的质检员,随时纠正跑偏的思路,确保最终输出的严谨性。 别再试图手把手教AI做事了。把规矩立好,把边界划清,然后放手让它自己找路,这才是驾驭顶级模型的正确姿势。 咱们先死磕第一条法则,也就是彻底放弃固定SOP,用明确的验收标准倒逼模型输出。 以前写提示词,大家总习惯当微观管理的包工头,给模型安排得明明白白。先分析背景,再提出方案,接着逐步验证,最后总结答案。但面对这种连人类专家都头疼的复杂任务,你事先写下的步骤大概率本身就是错的。模型一旦沿着你的错误路线狂奔,最后只会交出一份结构完整但毫无用处的废话。 OpenAI这次的做法非常反直觉。它根本不教模型怎么用归纳法或者流理论,也不规定具体的推导路径,而是反复强调最终结果必须满足什么条件。在这份700词的Prompt里,它直接把验收标准死死锁定在每一个有限、无桥、无自环的多重图,都必须被证明存在圈双覆盖。 这就相当于给模型下达了一份对赌协议。你不管中间怎么折腾,用了什么奇技淫巧,最后交出来的证明必须严丝合缝地满足这个条件。这种写法最核心的逻辑在于,用极致的结果定义去倒逼模型的推理过程。 以前我们总怕AI走弯路,恨不得把每一步都写进提示词里。现在顶级模型的并行计算能力这么猛,你反而应该放开手脚。别再试图用你有限的认知去框住AI的探索空间了。把验收标准钉到最死,把过程管理降到最低,让模型在明确的终点前自己去试错和找路,这才是驾驭大模型该有的松弛感。 验收标准钉死了,模型就不会乱跑了吗?太天真了。顶级模型最喜欢干的事,就是自作聪明地给你走捷径。你以为让它证明个猜想,它为了赶紧交差,偷偷加几个前置条件,最后搞出一个特供版的伪证明。 这就是为什么OpenAI在这份700词的Prompt里,干了件特别反直觉的事:花大篇幅告诉模型什么不算答案。 以前咱们写提示词,总是苦口婆心地告诉AI你要做什么。现在面对这种地狱级难度的任务,直接甩出一份负面清单反而更有效。OpenAI在正式提问前,不仅把基础概念定义得死死的,还直接堵死了模型绕道的后路。它明确禁止模型通过添加额外假设来解决问题,比如不能只证明三次图,不能只证明平面图,也不能假设图一定连通。 这么干的好处立竿见影。原本人工去排查模型是不是在偷工减料,得耗费几天时间去抠细节。现在通过这套清晰的边界条件,64个子Agent在不到一小时的并行计算中,直接排除了绝大多数无效分支,把算力全集中在了真正的硬骨头上。 与其手把手教AI怎么解题,不如明确告诉它哪些捷径是死路。划定边界从来不是为了限制模型的想象力,而是为了防止它把宝贵的算力浪费在伪命题上。把不准做什么写得越狠,模型给出的答案才越纯粹。 边界划清了,接下来就是怎么让这64个子Agent干活。 以前搞多智能体协作,大家最喜欢干的事就是排兵布阵。给每个节点分好工,你负责查资料,他负责写推导,最后那个负责汇总。这种死板的流水线分工,对付简单任务还行。一旦碰到像证明数学猜想这种需要不断试错的硬核任务,立马抓瞎。前面一个环节卡壳,后面全得跟着停工。 OpenAI这次的做法非常野。它根本没给这64个子Agent定死谁具体干嘛,而是让它们去动态搜索。模型在解题时,发现哪条路走不通,立刻调整方向。哪个节点跑出了有价值的线索,其他部分马上跟进验证。这种动态探索的机制,硬是把原本可能要磨上一整天的证明,压进了一个小时。 更绝的是,它还在这套动态流程里塞进了一个独立审查机制。这就好比在探索队伍里安了一个铁面无私的质检员。不管底下的节点怎么天马行空地找思路,最后都得过它这一关。它不干涉具体的探索过程,只死死盯着最终输出有没有偏离最初定下的验收标准。 以前我们总迷信流水线作业,觉得分工越细效率越高。但在面对真正复杂的未知任务时,死板的流程只会扼杀模型的灵活性。把权力下放给动态搜索,用独立审查兜底,才是榨干顶级模型算力的正确玩法。别总想着给AI当微操导演了,给它一个舞台和裁判,它自己就能给你交出满分答卷。 数学猜想听着确实遥远,但这套Prompt思路稍微平移一下,完全能治治你日常工作中那些让AI写出来的正确废话。 以前咱们让AI写个行业调研报告或者产品策划案,总习惯先列个大纲,让它按部就班地填空。结果写出来的东西四平八稳,全是没有灵魂的套话。现在你得换个脑子。直接告诉它验收标准,这份报告必须包含近三年行业增速数据、至少三个竞品差异化对比,字数控制在三千字以内。同时划定边界,严禁使用那些烂大街的互联网黑话,不要写没有数据支撑的预测。 写代码或者做复杂数据处理也是同理。别再去教它先写哪个函数后写哪个逻辑。直接钉死边界条件,核心接口签名绝对不能动,内存占用不能超过50MB。然后放手让它自己去重构底层逻辑。它要是敢为了优化性能偷偷改掉你的核心业务规则,独立审查机制立马就能把它揪出来。 你发现没有,以前我们总把AI当成听话的实习生,恨不得把每一步操作都嚼碎了喂给它。但现在模型能力已经溢出,你再用这种微观管理的方式,只会限制它的上限。把它当成一个需要明确KPI和底线的高级外包吧。把规矩立到最严,把边界划到最清,然后退后一步,看着它给你交出超预期的答卷。