推导过程被彻底接管后,人类在科研和工程里的角色已经变了。金山木拿下Crouzeix猜想,靠的不是矩阵分析功底,而是敢把16小时算力全交给模型盲试。猜想提出者Michel Crouzeix本人都没料到,AI没走人类预想的繁杂硬估计老路,自己摸出了巧妙的采样策略。这种推导能力溢出,在Anthropic未公开版Claude把黎曼ζ函数临界线上零点比例下界从41.6%硬拔到67.2%时,体现得淋漓尽致。
以前比拼谁算得快、推导得深,现在拼谁定的规则更严密、审计机制更狠。SpaceX豪掷600亿美元吞下Cursor搞出Grok Bot,本质就是在囤积能自主试错的推导算力。多智能体集群在约束下疯狂试错并收敛,手把手教步骤的保姆指令就成了废纸。
人类的价值现在只剩下定义目标与审计。精准告诉AI终点在哪,拿着放大镜挑它跑出来的错。别去卷那些AI一秒钟就能推翻重建的推导过程,把精力留给提出好问题和做冷酷裁判。当机器把试错成本降到无限低,你准备好当那个拍板的人了吗?拆解破解数学猜想背后的科研级提示词技巧
提示词技巧
提示词技巧
多智能体协同
AI编程
Agent框架
科研级提示词
这篇文章从协和医生利用GPT-5.6破解22年数学猜想的事件切入,深度拆解其背后颠覆传统的“科研级”提示词策略。文章跳出了常规的对话式指令教学,聚焦于如何通过设定物理断网、多路径发散、对抗性审计等边界规则,让AI智能体集群自主完成复杂推导。同时,结合SpaceX收购Cursor、DeepSeek推出Agent框架等行业动态,探讨高级提示词与智能体生态的协同关系。最后提供将“放权式”提示词应用于日常代码重构与数据分析的实操建议,帮读者完成从“指令下达者”到“规则制定者”的思维跃迁。
SpaceX刚砸下600亿美元收购AI编程公司Cursor,转头就推出了由一组AI智能体全天接管任务的Grok Bot。当科技巨头们还在为智能体生态疯狂砸钱铺路时,一个毫无数学科班背景的中国医生,已经用类似的多智能体集群玩法,直接掀了数学界的桌子。
北京协和医院神经外科博士后金山木,仅用16小时就证明了困扰学界22年的Crouzeix猜想。没有传统的纸笔推导,全靠GPT-5.6-Sol模型在ChatGPT Work平台上自主运行。连猜想提出者Michel Crouzeix本人都审阅手稿并确认无误。
这哥们本科在北大读地质,后来转行做神外医生,正式数学教育仅限本科基础课。他破局的核心全在开源的GitHub仓库里。他彻底抛弃了手把手教AI怎么算的保姆式指令。他的提示词策略聚焦于设定边界与审计:物理断网逼迫模型纯粹原创,启动海量智能体沿不同路径发散探索,对候选策略进行对抗性审计,并下达死命令要求不获完整证明绝不放弃。
以前我们写提示词,恨不得把解题步骤嚼碎了喂给模型,结果AI稍微绕个弯就开始胡编乱造。现在金山木设定好规则后直接离开,让GPT在16小时内经历了数万次假设与推翻。数学家们震惊地发现,AI根本没走人类预想的繁杂硬估计老路,而是自己摸索出了巧妙的采样策略简化出正性条件。
面对这种级别的复杂任务,人类的推导精力根本不够用。别再纠结怎么微调单个指令了,把目标定义清楚,把审计机制建好,让多智能体集群在约束下去疯狂试错。学会放权,才是驾驭下一代AI的正确姿势。
过去写提示词,大家总习惯当微观管理者,恨不得把推导步骤拆解得明明白白喂给模型。逻辑稍微绕个弯,AI就开始胡编乱造,人类还得赶紧打补丁。这种手把手教的保姆式指令,写写周报还行,真碰上Crouzeix猜想这种硬核难题,人类的脑容量根本兜不住。
金山木破局的关键,在于彻底抛弃了过程控制。他借鉴OpenAI攻克Cycle Double Cover猜想时的策略,把核心放在设定边界上。不教AI具体怎么算,只划定物理断网环境逼迫纯粹原创,启动海量智能体沿不同路径发散探索防止过早收敛,并引入对抗性审计。规则定好直接离场,任由模型在16小时内经历数万次假设与推翻。
现在科技圈的演进路线也在印证这点。SpaceX豪掷600亿美元收购Cursor后,迅速推出由一组智能体全天接管任务的Grok Bot。DeepSeek也顺势开源了Agent框架DeepSeek Harness。巨头们砸重金铺路,本质是把人类从逐行写指令的泥潭里拽出来。当多智能体集群接管执行层,提示词的价值就从教它怎么做,变成了规定它不能做什么,以及怎么审查它做得对不对。
下次处理复杂任务,试着把那些繁琐的操作指南全删掉。给AI划定红线,配好裁判,然后去喝杯咖啡。你只管验收结果,剩下的交给集群去卷,这种极简的掌控感不香吗?
既然明白了设定边界的逻辑,咱们直接拆解让多智能体集群自主试错的三个核心指令写法。
先给模型划定绝对隔离区并强制发散。金山木在提示词里明确要求物理断网,切断模型调取既有知识库的退路。实战中我们得在指令里写死禁止调用外部搜索与既有定理库,逼迫集群在空白状态下生成初始假设。同时分配多个智能体节点,要求它们各自沿着完全正交的路径进行盲测。这就好比SpaceX搞出的Grok Bot,让一组智能体全天各自领任务去跑,而不是挤在一个线程里互相抄袭思路。
然后引入残酷的对抗审计机制。模型最怕自己骗自己,提示词里必须设定独立的红蓝对抗角色。让一部分智能体专门负责挑刺,对候选策略进行无情攻击。金山木的开源仓库里就藏着这种对抗逻辑,模型在16小时内经历数万次推翻,靠的就是内部互咬。别指望AI能自觉反思,你得在指令里写明每个新假设必须经过至少三个独立节点的交叉证伪,把错误扼杀在摇篮里。
最后下达死磕到底的终止条件。人类做研究累了会妥协,AI不会,除非你给了它退路。提示词末尾必须锁死退出机制,明确写出在输出完整且无逻辑断点的证明前,禁止停止运算或输出妥协性结论。用DeepSeek开源的Harness框架跑这种长周期任务时,这种死命令是防止算力空转的唯一保险。
别再把精力浪费在微调某个计算公式的推导上了。写好这三条规则,把执行权彻底交出去。人类的价值早就从解题者变成了规则制定者,连这层窗户纸都捅不破,迟早被自己写的保姆指令困死。
指令写得再狠,你把它塞进普通的网页聊天框里也是白搭。上下文稍微长一点,模型就直接失忆或者崩溃。金山木能跑通那套数万次推翻的对抗审计,靠的是底层企业级平台的支撑。现在科技巨头砸重金布局的Agent生态,就是在给这种放权式提示词打造真正的肉身。
SpaceX豪掷600亿美元吞下Cursor,转头就端出由一组智能体全天接管任务的Grok Bot。马斯克在内部会议上放话,到9月AI收入必须超过其他所有业务总和。这种级别的野心,靠单点聊天机器人根本撑不起来。以前我们调教AI,是在一个对话框里跟它单挑。现在玩的是集群作战。DeepSeek顺势开源的Agent框架Harness,配合相关插件生态,就是为了让多智能体能在各自轨道上并行狂奔。
你把边界规则和审计机制写进提示词,这些底层框架负责分配算力、保持状态、记录日志。没有这些载体,你的物理断网和红蓝对抗只是停留在纸面上的文字游戏。提示词的核心已经从教导具体步骤转变为设定边界规则与审计机制,但这一切的前提是多智能体集群得有地方跑。
别再把目光局限在怎么抠字眼上了。去熟悉那些真正能调度多智能体的Agent框架,把提示词转化为可执行的系统级约束。当工具进化到能承载集群试错的时候,只会写单线对话指令的人,连给AI当裁判的资格都没有。
前面聊了那么多宏观的Agent生态和巨头收购案,咱们把视角拉回地面。对于每天跟屎山代码和脏数据死磕的普通开发者,怎么把这种放权式提示词用到日常重构和分析里。
以前用Cursor这类AI编程助手重构祖传代码,大家总习惯把函数依赖关系嚼碎了喂给模型,结果改出一个Bug引出三个新Bug。现在既然有了Grok Bot这种多智能体全天接管任务的生态,思路得彻底翻转。
拿复杂的遗留系统重构来说,别再写什么请帮我把这个模块改成微服务架构。先给模型划定绝对红线,明确写出保持原有API签名不变且禁止触碰核心交易逻辑。然后引入对抗审计机制,让一个智能体节点负责生成重构代码,另一个节点专门执行单元测试并生成覆盖率报告。最后锁死终止条件,要求测试通过率必须达到95%以上且无内存泄漏警告才允许输出最终版本。你只管看最终的审计报告,中间那几万行代码的试错全交给集群去卷。
数据分析也是同样的逻辑。处理几十万行充满缺失值的业务数据时,抛弃那些帮我清洗数据并画出趋势图的废话指令。直接给智能体集群设定边界,限定仅使用标准数据处理库并切断外部API调用。分配不同节点分别负责缺失值插补和异常值检测,强制要求两个节点对清洗结果进行交叉比对,差异阈值超过设定红线就直接打回重做。
别再把精力耗费在逐行微调代码逻辑上。把目标定义清楚,把审计机制建好,让多智能体在约束下自主试错。当工具进化到能承载集群作战时,只会写单线指令的程序员,迟早会被自己困在死循环里。
推导过程被彻底接管后,人类在科研和工程里的角色已经变了。金山木拿下Crouzeix猜想,靠的不是矩阵分析功底,而是敢把16小时算力全交给模型盲试。猜想提出者Michel Crouzeix本人都没料到,AI没走人类预想的繁杂硬估计老路,自己摸出了巧妙的采样策略。这种推导能力溢出,在Anthropic未公开版Claude把黎曼ζ函数临界线上零点比例下界从41.6%硬拔到67.2%时,体现得淋漓尽致。
以前比拼谁算得快、推导得深,现在拼谁定的规则更严密、审计机制更狠。SpaceX豪掷600亿美元吞下Cursor搞出Grok Bot,本质就是在囤积能自主试错的推导算力。多智能体集群在约束下疯狂试错并收敛,手把手教步骤的保姆指令就成了废纸。
人类的价值现在只剩下定义目标与审计。精准告诉AI终点在哪,拿着放大镜挑它跑出来的错。别去卷那些AI一秒钟就能推翻重建的推导过程,把精力留给提出好问题和做冷酷裁判。当机器把试错成本降到无限低,你准备好当那个拍板的人了吗?
推导过程被彻底接管后,人类在科研和工程里的角色已经变了。金山木拿下Crouzeix猜想,靠的不是矩阵分析功底,而是敢把16小时算力全交给模型盲试。猜想提出者Michel Crouzeix本人都没料到,AI没走人类预想的繁杂硬估计老路,自己摸出了巧妙的采样策略。这种推导能力溢出,在Anthropic未公开版Claude把黎曼ζ函数临界线上零点比例下界从41.6%硬拔到67.2%时,体现得淋漓尽致。
以前比拼谁算得快、推导得深,现在拼谁定的规则更严密、审计机制更狠。SpaceX豪掷600亿美元吞下Cursor搞出Grok Bot,本质就是在囤积能自主试错的推导算力。多智能体集群在约束下疯狂试错并收敛,手把手教步骤的保姆指令就成了废纸。
人类的价值现在只剩下定义目标与审计。精准告诉AI终点在哪,拿着放大镜挑它跑出来的错。别去卷那些AI一秒钟就能推翻重建的推导过程,把精力留给提出好问题和做冷酷裁判。当机器把试错成本降到无限低,你准备好当那个拍板的人了吗?