底层抠成本、外部勒缰绳,图啥?当然是让模型去啃硬骨头,而不是天天停留在聊天框里帮人写周报。
以前大模型写代码,顶多是帮程序员补全几行业务逻辑,或者像OpenAI把降价后的Luna塞进后台做做高频的代码审查。现在情况变了,模型不仅开始重构自己的底层推理引擎,甚至能深度介入复杂工程流。当算力账单不再是紧箍咒,Agent工作流的深度落地就成了必然。
更硬核的突破发生在基础科研领域。腾讯混元推出的科研智能体Hyra,直接去死磕加法组合学里悬置半个多世纪的未解难题。以前学界靠传统优化算法搞有限枚举,规模一大算力和内存就双双爆表。Hyra换了思路,不眠不休跑上24小时,用自然语言提出数学构造,再让大模型当裁判提供反馈。最后它不仅给出了显式构造,还顺手搞定了Lean 4形式化证明,直接敲定了2就是该问题的上确界。
从帮人查Bug到独立证明数学猜想,大模型的能力边界正在被工程化工作流强行拓宽。这背后的商业与技术逻辑很清晰:当单次调用成本被打到地板价,推理框架也不再漏风,Agent就能在长周期、高复杂度的任务里保持连贯的探索状态。
别再把大模型当成一个高级点的代码补全插件了。未来的硬核科研和复杂工程,拼的是谁能把Agent工作流打磨得足够深,让AI真正接管那些需要持续试错与推理的无人区。
活变难了,但账不能不算,OpenAI这次给出的解法是看菜下饭,把不同模型安排到最合适的位置。
最底层的Luna现在就是专门用来干杂活的。以前我们总觉得便宜模型只能做做文本分类和信息抽取,但这次Luna被赋予了调用工具和处理长上下文的能力。把代码审查、后台高频监控这些原本需要消耗大量算力的Agent节点全切给它,成本直接暴降到原来的十分之一。这就好比把流水线上的拧螺丝活儿从高级工程师手里交给了熟练工,效率上去了,账单下来了。
中间层的Terra降价两成,稳坐日常脑力活的主力位置。而真正的硬核烧脑任务,才轮到旗舰模型Sol出场。Sol这次没降价,反而搞了个加钱提速的Fast mode。遇到像腾讯混元Hyra那种连轴转24小时去死磕数学猜想的极限推理场景,或者需要极高准确率的复杂工作流,再把Sol请出来镇场子。
这种三层算力分配逻辑能成立,底气在于外部框架的工程化兜底。通过驭缰系统的推理保留和上下文压缩,把Token消耗硬生生压到六分之一,让小模型跑长任务也不再漏风。以前开发者迷信一招鲜吃遍天,不管啥任务都无脑调最贵的旗舰模型,导致算力账单经常爆表。现在这套玩法彻底变了,用框架优化兜底,用廉价模型铺量,用旗舰模型攻坚。
别再拿旗舰模型去干那些高频重复的杂活了。未来的Agent架构师,拼的早就不是谁买的模型最聪明,而是谁的任务路由写得最抠门、最精准。
明确了分层逻辑,接下来就是开发者怎么利用这些新特性重构应用了。以前大家写Agent,不管三七二十一全调最贵的模型,现在这套玩法得彻底翻新。趁着这波降价和框架优化,你的Agent工作流需要做三次大手术。
1、把高频节点全切给廉价模型。像代码审查、后台监控这种需要频繁调用工具的环节,直接换成Luna。输入价格打到两毛钱,配合Auto-review的升级,这部分账单能砍掉九成。
2、死磕外部驭缰系统的工程化。别光在提示词上抠字眼,去把上下文截断和推理丢失的坑填上。引入推理保留和上下文压缩机制,把Token消耗压到原来的六分之一,让小模型跑长任务也能保持连贯思考。
3、放开手脚让Agent跑长周期任务。以前算力太贵,智能体跑几个小时就得心疼钱。现在成本降下来了,完全可以参考科研智能体的打法,让Agent连轴转上二十四小时去死磕复杂工程,用大模型做反馈闭环。
大模型的竞争早就过了拼参数秀肌肉的阶段。未来开发者拼的不是谁的API额度多,而是谁的工程化调度最抠门、最精准。把便宜的模型用在刀刃上,把外部的缰绳勒紧,这才是重塑AI生产力性价比的终极解法。GPT-5.6大降价:大模型转向工程化降本
大模型动态
GPT-5.6
大模型降价
Agent工作流
AI工程化
腾讯混元
OpenAI突然宣布GPT-5.6系列API大幅降价,入门款Luna输入价格直降至0.2美元/百万Token。这并非简单的价格战,而是建立在模型自我优化底层代码与外部框架改进基础上的系统性降本。结合腾讯混元等大厂在科研智能体上的突破,大模型的竞争焦点已从单纯的智力跑分,转向Agent工作流的深度落地与极致性价比。本文拆解这波降价背后的技术逻辑,并为开发者提供重构AI应用的实操建议。
GPT-5.6 Luna的输入价格直接砸到了每百万Token 0.2美元,降幅高达80%。这已经不是常规的商业促销,而是直接把Agent大规模调用的门槛给物理击穿了。
以前百万Token输入要1美元,现在只要两毛钱,这价位基本跟上一代只干分类、抽取等简单杂活的GPT-5.4 nano持平。但Luna的定位完全不同,它是能调用工具、处理长上下文并执行多步工作流的Agent主力。以前开发者让大模型做代码审查、后台高频监控,还得抠抠搜搜算算力账单,现在OpenAI把ChatGPT和Codex CLI里的Auto-review模型换成Luna后,这部分成本直接砍到了原来的十分之一。便宜模型不再只配干不动脑子的杂活,而是正式接管了需要判断和工具调用的核心Agent环节。
光靠模型本身降价还不够,外部框架的工程化优化才是把成本打下来的底牌。就像OpenAI最近在ARC-AGI-3测试里搞的推理保留和上下文压缩机制,不改变模型架构,纯靠优化外部驭缰系统,硬是把Token输出量压到了六分之一。大模型竞争走到今天,单纯拼智力测试的榜单已经没意义了,模型自我优化加上框架改进,正在重塑AI的生产力性价比。
这波降价飞轮转起来后,开发者的算盘也得跟着换打法。别再把昂贵的旗舰模型当全能神供着去干所有事,把高频、成本敏感的Agent节点全切给Luna,把Sol留给真正的硬核推理。以后Agent工作流里拼的,早就不是谁用的模型最聪明,而是谁的工程化调度最抠门。
价格跳水不是做慈善,得看看OpenAI是怎么把成本硬生生抠下来的。
官方给出的理由挺有意思,GPT-5.6 Sol自己下场给自己改了底层代码。这可不是常规的参数微调,而是直接重写了生产环境的GPU Kernel,还顺手优化了推测解码。这套操作让端到端服务成本直降20%,Token生成效率拔高了15%以上。模型本身的参数量没变,但同一块显卡现在能榨出更多算力,单次调用的账单自然就薄了。
以前我们看大模型写代码,多是帮程序员写写业务逻辑,或者像腾讯混元Hyra那样在人类引导下死磕悬而未决的数学猜想。现在Sol直接把手伸进了自己的底层推理引擎,跑了数百次生成实验,盯着训练过程抓异常。虽然OpenAI特意强调这依然是人类主导,目标设定和代码合入还得人来拍板,但这已经触碰到了AI自我优化的深水区。
当大模型开始优化自己的发动机,降本就不再只是靠堆硬件和打价格战,而是向内要工程效率。这种左脚踩右脚上天的飞轮一旦转起来,那些还在靠单纯扩大参数规模来秀肌肉的厂商,恐怕连跟进降价的底气都没了。
模型自己下场改底层代码是一方面,但外部套的缰绳同样决定了马能跑多快、省多少草料。光盯着模型参数卷智力测试,不如把外部工程做透。
OpenAI最近在ARC-AGI-3这个公认最严苛的交互式推理测试里交了底。没动模型权重,纯靠重构外部的harness(驭缰系统),硬是把GPT-5.6 Sol的Token输出量压到了原来的六分之一,得分反而暴涨188%。以前官方框架有个致命伤,模型每执行一步动作就把私有推理清空,上下文一长还搞滚动截断。这导致模型像个金鱼,边做边忘,只能反复重新理解环境,白白烧掉大量算力。现在通过推理保留和上下文压缩机制,把思考过程锁住,历史记忆也做了精简,Token消耗直接断崖式下跌。
这种框架层面的工程化抠门,对Agent长任务来说简直是雪中送炭。不管是OpenAI想让Luna去跑高频的代码审查和多步工作流,还是像腾讯混元Hyra那样让科研智能体不眠不休跑上24小时去死磕数学猜想,长上下文和重复推理都是吃掉预算的无底洞。不改模型架构,只优化外部运行环境和反馈机制,就能把这些隐性成本砍到脚踝。
大模型竞争走到今天,单纯拼静态榜单的智力测试已经没意义了。谁能把工程化缰绳勒得更紧,把极限推理的Token消耗打下来,谁才真正握住了重塑AI生产力性价比的杀手锏。
底层抠成本、外部勒缰绳,图啥?当然是让模型去啃硬骨头,而不是天天停留在聊天框里帮人写周报。
以前大模型写代码,顶多是帮程序员补全几行业务逻辑,或者像OpenAI把降价后的Luna塞进后台做做高频的代码审查。现在情况变了,模型不仅开始重构自己的底层推理引擎,甚至能深度介入复杂工程流。当算力账单不再是紧箍咒,Agent工作流的深度落地就成了必然。
更硬核的突破发生在基础科研领域。腾讯混元推出的科研智能体Hyra,直接去死磕加法组合学里悬置半个多世纪的未解难题。以前学界靠传统优化算法搞有限枚举,规模一大算力和内存就双双爆表。Hyra换了思路,不眠不休跑上24小时,用自然语言提出数学构造,再让大模型当裁判提供反馈。最后它不仅给出了显式构造,还顺手搞定了Lean 4形式化证明,直接敲定了2就是该问题的上确界。
从帮人查Bug到独立证明数学猜想,大模型的能力边界正在被工程化工作流强行拓宽。这背后的商业与技术逻辑很清晰:当单次调用成本被打到地板价,推理框架也不再漏风,Agent就能在长周期、高复杂度的任务里保持连贯的探索状态。
别再把大模型当成一个高级点的代码补全插件了。未来的硬核科研和复杂工程,拼的是谁能把Agent工作流打磨得足够深,让AI真正接管那些需要持续试错与推理的无人区。
活变难了,但账不能不算,OpenAI这次给出的解法是看菜下饭,把不同模型安排到最合适的位置。
最底层的Luna现在就是专门用来干杂活的。以前我们总觉得便宜模型只能做做文本分类和信息抽取,但这次Luna被赋予了调用工具和处理长上下文的能力。把代码审查、后台高频监控这些原本需要消耗大量算力的Agent节点全切给它,成本直接暴降到原来的十分之一。这就好比把流水线上的拧螺丝活儿从高级工程师手里交给了熟练工,效率上去了,账单下来了。
中间层的Terra降价两成,稳坐日常脑力活的主力位置。而真正的硬核烧脑任务,才轮到旗舰模型Sol出场。Sol这次没降价,反而搞了个加钱提速的Fast mode。遇到像腾讯混元Hyra那种连轴转24小时去死磕数学猜想的极限推理场景,或者需要极高准确率的复杂工作流,再把Sol请出来镇场子。
这种三层算力分配逻辑能成立,底气在于外部框架的工程化兜底。通过驭缰系统的推理保留和上下文压缩,把Token消耗硬生生压到六分之一,让小模型跑长任务也不再漏风。以前开发者迷信一招鲜吃遍天,不管啥任务都无脑调最贵的旗舰模型,导致算力账单经常爆表。现在这套玩法彻底变了,用框架优化兜底,用廉价模型铺量,用旗舰模型攻坚。
别再拿旗舰模型去干那些高频重复的杂活了。未来的Agent架构师,拼的早就不是谁买的模型最聪明,而是谁的任务路由写得最抠门、最精准。
明确了分层逻辑,接下来就是开发者怎么利用这些新特性重构应用了。以前大家写Agent,不管三七二十一全调最贵的模型,现在这套玩法得彻底翻新。趁着这波降价和框架优化,你的Agent工作流需要做三次大手术。
1、把高频节点全切给廉价模型。像代码审查、后台监控这种需要频繁调用工具的环节,直接换成Luna。输入价格打到两毛钱,配合Auto-review的升级,这部分账单能砍掉九成。
2、死磕外部驭缰系统的工程化。别光在提示词上抠字眼,去把上下文截断和推理丢失的坑填上。引入推理保留和上下文压缩机制,把Token消耗压到原来的六分之一,让小模型跑长任务也能保持连贯思考。
3、放开手脚让Agent跑长周期任务。以前算力太贵,智能体跑几个小时就得心疼钱。现在成本降下来了,完全可以参考科研智能体的打法,让Agent连轴转上二十四小时去死磕复杂工程,用大模型做反馈闭环。
大模型的竞争早就过了拼参数秀肌肉的阶段。未来开发者拼的不是谁的API额度多,而是谁的工程化调度最抠门、最精准。把便宜的模型用在刀刃上,把外部的缰绳勒紧,这才是重塑AI生产力性价比的终极解法。
底层抠成本、外部勒缰绳,图啥?当然是让模型去啃硬骨头,而不是天天停留在聊天框里帮人写周报。
以前大模型写代码,顶多是帮程序员补全几行业务逻辑,或者像OpenAI把降价后的Luna塞进后台做做高频的代码审查。现在情况变了,模型不仅开始重构自己的底层推理引擎,甚至能深度介入复杂工程流。当算力账单不再是紧箍咒,Agent工作流的深度落地就成了必然。
更硬核的突破发生在基础科研领域。腾讯混元推出的科研智能体Hyra,直接去死磕加法组合学里悬置半个多世纪的未解难题。以前学界靠传统优化算法搞有限枚举,规模一大算力和内存就双双爆表。Hyra换了思路,不眠不休跑上24小时,用自然语言提出数学构造,再让大模型当裁判提供反馈。最后它不仅给出了显式构造,还顺手搞定了Lean 4形式化证明,直接敲定了2就是该问题的上确界。
从帮人查Bug到独立证明数学猜想,大模型的能力边界正在被工程化工作流强行拓宽。这背后的商业与技术逻辑很清晰:当单次调用成本被打到地板价,推理框架也不再漏风,Agent就能在长周期、高复杂度的任务里保持连贯的探索状态。
别再把大模型当成一个高级点的代码补全插件了。未来的硬核科研和复杂工程,拼的是谁能把Agent工作流打磨得足够深,让AI真正接管那些需要持续试错与推理的无人区。
活变难了,但账不能不算,OpenAI这次给出的解法是看菜下饭,把不同模型安排到最合适的位置。
最底层的Luna现在就是专门用来干杂活的。以前我们总觉得便宜模型只能做做文本分类和信息抽取,但这次Luna被赋予了调用工具和处理长上下文的能力。把代码审查、后台高频监控这些原本需要消耗大量算力的Agent节点全切给它,成本直接暴降到原来的十分之一。这就好比把流水线上的拧螺丝活儿从高级工程师手里交给了熟练工,效率上去了,账单下来了。
中间层的Terra降价两成,稳坐日常脑力活的主力位置。而真正的硬核烧脑任务,才轮到旗舰模型Sol出场。Sol这次没降价,反而搞了个加钱提速的Fast mode。遇到像腾讯混元Hyra那种连轴转24小时去死磕数学猜想的极限推理场景,或者需要极高准确率的复杂工作流,再把Sol请出来镇场子。
这种三层算力分配逻辑能成立,底气在于外部框架的工程化兜底。通过驭缰系统的推理保留和上下文压缩,把Token消耗硬生生压到六分之一,让小模型跑长任务也不再漏风。以前开发者迷信一招鲜吃遍天,不管啥任务都无脑调最贵的旗舰模型,导致算力账单经常爆表。现在这套玩法彻底变了,用框架优化兜底,用廉价模型铺量,用旗舰模型攻坚。
别再拿旗舰模型去干那些高频重复的杂活了。未来的Agent架构师,拼的早就不是谁买的模型最聪明,而是谁的任务路由写得最抠门、最精准。
明确了分层逻辑,接下来就是开发者怎么利用这些新特性重构应用了。以前大家写Agent,不管三七二十一全调最贵的模型,现在这套玩法得彻底翻新。趁着这波降价和框架优化,你的Agent工作流需要做三次大手术。
1、把高频节点全切给廉价模型。像代码审查、后台监控这种需要频繁调用工具的环节,直接换成Luna。输入价格打到两毛钱,配合Auto-review的升级,这部分账单能砍掉九成。
2、死磕外部驭缰系统的工程化。别光在提示词上抠字眼,去把上下文截断和推理丢失的坑填上。引入推理保留和上下文压缩机制,把Token消耗压到原来的六分之一,让小模型跑长任务也能保持连贯思考。
3、放开手脚让Agent跑长周期任务。以前算力太贵,智能体跑几个小时就得心疼钱。现在成本降下来了,完全可以参考科研智能体的打法,让Agent连轴转上二十四小时去死磕复杂工程,用大模型做反馈闭环。
大模型的竞争早就过了拼参数秀肌肉的阶段。未来开发者拼的不是谁的API额度多,而是谁的工程化调度最抠门、最精准。把便宜的模型用在刀刃上,把外部的缰绳勒紧,这才是重塑AI生产力性价比的终极解法。