从硬件到软件,整个行业的逻辑已经重构,咱们开发者和企业也得跟着换换脑子。别再抱着训练时代的旧黄历看选型了。
以前选算力,大家死盯着PPT上各种精度的峰值算力,觉得数字越大越有面子。现在真要落地算经济账,你得看显存带宽和低精度下的实际吞吐量。苏姿丰在台上把话挑得很明,MI455X在OCP MXFP4格式下性能飙到40.26 PFLOPS,比前代快了整整4倍。这就意味着,以前跑一个超长文本推理要等半天,现在优化好量化策略,十分钟就能出结果。算力选型的核心,已经从谁能训出更大的模型,变成了谁能用更低的成本吐出更多的Token。
具体到落地实操,企业千万别再盲目迷信千亿参数的巨无霸模型了。如果是做智能客服、代码补全或者常规的智能体任务,用蒸馏后的小参数模型配合高并发,成本能直接砍掉几个数量级。特别是现在智能体AI开始死磕复杂任务,调用链路变长,Token消耗是个无底洞。小米MiMo刚结束免费转向Token Plan订阅,这就是个明确的信号,以后API计费只会越来越精细。你在做架构设计时,必须把上下文超长导致的Token暴增这种隐性成本算进去,别等月底收到账单才发现利润全被算力吃光了。
如果是打算自建算力集群的老板,眼光也别只局限在GPU上。苏姿丰专门强调了针对智能体AI设计的EPYC Venice CPU,最高256核心。在复杂的Agent工作流里,CPU的调度能力和GPU的推理能力一样致命。别为了省点钱去买一堆二手训练卡,最后发现网络互联和显存池化一塌糊涂。去算算你下个月的推理账单吧,能把单Token成本抠到极致的,才是真正能活到下半场的狠角色。大模型告别训练内卷,推理算力战全面打响
大模型动态
大模型
推理算力
AMD MI455X
小米MiMo
商业化落地
大模型圈的风向变了。过去两年大家拼命卷训练参数,但今年一个明显的拐点是,推理算力的需求已经反超训练。AMD刚发布的MI455X和英特尔财报里暴增的AI业务,都在证明底层硬件正在为推理疯狂堆料。与此同时,小米MiMo等模型API结束免费,宣告大模型“白嫖”时代终结。本文带你拆解大模型从“训练军备竞赛”转向“推理落地与商业化”的真实动向,并给开发者和企业提供一份避开选型坑的实操指南。
60%的计算资源已经砸向推理,而不是训练。苏姿丰在Advancing AI 2026上抛出的这个数据,算是彻底扯下了大模型行业最后一块遮羞布。今年是推理需求反超训练的元年,算力风向标已经连根拔起,彻底变了。
前两年大家红着眼拼参数、卷训练集群,仿佛谁的卡多谁就是爷。现在模型训出来了,真要落地变现,全卡在推理成本上。你看小米MiMo Code刚宣布26号结束免费,转头就开始推Token Plan订阅收费。大模型API白嫖时代正式终结,商业变现的镰刀已经高高举起。
硬件老炮们比谁都门儿清。AMD直接掏出432GB HBM4显存的MI455X硬刚英伟达,苏姿丰在现场直言智能体AI带来了巨大飞跃,极大地推动了需求增长。英特尔最新的财报也印证了这一点,数据中心与AI业务营收同比暴增59%。巨头们疯狂堆料,但这次瞄准的不再是虚无缥缈的训练峰值,而是实打实的推理吞吐量。
别再迷信什么万卡训练集群的宏大叙事了。对于现在的AI公司来说,谁能把单Token成本抠到极致,谁才能活到下半场。算力选型别光盯着PPT上的峰值算力自嗨,去算算你下个月的推理账单吧。
硬件厂商的嗅觉最敏锐,既然推理成了主战场,底层的算力架构自然得跟着大换血。AMD这次没跟老黄在单卡算力上玩捉迷藏,而是直接在显存容量上掀了桌子。
MI455X直接塞进432GB的HBM4显存,带宽干到23.3 TB/s。对比英伟达刚透底的Rubin初代288GB,AMD这波暴力堆料摆明了是要在推理大显存场景里抢肉吃。毕竟跑大模型推理,显存不够什么都白搭,超长上下文窗口和并发量全靠它撑着。
单卡猛只是基操,AMD真正亮出的底牌是Helios机架级架构。把72张MI455X整合进一个统一的相干域,硬刚英伟达的NVL72。苏姿丰在现场没少拽大佬站台,OpenAI基础设施主管Sachin Katti那句“我们已迫不及待地需要它”倒是挺实在,Anthropic更是直接砸下2GW的Helios部署计划。
以前大家买卡盯的是各种精度下的峰值算力,现在聪明人都开始算显存池化后的Tokens成本了。MI455X号称能把Tokens成本降到前代的十八分之一,这才是戳中AI公司肺管子的杀手锏。不过话说回来,机架级方案对网络互联和液冷散热要求极高,中小企业别看着眼热就盲目跟风。选型时先盘盘自己的业务模型到底需要多大的上下文,别花大价钱买了个机架,最后显存利用率连一半都不到,那就真成了给苏妈送温暖了。
底层算力在疯狂堆料,上层应用端的账本也开始精打细算了。小米刚发了个公告,MiMo Code 在 7 月 26 号 18 点准时结束免费,想继续用就得去 API 开放平台掏钱订阅 Token Plan。虽然首次订阅给了个 88 折的安慰奖,但这信号再明显不过了:大模型 API 白嫖的草莽时代彻底翻篇,商业变现的镰刀已经磨得锃亮。
前两年大厂搞免费,无非是为了跑马圈地攒调用量,顺便拿真实流量给自家的训练集群练练手。现在风向变了,苏姿丰在 Advancing AI 2026 上把话挑得很明,今年已经是推理需求反超训练的元年,60% 的算力都砸在了推理上。特别是智能体 AI 这种给个问题就能自己死磕到底的玩法,让推理算力消耗像个无底洞。英特尔最新的财报也印证了这点,数据中心与 AI 业务营收同比暴增 59%,真金白银都砸向了 AI 基础设施建设。
模型训得再花哨,不能落地变现就是耍流氓。小米这波收费,其实是整个行业从拼参数秀肌肉,转向拼推理效率算经济账的缩影。当推理成为算力消耗的大头,API 定价就成了企业的生死线。以前大家比谁的模型参数大,现在得比谁的单 Token 成本低、并发扛得住。对于开发者来说,别再盯着那些免费额度薅羊毛了,赶紧去测算下自己业务的真实推理成本。靠补贴烧出来的繁荣终究是泡沫,能扛住 API 账单跑通的,才是真正能活到下半场的商业模式。
从硬件到软件,整个行业的逻辑已经重构,咱们开发者和企业也得跟着换换脑子。别再抱着训练时代的旧黄历看选型了。
以前选算力,大家死盯着PPT上各种精度的峰值算力,觉得数字越大越有面子。现在真要落地算经济账,你得看显存带宽和低精度下的实际吞吐量。苏姿丰在台上把话挑得很明,MI455X在OCP MXFP4格式下性能飙到40.26 PFLOPS,比前代快了整整4倍。这就意味着,以前跑一个超长文本推理要等半天,现在优化好量化策略,十分钟就能出结果。算力选型的核心,已经从谁能训出更大的模型,变成了谁能用更低的成本吐出更多的Token。
具体到落地实操,企业千万别再盲目迷信千亿参数的巨无霸模型了。如果是做智能客服、代码补全或者常规的智能体任务,用蒸馏后的小参数模型配合高并发,成本能直接砍掉几个数量级。特别是现在智能体AI开始死磕复杂任务,调用链路变长,Token消耗是个无底洞。小米MiMo刚结束免费转向Token Plan订阅,这就是个明确的信号,以后API计费只会越来越精细。你在做架构设计时,必须把上下文超长导致的Token暴增这种隐性成本算进去,别等月底收到账单才发现利润全被算力吃光了。
如果是打算自建算力集群的老板,眼光也别只局限在GPU上。苏姿丰专门强调了针对智能体AI设计的EPYC Venice CPU,最高256核心。在复杂的Agent工作流里,CPU的调度能力和GPU的推理能力一样致命。别为了省点钱去买一堆二手训练卡,最后发现网络互联和显存池化一塌糊涂。去算算你下个月的推理账单吧,能把单Token成本抠到极致的,才是真正能活到下半场的狠角色。
从硬件到软件,整个行业的逻辑已经重构,咱们开发者和企业也得跟着换换脑子。别再抱着训练时代的旧黄历看选型了。
以前选算力,大家死盯着PPT上各种精度的峰值算力,觉得数字越大越有面子。现在真要落地算经济账,你得看显存带宽和低精度下的实际吞吐量。苏姿丰在台上把话挑得很明,MI455X在OCP MXFP4格式下性能飙到40.26 PFLOPS,比前代快了整整4倍。这就意味着,以前跑一个超长文本推理要等半天,现在优化好量化策略,十分钟就能出结果。算力选型的核心,已经从谁能训出更大的模型,变成了谁能用更低的成本吐出更多的Token。
具体到落地实操,企业千万别再盲目迷信千亿参数的巨无霸模型了。如果是做智能客服、代码补全或者常规的智能体任务,用蒸馏后的小参数模型配合高并发,成本能直接砍掉几个数量级。特别是现在智能体AI开始死磕复杂任务,调用链路变长,Token消耗是个无底洞。小米MiMo刚结束免费转向Token Plan订阅,这就是个明确的信号,以后API计费只会越来越精细。你在做架构设计时,必须把上下文超长导致的Token暴增这种隐性成本算进去,别等月底收到账单才发现利润全被算力吃光了。
如果是打算自建算力集群的老板,眼光也别只局限在GPU上。苏姿丰专门强调了针对智能体AI设计的EPYC Venice CPU,最高256核心。在复杂的Agent工作流里,CPU的调度能力和GPU的推理能力一样致命。别为了省点钱去买一堆二手训练卡,最后发现网络互联和显存池化一塌糊涂。去算算你下个月的推理账单吧,能把单Token成本抠到极致的,才是真正能活到下半场的狠角色。