马斯克透露Grok 4.6即将完成2万亿参数初始训练,大模型军备竞赛仍在狂飙。但狂欢背后,行业焦点正悄然从“拼参数规模”向“拼推理效率”转移。摩尔线程王东直言推理市场没有万能芯片,阿里云也推出了支持十万亿参数推理的超节点实例。当单卡物理极限逼近,算力竞争已演变为软硬协同与系统级解决方案的较量。本文拆解大模型推理算力的最新演进路线,看看厂商们如何在有限算力下抠出性价比,以及企业该如何选择算力方案。
马斯克在X上透了个底,xAI正在训练的Grok 4.6参数规模直奔2万亿,预计下周完成初步训练。有意思的是,他特意强调这个2万亿参数的巨无霸,推理速度和Token效率要接近现有的1.5万亿版本。
这话其实暴露了当前大模型圈的真实处境。以前大家闭着眼睛卷参数,觉得数字越大模型越聪明。现在2万亿参数要是推理慢得像蜗牛,或者每次调用都烧钱如流水,那这模型基本就废了。大模型军备竞赛的焦点,早就从单纯的参数规模扩张,转向了推理效率的生死较量。
国内厂商的处境更直接。在算力受限的现实下,头部玩家硬是拼出了明显的成本优势。平均每两个月迭代一次前沿模型,靠的不是无脑堆卡,而是死磕模型效率和调用成本。当单次Token价格成为客户最敏感的指标时,谁能把推理速度提上去、把价格打下来,谁就能留在牌桌上。
参数规模的数字游戏已经玩到了尽头。接下来比拼的不再是谁的PPT上写的零更多,而是谁能通过软硬协同和系统级优化,把庞大的模型又快又便宜地跑起来。跑得快且便宜的模型,才是真正能变现的资产。
既然模型参数还在无上限膨胀,算力需求自然水涨船高。很多人觉得只要砸钱买最贵的顶级单卡,就能把大模型跑得飞起。现实很快会教做人。
摩尔线程联合创始人王东直接戳破了单卡万能的神话。他直言推理市场根本不存在万能芯片,拼的是解决方案的组合。这话算是把行业滤镜砸碎了。现在的推理场景高度碎片化,自动驾驶、具身智能、文本对话,每个场景对算力的胃口天差地别。指望一块芯片通吃所有细分应用,纯属异想天开。
没有绝对完美的单一硬件,只有最合适的软硬协同。以摩尔线程量产的MTT S5000为例,单卡AI算力干到1000 TFLOPS,配上80GB显存,纸面数据确实够猛。但这只是基础入场券。真正的核心在于,怎么通过灵活的架构,让不同模型找到最契合的硬件组合,把成本和性能平衡到极致。
以前大家迷信大力出奇迹,现在必须学会精打细算。国内模型能在有限算力下拼出明显的成本优势,靠的就是这种不迷信单一硬件的务实打法。当碎片化场景成为常态,靠单卡打天下的日子就彻底结束了。未来市场上,那些能提供定制化推理服务的ISP(推理服务提供商)会迎来大爆发。能把手里的牌打出漂亮组合拳的系统级玩家,才能在这场算力消耗战里活到最后。

既然单卡无法包打天下,云厂商的解法是向系统级架构要算力,阿里云的最新动作就是个典型样本。在世界人工智能大会上,阿里云直接端出了灵骏真武M890超节点实例。这台机器最狠的地方,在于单台就能承载十万亿参数级MoE大模型的推理。
别以为这只是把几十张卡简单捆在一起。M890玩的是底层架构的彻底重构。通过ICN Switch 1.0芯片,互联规模直接从16卡拉到64卡,卡间带宽飙到800GB/s。配合FP8和FP4低精度计算,硬是把训练性能比上一代拔高了三倍。这种全对称高速互联叠加超大显存,才是撑起十万亿参数推理的真底气。
算力瓶颈往往不在计算本身,而在网络和存储拖后腿。阿里云这次把HPN 8.0训推一体网络架构也推到了台前,单集群最高支持13万卡异构算力混布,还能向百万卡级扩展。存储侧基于飞天盘古对CPFS做了全栈重构,单文件系统就能扛下百PiB容量和百TB/s吞吐。计算、网络、存储三管齐下,才让算力真正转化为生产力。
以前总觉得算力不够就买卡,现在发现光有卡根本跑不动大模型。十万亿参数的推理早就不是单纯堆硬件的游戏,而是对系统级架构的极限压榨。只会无脑堆料的时代彻底结束了,能把底层架构重构到极致的玩家,才能拿到下一代大模型的入场券。
云端算力在重构,底层硬件厂商也没闲着,国产GPU正借这波推理需求红利加速商业化落地。
摩尔线程刚交出的半年度成绩单足够惹眼。2026年上半年业绩预告显示,营收区间达到16.5亿至17.5亿元,同比暴增135%到149%。这组翻倍的数字意味着,国产全功能GPU终于跨过了商业化交付的实质性门槛。
大模型竞争早就不是单纯拼参数规模,而是转向以软硬协同和系统级优化为核心的推理算力解决方案之争。摩尔线程的旗舰产品MTT S5000就是在这个逻辑下跑出来的产物。单卡1000 TFLOPS算力、80GB显存、1.6TB/s显存带宽,完整支持从FP8到FP64全精度计算。纸面参数够硬,但真正让它实现规模量产的,是它精准契合了当前推理市场的真实胃口。
以前总觉得国产GPU只能在边缘场景打转,现在人家直接杀进大模型训练和推理的核心区。王东把账算得很明白,中国前沿模型相比国外有明显成本优势,恰恰说明国内团队在有限算力下把效率榨干了。推理市场根本不存在万能芯片,拼的就是解决方案的组合。MTT S5000不是去死磕单点极限性能,而是通过第四代MUSA架构的灵活协同,让不同模型找到最契合的硬件组合,把成本和性能平衡到极致。
靠单一硬件参数碾压对手的日子一去不复返了。国产GPU能在这波浪潮中拿下超一倍的营收增长,靠的不是盲目对标,而是切中性价比和系统级优化的痛点。在算力受限的现实下交出好用的答卷,才是真正立足市场的硬实力。

硬件交付跟上后,更关键的是如何在实际应用中把算力成本打下来,这正是国内大模型厂商的强项。在算力受限的现实下,国内玩家硬是把抠门做成了一门艺术。
摩尔线程王东算过一笔账,中国前沿基础模型相比国外同等智力水平的模型,有着明显的成本优势。他直言,这恰恰说明国内团队在有限算力下,把模型效率、价格效率和训练成本榨到了极致。以前大家觉得算力不够就拼命买卡,现在发现靠性价比撕开突破口才是真本事。大模型竞争早就从单纯的参数规模扩张,转向了以软硬协同和系统级优化为核心的推理算力解决方案之争。
国内厂商这套极致抠门的打法,核心就体现在三个方面:
1、死磕算法效率,用更少的Token和更精妙的架构跑出同等智力水平。
2、软硬协同优化,不迷信单卡极限性能,而是通过系统级重构把集群利用率拉满。
3、场景化定制,针对碎片化需求提供灵活组合,把每一滴算力都用在刀刃上。
在算力受限的牌桌上,性价比从来不是退而求其次的妥协,而是撕开市场缺口的利刃。靠堆料换来的参数虚荣终会褪色,能把每一分算力成本抠到极致并转化为商业价值的玩家,才能真正定义下一代大模型的生存法则。
当性价比成为核心竞争力,推理市场的商业模式也随之演变,单纯的卖卡或卖算力已经不够看了。
硬件堆砌的尽头,是场景的极度碎片化。自动驾驶、具身智能、文本对话,每个细分领域对算力的胃口天差地别。以前大家迷信砸钱买最贵的顶级单卡就能包打天下,现在发现根本行不通。摩尔线程王东把话挑得很明,推理市场没有万能芯片,而是解决方案的组合。不存在任何一家公司能垄断所有细分应用,更没有绝对完美的单一硬件。
这恰恰印证了当下的行业共识,大模型竞争已从单纯的参数规模扩张,转向以软硬协同和系统级优化为核心的推理算力解决方案之争。既然单卡无法通吃,市场自然会催生新的分工。王东预判,市场将涌现大量ISP(推理服务提供商),专门为模型提供商或终端客户提供更具性价比、更灵活的定制化推理服务。
这是一场算力供给侧的精细革命。模型公司把算法效率榨干后,剩下的优化空间就在系统级定制上。通过灵活的软硬协同,让每个模型找到最契合的硬件组合,把成本与性能平衡到极致。中国前沿基础模型能在国外同等智力水平下保持明显成本优势,靠的就是这种不迷信单一硬件的务实打法。
别再盯着单卡跑分自嗨了。未来的算力生意,拼的是谁能把手里的牌打出漂亮的组合拳。能精准切中碎片化场景痛点、提供定制化推理服务的系统级玩家,才能在这波新一波的ISP红利中吃下最肥的肉。