算力优化不能只停留在纸面指标,必须落到具体业务场景,鸿蒙生态的规模化正好提供了最佳试验田。openPangu 2.0 的底层改造并非单纯为了跑分,而是把昇腾 NPU 的算子调度与鸿蒙的系统级 AI 框架做了硬绑定。过去跑 Agent 任务,跨层调用和显存搬运往往吃掉大半响应时间。现在这套架构直接在底层打通通信链路,配合 18B 的激活参数设计,长上下文推理时的显存碎片被大幅压缩。模型在昇腾集群上跑出的两倍吞吐,落到鸿蒙侧直接转化为任务执行的时延断崖式下降。
鸿蒙 6 升级率已经冲到 98%,终端设备数突破 6600 万,这套庞大的存量底座早就过了概念验证阶段,直接扛起真实的并发压力。设备调度、应用交互、跨端协同这些高频操作,不再依赖大模型盲目生成,而是靠系统级路由配合轻量化参数精准执行。发布会提到的“更快更准更省”,本质上是算力配额受限后,用工程手段硬挤出来的效率红利。
软硬协同的底层逻辑很直白。单卡吞吐翻倍只是入场券,决定 Agent 能否真正跑通商业闭环的,是端到端任务完成率和单次调用成本。当硬件供给成为硬约束,继续在云端堆参数只会把现金流烧干。把模型能力下沉到操作系统层,用原生框架吃透底层算力,才是打破算力瓶颈的唯一路径。厂商和开发者现在就该调转评估重心,别盯着参数榜单内卷,直接去鸿蒙真机上压测 Agent 任务流,实际吞吐和任务成功率会给出最诚实的反馈。
生态跑通需要底层工具链的开放,华为此次不仅给模型权重,更把核心训练组件交了出去。6月30日起,预训练代码、后训练流程以及关键训练算子等7大组件将陆续全量上线。过去行业开源往往只扔个权重包,开发者拿到手只能做应用层微调,底层优化路径全是黑盒。这次盘古2.0直接把完整训练链路敞开,等于把吞吐率优化的操作底牌摊在了桌面上。开发者可以直接在代码层复现昇腾算子是如何重写跨节点通信、如何压榨单卡显存利用率的。余承东在台上没绕弯子,全栈开源的核心逻辑很明确,在算力配额见顶的窗口期,闭源模型很难单点突破硬件瓶颈,必须把全行业的开发者拉进来共建底座。这批代码放出来,团队别急着拿它去刷公开榜单,直接接入昇腾集群跑通预训练与后训练流水线,把通信开销和显存碎片压到极限,才是检验这套开源策略成色的唯一标准。
代码开源只是起点,这套以效率为核心的打法,正在重塑行业对“强模型”的评判标准。过去两年,厂商们把资源全砸进千亿、万亿参数的数字竞赛里,仿佛只要规模够大,就能自动抹平所有技术鸿沟。现实却非常直接,算力成本呈指数级攀升,数据中心供电与芯片供给根本托不住无底线的参数膨胀。继续硬堆规模,只会把现金流迅速烧干。华为把505B的总盘子做轻,靠架构重组和底层硬件协同把单卡吞吐率拉到业界两倍,这不是战术妥协,而是算力账本倒逼出的生存法则。
大模型落地从来不是比谁跑分高,而是比谁能在单位成本下扛住更多并发。吞吐率上不去,再强的泛化能力也只能困在测试环境里。现在该把目光从参数榜单上挪开了,评估模型价值得看它吃透了多少硬件红利,能在真实业务中挤出多少有效吞吐量。
技术路线的拐点已经清晰。与其继续死磕万亿参数,不如把算子调度、显存碎片和跨节点通信拆解到物理极限。建议各家研发负责人直接调整验收指标,把单卡实测吞吐、端到端响应时延和单次调用成本列为硬性KPI。效率战拼的是工程底蕴,谁能用更少的算力跑出更高的业务并发,谁才能拿到下一阶段的生存筹码。华为开源盘古2.0:算力受限下的吞吐率突围
大模型动态
华为
openPangu 2.0
大模型开源
昇腾算力
鸿蒙生态
在6月12日的HDC 2026上,华为常务董事余承东正式发布openPangu 2.0,并立下“只有第一”的军令状。面对国内算力吃紧的现状,华为并未盲目卷入参数军备竞赛,而是将Pro版总参数量控制在505B,激活参数压至18B,把技术重心全面转向单卡吞吐率与推理时延优化。结合6月30日启动的7大组件开源计划,以及鸿蒙6已突破6600万台设备的规模化底座,盘古2.0正试图以软硬协同的效率路线重构开源大模型格局。本文将还原其技术取舍逻辑,并梳理对产业端的实际影响。
HDC 2026 现场的大幕刚拉开,余承东直接把 openPangu 2.0 的底牌摊在了台上。这次发布很干脆,Pro 版 505B 总参数搭配 18B 激活参数,Flash 版 92B 总参数搭配 6B 激活参数,全系标配 512K 上下文。余承东没做过多铺垫,坦言自己分到的算力非常有限,大头得优先保国内其他企业的生存。
在高昂的 AI 算力成本面前,华为的策略已经转向:彻底放弃参数堆砌,把精力全砸在架构优化与单卡吞吐率上。实测数据给得很直接,得益于与昇腾底座的深度绑定,单卡吞吐率拉到业界主流开源模型的两倍,鸿蒙侧的 Agent 任务执行跟着提速降本。6 月 30 日,预训练代码、后训练流程及核心算子等 7 大组件将陆续全量释放。
余承东那句我的字典里没有第二,只有第一并非单纯喊话,而是算力账本算清后的精准卡位。在国产算力供给吃紧的窗口期,用极致的吞吐效率和全栈开源去置换开发者生态,比盲目冲击参数榜单更符合当下的商业逻辑。
从发布会现场的激进表态回到参数设定的现实考量,算力瓶颈直接划定了华为的技术路线。505B的总参数量在动辄万亿的榜单里显得克制,但激活参数仅18B的架构设计才是精打细算的产物。余承东直言留给大模型团队的算力配额紧张,国内产业链的生存需求必须优先保供。在算力供给吃紧的当下,硬堆参数只会快速烧干现金流。华为的解法很务实:把有限的卡用在刀刃上,把架构优化和单卡吞吐率作为核心指标死磕到底。
实测数据已经给出了明确信号。openPangu 2.0在昇腾集群上的单卡吞吐率直接拉到业界主流开源模型的两倍。这并非靠堆砌硬件或玄学调参,而是底层算子重写与硬件调度深度绑定的结果。过去行业习惯用万卡集群去弥补架构缺陷,现在昇腾底座直接把跨节点通信开销和显存碎片问题压到最低。说实话,这种软硬协同的底层改造极其耗时,但换来的推理延迟下降和吞吐量翻倍,在真实业务场景里比纸面参数管用得多。
算力账本算得明明白白。当训练与推理成本成为悬在厂商头顶的现实约束,继续卷参数规模早已触及边际效益的天花板。将资源向单卡吞吐率和端到端时延倾斜,才是打破算力物理限制的必经之路。厂商和开发者在选型时,真该把目光从参数排行榜上移开,直接盯住单卡实测吞吐和单次推理成本。大模型竞赛的下半场,谁能用更少的卡跑出更高的业务并发,谁就能真正拿到商业化落地的入场券。
算力优化不能只停留在纸面指标,必须落到具体业务场景,鸿蒙生态的规模化正好提供了最佳试验田。openPangu 2.0 的底层改造并非单纯为了跑分,而是把昇腾 NPU 的算子调度与鸿蒙的系统级 AI 框架做了硬绑定。过去跑 Agent 任务,跨层调用和显存搬运往往吃掉大半响应时间。现在这套架构直接在底层打通通信链路,配合 18B 的激活参数设计,长上下文推理时的显存碎片被大幅压缩。模型在昇腾集群上跑出的两倍吞吐,落到鸿蒙侧直接转化为任务执行的时延断崖式下降。
鸿蒙 6 升级率已经冲到 98%,终端设备数突破 6600 万,这套庞大的存量底座早就过了概念验证阶段,直接扛起真实的并发压力。设备调度、应用交互、跨端协同这些高频操作,不再依赖大模型盲目生成,而是靠系统级路由配合轻量化参数精准执行。发布会提到的“更快更准更省”,本质上是算力配额受限后,用工程手段硬挤出来的效率红利。
软硬协同的底层逻辑很直白。单卡吞吐翻倍只是入场券,决定 Agent 能否真正跑通商业闭环的,是端到端任务完成率和单次调用成本。当硬件供给成为硬约束,继续在云端堆参数只会把现金流烧干。把模型能力下沉到操作系统层,用原生框架吃透底层算力,才是打破算力瓶颈的唯一路径。厂商和开发者现在就该调转评估重心,别盯着参数榜单内卷,直接去鸿蒙真机上压测 Agent 任务流,实际吞吐和任务成功率会给出最诚实的反馈。
生态跑通需要底层工具链的开放,华为此次不仅给模型权重,更把核心训练组件交了出去。6月30日起,预训练代码、后训练流程以及关键训练算子等7大组件将陆续全量上线。过去行业开源往往只扔个权重包,开发者拿到手只能做应用层微调,底层优化路径全是黑盒。这次盘古2.0直接把完整训练链路敞开,等于把吞吐率优化的操作底牌摊在了桌面上。开发者可以直接在代码层复现昇腾算子是如何重写跨节点通信、如何压榨单卡显存利用率的。余承东在台上没绕弯子,全栈开源的核心逻辑很明确,在算力配额见顶的窗口期,闭源模型很难单点突破硬件瓶颈,必须把全行业的开发者拉进来共建底座。这批代码放出来,团队别急着拿它去刷公开榜单,直接接入昇腾集群跑通预训练与后训练流水线,把通信开销和显存碎片压到极限,才是检验这套开源策略成色的唯一标准。
代码开源只是起点,这套以效率为核心的打法,正在重塑行业对“强模型”的评判标准。过去两年,厂商们把资源全砸进千亿、万亿参数的数字竞赛里,仿佛只要规模够大,就能自动抹平所有技术鸿沟。现实却非常直接,算力成本呈指数级攀升,数据中心供电与芯片供给根本托不住无底线的参数膨胀。继续硬堆规模,只会把现金流迅速烧干。华为把505B的总盘子做轻,靠架构重组和底层硬件协同把单卡吞吐率拉到业界两倍,这不是战术妥协,而是算力账本倒逼出的生存法则。
大模型落地从来不是比谁跑分高,而是比谁能在单位成本下扛住更多并发。吞吐率上不去,再强的泛化能力也只能困在测试环境里。现在该把目光从参数榜单上挪开了,评估模型价值得看它吃透了多少硬件红利,能在真实业务中挤出多少有效吞吐量。
技术路线的拐点已经清晰。与其继续死磕万亿参数,不如把算子调度、显存碎片和跨节点通信拆解到物理极限。建议各家研发负责人直接调整验收指标,把单卡实测吞吐、端到端响应时延和单次调用成本列为硬性KPI。效率战拼的是工程底蕴,谁能用更少的算力跑出更高的业务并发,谁才能拿到下一阶段的生存筹码。
算力优化不能只停留在纸面指标,必须落到具体业务场景,鸿蒙生态的规模化正好提供了最佳试验田。openPangu 2.0 的底层改造并非单纯为了跑分,而是把昇腾 NPU 的算子调度与鸿蒙的系统级 AI 框架做了硬绑定。过去跑 Agent 任务,跨层调用和显存搬运往往吃掉大半响应时间。现在这套架构直接在底层打通通信链路,配合 18B 的激活参数设计,长上下文推理时的显存碎片被大幅压缩。模型在昇腾集群上跑出的两倍吞吐,落到鸿蒙侧直接转化为任务执行的时延断崖式下降。
鸿蒙 6 升级率已经冲到 98%,终端设备数突破 6600 万,这套庞大的存量底座早就过了概念验证阶段,直接扛起真实的并发压力。设备调度、应用交互、跨端协同这些高频操作,不再依赖大模型盲目生成,而是靠系统级路由配合轻量化参数精准执行。发布会提到的“更快更准更省”,本质上是算力配额受限后,用工程手段硬挤出来的效率红利。
软硬协同的底层逻辑很直白。单卡吞吐翻倍只是入场券,决定 Agent 能否真正跑通商业闭环的,是端到端任务完成率和单次调用成本。当硬件供给成为硬约束,继续在云端堆参数只会把现金流烧干。把模型能力下沉到操作系统层,用原生框架吃透底层算力,才是打破算力瓶颈的唯一路径。厂商和开发者现在就该调转评估重心,别盯着参数榜单内卷,直接去鸿蒙真机上压测 Agent 任务流,实际吞吐和任务成功率会给出最诚实的反馈。
生态跑通需要底层工具链的开放,华为此次不仅给模型权重,更把核心训练组件交了出去。6月30日起,预训练代码、后训练流程以及关键训练算子等7大组件将陆续全量上线。过去行业开源往往只扔个权重包,开发者拿到手只能做应用层微调,底层优化路径全是黑盒。这次盘古2.0直接把完整训练链路敞开,等于把吞吐率优化的操作底牌摊在了桌面上。开发者可以直接在代码层复现昇腾算子是如何重写跨节点通信、如何压榨单卡显存利用率的。余承东在台上没绕弯子,全栈开源的核心逻辑很明确,在算力配额见顶的窗口期,闭源模型很难单点突破硬件瓶颈,必须把全行业的开发者拉进来共建底座。这批代码放出来,团队别急着拿它去刷公开榜单,直接接入昇腾集群跑通预训练与后训练流水线,把通信开销和显存碎片压到极限,才是检验这套开源策略成色的唯一标准。
代码开源只是起点,这套以效率为核心的打法,正在重塑行业对“强模型”的评判标准。过去两年,厂商们把资源全砸进千亿、万亿参数的数字竞赛里,仿佛只要规模够大,就能自动抹平所有技术鸿沟。现实却非常直接,算力成本呈指数级攀升,数据中心供电与芯片供给根本托不住无底线的参数膨胀。继续硬堆规模,只会把现金流迅速烧干。华为把505B的总盘子做轻,靠架构重组和底层硬件协同把单卡吞吐率拉到业界两倍,这不是战术妥协,而是算力账本倒逼出的生存法则。
大模型落地从来不是比谁跑分高,而是比谁能在单位成本下扛住更多并发。吞吐率上不去,再强的泛化能力也只能困在测试环境里。现在该把目光从参数榜单上挪开了,评估模型价值得看它吃透了多少硬件红利,能在真实业务中挤出多少有效吞吐量。
技术路线的拐点已经清晰。与其继续死磕万亿参数,不如把算子调度、显存碎片和跨节点通信拆解到物理极限。建议各家研发负责人直接调整验收指标,把单卡实测吞吐、端到端响应时延和单次调用成本列为硬性KPI。效率战拼的是工程底蕴,谁能用更少的算力跑出更高的业务并发,谁才能拿到下一阶段的生存筹码。