智东西
作者 | 程茜
编辑 | 李水青
7月31日,华为正式开源了基于昇腾NPU训练的盘古MoE模型——openPangu-2.0-Pro。
作为openPangu-2.0系列的最新力作,该模型总参数量达到5050亿,激活参数为180亿,能够支持高达512K的上下文长度,训练数据规模约34T tokens。此前,华为已于6月12日开源了另一款轻量化模型openPangu-2.0-Flash,其参数规模为92亿,其中激活参数占6亿。
回顾今年6月12日的华为开发者大会,华为常务董事、产品投资评审委员会主任兼终端BG董事长余承东现场发布了openPangu-2.0-Flash,并预告了openPangu-2.0-Pro。当时他放言要将盘古大模型打造至世界第一。此次openPangu-2.0-Pro的开源,正是这一豪言壮语后的首次重磅落地。
不过,本次发布的技术报告仅披露了openPangu-2.0两款模型的相关数据,并未提供与第三方模型的直接对比结果。报告中指出,openPangu-2.0系列在通用能力、逻辑推理及智能体相关的主流评测基准中,均展现出强劲的对标实力。
在架构层面,openPangu-2.0-Pro实现了全面升级:
Attention架构方面,模型沿用高效MLA技术,并引入DSA+SWA独立分层混合架构,层配比为1:2。其中,SWA层负责局部窗口建模,DSA层处理稀疏全局聚合,这种设计在保持精度的同时,显著降低了长序列推理过程中的计算、显存及访存开销。
拓扑结构上,传统残差连接被升级为4支流mHC架构,从而提升了模型的表征多样性与泛化能力。
自投机模块采用3头MTP架构,单次可额外预测3个token,有效提升了推理速度。
优化器选用Muon,使得模型在训练中能够获得更快的收敛速度。
研究团队还发现了一种正向协同反馈机制:底层强大的基础推理能力可以直接支撑复杂智能体行为的运行;反之,智能体的持续运行也会反向迭代优化模型的多阶任务规划能力及长轨迹上下文处理水平。
目前,openPangu-2.0-Pro的模型权重、基础推理代码及技术报告已正式开源上线。
开源地址如下:
技术报告:https://huggingface.co/openpangu/openPangu-2.0-Pro/blob/main/openPangu-2.0%20Tech%20Report.pdf
一、专为长上下文智能体任务打造,复杂软件工程任务与顶尖模型存在差距
智能体应用对模型提出了更高要求,需能执行长程任务、精准调用外部工具,并在长时间运行时保持认知一致性。
但在实际部署中,模型往往暴露出诸多问题。例如,现有通用框架会引入不必要的推理资源损耗,而拉长上下文长度则会拖累模型表现;此外,传统对齐手段稳定性不足,导致模型在处理长周期任务时,常出现时间逻辑或层级结构方面的推理错误。
针对上述痛点,openPangu-2.0系列模型融合了自研硬件内核、整机系统架构以及训推一体化的智能体强化学习算法,搭配专属推理加速方案,构建了一套完备的软硬件协同设计体系,专门面向长上下文智能体任务。
该系列包含此次新开源的openPangu-2.0-Pro,以及6月12日开源的轻量化模型openPangu-2.0-Flash(参数92亿,激活参数6亿)。
在发布openPangu-2.0-Flash时,余承东曾强调,从算法架构到训练推理,盘古模型重点针对昇腾算力进行了优化,并进行了更深度的开源。昇腾原生训练效率提升了30%,且这是业界首个采用DSA+SWA独立分层混合架构的模型。他特别指出,这也是首个开源预训练代码、后训练代码及训推算子的模型。
Hugging Face数据显示,上月本地离线模型openPangu-2.0-Flash GGUF的下载量达到39935次。
此外,华为还推出了一款专为资源受限环境优化的30亿参数模型,其中激活参数为2亿。
研究人员基于多个公开基准测试评估了openPangu-2.0模型的性能。虽然技术报告未公开与第三方模型的对比结果,但提到在通用能力、推理任务及智能体等测试中,openPangu-2.0表现优异。不过在处理复杂的现实世界软件工程任务时,其与顶尖模型仍存在明显差距。
在通用能力方面,openPangu-2.0-Flash和openPangu-2.0-Pro在上下文学习、指令遵循及多轮理解等多种通用测试中均表现良好。在世界知识及事实可靠性测试中,openPangu-2.0-Pro的表现远超openPangu-2.0-Flash。
华为内部实验显示,为模型建立扎实的基础知识与推理能力,有助于其学习更复杂的智能体行为和编程技能。反过来,在复杂智能体环境中进行训练,能显著提升模型的基本能力,包括指令遵循、长轨迹上下文处理、多步推理及程序规划等。
此外,在训练过程中及结束后,持续提供高质量、多样化的长轨迹智能体数据及互动环境具有显著优势,这将成为未来模型升级的核心策略之一。
二、核心是采用分层混合注意力机制,预训练语料34T tokens
openPangu-2.0系列模型的核心架构通过分层混合注意力机制实现上下文计算解耦:利用滑动窗口注意力机制(SWA)处理稠密局部上下文,使用深度稀疏注意力机制检索全局稀疏信息。
为实现推理加速,模型额外搭载了三头多Token预测(MTP)模块,并将流形约束超连接(mHC)与Muon优化器相结合,在固定数据投入量前提下提升模型收敛速度。
▲openPangu-2.0模型架构
针对MoE负载均衡、mHC结构稳定性、MTP训练策略及Muon参数分组,研究人员分别设计了专属优化方案,以保障端到端训练全过程的稳定性。
当模型拓展至512K上下文窗口,并叠加mHC、Muon、MTP等多重复杂基础架构单元时,通信开销与显存占用瓶颈会随之增加。
为此,研发人员搭建了一套系统化协同优化框架:融合无冗余混合上下文并行(CP)、面向MTP的轻量化点对点数据传输、适配Muon优化器的分布式计算通信重叠机制以及混合重计算策略;依托Ascend C专用编程语言定制融合内核,对mHC、参数化注意力汇点(PAS)、模块化注意力(ModAttn)模块进行深度加速。
▲Muon通信与计算重叠情况
为释放CloudMatrix 384超节点集群的整体算力,落地了一套精简且感知网络拓扑的硬件亲和调度策略,将高带宽数据流约束在超节点内部交互,最大限度减少跨节点数据传输开销,破除集群运行瓶颈,实现硬件资源利用率最大化。
预训练阶段,openPangu-2.0预训练语料库包含约34T tokens。为优化学习过程,预训练被划分为三个阶段,每个阶段采用特定的数据配方和选择策略逐步提升模型能力:
第一阶段为通用领域(25T tokens),重点在于建立扎实的通用知识和广泛的语言能力基础。
第二阶段聚焦推理能力培养(8T tokens),旨在提升深度推理、逻辑思维及高级编程技能。
第三阶段进行退火处理(1.4T tokens),优化模型行为及智能体能力。研究人员特意保留了较长的文档和复杂的轨迹数据,以便在这一阶段最大限度提升模型的自主任务处理能力。
其预训练语料库汇集了网页、书籍、PDF文件、多语言文本、代码库等数据。
后训练阶段分为三级流水线:监督微调(SFT)、并行强化学习专家训练、多专家在线策略蒸馏(OPD)。
▲监督式微调
完成统一监督微调后,系统并行训练多组强化学习专家模型。各组专家依托独立数据集与专属奖励函数,分别针对逻辑推理、通用问答、智能体交互、代码生成四大领域优化策略,消除强化学习过程中的跨领域任务干扰。
最后,借助在线策略蒸馏完成各路专家能力的融合聚合。
在推理加速方面,华为自研了昇腾原生推理框架,实现硬件执行逻辑与模型运行时动态行为的耦合。
该架构自研多款融合算子,包含面向推理场景优化的mHC算子、专用集合通信原语,同时配套Felix上下文并行、单核多流执行等并行策略。
▲Felix流水并行(CP)方案完整前向计算流程
为提升推理吞吐,该框架搭配了定制量化方案与算子感知式保精度量化机制;并且集成混合KV缓存管理、无损并行分词(LoPT),基于模块化注意力(ModAttn)原生适配自动前缀缓存(APC)与MTP技术。
在128K上下文长度下,这套框架在昇腾NPU硬件上的长上下文推理性能表现为:openPangu-2.0-Flash版本最低TPOT时延可达5.63ms,在TPOT为15ms的工况下单卡NPU生成吞吐1846 token/s;openPangu-2.0-Pro版本最低TPOT时延9.55ms,TPOT 20ms条件下单卡吞吐1326 token/s。
结语:华为要借openPangu,打造端侧智能体生态
基于Ascend平台的硬件与软件协同设计方法,openPangu-2.0模型解决了大模型训练、长上下文对齐以及推理效率方面的关键瓶颈。
此外,华为在技术报告中表示,目标不仅停留在静态基准测试的性能上,更注重实际系统的实用性。openPangu在战略上处于有利地位,有望成为智能设备、汽车等领域智能体应用的核心竞争力。
华为也在积极扩展基于边缘计算的能力,利用麒麟处理器架构来突破设备智能化的极限。为了实现这一变革,将以昇腾硬件生态系统为基础,进一步扩展基于沙盒的仿真流程,以在复杂且开放性的场景中生成大量高保真度的执行数据集。
未来几个月,研究人员将持续迭代该模型,目标是在编程和复杂智能体任务方面,系统地提升openPangu的核心能力。








