中国电信发布星辰大模型Xing4.0-29B-A4B - 果核剥壳

9月20日消息,中电信人工智能科技有限公司于9月17日正式发布新一代星辰大模型Xing4.0-29B-A4B。该模型聚焦复杂任务理解、任务规划、工具调用和自主执行等能力,支持长上下文处理,可应用于代码开发、数据分析、办公自动化及生活服务等场景。

中国电信发布星辰大模型Xing4.0-29B-A4B

另据华为中国官方昨晚宣布,Xing4.0-29B-A4B总参数29B,激活参数仅4B,是国内首个基于昇腾Atlas 900 A3 SuperPoD液冷超节点与昇思MindSpore框架完成训练的百亿参数大模型,面向复杂工程任务进行了深度优化。该模型采用新一代架构设计,进一步提升长程任务处理和多步骤执行能力,能够根据用户提出的目标自主规划任务路径、调用工具并完成复杂任务。

技术攻坚方面,华为官方表示,模型的中高阶代码生成与智能体执行是对长程上下文理解、复杂推理规划、工具调用协同的综合考验,华为团队与中电信团队从数据体系、模型架构、训练工程到强化学习进行了系统性攻坚:

数据基座:围绕预训练与后训练全生命周期,建设涵盖数十万亿词元的数据体系。预训练阶段完成PB级多源异构数据清洗,引入海量智能体行为轨迹与结构化知识图谱;后训练阶段搭建高并发沙箱容器,构建端到端长程任务合成数据,并建立自动化校验机制保障数据正确性。

架构设计:专为长程Agent任务设计,MLA多头潜变量注意力压缩KV缓存;MT多Token预测增强生成连贯性;mHC流形约束超连接解决训练数值不稳定问题;Muon与QK-Clip优化器保障训练稳定。训练采用分阶段递进策略,从4K逐步扩展至32K/128K/256K序列长度,系统性构建长程能力。

工程优化:Xing4.0-29B-A4B在昇腾超节点集群上通过多层次软硬件协同优化实现训练性能提升96%。具体而言:基于MindSpore全栈适配mHC多残差连接与DSA长序列机制;针对细粒度MoE(64路由/Top4激活),通过专家负载均衡、Grouped GEMM、通信计算重叠及DVM图算融合,吞吐提升32%;层级与算子级选择性重计算再提升19%;自研Ascend C mHC融合算子解决Sinkhorn碎片化,计算效率提升30%,整网吞吐再提升25%。

多专家强化学习:基于昇腾生态完成Slime强化学习框架适配,面向Agent、Coding、Reasoning开展多专家强化学习训练,通过MOPD技术实现多专家能力高效融合,进一步提升复杂推理与智能体任务表现。

值得一提的是,目前昇腾已支持40余个业界头部模型完成原生训练,也是国内唯一支持商用大规模预训练并训练落地SOTA大模型的厂商。

 

 

如果您喜欢本站,点击这儿不花一分钱捐赠本站

这些信息可能会帮助到你: 下载帮助 | 报毒说明 | 进站必看

修改版本安卓软件,加群提示为修改者自留,非本站信息,注意鉴别

(0)
上一篇 3天前
下一篇 3天前

相关推荐

发表回复

评论问题之前,点击我,能帮你解决大部分问题

您的电子邮箱地址不会被公开。 必填项已用*标注