中国电信开源全栈国产轻量模型Xing4.0-29B-A4B:单卡3090即可部署,专注企业本地AI办公
2026/09/20 20:22阅读量 5
中国电信最新开源全栈国产化代码智能体大模型Xing4.0-29B-A4B,基于华为昇腾910C算力与MindSpore框架训练,实现“国芯训国模”。该模型采用MoE架构,经4-bit量化后仅需约15GB显存,单张RTX 3090即可运行。模型原生支持256K至512K长上下文,强化Coding工程能力与Agent长程任务处理,并适配主流开发工具链,旨在满足数据不出域且算力有限企业的本地化部署需求。
事件概述
中国电信近期开源了Xing4.0-29B-A4B,这是一款面向企业本地化部署的全栈国产化轻量级代码智能体大模型。该模型旨在解决数据敏感型企业“数据不能出域”、“算力资源有限”但需处理复杂业务(如长文档阅读、代码工程、多步骤Agent任务)的痛点。目前,该模型已在GitHub、Hugging Face、Gitee、魔搭及魔乐等平台上线,并位居HuggingFace趋势榜单第四。
核心技术与性能指标
- 全栈国产化适配:模型完全基于华为昇腾910C集群训练,使用国产MindSpore/MindFormers训练框架与开发套件,并在推理端完成昇腾适配,实现了从芯片、框架到模型的全链路国产化。
- 轻量化部署能力:采用MoE(混合专家)架构,总参数量290亿,每次推理仅激活约40亿参数。经过4-bit量化后,显存占用压缩至约15GB(较FP16精度降低约75%),使得消费级显卡如RTX 3090/4090即可承载运行。
- 长上下文与编码能力:原生支持256K上下文,可扩展至512K。针对代码工程场景,模型具备跨文件追踪接口调用、结合日志与历史上下文定位问题及验证修改的能力,从单纯的“写片段”升级为“干工程”。
- Agent智能体强化:针对长程任务进行专项优化,能够自主拆解任务、安排执行顺序、调用外部工具(如天气、日程等),并根据中间结果动态调整策略,直至交付验收结果。
架构优化与训练细节
- 注意力机制优化:采用MLA(多头潜变量注意力)技术,将KV Cache压缩为更紧凑形式,降低长上下文推理的显存开销;引入MTP(多Token预测),通过提前生成候选内容并由主模型校验,提升生成速度。
- 数据体系构建:自建数十万亿词元数据体系,预训练数据包含PB级清洗后的通用内容、复杂表格、结构化知识图谱及智能体行为轨迹。行为轨迹数据记录了任务目标、工具调用及反馈过程,直接增强Agent能力。
- 训练流程创新:
- 阶段演进:预训练从4K序列起步,逐步扩展至32K、128K和256K,增加仓库级代码与复杂推理数据占比。
- 后训练强化:搭建支持代码运行、在线搜索和工具调用的高并发沙箱,通过测试用例自动化校验结果。围绕Coding、Agent和Reasoning开展多专家强化学习,并通过MOPD融合专项能力。
- 稳定性控制:使用Muon优化参数更新,采用QK-Clip控制注意力计算数值规模,防止数值异常增长。
- 工程效率提升:通过DVM图算融合、细粒度重计算和Ascend C定制融合算子,减少调度与数据搬运开销。整网训练吞吐较开箱性能提升约96%。
应用场景与落地方案
- 实际业务表现:在智能客服私有化部署场景中,模型已完成意图理解、任务拆解、工具调用及合规校验全流程,复杂业务办理成功率超过90%,用户通话及身份信息全程不出域。
- 工作流集成:已定向适配OpenCode、Claude Code、OpenClaw、Hermes等主流Agent/Harness框架,兼容LLaMA-Factory、SGLang、vLLM等常用工具链,降低接入现有开发环境的门槛。
- 多元化部署路径:提供从单张消费级显卡、预集成算网一体机,到基于智源FlagOS统一软件栈的跨硬件平台迁移方案,以及通过智算专线调用云端算力的弹性扩容选项,满足不同规模企业的需求。
