7名博士生3个月从零训练7B大模型:构建数百Agent团队实现AI4AI研发闭环
2026/09/15 10:17阅读量 2
北京中关村学院7名博士生历时3个月,利用“AI4AI”范式从零训练出7B参数大模型ZGCM-1。团队通过调度数百个Agent处理数据清洗、实验监控及评测任务,解决了人力无法覆盖的工程瓶颈。该模型在多项通用评测中与Qwen3-8B表现相当,且开源了全链路代码、数据及日志,为复现和研究提供完整参考。
事件概述
北京中关村学院的7名博士生团队(涵盖人工智能、网络、化学、生物及网安背景)在一个暑假期间,从零开始训练并发布了7B参数大模型 ZGCM-1。该项目不仅公开了模型权重,还全面开放了训练代码、数据处理配方、中间Checkpoint及详细日志,旨在让研究者能够追溯和复现整个研发流程。在多项通用评测中,ZGCM-1的表现与同规模的 Qwen3-8B 相近,并在部分数学推理和搜索任务中展现出与更大规模模型竞争的能力。
核心信息:AI4AI 研发范式实践
面对传统大模型训练需要数百人团队协作的工程体量,该团队采用 “AI4AI” 模式,组建了一支由数百个 Agent 组成的虚拟团队来辅助研发:
- Agent 分工与协作:团队搭建了自研的 ZGent 平台,将任务拆分为数据、实验和评测子团队。Agent 负责编写清洗脚本、监控日志、定位故障及优化 I/O 流程,形成从目标设定到结果检查的闭环。
- 自主性评级发现:团队对研发过程进行了 L1-L5 的自主性评级。结果显示,实验监控和部署已达到 L4 级别(Agent可独立规划执行),但模型架构设计等核心研究环节仍主要依赖人类主导(L2)。
- 工程效率优化:为解决长上下文推理的成本问题,团队采用了局部与全局注意力结合的架构,将上下文扩展至 256K。相比全注意力方案,吞吐提升约 3.94倍,KV Cache 占用降至约六分之一。同时结合 Muon 优化器和 FP8 精度,使预训练效率较基线提高约 4.2倍。
关键挑战与解决方案
- 能力退步排查:训练中曾出现 Loss 下降但模型能力退步的现象。团队通过建立 ACE 原子能力评测体系(包含18类、183项探针),密集保存 Checkpoint 并追踪具体能力变化,最终定位问题源于底层数据分片和 Shuffle 环节的数据比例波动。
- 数据策略调整:实战经验表明,SFT 阶段更严格的质量筛选虽使样本量减少约 44.9%,但整体评测表现反而提升;过高的长思维链数据比例则会损害指令遵循能力。
开源资源
- 技术报告:GitHub链接
- 训练代码:GitHub链接
- 模型权重:HuggingFace链接
- 训练数据:HuggingFace数据集
