云知声发布U2-Flash:国产RSI模型实现“快省强”反打旗舰

2026/09/17 11:26阅读量 4

云知声正式发布基于递归自我改进(RSI)理念的U2-Flash模型,采用稀疏MoE架构,总参数约266B但单次推理仅激活约10B。实测显示,该模型在保持生成速度提升2.1倍、成本降低的同时,代码与Agent任务能力大幅超越上一代U2模型,部分指标进入万亿参数级区间。其核心突破在于构建了包含自主数据生成、异步强化学习及多教师蒸馏的后训练闭环,标志着国产模型在RSI工程化落地方面迈出关键一步。

事件概述

港股AGI第一股云知声正式发布U2-Flash大模型。该模型被视为国产RSI(Recursive Self-Improvement,递归自我改进)的早期答卷,通过让模型深度参与自身演进(包括生成训练数据、分析执行轨迹、巡检修复系统),实现了性能与效率的双重突破。U2-Flash已上线云知声MaaS平台,兼容OpenAI和Anthropic协议,并提供限时优惠及免费额度活动。

核心信息与技术突破

1. 性能表现:打破Flash模型“能力打折”惯例

传统Flash模型通常以牺牲能力换取速度和成本优势,但U2-Flash实现了反向超越:

  • 效率提升:相比上一代U2模型,生成速度提升2.1倍,Agent任务完成时间缩短35%,任务迭代步数和Token消耗降低20%-30%
  • 能力反超
    • DeepSWE v1.1评分从32分升至64.6分(翻倍);
    • TerminalBench 3.0评分从2.7分飙升至24.3分(9倍增长);
    • SWE-Bench Pro拿下61.6分,较前代提升10.5分。
  • 智能密度:采用稀疏MoE架构,总参数约266B,单次推理仅激活约10B(不足4%),却在代码和Agent任务上展现出足以与主力模型掰手腕的能力,部分表现闯入万亿参数级模型区间。

2. 后训练闭环:RSI落地的三大关键技术

U2-Flash的高效能能源于云知声构建的“后训练闭环”,模型开始参与决定下一版自己的学习内容:

  • 自主任务生成:根据当前能力动态生成新任务,专门挑选“接近突破但未掌握”的问题,目前已构建近10万道高质量SWE任务。
  • 异步Agent RL:将长任务拆分给多个Worker并行执行,避免同步等待,并通过回溯关键Action标记成功/失败路径,使单位时间内有效训练轨迹数量提升约60%
  • 多教师在线策略蒸馏:针对代码、数学、Agent等不同领域训练专项教师模型,对学生模型生成的轨迹进行逐Token打分,提供细粒度反馈,使达到同等能力所需的训练步数减少约55%

此外,该闭环还延伸至训练系统本身,模型可参与机器巡检和故障修复,使训练故障平均恢复时间缩短至人工介入模式的三分之一

3. RSI分级定位

参考上海交大、清华等机构提出的L1-L5 RSI路线图,U2-Flash显露出明显的L3特征:虽运行在人工设定的沙盒和规则内,但已开始参与决定下一版模型的学习方向。这标志着后训练竞争已从“人给模型准备答案”升级为“模型持续为自己创造有效经验”。

值得关注

  • 国产算力适配:U2-Flash已针对主流国产算力平台进行架构、算子及调度优化,在吞吐、时延和集群扩展效率上持续提升,部分场景接近NVIDIA GPU方案,为RSI体系的长期稳定运行提供基础。
  • API接入与成本:U2-Flash支持OpenAI和Anthropic双协议,便于接入Cursor、Trae等主流开发工具。当前定价极具竞争力(输入0.6元/百万Tokens,输出1.2元/百万Tokens),且活动期间提供1亿Tokens免费额度。
  • 实测验证:在虚构Bug查找、混乱环境调试及14份文件长上下文处理等测试中,U2-Flash均展现了快速定位问题、辨别错误线索及整合复杂信息的能力,验证了其作为“干活主力”的可行性。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。