联想天禧自研代码智能体TianxiCode登顶SWE-bench-Live全球第一

2026/10/09 16:53阅读量 8

联想天禧AI自主研发的代码智能体框架TianxiCode配合DeepSeek-v4.1-Flash模型,在权威软件工程评测SWE-bench-Live(Lite分榜)中以71%的问题解决率获得全球第一名。该成绩已通过官方“Verified”严格审核,证明了其在真实开发环境下的可复现性与高含金量。TianxiCode通过跨文件检索、自主规划及闭环自愈等工程能力,展现了从榜单突破走向产业落地的潜力。

事件概述

近日,在国际公认难度最高且最贴近真实开发环境的软件工程动态评测基准 SWE-bench-Live(Lite分榜)中,由联想天禧AI自主研发的专业代码智能体框架 TianxiCode 配合 DeepSeek-v4.1-Flash 模型,取得了突破性成绩:以 71% 的问题解决率登顶全球第一名,并正式通过官方审核认证。

核心信息

  • 评测含金量与权威性:
    • SWE-bench-Live基于真实GitHub项目中的问题,评估模型生成代码补丁及修复问题的能力,并提供可复现的执行环境,比传统单函数测试更贴近实际研发场景。
    • 为确保公正性,官方设立“Verified”核验机制,要求提交全链路智能体运行轨迹(Trajectories),严格审查输入隔离及是否存在答案泄露。TianxiCode成功通过审查,证明其成绩具备高可复现性。
  • 技术架构与能力:
    • TianxiCode作为工程级智能体框架,协同大模型(大脑)发挥效能,具备三大核心系统工程能力:
      1. 跨文件多跳检索与精准上下文管理:能在大型代码库中快速定位缺陷根因,类似资深工程师的排查逻辑。
      2. 自驱动规划与多轮工具调用:支持主动制定排错计划,通过终端命令行运行测试、查阅日志、比对修改记录,实现自主推进。
      3. 闭环补丁生成与测试驱动自愈:在隔离环境中自动运行代码,若发现报错或功能破坏,立即进行自我反思与修改,直至补丁通过验收。
  • 产业应用前景:
    • 此次突破标志着自研代码智能体框架进入国际第一梯队。未来,TianxiCode的技术成果将沉淀为开发者工具链,赋能联想AI硬件产品,旨在降低一线开发者的排错与工程协同成本。

值得关注

  • 该案例展示了“自研智能体架构 + 顶级闭源/开源模型”组合在复杂软件工程任务中的决定性优势,验证了Agent在真实工业场景落地可行性。
  • 通过官方严格审核的“Verified”状态,为后续其他AI代码助手参与同类评测提供了可信度参考标准。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。