DeepSeek Harness来了:AI开始制造AI?
2026/08/24 15:56阅读量 2
DeepSeek发布开发者预览版DeepSeek Harness,并联合北京大学发表论文,提出让AI在可回退、可重组的插件化环境中实现自我改进的架构。梁文锋将AI发展路径定位为LLM到具身智能的阶梯,RSI被视为通往AGI的关键手段。谷歌DeepMind、OpenAI、Anthropic、腾讯、MiniMax等同步加码RSI,竞争重点转向环境、反馈与循环。
事件概述
递归式自我改进(RSI)指让AI参与设计更强的AI,再由更强的AI加速下一轮改进,这一设想可追溯至数学家I.J.古德1965年的论文。DeepSeek近期推出开发者预览版DeepSeek Harness(DSH),并联合北京大学发表论文《a programming paradigm for spatiotemporal composability》,公开其架构思路。DSH在Codex、Claude Code、Kimi、Hy等已有Harness之后发布,虽然被部分用户吐槽部署繁琐、配置复杂,但被视为梁文锋布局RSI路径的关键一步。梁文锋在内部发言中将AI发展形容为LLM—CoT—Agent—持续学习—自我迭代—具身智能的阶梯,认为自我迭代将通向奇点。
核心信息
1. DSH的核心机制:Cordis
- DSH底层框架包含名为Cordis的机制,用于解决传统插件系统难以在不重启进程的情况下完整撤销插件影响的问题。
- 该机制从时间可组合性和空间可组合性两个维度,支持追踪与撤销插件影响,并在依赖变化时自动重新协调组件关系。
- Cordis已在开源聊天机器人框架Koishi中运行4年,该框架拥有四千多个社区插件,未来还需在更大规模系统中验证。
2. 梁文锋的RSI策略:模型先服务自身
- 梁文锋称DeepSeek模型的第一目标不是用户用得好,而是“自己用得好”,这是实现AGI最快的办法。
- AGI是目标,RSI是手段。让AI在可修改、可回退的工程环境中持续自我调整,是RSI落地的土壤。
3. 国内外玩家的RSI布局
- 谷歌DeepMind:掌门人哈萨比斯表示,大多数前沿实验室都在致力于RSI。AlphaEvolve已运行一年多,通过Gemini生成程序、自动评估器打分并循环优化,为数据中心调度找到新算法,平均回收全球约0.7%计算资源;在Gemini训练中加速一个关键矩阵乘法内核23%,整体训练时间缩短约1%。首席战略官称RSI正成为AI资本开支的核心投资逻辑。今年8月谷歌AI团队经历动荡,Jeff Dean离职创办Discovery Loop,方向即RSI;联合创始人Sergey Brin仍在内部推动资源流向RSI。
- OpenAI:在GPT-5.6发布说明中引入“RSI-Index”指标,衡量模型自进化程度。
- Anthropic:成立Anthropic Institute,将RSI列为重点方向;在“Automated Weak-to-Strong Researcher”实验中,Claude驱动的多个AI agent自主提出假设、设计并运行实验、分析结果并迭代,在一个AI对齐问题上取得优于人工研究者的结果。联合创始人Jack Clark预测RSI有60%概率在2028年底前发生。
- 腾讯:7月发布Hyra-1.0,官方称其能递归自我改进,面向性能导向的研究与工程任务。
- MiniMax:3月发布M2.7,标题为“自我进化的早期回响”。模型自己搭harness,分析失败轨迹、修改代码、跑评测、决定保留或回退,循环一百多轮后内部评测成绩提高约3成。
4. 竞争重点:环境、反馈和循环
- 模型发布不再是能力变化的唯一节点,单次发布领先周期正在缩短,RSI路径发生在模型发布之后。
- RSI落地需要三个条件:可行动与验证的真实环境、可靠的反馈机制、可持续迭代的循环。
- 马斯克以600亿美元收购代码编辑器Cursor,看重的是AI编程产生的高质量结构化数据、快速反馈周期和高频使用轨迹,本质上是为AI获取真实工作环境中的反馈与循环。
值得关注
RSI仍是“远方目标”,存在质疑。华盛顿大学教授Pedro Domingos指出,自1950年代LISP出现起,AI就具备某种构建自身的能力,但自我改进带来递增还是递减回报,目前尚无足够证据证明前者。此外,若AI通过RSI实现能力指数级增长,人类能否始终掌握“开关”仍是待解问题。
