Gemini 4 Pro疑似泄露:AI递归自我改进加速,行业“减速”倡议落空
2026/09/19 10:19阅读量 4
谷歌下一代旗舰模型Gemini 4 Pro疑似在盲测竞技场以错误标签泄露,其编码、3D生成及Agent能力显著超越现有版本,并传出多项基准测试数据碾压竞品。与此同时,递归自我改进(RSI)正成为加速AI研发的核心驱动力,Anthropic数据显示AI已主导26%的内部研发任务。尽管业界呼吁建立共同安全规则以减缓发展速度,但主要实验室仍在推进下一代模型的测试与发布,实际进展并未放缓。
事件概述
近期,谷歌疑似下一代旗舰模型Gemini 4 Pro在第三方盲测平台Arena中匿名出现。该模型虽被标记为“gemini-3.8-flash”,但其实际表现远超官方发布的Gemini 3.8 Flash,引发社区广泛猜测其为未正式发布的Pro系列模型。与此同时,AI领域关于“减速”的倡议因各前沿实验室持续推进新一代模型研发而显得流于形式,递归自我改进(RSI)技术的深化进一步加剧了迭代速度的竞争。
核心信息
1. Gemini 4 Pro疑似泄露及性能表现
- 异常现身: 9月2日谷歌正式发布Gemini 3.8 Flash后,Arena中出现同名但性能更强的模型。开发者实测发现,该模型在代码编写、SVG图形生成、3D场景构建(如Voxel风格宝塔、直升机模型)及网页设计等方面表现优异,细节完整度与交互性远超预期。
- 技术线索: 有开发者声称通过“幽灵路由”获取后端信息,显示内部标识包含“G4P-ARGON”和“VIA_3.8_FLASH”,最大输出达256K,上下文窗口超1000万token,并具备跨会话记忆、自动联网及脚本运行等高级能力。
- 基准测试传闻: 社区流传一张对比表显示,该模型在软件工程(DeepSWE v1.1: 88.7%)、终端Agent(Terminal-Bench 2.1: 95.3%)、知识推理(HLE-Verified: 72.1%)及电脑操作(OSWorld 2.0: 86.8%)等指标上均领先于GPT-6 Astra和Claude Fable,真实知识工作评分(GDPval-AA v2)突破2000 Elo。
- 可信度说明: 上述基准数据和后端截图未经Google或Arena官方证实,且存在数据不一致之处,目前仍属社区推测。唯一确认的事实是存在一个性能异常且标签错误的模型实例。
2. RSI成为加速研发的关键驱动力
- 概念定义: RSI(Recursive Self-Improvement,递归自我改进)指AI参与制造更强AI,形成闭环加速循环,不仅提升模型能力,更加快研发速度本身。
- 谷歌动向: 谷歌联合创始人Sergey Brin推动Gemini提速,将RSI列为重点方向。DeepMind研究员指出Gemini 3.8 Flash的发布是“RSI的一大步”,官方提及长期运行的Agent循环正在递归评估和改进底层模型。团队还发布了Dream-RSI论文,研究Agent通过改进探索策略实现递归自我改进的方法。
- 行业数据佐证: Anthropic披露数据显示,截至8月,Claude已主导26%的内部AI研发任务(2月时不足1%),超过90%的研发任务进入AI协作阶段。智谱GLM-5.3-Flash也展示了由Infra Agent驱动的自动化优化案例,将端到端吞吐提升至初始水平的3.2倍。
3. “AI减速”倡议与实际进展脱节
- 倡议背景: 鉴于RSI可能带来的失控风险,包括OpenAI、Anthropic在内的多家机构呼吁建立共同安全标准、引入独立评测者并协调放慢研发速度,以防止人类评估与控制能力滞后于模型进步。
- 实际进展: 尽管风险共识存在,但出于竞争压力,主要实验室并未真正减速。
- 谷歌: 疑似已在测试Gemini 4 Pro。
- Anthropic: 社区出现Opus 5.2灰度测试痕迹。
- OpenAI: 后台疑似出现GPT-6 Sol模型名,预计近期发布。
- 结论: 三家前沿实验室的下一代模型均处于测试或即将发布状态,“减速”目前仅停留在风险警示层面,尚未转化为实质性的研发暂停或限制措施。
