Gemini 4 Pro疑似泄露:谷歌加速RSI研发,AI“减速”倡议面临现实挑战
2026/09/19 10:54阅读量 30
近期,Arena竞技场中出现的疑似Gemini 4 Pro模型在编码、3D生成及Agent任务上表现远超现有版本,引发业界对其能力跃升的关注。与此同时,谷歌正大力推动递归自我改进(RSI)技术,试图通过AI自动化优化模型研发流程,Anthropic等公司也披露了AI主导部分研发任务的进展。尽管多位AI领袖呼吁建立共同安全标准以“减速”,但在激烈的技术竞争下,前沿实验室的实际行动与口头倡议出现背离,共识难以落地。
事件概述
近期,AI模型盲测竞技场(Arena)中出现一个标识为 gemini-3.8-flash 但性能异常强大的模型,社区普遍推测其为谷歌尚未发布的下一代旗舰模型 Gemini 4 Pro。该模型的泄露不仅展示了显著的能力提升,更折射出谷歌正在加速推进**递归自我改进(Recursive Self-Improvement, RSI)**技术。这一趋势使得此前关于AI发展应“减速”的行业倡议显得愈发无力,因为主要竞争对手均在通过AI自动化手段加速研发进程。
核心信息
1. Gemini 4 Pro 疑似泄露与性能表现
- 异常发现:9月2日谷歌正式发布 Gemini 3.8 Flash 后,Arena中随即出现同名但性能更强的模型。开发者实测显示,该模型在代码编写、SVG绘图、3D场景生成及Agent任务上的表现远超正式版 3.8 Flash。
- 具体案例:
- 3D生成:能在约8分钟内生成可交互的Voxel风格宝塔场景;约10分钟搭建包含空客H145直升机的完整3D展示页面。
- 网页设计:约14分钟生成干净完整的单色主题网站,弥补了过往Gem系列在设计品味上的短板。
- 游戏开发:生成的游戏画面流畅,世界生成完成度高。
- 内部线索:有开发者声称通过“幽灵路由”获取后端信息,显示模型内部标识含
G4P-ARGON,最大输出达256K,上下文窗口超1000万token,并具备跨会话记忆、自动编译脚本及物理机器人控制等能力。 - 基准测试传闻:流传的Benchmark数据显示,该模型在软件工程(DeepSWE v1.1: 88.7%)、终端Agent(Terminal-Bench 2.1: 95.3%)、知识推理(HLE-Verified: 72.1%)及电脑操作Agent(OSWorld 2.0: 86.8%)等指标上均大幅领先 GPT-6 Astra 和 Claude Fable。尽管数据未经官方背书,但其长期空窗的Pro线升级预期使其猜测具有较高可信度。
2. 背后的关键驱动力:递归自我改进(RSI)
- 定义:RSI指AI参与制造更强AI,进而加速下一代模型研发的闭环过程。这不仅提升模型能力,更加速进化速度。
- 谷歌动向:
- 联合创始人 Sergey Brin 近几个月推动Gemini提速,将RSI列为重点方向。
- 谷歌已将评测、寻找改进方向、实验运行等工作交由Agent处理,形成“递归评估和改进底层模型”的循环。
- DeepMind研究员姚顺宇称此次更新为“模型的一小步,RSI的一大步”。
- 9月14日发布论文《Dream-RSI》,研究Agent如何通过改进探索策略实现递归自我改进,在算法工程和数学优化上显示出更高效率。
- 行业对比:
- Anthropic:公开数据显示,截至8月,Claude已能主导26%的研发任务(从年初的<1%激增),超过90%的任务进入AI协作阶段。
- 智谱:创始人唐杰指出最小循环已出现,GLM-5.3驱动的Infra Agent在国产AI芯片集群上两周内将端到端吞吐提升至初始水平的3.2倍。
3. “AI减速”倡议与现实困境
- 风险共识:Amodei、奥特曼、马斯克、哈萨比斯等领袖均认同需对前沿AI发展保持谨慎,特别是当AI开始自主加速研发时,人类理解和控制能力的滞后可能带来安全风险。
- 倡议内容:呼吁建立第三方评测、共同安全标准和协调机制,在能力跨越门槛前实施减速。
- 执行落差:
- 缺乏共同规则:由于直接的技术竞争和国家间的AI博弈,任何单独减速都意味着让出领先窗口,导致共识难以转化为行动。
- 言行不一:在呼吁减速的同时,谷歌疑似提前测试Gemini 4 Pro,Anthropic社区亦出现Opus 5.2灰度痕迹,表明各实验室仍在全力加速。
值得关注
当前AI行业的核心矛盾已从单纯的能力比拼转向研发范式变革(即AI辅助/主导研发带来的指数级加速)。尽管安全警告频发,但在竞争压力下,建立有效的全球性“减速”或监管机制面临巨大阻力。Gemini 4 Pro若确认为真,标志着谷歌在RSI路径上取得了实质性进展,可能进一步加剧前沿模型的性能鸿沟。
