GPT-5.6 自优化实锤:递归自进化已迈出第一步,OpenAI 成本降低 20%

2026/07/30 15:51阅读量 2

OpenAI 最新技术报告披露,GPT-5.6 已在生产环境中参与优化自身运行系统,包括分析流量、重写 GPU Kernels、优化推测解码和部署参数。该自力更生使端到端服务成本下降 20%,Token 生成效率提升 15% 以上。同时 OpenAI 搭建了 Agent Harness 框架以减少 Agent 循环中的重复开销。内部测试还显示,AI 效率提升后使用量反而激增——研究算力半年增长 100 倍,Token 用量增长约 22 倍。

OpenAI 在最新技术报告中公开了部分 RSI(递归自我改进)技术细节。GPT-5.6 已被部署到真实生产环境,开始参与优化供自己运行的系统。具体包括四类工作:

  1. 分析生产流量:识别服务器负载不均,测试新路由策略,将请求分配到更合适的位置。
  2. 重写生产 Kernel:深入模型 forward pass,寻找可提前计算、省略或并行的部分,通过 Codex 改写 Triton 和 Gluon Kernel。
  3. 优化推测解码系统:自动为 draft model 设计方案,运行数百次实验测试不同模型大小和结构,并在训练中主动处理硬件故障或不稳定。
  4. 自动搜索最优部署参数:针对短对话、长上下文、代码任务等不同负载,自动调整 batching、sharding 和 KV Cache 管理组合。

这些改进使端到端服务成本降低 20%,Token 生成效率提升 15% 以上。值得注意的是,Triton 之父 Philippe Tillet 是报告的五名作者之一,从“教人类写 Kernel”到“让模型自改 Kernel”,RSI 色彩已相当明显。

不过人类仍保持监督(human-in-the-loop):优化目标、工具权限、评测指标以及代码是否进入生产环境仍由人类决定。此外,OpenAI 还搭建了一层由 Rust 编写的 Agent Harness,专门减少 Agent 循环中的重复工作,核心优化包括:

  • 延迟发现工具:不在一开始将所有工具说明塞进上下文,仅在需要时展示对应工具,工具返回内容默认限制在 1 万 Token 以内。
  • 只追加不回写:保持 Prompt 缓存有效,新消息和工具结果接在上下文末尾,不插回旧内容,GPU 可复用此前计算。

内部测试数据显示,GPT-5.6 期间每名活跃研究人员的日均输出 Token 超过 GPT-5.5 时期峰值的两倍;过去半年内部编程推理算力占比增长 100 倍,Agent Token 用量增长约 22 倍。这印证了“AI 越便宜越好用,用量反而会不断增长”的趋势。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。