Asana利用GPT-6.1 Sol将浏览器代理成本降低76倍

2026/10/09 15:00阅读量 2

Asana通过其收购的StackAI平台,利用OpenAI的GPT-6 Astra在Codex中优化浏览器代理工作流,成功将模型运行成本降低76倍,速度提升5倍。经过144次实验对比,基于GPT-6.1 Sol的优化方案使单次运行成本降至0.47美元,耗时约4分钟。该案例展示了人机协作在自动化工作流优化中的高效性,并计划将此测试流程集成到产品评估体系中。

事件概述

Asana通过其自动化平台StackAI,利用OpenAI的GPT-6 Astra智能体在Codex环境中进行代码分析与实验,优化了浏览器代理(Browser Agent)的工作流。这一优化使得代理在导航网站、填写表单和收集信息时,相比原有生产环境设置,模型成本降低了76倍,运行速度提升了5倍。

核心发现与数据

  • 成本与效率提升:优化后的工作流在GPT-6.1 Sol模型上平均每次运行成本为0.47美元,耗时约4分钟。相比之下,原生产环境使用的Model B单次成本至少为36.21美元(部分因步骤限制未完成),优化后虽降至1.24美元,但结合GPT-6.1 Sol进一步将成本压低至0.47美元,整体降幅达76倍。
  • 实验规模:Asana进行了包含144次运行的研究,对比了GPT-6.1 Sol与其他三款前沿模型(Model A, B, C)。所有优化配置均能正确完成任务并返回答案。
  • 技术瓶颈突破:原始代理存在缓存策略缺陷,仅缓存固定指令而重复发送不断增长的页面文本和截图历史,导致高昂的计算成本。此外,频繁删除旧截图和修剪文本导致上下文丢失,迫使代理重新访问已读页面。

优化策略与实施过程

  1. 问题诊断:StackAI首席技术官Frank Hidalgo博士指导GPT-6 Astra分析代码库,识别出代理未有效缓存浏览历史记录的问题。Astra指出,由于每次编辑都会改变历史,单纯缓存历史无效,且关键信息的丢失需要代理回溯。
  2. 实验设计:Hidalgo选择三项改进措施进行测试:扩展浏览历史缓存、增加保留文本量、批量移除截图而非逐步移除。为了支持并行实验,团队重构了前端和后端代码。
  3. 最佳实践确定:GPT-6 Astra测试了不同历史预算(12万和48万字符)及六种缓存/截图策略。结果显示,允许截图累积至20张后再截断至最新一张的策略效果最佳。配合更大的历史预算,该策略显著降低了输入成本(89%的输入来自缓存,价格仅为非缓存状态的5%)。
  4. 可靠性提升:扩大历史保留空间不仅降低了成本,还提高了成功率。在使用较小历史预算时,GPT-6.1 Sol仅有3/18的运行产生正确答案;而在较大历史预算下,18次运行全部产生正确答案。

业务影响与未来展望

  • 人机协作模式:整个研究过程从原本预计的一到两个月缩短至一周。工程师设定目标,GPT-6 Astra执行实验和分析,结果通过Asana的软件交付平台Command转化为工单和拉取请求,最终部署上线。这体现了“人类设定方向+智能体执行实验”的高效协作模式。
  • 规模化应用:Asana已将浏览器导航优化发布至StackAI,并计划开发工具以简化类似实验。未来,团队希望将此类测试集成到平台评估系统中,帮助客户和内部团队在配置代理时比较成本、运行时间和答案质量。
  • 新研发范式:Asana正利用GPT-6 Astra在Codex中进行新功能发布前的测试,智能体自动导航平台、尝试不同输入并报告Bug供人工QA审核。这被视为一种新的软件开发生命周期基础,即每个工程师领导一支由多个云智能体组成的测试舰队。

“以前成本限制了我们可以为客户提供哪些模型。通过提高代理的效率,我们可以在降低运营成本的同时,为客户提供更好、更快的模型。” —— Frank Hidalgo, PhD, Asana StackAI CTO

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。