电商模型测评新基准 RealReplicaBench:13 款模型无一及格,最高仅 56.1 分
RealReplicaBench 是脱胎于阿里 Accio Work 的电商领域 Agent 评测基准,用 107 个真实商业任务考核模型,并以最终环境状态验证交付,不采信模型自述。结果显示 13 款参评模型全部低于 60 分,最高分由 Claude Opus 5 取得(56.1 分)。该基准强调端到端完成,正在把「AI 能否真正完成工作」变成可重复、可验证的技术标准。
事件概述
随着 AI 从聊天机器人走向可调用工具、操作网页和处理文件的 Agent,传统以答题和跑分为核心的模型评测方式逐渐失效。面向电商场景的 RealReplicaBench 评测,用 107 个真实商业任务考核模型,结果显示 13 款参评模型无一达到 60 分,最高分是 Claude Opus 5 的 56.1 分,Gemini 排名垫底。
核心信息
-
RealReplicaBench 由阿里 Accio Work 技术团队推出。Accio Work 定位为聚焦电商领域的 AI Agent 平台,目标是让商家在一个 AI 工作台上管理、自动操作和分析多平台店铺。
-
在完成度上,评测不设「将就」:任务若不能把最终结果直接交给下一环节,就按 0 分计。Claude Opus 5 在不同执行框架上的通过率分别为 Accio Work 66/107、PI 65/107、OpenClaw 60/107,Accio Work 框架对多数模型的性能增益更明显。
-
为测试真实工作,RealReplicaBench 复刻了前端 UI、浏览器操作、CLI、API/MCP、文件系统和后台状态,让 Agent 在一个可操作的业务环境中完成任务,而非只面对文字题面。
-
验证环节读取最终环境状态,不采信模型自我报告。例如物流任务要求为一票从中国到美国的运单枚举可行路线,计入海运、拖车、尾程、保险、清关、Bond 和平台费,排除超 30 天或港口衔接不成立的方案,并完成海运段 Booking 和 Shipment Verification,最终验证实际生成的 Shipment ID。
-
107 个任务来自约 160 万段完整对话、20 万条商业执行轨迹和 2000 条高价值工作流,经过可复现性与可判定性收敛而成。任务示例包括从约 300 封高噪声邮件中还原采购需求并完成供应商选择、邮件标签、回复草稿和 Kickoff 日历;以及将 5383 条海关记录转换为跨系统采购控制塔,需要聚合数据、筛选 Top 3 供应商并在 Google Workspace、Box 和 Jira 中建立 Dashboard、证据文件夹和项目任务。
值得关注
RealReplicaBench 的设计把 Agent 能力从「答对题」转向「完成工作」,并以环境状态作为可验证依据。团队计划持续加入新的真实任务,滚动更新评测环境,并用于模型评测、训练优化和模型路由。这套标准对商家选择模型和 AI 产品有用,也反映出测评方向正在从模型知道多少、能否推理,转向能否真正把工作推进到结束。
