百度文心助手任务 Agent 登顶 PinchBench v2 榜单,超越 Claude、GPT 获全球智能体冠军
2026/07/22 15:18阅读量 2
2026 年 7 月 17 日,百度文心助手任务 Agent 在 PinchBench v2 榜单中以最高分 94.6%、平均分 94.4% 的成绩排名第一,成为首个以正式产品身份获此殊荣的国产智能体系统。该榜单侧重工程向任务完成能力,覆盖 23 个真实场景、147 项任务,采用自动化与 LLM 双轨评审,零人工干预。文心助手基于百度搜索猎户座 AI 引擎的多智能体框架,已集成至百度 App 及文心助手。
事件概述
2026 年 7 月 17 日,百度文心助手任务 Agent 在全球工程向 AI 智能体评测榜单 PinchBench v2 中夺冠,最高分 94.6%、平均分 94.4%,超越 Anthropic Claude Opus 4.8-fast(93.5%)、阿里通义千问 Qwen3.7-max(92.5%)、OpenAI GPT-5.6-luna(88.7%)等 59 个参评模型。这是首个以正式产品身份获得 PinchBench 总榜第一的国产智能体系统。
核心信息
- 榜单背景:PinchBench 由 Kilo AI 推出、OpenClaw 社区维护,评测智能体能否完整完成工程任务并交付可验证结果,而非仅考察知识储备。当前版本含 23 个真实工作场景、147 项任务,覆盖数据分析、研究写作、代码开发、办公自动化、文档处理、网页操作、多媒体等七大类别,共 617 次测试运行。评分采用“自动化校验 + LLM 评审”双轨机制,全程无人工干预。
- 任务实例:
- GitLab 财务分析:自主检索财报原文,计算非 GAAP 运营利润率并对比指引,五个维度均获满分。
- 安全漏洞分析:分析 Node.js 应用的多个 CVE 漏洞,按优先级分级并制定分批次修复计划,LLM 评审满分。
- 合同法律分析:读取软件服务协议,提取关键日期、梳理双方义务、识别风险点(客户 12 项、供应商 10 项、共享 5 项),所有维度满分。
- 日常办公:处理职业数据表,自动统一格式、生成汇总 sheet、图表对比,一次性完成依赖链任务。
- 旅行规划:仅给“周末北京到青岛 solo trip”的模糊指令,Agent 自主检索交通、住宿、景点数据,输出完整攻略。
- 定时任务:支持设置“每周一汇总一周 AI 论文”等周期性任务,无需用户时刻在场。
- 技术背景:文心助手任务 Agent 依托百度搜索猎户座 AI 引擎的多智能体框架。搜索引擎本质上是意图接收、任务拆解、工具调用、结果验证的 Agent 雏形,百度在该领域有 20 余年积累。Agent 时代,框架工程能力的重要性已超过单纯模型参数比拼。百度已开源完整评测流程(GitHub 仓库)。
值得关注
- PinchBench 评测衡量模型与 Agent 框架的综合能力,同一底座模型搭配不同框架得分差异明显,文心助手任务 Agent 夺冠体现模型与系统工程协同优势。
- 该能力已落地百度 App 及文心助手(chat.baidu.com),用户可通过“任务”模式体验。
