百度文心助手任务Agent登顶PinchBench v2,超越Claude和GPT获全球智能体冠军
2026/07/22 15:31阅读量 10
2026年7月17日,百度文心助手任务Agent以94.6%的最高分登顶全球工程向AI智能体评测榜单PinchBench v2,成为首个以正式产品身份获总榜第一的国产系统。该榜单考核智能体完成端到端任务的能力,涵盖23个真实场景、147项任务。文心助手任务Agent在59个参评模型中超越Anthropic Claude Opus 4.8-fast、阿里Qwen3.7-max、OpenAI GPT-5.6-luna等。
事件概述
2026年7月17日,百度文心助手任务Agent在全球工程向AI智能体评测榜单PinchBench v2中,以最高分94.6%、平均分94.4%的成绩排名第一,成为首个以正式产品身份登顶该榜的国产智能体系统。在59个参评模型中,文心助手任务Agent领先于Anthropic Claude Opus 4.8-fast(93.5%)、阿里通义千问Qwen3.7-max(92.5%)、Anthropic Claude Opus 4.8(90.5%)、OpenAI GPT-5.6-luna(88.7%)。
核心信息
- 榜单特点:PinchBench由Kilo AI推出、OpenClaw社区维护,与传统大模型基准不同,它考核智能体能否完成整项任务并交付可验证结果。当前版本包含23个真实工作场景、147项任务,覆盖数据分析、研究写作、代码开发、办公自动化、文档处理、网页操作、多媒体处理七大类,共617次测试运行。评分采用“自动化校验 + LLM评审”双轨机制,全程零人工干预。
- 评测意义:PinchBench衡量模型与Agent框架的综合能力,同一底座模型搭载不同框架得分差异显著。文心助手任务Agent的榜首成绩代表模型能力与系统工程协同的综合实力。百度AI搜索团队已在GitHub开源完整评测流程,包括147个任务的执行快照、交付物和评审理由,可供复现。
- 典型任务示例:
- GitLab财报分析:自主检索财报原文,计算非GAAP运营利润率约18%、超出指引约500个基点,文件创建、指标定位、提取、计算等五维度均获满分1.0。
- 安全工程:分析Node.js应用的多个CVE漏洞,识别两个CRITICAL级漏洞为P0并标注活跃利用记录,将PostgreSQL SQL注入定为P1并给出支付路径上下文,制定五批次修复计划,LLM评审满分1.0。
- 合同法律分析:读取软件服务协议,识别客户方12项风险、供应商10项风险、5项共享风险,付款结构现金流前置问题、IP转让产权间隙均被检出,四维度满分1.0。
- 日常办公:支持自然语言指令处理复杂电子表格(统一表头、新建汇总sheet、生成Top10/Bottom10图表)、旅行规划(自动检索交通住宿景点输出完整行程)、定时任务(每周汇总AI论文生成HTML报告)等。
值得关注
文心助手任务Agent依托百度搜索猎户座AI引擎的多智能体框架构建。百度在意图理解领域深耕二十余年,搜索引擎本身就是最早的Agent雏形——接收意图、拆解任务、调用工具、验证结果。文心助手任务Agent将模型任务评估得分提升至94%以上,表明优秀的系统架构与工程实现能显著释放模型潜力。Agent时代,框架工程能力的重要性正在超越单纯模型参数比拼。目前,该Agent核心技术已全面应用于百度App及文心助手(chat.baidu.com,点选“任务”体验)。
