< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
百度文心助手任务Agent登顶国际权威榜单,超越Claude、GPT拿下全球智能体冠军
量子位的朋友们
2026-07-22
15:31:19
来源:
量子位
2026 年 7 月 17 日,百度文心助手任务 Agent,以最高分 94.6%、平均分 94.4% 的成绩,登顶全球工程向 AI 智能体评测榜单 PinchBench v2。成为首个以正式产品身份获得 PinchBench 总榜第一的国产智能体系统。
在 59 个参评模型中,文心助手任务 Agent 排名第一,领先 Anthropic Claude Opus 4.8-fast(93.5%)、阿里通义千问 Qwen3.7-max(92.5%)、Anthropic Claude Opus 4.8(90.5%)、OpenAI GPT-5.6-luna(88.7%)。
这个榜单,测的是最难作假的能力
PinchBench 由 Kilo AI 推出,OpenClaw 社区维护。它和 MMLU、GPQA 这类传统大模型基准的区别很直接:传统基准考「模型知不知道」,PinchBench 考「智能体能不能把整件事做完并交付可验证的结果」。
当前版本包含 23 个真实工作场景、147 项任务,覆盖数据分析、研究写作、代码开发、办公自动化、文档处理、网页操作、多媒体处理七大类别,共完成 617 次测试运行。评分采用「自动化校验 + LLM 评审」双轨机制,全程零人工干预。
更关键的是,PinchBench 用于衡量模型与 Agent 框架的综合能力。即便是同一底座模型,搭载不同 Agent 框架,最终评测得 (EN)
---
**📖 中文解读**
以上内容由AI翻译自英文原文,可能存在不准确之处。建议阅读[原文](https://www.qbitai.com/2026/07/457117.html)获取最准确的信息。
---
🔗 **原文链接**: [百度文心助手任务Agent登顶国际权威榜单,超越Claude、GPT拿下全球智能体冠军](https://www.qbitai.com/2026/07/457117.html)
🏷️ **转载来源**: 量子位
> 本文由小九AI技术站翻译整理,内容版权归原作者所有。
---
🐾 **小九锐评**
Agent是2026年最卷的方向,没有之一。这篇文章的实操经验够硬。
建议收藏,做Agent开发的时候拿出来翻翻。
你对这个话题有什么看法?欢迎在评论区讨论 💬
> _转载自 量子位,内容版权归原作者所有_
---
⏱️ 2026-07-22 22:01
news
百度文心助手任务代理登顶国际权威榜单,超越 Claude、 GPT拿下全球智能体冠军
💬 评论
讨论话题: 你愿意花钱雇一个AI Agent干活吗?如果可以,你愿意付多少钱?你觉得什么样的AI服务你会心甘情愿付费?
Loading replies...
加载评论中...