Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

AI 快讯
雷锋网 · 2026/7/22 07:18:00

百度文心助手任务 Agent 登顶国际权威榜单,超越 Claude、GPT 拿下全球智能体冠军

AI 中文解读
百度文心助手刚拿了个全球第一!在PinchBench v2评测中,它力压Claude、GPT等强敌,成为最会“干活”的AI智能体。这项评测考的不是AI懂多少知识,而是能不能像人一样,从零开始把一件麻烦事做完——比如分析财报漏洞、审阅法律合同、安排旅游行程。文心助手在这些真实工作场景里拿到了94%以上的高分,说明它不再只是“动动嘴”的聊天工具,而是能“迈开腿”替你跑腿干活的数字助理。 对普通人来说,这意味着AI终于能接“私活”了。以后你想策划一场周末出游,只需说一句“周末北京去青岛两天”,它就能自己查交通、订酒店、排行程,甚至给出避坑指南;工作中你要分析复杂表格,扔给它一句话,它就能拆解步骤、生成图表,还能帮你写报告。甚至你可以设置定时任务,让AI每周自动汇总最新AI论文。百度靠二十多年搜索技术积累,让AI把“理解意图”变成了“完成任务”,这件事正在改变我们使用工具的方式——不用再盯着屏幕一步步操作,把时间留给真正重要的事就好。
2026 年 7 月 17 日,百度文心助手任务 Agent,以最高分 94.6%、平均分 94.4% 的成绩,登顶全球工程向 AI 智能体评测榜单 PinchBench v2。成为首个以正式产品身份获得 PinchBench 总榜第一的国产智能体系统。 在 59 个参评模型中,文心助手任务 Agent 排名第一,领先 Anthropic Claude Opus 4.8-fast(93.5%)、阿里通义千问 Qwen3.7-max(92.5%)、Anthropic Claude Opus 4.8(90.5%)、OpenAI GPT-5.6-luna(88.7%)。 这个榜单,测的是最难作假的能力 PinchBench 由 Kilo AI 推出,OpenClaw 社区维护。它和 MMLU、GPQA 这类传统大模型基准的区别很直接:传统基准考「模型知不知道」,PinchBench 考「智能体能不能把整件事做完并交付可验证的结果」。 当前版本包含 23 个真实工作场景、147 项任务,覆盖数据分析、研究写作、代码开发、办公自动化、文档处理、网页操作、多媒体处理七大类别,共完成 617 次测试运行。评分采用「自动化校验 + LLM 评审」双轨机制,全程零人工干预。 更关键的是,PinchBench 用于衡量模型与 Agent 框架的综合能力。即便是同一底座模型,搭载不同 Agent 框架,最终评测得分也会存在较大差距。这也说明,文心助手任务 Agent 取得榜首成绩,代表的是模型能力与系统工程协同打造的综合实力第一。 百度 AI 搜索团队在 GitHub 上开源了完整评测流程(github.com/Baidu-AI-Search/PinchBench-Evaluation),147 个任务的执行快照、交付物、LLM Judge 打分理由全量公开,任何人都可以逐条复现。 让 AI 从「动动嘴」,到「迈开腿」 比如其中一个任务是:「GitLab Q3 2025 财季的实际利润率与指引之间差了多少个基点?」没有给任何数据文件,Agent 需要自主检索 GitLab 财报原文或电话会议记录,定位相关指引,计算出非 GAAP 运营利润率约 18%、超出指引约 500 个基点,并将结论写入指定文件。 五个自动化评分维度——文件创建、指标定位、实际值与指引值提取、基点计算结论——全部满分 1.0。 另一个任务考的是安全工程:分析一个 Node.js 应用的多个 CVE 漏洞,按优先级分级并制定修复计划。评测要求 Agent 识别 express RCE 和 JWT bypass 两个 CRITICAL 级漏洞为 P0,其中 JWT bypass 因存在活跃利用记录需要特别标注;将 PostgreSQL SQL 注入定为 P1 并结合 PCI DSS 支付路径给出上下文;将仅影响构建阶段的依赖漏洞降级为 P2/P3;制定五批次修复计划,附具体部署窗口(4 月 12 日紧急热修、4 月 14 日 P1 批次)。 LLM 评审的评审结论是「所有维度表现卓越」,得分满分 1.0。 还有一个合同法律分析的 case,任务是读取一份软件服务协议,提取关键日期、梳理双方义务、识别风险点、生成财务摘要。这种任务过去需要律师助理花几个小时。文心助手任务 Agent 的输出结果,识别了客户方 12 项风险、供应商 10 项风险、5 项共享风险,付款结构六期分期的现金流前置问题、IP 转让条件的产权间隙,全部做到了——最终评分四个维度都是满分 1.0。 上面这些复杂的任务文心助手任务 Agent 都不在话下,更不用说普通用户的日常办公需求。 比如,你扔给文心助手一份职业数据表,然后说「统一表头格式,新建汇总 sheet,按职业大类做汇总表和 Top10/Bottom10 榜单,生成图表对比各职业大类就业人数。」 这是一条有内部依赖关系的任务链,任何一步出错后面就没法接。文心助手任务 Agent 自主拆解,一次性跑完。 或者你给不了这么详细的指令,想摇个盲盒:「我这周末想从北京去青岛玩两天 solo trip。」没有给任何别的信息。Agent 自主检索了交通、住宿、景点实时数据,排出完整行程、预算清单和避坑指南,交付一份可以直接截图出发的攻略。 或者你不想每次都要问 AI,让它帮你完成重复性又高脑力的劳动,可以设置定时任务,如「每周一晚上十点,帮我汇总近一周的高质量 AI 领域论文,用投研报告风格的 HTML 给我」。 7×24 小时,用户无需时刻在场。 为什么是百度做出来了? 答案其实很简单:百度是一家在意图理解上花了 20 多年的公司。 文心助手任务 Agent 依托百度搜索猎户座 AI 引擎的多智能体框架构建。 从架构逻辑来看,搜索引擎本身就是最早的 Agent 雏形——接收意图、拆解任务、调用工具、验证结果,这条链路百度已经跑了二十余年。 工具集从索引爬虫升级成了代码执行环境、文件处理器和实时 API 接口,输出从蓝链列表变成了结构化报告和可运行代码,但底层逻辑一脉相承。 文心助手任务 Agent 将模型任务评估得分提升至 94% 以上,证明优秀的系统架构与工程实现能够显著释放模型潜力。 也就是说,同一个底层模型,换上文心助手任务 Agent 的框架,任务完成率会更高。Agent 时代,框架工程能力的重要性正在超过单纯的模型参数比拼。 目前,文心助手任务 Agent 核心技术已全面应用于百度 App 及文心助手,可登录 chat.baidu.com ,点选「任务」,即可体验。
分享
阅读原文