2026年的AI Agent交出了一份漂亮的成绩单。First Page Sage发布的《Agentic AI Statistics: 2026》报告显示,8128名用户的滚动面板中,487人参与的性能测试样本平均任务完成率达到75.3%。这意味着每交给智能体四件事,大约能干完三件。
这个数字本身很体面。一个两年前几乎不存在的品类,现在能把多步骤任务做到四分之三的完成率,确实值得记一笔。
真正值得深挖的数字藏在均值底下。
21个百分点的鸿沟:选错Agent等于白干五分之一
报告测了五款主流智能体,完成率从86%一路跌到65%,差距拉到21个百分点。
Cognition Labs的Devin以86%领跑。这款2024年发布、2025年4月升级到2.0版本的自主软件工程Agent,在完成率榜上稳坐第一。开源项目OpenClaw紧随其后,拿到81%。OpenClaw前身叫Moltbot,2026年1月改名,主打本地优先、开源自托管,第一季度月活已达230万。
有意思的是用户量和完成率完全错位。OpenAI Agents月活270万,是体量最大的平台,完成率却只有73%,卡在中游。Devin完成率最高,用户基数却只有32.9万。Replit AI Agents月活57.4万,完成率69%。Perplexity Computer月活98.3万,完成率垫底,65%。
把这张表读完会发现一个问题:你的团队现在用得最多的那款Agent,未必是干活最靠谱的那款。选型这件事,已经不是品牌偏好问题,而是一个能算出成本的可靠性决策。21个百分点的差距,意味着每五件任务里有一件会因为选错工具而悬空。
信任悖论:完成率75%,凭什么54%的人还信手动搜索
报告里最反直觉的数据在信任这一栏。
同样的用户群体,54%表示更信任手动搜索的结果,只有34%更信任Agent给出的结果。在技术背景较强的用户中,这个偏好手动搜索的差距进一步拉大到37个百分点。
完成率和信任度出现了明显倒挂。事情干完了,用户却不敢直接用。
原因可以从引用深度里找到线索。OpenClaw每个任务中位引用7个信息源,范围从3到15个。Devin每个任务只引用2个,范围1到4个。引用链越薄,技术用户的信心就越低。快速干完活和把活干得让人敢用,中间隔着一道理性的证据审查。
这点对采购决策者很关键。一款Agent跑得快、完成率高,并不等于你的工程师会真的把它的输出接入生产流程。引用来源是否充足、推理过程是否可追溯,正在变成比完成率更硬的采购指标。
METR时间地平线:每7个月翻一番,但起点并不高
把镜头拉远,能看出自主能力确实在涨,只是涨得没 headlines 那么夸张。
测量机构METR在2026年5月8日更新了时间地平线追踪器。GPT-5智能体以50%可靠性完成的任务,对应人类专家约2小时17分钟的工作量。METR同时指出,超过16小时的测量在当前任务集下已不可靠。
更值得关注的是趋势斜率。前沿Agent能自主完成的任务时长,过去六年大约每7个月翻一番。这条曲线解释了为什么市场情绪持续走高,也解释了为什么今天的自主能力仍然只覆盖中等长度任务。从2小时17分钟到能独立跑完一个完整工作日,还有相当距离。
Gartner的预测给这条曲线定了个坐标点:2028年将有15%的日常工作决策由智能体自主做出,2024年这个数字是0%。企业软件应用中包含智能体的比例,也将从2024年不到1%涨到2028年的33%。增长方向确定,兑现节奏需要时间。
96%要扩张,49%从没用过:落地真相比口号复杂
采纳数据本身就透着矛盾。
Cloudera对1484名IT负责人的调查显示,96%的企业计划在未来12个月扩大Agent使用。PwC的AI Agent调查给出79%的组织已在某层级部署了智能体。
硬币的另一面来自Gallup 2025年第四季度职场调查:49%的美国劳动者说自己从没在工作中用过AI。McKinsey全球研究院2025年11月的估算则显示,AI Agent理论上可承担占美国工时44%的任务,机器人再覆盖13%。
两组数据拼在一起,画面清晰许多:自主化高度集中在少数团队和少数工作流里。喊扩张的企业很多,真正让一线员工天天用上的并不算多。HUMAN Security的2026报告提供了一个旁证——智能体驱动的网络流量同比增长7851%,但自动流量整体增速是人类流量的8倍,流量热度并不等于深度落地。
给选型者的三条实在建议
第一,别把完成率当唯一指标。Devin的86%很亮眼,但每个任务只引用2个来源,技术团队未必买账。把完成率、引用深度、可追溯性放一张表里看,才接近真实可靠性。
第二,区分任务类型再选工具。First Page Sage的样本里,行程规划节省时间最多,Agent平均9.2分钟完成,手动需38.5分钟,节省76%。B2B供应商寻源节省约55%。复杂度越高、容错越低的任务,越该优先考虑引用链完整的Agent。
第三,盯紧时间地平线的实际边界。METR给出的2小时17分钟是50%可靠性下的数字,不是保证完成时间。把任务拆到Agent当前能稳定驾驭的时长区间内,比硬塞长任务更划算。
75.3%的完成率说明AI Agent已经能干活。54%的信任缺口说明,能干和敢用之间还差一道证据审查的坎。选型时跨过这道坎的工具,才是2026年真正值得押注的那一个。
苏公网安备32010502011527号
发表回复