Claude Computer Use正式GA:OSWorld跑出83.4%,企业部署AI Agent的最后一道门槛被拆掉

2026年8月19日,Anthropic把五项Claude Developer Platform能力同一天推上正式版(GA):computer use、全新的browser use工具、Files API、Agent Skills加Skills API,以及Admin API用户管理。对一直在”测试阶段”观望的企业来说,这一天的意义很明确——搭建AI Agent的底层平台风险消失了,beta基础设施的工程不确定性被清零。

OSWorld从15%飙到83.4%,Claude凭什么领先

computer use刚在2024年底亮相时,OSWorld基准成绩不到15%。两年不到,Claude Opus 4.8把这项成绩推到83.4%,已经超过人类专家的72.4%。同期GPT-5.5停在78.7%。这意味着在”让AI操作一台电脑完成真实任务”这件事上,Claude已经把同行甩开一个身位。

GA版本的工具集标识符是`computer_toolset_20260801`,不再需要beta header。更关键的变化是支持batch actions——智能体可以在一个回合里连续执行多个动作,而不是每点一下鼠标就停下来等你确认。登录内部系统、跳到报表页、抓取数字、粘贴进文档,过去要来回好几轮,现在一次请求就能跑完。Zoom也默认开启,高密度屏幕和小UI元素不再需要额外绕路。

browser use:一个全新工具,不是computer use的改名

很多人把browser use看作computer use的网页版,这是个误解。computer use给AI一个虚拟桌面,靠截屏猜界面元素位置;browser use直接读取网页的无障碍树(accessibility tree),像开发者的测试工具一样结构化地操作页面——填表单、开标签页、追踪下载、上传文件。

它跑在你应用自己托管的浏览器视口里,数据边界、合规边界都由你掌控。对那些没有API、只能靠网页操作的老旧内部系统、供应商门户、客户平台,browser use省掉了为每个系统单独写集成的麻烦。工具集标识符是`browser_toolset_20260801`,和computer use是两套独立能力。

两个工具集都支持Claude Fable 5、Mythos 5、Opus 5、Sonnet 5和Opus 4.8。

Skills API和Files API:可复用能力包加合规文件管理

Skills API和Agent Skills同步转正。Skills是通过API的`container`参数加载进Claude会话的打包能力——从某个系统拉数据、遵循公司某套流程、按特定格式输出。企业可以建一套经过验证的可复用技能库,跨多个项目稳定部署,不再受beta基础设施的稳定性拖累。

Files API同样脱离beta。上传的文件现在支持过期时间设置,对合规敏感的环境很关键。Admin API的用户管理端点(成员、邀请、分组、自定义角色)也对Claude Enterprise组织转正,团队访问管理从手动控制台操作变成可编程的稳定能力。

企业该问的问题变了:从”用不用”到”权限怎么设计”

GA不等于即插即用。让AI Agent控制浏览器或桌面,仍然需要基础设施、测试和治理。智能体要有明确任务、受控环境,凡是有后果的操作都需要人盯着。

企业侧的真正功课已经从”要不要用”变成”画面操作权限怎么设计、谁来批准、记录留到哪”。Anthropic把执行环境和权限控制权留给使用者:连接哪个系统、碰哪些数据、授权哪些成员、在哪个节点插入人工审批,都要单独梳理。这恰恰是大多数团队还没准备好的部分。

迁移成本:零强制,零截止日期

对已经在跑beta集成的团队,这次GA的迁移压力异常低。所有被取代的beta header仍然被接受,早期的beta工具版本(如`computer_20251124`)依然可用,GA标识符是叠加新增而非强制替换。截至核实时,Anthropic没有为任何被取代的标识符公布停用日期。你可以按自己的节奏排期迁移,不用赶Anthropic的日历。

唯一需要改代码的地方是Files API:删掉`files-api-2025-04-14` header后,列表分页从游标方式切到`page`/`next_page`加新的`ids[]`过滤器,list-files代码要做一次小更新。其余几项,删header后行为不变。

谁该现在动手

如果你的企业一直在评估AI Agent做工作流自动化,却因为平台成熟度顾虑而按兵不动,现在是重新评估的时机。让智能体操作网页应用和桌面软件的工具已经达到生产级,打包和复用Agent能力的Skills基础设施也已就绪。

技术是否ready这个问题,Anthropic用GA回答了。剩下的问题属于你的组织:流程是否清晰到能告诉Agent它到底该干什么,治理是否到位到敢放手让它跑。这两件事,工具帮不了你。


评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

苏ICP备2025163703号-2   警徽苏公网安备32010502011527号