清华开源RPent:GPT-6 Astra装进机器人大脑,92.6%成功率背后的四层架构

数字世界的Agent已经证明了这套工作方式的价值:模型理解目标,拆解任务,调用工具,根据执行结果调整计划。Codex和Claude Code把这套路径跑得很顺。

现在,同样的范式开始走向物理世界。GPT-6 Astra已进入真实机器人操作测试阶段。9月21日,清华大学联合无问芯穹等团队开源了具身智能体框架RPent,把通用大模型的规划能力、VLA专家模型的操作精度、记忆系统和机器人接口装进了同一套工程体系。

开源地址:github.com/RLinf/RPent。开发者视角下,这个项目值得拆开细看。

一组数据先看分量

LIBERO-PRO基准测试中,RPent搭载GPT-6 Astra跑出92.63%的任务成功率。榜单第二名RPent/Opus-4.7为82.4%,差距10.23个百分点。对比π_RLinf的50.0%,领先42.63个百分点。

这个基准强调指令变化、布局变化和长程执行,专治”训练时全能、上线就翻车”的智能体。

再看速度。LIBERO Object的200次评测里,开启Flash Mode后,平均执行时间从283.6秒压到40.9秒,约7倍加速,成功率只降3.5个百分点。

记忆机制的效果同样硬核。位置交换任务中,引入记忆前成功率31.0%,引入后87.0%。一次探索攒下的经验,真的能变成下一次任务的起点。

四层架构:各司其职

RPent把控制权拆开分配。通用大模型负责理解任务、制定计划;VLA、WAM等专家模型负责亚厘米级的动作执行;记忆系统沉淀经验;框架负责连接。这套分工对应四层设计。

用户层:交互式命令行加Web Dashboard,类似Claude Code的CLI体验,可实时查看推理过程、视觉输入和动作轨迹。

智能层:核心是Agentic Planner和Action Primitive。规划器结合基础模型、Memory和工具库拆解任务;动作原语把VLA、WAM和程序化技能封装成标准工具,供规划器统一调用。

接口层:把智能体决策转换为机器人可执行指令,提供动作执行、状态读取、环境渲染、设备复位等统一调用。

环境层:负责任务执行。目前已覆盖LIBERO-PRO、RoboCasa、RoboTwin、RoboDojo等仿真环境,以及Franka、双臂Franka、YAM、SO101等真实设备。

三层接口:MCP、RPC、MHS

数字世界的Agent有MCP协议统一工具调用。物理世界的问题复杂得多,机器人、相机、传感器、仿真器各有各的接口。

RPent的解法是分层抽象。MCP统一描述可调用能力,无论底层是VLA还是程序化技能,规划器按统一定义选择调用;RPC连接工具、模型服务与机器人环境,支持独立部署与远程服务;MHS面向更广泛的物理设备,提供统一读写与控制抽象,未来可扩展到实验仪器、家庭设备和工业系统。

新增一台机器人,只需在robots/目录实现标准动作、状态与环境接口,框架自动识别。上层Agent、提示词、工具无需针对设备重新开发。

Task Card与Flash Mode:砍掉重复推理

大模型推理速度远慢于机械臂动作执行。等待模型生成下一步决策,往往成为整个系统的延迟大头。

RPent把这个问题交给任务卡(Task Card)。探索阶段,规划器调用大模型、VLA和程序化技能尝试各种动作组合,把成功且验证过的流程压缩成Task Card,保存任务阶段、动作原语、关键目标与检查条件,不保存固定坐标。

进入Flash Mode后,系统按Task Card执行:视觉模块重新定位关键物体,执行模块根据实时状态微调动作;检查失败或环境偏离时,才重新调用规划器。稳定流程中不再反复烧推理。

记忆系统:一次成功变成长期能力

物理世界试错成本高。一次失败抓取可能需要重新布置场景,错误操作甚至损坏设备。

RPent用三层记忆组织经验,每条记录带适用范围、类型、可信度和支撑证据。新经验需验证后才提升可信度;冲突记录保留并隔离,防止偶然成功污染已有能力。记忆里存的是Recipe,可迁移的任务方案,与固定坐标无关,物体挪了位置照样复用。

这套记忆还支持资产分发:一台智能体攒下的经验,可以同步给其他智能体,单点能力变成整个系统的进化基础。

开发者该关注什么

两条主流技术路线各有短板。纯VLA端到端在任务变长、语言变花、场景被扰动时迅速退化;纯大模型Agent在亚厘米级精度、执行时延和持续变强上仍有明显不足。RPent给出第三条路:把具身智能拆成不同层次的能力,让不同模型干各自最擅长的事。

底层算法来自团队7月提出的Harness VLA工作(arxiv:2607.08448)。项目文档托管在readthedocs,附带性能和延时双Leaderboard,不同基座模型的横向对比一目了然。RoboCasa365 Target50厨房长程任务中,RPent/GPT-6 Astra拿到59.20%位列第一;RPent/Opus-4.7在LIBERO达96.0%;RPent/GPT-5.5在RoboTwin达62.4%,框架对模型与执行配置的兼容性摆在了台面上。

从Codex、Claude Code到RPent,Agent的开发范式正在跨越数字与物理的边界。对开发者而言,值得盯住的信号很明确:具身智能的竞争焦点,正在从”训练一个更大的模型”转向”建好连接模型、工具与硬件的那层基础设施”。这层设施谁先做扎实,谁就握住下一波入口。


评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

苏ICP备2025163703号-2   警徽苏公网安备32010502011527号