1Hz思考、1000Hz干活:逐际动力COSA 0.5三层大脑拆解,具身智能的快慢之争有了新答案

2026年的具身智能圈,争论最凶的问题只有一个:机器人到底该塞进一个端到端大模型,还是分层搭一套”大脑系统”?

7月15日,逐际动力发布LimX COSA 0.5,用一段视频给出了自己的答案。全尺寸人形机器人Oli一镜到底、无剪辑、无遥操,连续完成从衣架高处取衣、收纳玩偶、堆叠储物箱到弯腰拾取杂物的一整套家庭任务。Oli由此成为中国首个、全球继Figure之后第二台能全自主完成长程移动操作家庭任务的全尺寸人形机器人。

三层大脑:1Hz、50Hz、1000Hz各干各的活

COSA 0.5的核心设计在于分层。

System 2是认知层,以LLM/VLM为核心,负责场景理解、记忆、推理和任务调度,运行频率约1Hz。它决定机器人”要做什么”。

System 1是技能层,承载VLA等可复用技能,把认知意图转成具体动作策略,运行频率约50Hz。

System 0是运控层,基于自研LimX WBT全身运动基础模型,把动作指令转化为平衡协调的关节指令,控制频率高达1000Hz。

三个频率差出三个数量级。这正是分层架构存在的理由:语言模型擅长思考但反应慢,运控模型反应快但不会思考。把两者压进同一个端到端网络,目前没有任何团队真正跑通。逐际动力的选择是让各层各司其职,层间用统一接口衔接。

在WAIC 2026现场,这套架构公开亮相,”边思考边干活”成了具身智能落地的新范式。

路线之争:VLA派、世界模型派、分层派

COSA 0.5发布的同时,行业里三条路线正打得火热。

第一条是VLA路线。视觉-语言-动作大模型把感知、理解和控制塞进一个端到端网络。银河通用的GraspVLA号称全球首个合成大数据驱动的抓取大模型,靠域随机化和物理引擎生成数十亿抓取样本,绕开真机数据采集的高成本。字节跳动的Seed GR-3用40亿参数在抓取泛化任务上超越π0,验证了大模型加合成数据路线的可行性。

第二条是世界模型路线。蚂蚁灵波科技首席科学家沈宇军的态度明确:VLA和世界模型解决的是不同问题,VLA依托多模态技术侧重人机交互,世界模型擅长模拟物理规律,两条路线都不会是终局。2026年的主流做法已经变成融合——世界模型提供仿真环境,VLA提供动作策略,蚂蚁灵波的LingBot组合、AGIBOT的GE-2加GO-2都在走这条路。

第三条就是逐际动力代表的分层路线。灵初智能的Psi R1用”快慢脑架构”做类似尝试,快速反射控制搭配慢速规划推理,工程化借鉴人类认知双系统理论。Figure的Helix把这条路走得更早——helix-02在01的基础上增加System 0全身控制器,成了COSA架构最直接的对照物。

数据仍是最大的墙

架构可以设计,数据没法抄近路。

真机数据采集成本高企,各家都在找替代方案。GraspVLA选仿真合成,Seed GR-3用视频生成模型造数据并与真实数据1:1混合训练,千寻智能押注世界模型,10个月融了10个亿的这支”国家队”,赌的正是数据生产方式的变化。

中国人工智能学会2026年4月发布的具身智能白皮书给出判断:端到端操作模型是下一步技术发展的主流共识。共识归共识,卡点依然明显——跨本体泛化还停在”一机一模型”阶段,RDT2、ACE-Brain-0、Kairos3.0-4B都在尝试让一个大脑驱动多形态机器人,进展有限。

写在最后

逐际动力没有卷参数规模,转向卷系统架构。COSA 0.5证明了一件事:具身智能的竞争焦点已经从”模型多强”切换到”系统多稳”。

1Hz的思考配上1000Hz的执行,中间隔着50Hz的技能调度。这三层之间的接口怎么设计、错误怎么传播、记忆怎么管理,才是未来两年具身智能公司真正的护城河。下一个值得盯的信号很简单:哪家公司先让机器人在没见过的陌生房间里,无人干预干完一整套家务。


评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

苏ICP备2025163703号-2   警徽苏公网安备32010502011527号