在物理环境中,端到端策略模型往往面临失败,因此,研究者们开始探索一种结合“大型模型智能体和工具调用”的新方法,力求在动态环境中实现持续学习。然而,在线学习依然在真实物理世界中遇到挑战。物理环境快速变化,在任务失败后现有智能体只能对整个轨迹进行复盘,难以即时调整和学习来应对现场的状态变化。清华大学的AIR团队与域变换合作推出了Zetta ζ,通过演进的高频次监督机制,使得闭环物理智能体能够实现在线学习。从而,机器人不再仅仅是在失败后回顾总结,而是在执行过程中不断观察周围环境,触发自我恢复,并将获取的经验转化为可重复利用的技能。实验结果表明,Zetta ζ 的任务成功率随着自我探索的积累而显著提升。在有限的回滚预算内,LIBERO PRO和RoboCasa获得了90.8%和93.6%的成功率,这一成绩远超现有方法。更令人惊叹的是,研究人员捕捉到了机器人在学习过程中闪现出的“Aha时刻”,这为物理智能体扩大智能化的进展提供了新的契机。
项目概述: 项目名称:Zetta ζ 发布单位:清华大学AIR与域变换合作 论文标题:Zetta ζ:一种高效的闭环具身智能体自我进化架构 项目主页:链接见附录
常见的机器人失败场景可以想象为一个普通的尝试:例如,机器人试图拿取一个水杯。尽管智能体理解了任务指令,并进行了看似合适的抓取操作,但在实际执行过程中却出了问题:抓取力度过大导致水杯破裂;靠近目标时姿态偏差,无法放置到位;没有在线反馈机制使得智能体无法进行调整。这一切的关键在于,目前的具身智能系统大多还是基于“静态、开环”的模式。它们能够执行固定的技能,但难以在物理操作中实时感知和修复错误,也不能将失败经验转化为未来的可复用能力。物理世界的动态特性与大型模型智能体的反思机制之间的时间差,使得智能体无法在执行过程中测试备选方案及验证其反思。因此,对完整轨迹的信用分配也面临一定难度,回溯分析往往无法提供故障发生时的准确状态。
Zetta ζ 正是为了解决这些问题而设计。它是一种闭环在线学习的自我进化物理智能体,能够监控机器人每一步动作的执行,及时根据反馈生成下一步执行策略,并逐步学习监督和恢复技能,提炼出可以泛化和复用的成功经验,让智能体在操作中不断进步。研究团队还为Zetta ζ开发了Z-Infra,这是首个专为物理智能体设计的回滚系统,通过解耦智能体与底层硬件,管理各类异构设备的环境、模型和工具资源,极大地加快了自我进化的过程。
Zetta ζ 由三个不同时间尺度的闭环系统构成,形成了一个“自我进化的飞轮”。第一个闭环是Critic-Governed Action Loop(动作级闭环),在此,Zetta ζ 的运行批评者会实时监控机器人的物理状态,若发生异常状况,如抓取物体滑落等,系统会立即触发恢复操作,而非等到任务失败后才进行回顾。恢复完成后,系统会设立严格的“VLA再进入协议”,确保在确认故障消除和物理状态稳定后,控制权才会交还给原有的VLA模型,这相当于为机器人配备了一位在线监测的安全员。
第二个闭环是Rollout-Batch Candidate Optimization Loop(批量候选优化闭环),机器人完成一批任务后,Zetta ζ 会对失败的轨迹进行聚类和因果分析。它不仅关注任务是否最终成功,更会定位最早偏离正常状态的关键时间点,并通过“评估→批评者→状态表征→规划控制→恢复→参数”这一层级流程,找到真正需要修复的根因。最后,系统会自动生成可供更新的批评者、恢复策略和工具。
第三个闭环是Validation-Gated Skill Update Loop(验证门控更新闭环)。在这一环节中,候选更新不会直接上线,而是需先经过历史回归测试,并在严格隔离的验证数据集上进行验证,确保只有那些真正能提升成功率并能泛化到新场景的技能更新才会被采用。