机器人学习新方式:Zetta ζ 的闭环智能体探索

2026-08-19

在物理环境中,端到端策略模型往往面临失败,因此,研究者们开始探索一种结合“大型模型智能体和工具调用”的新方法,力求在动态环境中实现持续学习。然而,在线学习依然在真实物理世界中遇到挑战。物理环境快速变化,在任务失败后现有智能体只能对整个轨迹进行复盘,难以即时调整和学习来应对现场的状态变化。清华大学的AIR团队与域变换合作推出了Zetta ζ,通过演进的高频次监督机制,使得闭环物理智能体能够实现在线学习。从而,机器人不再仅仅是在失败后回顾总结,而是在执行过程中不断观察周围环境,触发自我恢复,并将获取的经验转化为可重复利用的技能。实验结果表明,Zetta ζ 的任务成功率随着自我探索的积累而显著提升。在有限的回滚预算内,LIBERO PRO和RoboCasa获得了90.8%和93.6%的成功率,这一成绩远超现有方法。更令人惊叹的是,研究人员捕捉到了机器人在学习过程中闪现出的“Aha时刻”,这为物理智能体扩大智能化的进展提供了新的契机。

项目概述: 项目名称:Zetta ζ 发布单位:清华大学AIR与域变换合作 论文标题:Zetta ζ:一种高效的闭环具身智能体自我进化架构 项目主页:链接见附录

常见的机器人失败场景可以想象为一个普通的尝试:例如,机器人试图拿取一个水杯。尽管智能体理解了任务指令,并进行了看似合适的抓取操作,但在实际执行过程中却出了问题:抓取力度过大导致水杯破裂;靠近目标时姿态偏差,无法放置到位;没有在线反馈机制使得智能体无法进行调整。这一切的关键在于,目前的具身智能系统大多还是基于“静态、开环”的模式。它们能够执行固定的技能,但难以在物理操作中实时感知和修复错误,也不能将失败经验转化为未来的可复用能力。物理世界的动态特性与大型模型智能体的反思机制之间的时间差,使得智能体无法在执行过程中测试备选方案及验证其反思。因此,对完整轨迹的信用分配也面临一定难度,回溯分析往往无法提供故障发生时的准确状态。

Zetta ζ 正是为了解决这些问题而设计。它是一种闭环在线学习的自我进化物理智能体,能够监控机器人每一步动作的执行,及时根据反馈生成下一步执行策略,并逐步学习监督和恢复技能,提炼出可以泛化和复用的成功经验,让智能体在操作中不断进步。研究团队还为Zetta ζ开发了Z-Infra,这是首个专为物理智能体设计的回滚系统,通过解耦智能体与底层硬件,管理各类异构设备的环境、模型和工具资源,极大地加快了自我进化的过程。

Zetta ζ 由三个不同时间尺度的闭环系统构成,形成了一个“自我进化的飞轮”。第一个闭环是Critic-Governed Action Loop(动作级闭环),在此,Zetta ζ 的运行批评者会实时监控机器人的物理状态,若发生异常状况,如抓取物体滑落等,系统会立即触发恢复操作,而非等到任务失败后才进行回顾。恢复完成后,系统会设立严格的“VLA再进入协议”,确保在确认故障消除和物理状态稳定后,控制权才会交还给原有的VLA模型,这相当于为机器人配备了一位在线监测的安全员。

第二个闭环是Rollout-Batch Candidate Optimization Loop(批量候选优化闭环),机器人完成一批任务后,Zetta ζ 会对失败的轨迹进行聚类和因果分析。它不仅关注任务是否最终成功,更会定位最早偏离正常状态的关键时间点,并通过“评估→批评者→状态表征→规划控制→恢复→参数”这一层级流程,找到真正需要修复的根因。最后,系统会自动生成可供更新的批评者、恢复策略和工具。

第三个闭环是Validation-Gated Skill Update Loop(验证门控更新闭环)。在这一环节中,候选更新不会直接上线,而是需先经过历史回归测试,并在严格隔离的验证数据集上进行验证,确保只有那些真正能提升成功率并能泛化到新场景的技能更新才会被采用。

最新文章

  • 张柏芝坦言保姆车是“第二个家”,三胎父亲谜团终结
    张柏芝坦言保姆车是“第二个家”,三胎父亲谜团终结

    张柏芝最近在青岛说了句大实话:"常年陪我跑的那辆车,就是我的第二个家。 "就这一句话,把缠了她整整八年的"三胎生父"谣言轻轻掀到了一边。 2018年11月出生的三子Marcus,跟了母姓张,出生证明父亲栏空白,从此谢霆锋、谢贤、周星驰、新加坡富商轮番被拉进"嫌疑人名单"。 八年后的2026年,这场闹剧终于被法律、被当事人、被一张排球近照,三重盖章终结。 2026年8月14日,张柏芝落地青岛,第二天...

  • 郭士强的期待与挑战:能否依靠杨瀚森扭转男篮局面?
    郭士强的期待与挑战:能否依靠杨瀚森扭转男篮局面?

    郭士强指导写出了自己的心愿:全力以赴扎实细致做好备战工作,打好2027年男篮世界杯翻身仗,为实现进入2028年洛杉矶奥运会而努力奋斗。(如今中国男篮世预赛的前景都还很堪忧) 中国男篮近期的三场热身赛,两战乌拉圭(1胜1负)、77-84不敌新西兰,尤其是对阵仅集训了5天(合训4-5次)新西兰吞下了一场惨烈的失利。 这两场比赛后 郭士强的个人评分已经低至2.3分,而去年夏天郭士强带领中国男篮拿到亚洲杯...

  • 机器人学习新方式:Zetta ζ 的闭环智能体探索
    机器人学习新方式:Zetta ζ 的闭环智能体探索

    端到端策略模型在物理世界频频失灵,研究者转向 “大模型智能体 + 工具调用” 自救,试图在动态物理世界中持续学习。然而, 这条在线学习路径在物理世界仍未真正走通 。挑战在于,真实物理环境高速变化,现有物理智能体只能在任务失败后复盘整段轨迹,难以在执行现场根据状态变化实时判断、纠错和学习。 清华 AIR 与域变换联合推出 Zetta ζ ,通过演进可高频执行的 critics,闭环物理智能体的在线学...