把动作「画」给视频世界模型,跨本体双向推演,李飞飞参与
机器学习算法与自然语言处理
2026-07-24 00:00
文章摘要
本文探讨了如何通过将机器人动作渲染为像素级运动轨迹(Masked Visual Actions),让视频世界模型更自然地理解和预测机器人行为与环境变化。背景:传统视频世界模型依赖数值动作(如关节角、末端位姿)与环境画面的对应,但这种表示方式存在语义鸿沟,且跨不同机器人本体时数据结构差异大,泛化困难。研究目的:提出一种将动作“可视化”的方法,通过向视频模型输入机器人或物体的掩码轨迹,实现正向预测(给定动作,预测环境变化)和逆向生成(给定目标物体运动,推测机器人动作),并统一不同机器人的接口。结论:该方法在RoboCasa任务中,视频模型辅助规划提升了7-26个百分点的成功率;策略评估与真实仿真相关系数达0.982;逆向动作提取在CoffeeServeMug任务上取得90%成功率。模型仅使用约15小时机器人交互数据进行微调,即可支持多种机器人本体、策略评估与模型规划,但受限于基础视频模型能力,仍存在无接触运动等物理不一致问题。
本站注明稿件来源为其他媒体的文/图等稿件均为转载稿,本站转载出于非商业性的教育和科研之目的,并不意味着赞同其观点或证实其内容的真实性。如转载稿涉及版权等问题,请作者速来电或来函联系。