把动作「画」给视频世界模型,跨本体双向推演,李飞飞参与

机器学习算法与自然语言处理 2026-07-24 00:00
文章摘要
本文探讨了如何通过将机器人动作渲染为像素级运动轨迹(Masked Visual Actions),让视频世界模型更自然地理解和预测机器人行为与环境变化。背景:传统视频世界模型依赖数值动作(如关节角、末端位姿)与环境画面的对应,但这种表示方式存在语义鸿沟,且跨不同机器人本体时数据结构差异大,泛化困难。研究目的:提出一种将动作“可视化”的方法,通过向视频模型输入机器人或物体的掩码轨迹,实现正向预测(给定动作,预测环境变化)和逆向生成(给定目标物体运动,推测机器人动作),并统一不同机器人的接口。结论:该方法在RoboCasa任务中,视频模型辅助规划提升了7-26个百分点的成功率;策略评估与真实仿真相关系数达0.982;逆向动作提取在CoffeeServeMug任务上取得90%成功率。模型仅使用约15小时机器人交互数据进行微调,即可支持多种机器人本体、策略评估与模型规划,但受限于基础视频模型能力,仍存在无接触运动等物理不一致问题。
把动作「画」给视频世界模型,跨本体双向推演,李飞飞参与
本站注明稿件来源为其他媒体的文/图等稿件均为转载稿,本站转载出于非商业性的教育和科研之目的,并不意味着赞同其观点或证实其内容的真实性。如转载稿涉及版权等问题,请作者速来电或来函联系。
机器学习算法与自然语言处理
最新文章
热门类别
相关文章
联系我们:info@booksci.cn Book学术提供免费学术资源搜索服务,方便国内外学者检索中英文文献。致力于提供最便捷和优质的服务体验。 Copyright © 2023 布克学术 All rights reserved.
京ICP备2023020795号-1
ghs 京公网安备 11010802042870号
Book学术文献互助
Book学术文献互助群
群 号:604180095
Book学术官方微信
小红书