首页 /研究 /小米机器人-1:基于超过10万小时真实世界轨迹的视觉-语言-动作模型扩展
MANIPULATION

小米机器人-1:基于超过10万小时真实世界轨迹的视觉-语言-动作模型扩展

Xiaomi Robotics Team, Jun Guo, Piaopiao Jin, Jason Li, Peiyan Li, Yingyan Li, Futeng Liu, Wanli Peng, Optimus Qin, Yifei Su, Nan Sun, Qiao Sun, Runze Suo, Heyun Wang, Yunhong Wang, Rujie Wu, Caoyu Xia, Lina Zhang, Jack Zhao, Guoliang Chen

发表年份
2026
访问权限
开放获取

摘要

本文提出小米机器人-1,一种基础视觉-语言-动作模型,能通过语言指令在未知环境中执行多种移动操作任务,并高效适应新任务。通过两阶段训练(预训练和后期训练),模型在超过10万小时真实操作轨迹上学习,展示了强大的扩展行为。

关键词

vision-language-action modelmobile manipulationreal-world trajectoriesscaling lawfine-tuning

相关论文

查看 MANIPULATION 分类全部论文