首页 /研究 /空中多模态大语言模型智能体的零样本任务级评估
LOCOMOTION

空中多模态大语言模型智能体的零样本任务级评估

Suman Navaratnarajah, Taehyoung Kim, Jona Ruthardt, Ishaan Bhimwal, Ryousuke Yamada, Yannik Blei, Wolfram Burgard, Yuki M Asano

发表年份
2026
访问权限
开放获取

摘要

本文提出了MissionBench基准,用于评估多模态大语言模型在三维空中环境中执行长期任务的能力。实验表明,最强模型在任务成功率上远低于人类水平,揭示了多步骤具身任务的挑战性。

关键词

Zero-shotAerial robotsMLLMEmbodied agentsBenchmark

相关论文

查看 LOCOMOTION 分类全部论文