Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents
作者: Suman Navaratnarajah, Taehyoung Kim, Jona Ruthardt, Ishaan Bhimwal, Ryousuke Yamada, Yannik Blei, Wolfram Burgard, Yuki M Asano
分类: cs.AI, cs.CL, cs.CV, cs.RO
发布日期: 2026-07-24
备注: Preprint
💡 一句话要点
提出MissionBench以评估空中多模态大语言模型的任务能力
🎯 匹配领域: 支柱六:视频提取与匹配 (Video Extraction) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态大语言模型 具身智能 任务评估 无人机导航 自适应推理 闭环评估 3D环境 长时间任务
📋 核心要点
- 现有的多模态大语言模型在处理长时间具身任务时表现不佳,尤其是在单一高层指令下的任务成功率低。
- 本文提出MissionBench基准,旨在评估空中3D环境中MLLMs的任务能力,智能体需独立完成任务而无需特定微调。
- 实验结果显示,最强模型的任务成功率不足35%,而人类表现为84.4%,表明多步骤任务的复杂性和模型能力的局限性。
📝 摘要(中文)
多模态大语言模型(MLLMs)作为具身智能体的核心推理模块逐渐崭露头角,但尚不清楚通用模型在单一高层指令下解决长时间具身任务的能力。本文提出了MissionBench,一个用于空中3D环境中MLLMs任务级评估的基准,包含120个任务,涵盖五个模拟3D环境和四个任务类别。智能体需仅依靠自我中心观察和行动历史,独立规划、导航并报告结果,而无需针对空中任务进行特定微调。通过对22个开源和闭源的MLLMs进行评估,最强模型在任务成功率上不足35%,而人类表现为84.4%,突显了多步骤具身任务的挑战。尽管模型家族间存在较大差异,但我们观察到规模扩展带来的收益,表明更大的通用模型具备更强的零样本具身能力。我们的分析显示,任务级能力需要协调多种能力,超越空间感知,包括多步骤规划和自适应推理,这为闭环评估提供了动力,并突显了基于规模驱动的改进在具身AI中的潜力与风险。
🔬 方法详解
问题定义:本文旨在解决多模态大语言模型在长时间具身任务中的评估问题,现有方法在高层指令下的任务成功率低,难以满足实际应用需求。
核心思路:通过引入MissionBench基准,提供一个系统化的评估框架,允许智能体在不进行特定微调的情况下,依赖自我中心的观察和历史行动完成任务。
技术框架:MissionBench包含120个任务,分布在五个模拟3D环境和四个任务类别中。评估过程涉及智能体的规划、导航和结果报告,重点考察其多步骤任务处理能力。
关键创新:最重要的创新在于提出了一个新的评估基准,MissionBench,能够有效衡量MLLMs在复杂环境中的任务执行能力,尤其是在缺乏特定微调的情况下。
关键设计:在设计中,智能体仅依赖自我中心的观察和行动历史,未使用额外的空中任务微调,确保评估的公平性和通用性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,最强的多模态大语言模型在任务成功率上仅为35%,而人类的成功率达到84.4%,显示出多步骤具身任务的复杂性。此外,模型规模的扩大与零样本能力的提升之间存在正相关关系,表明更大的模型在处理复杂任务时具有更强的潜力。
🎯 应用场景
该研究的潜在应用领域包括无人机自主导航、智能监控系统以及复杂环境中的任务执行等。通过提升多模态大语言模型在具身任务中的表现,未来可实现更高效的自动化系统,推动智能体在实际应用中的广泛部署。
📄 摘要(原文)
Multimodal Large Language Models (MLLMs) are emerging as core reasoning modules for embodied agents, yet it remains unclear how well general-purpose models can solve long-horizon embodied tasks from a single high-level instruction. We introduce MissionBench, a benchmark for mission-level evaluation of MLLMs in aerial 3D environments. It comprises 120 missions across five simulated 3D environments and four task families. Agents must autonomously plan, navigate, and report outcomes using only egocentric observations and its action history, without aerial-specific fine-tuning. Across 22 open- and closed-source MLLMs, the strongest model succeeds on fewer than 35% of missions compared to 84.4% human performance, highlighting the difficulty of multi-step embodied tasks. Despite large variations between model families, we observe gains from scaling, indicating that larger general-purpose models possess stronger zero-shot embodied capabilities. Our analysis shows that mission-level competence requires coordinating multiple capabilities beyond spatial perception, including multi-step planning and adaptive reasoning. This motivates closed-loop evaluation and highlights both the promise and risk of scaling-driven improvements for embodied AI.