Towards Embodied Air-Ground Cooperative Object Search: Benchmark, Dataset and Agentic Method

📄 arXiv: 2609.08402v1 📥 PDF

作者: Boao Yu, Zimo Chen, Junreng Rao, Yue Hu, Zhengqiu Zhu, Yong Zhao, Rusheng Ju

分类: cs.CV, cs.AI

发布日期: 2026-09-08

备注: 16 pages, 4 figures, 4 tables; includes an appendix


💡 一句话要点

提出AGOS-Agent以解决城市环境中的空地协同物体搜索问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 空地物体搜索 无人机 无人地面车辆 视觉语言模型 协同搜索 城市环境 数据集 基准测试

📋 核心要点

  1. 核心问题:现有方法在城市环境中进行空地物体搜索时,面临复杂的动态协调挑战,难以有效整合空中和地面信息。
  2. 方法要点:提出AGOS-Agent,通过搜索-交接-验证的合作协议,简化了VLMs的任务,专注于场景理解和决策。
  3. 实验或效果:在九个VLMs的实验中,AGOS-Agent提升了八个模型的成功率,并在所有模型中减少了决策步骤。

📝 摘要(中文)

城市环境中的空地物体搜索(AGOS)是一项具有挑战性的任务,要求无人机(UAV)和无人地面车辆(UGV)共同搜索和验证指定目标。为研究这一未被充分探索的问题,本文提出了AGOS-Bench,这是第一个专门用于评估通用视觉语言模型(VLMs)在UAV-UGV合作中整合空中发现和地面验证能力的基准。此外,提供了AGOS-Dataset,包含7700个多样化类别和属性的搜索任务,分为三个难度级别。为了解决AGOS任务,提出了AGOS-Agent,这是一种无训练且工具增强的方法,通过明确的搜索-交接-验证合作协议,减轻了VLMs的复杂协调负担。大量实验表明,AGOS-Agent在九个VLMs上的整体成功率有所提升,同时减少了决策步骤。

🔬 方法详解

问题定义:本文旨在解决城市环境中的空地物体搜索问题,现有方法在UAV和UGV的协作中存在协调复杂性和信息整合不足的痛点。

核心思路:AGOS-Agent通过设计明确的搜索-交接-验证协议,减轻了VLMs在动态环境中的协调负担,使其专注于场景理解和决策,从而提高搜索效率。

技术框架:整体架构包括三个主要阶段:首先是UAV进行空中搜索,接着将发现的信息交接给UGV,最后UGV进行地面验证。每个阶段都依赖于VLMs的视觉和语言理解能力。

关键创新:AGOS-Agent的核心创新在于其无训练和工具增强的设计,使得VLMs能够在复杂环境中高效协作,而不需要额外的训练过程,这与传统方法有本质区别。

关键设计:在设计中,AGOS-Agent使用了特定的参数设置和损失函数,以优化VLMs的决策过程,并确保在不同难度级别的任务中都能保持高效的性能。具体的网络结构和参数设置在实验部分进行了详细说明。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,AGOS-Agent显著提升了Gemini-3.6-Flash模型的成功率,从8.6%提高至55.7%,成功率(SR)和步骤效率(SPL)分别从7.6%提升至44.0%。此外,八个模型的整体成功率均有所提高,所有模型的决策步骤均减少,显示出该方法的有效性。

🎯 应用场景

该研究的潜在应用领域包括城市搜索与救援、无人驾驶汽车的目标识别与跟踪、以及智能监控系统等。通过提升UAV和UGV的协作能力,能够在复杂环境中实现更高效的目标搜索,具有重要的实际价值和未来影响。

📄 摘要(原文)

Air-Ground Object Search (AGOS) in urban environments is a challenging embodied task, which requires an Unmanned Aerial Vehicle (UAV) and an Unmanned Ground Vehicle (UGV) to jointly search for and verify a specified target vehicle from multi-view visual references. To study this underexplored problem, we introduce AGOS-Bench, the first dedicated benchmark for evaluating whether general-purpose Vision-Language Models (VLMs) can integrate aerial discoveries and ground-level verification through UAV-UGV cooperation. We further provide AGOS-Dataset as the companion resource of exemplary trajectories constructed by an automatic pipeline. It consists of 7.7k episodes for searching objects of diverse categories and attributes, spanning three difficulty levels. To address the AGOS task, we propose AGOS-Agent, a training-free and tool-augmented approach. The agentic method relieves VLMs from complex and dynamic coordination via a deliberate search-handoff-verify cooperation protocol, only demanding VLMs for scene understanding and decision-making. Extensive experiments on nine VLMs show that AGOS-Agent improves overall success rate for eight of the nine evaluated backbones while reducing decision steps for all nine. On the hard split, the SR and SPL of Gemini-3.6-Flash increase from 8.6% to 55.7% and from 7.6% to 44.0%, respectively.