SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulation

📄 arXiv: 2607.05943v1 📥 PDF

作者: Zhengbo Jiao, Yiming Cheng, Yilei Jiang, Kaituo Feng, Rui Huang, Tianyi Jiang, Juanxi Tian, Jiapeng li, Qunzhong Wang, Tailai Chen, Qianshan Wei, Chuan Xiao, Shanyu Rong, Yangfu Li, Yanhan Zhou, Yunpu Ma, Yifan Zhang, Xiangyu Yue

分类: cs.AI

发布日期: 2026-07-07

备注: Project page: https://github.com/Frostlinx/SearchEyes


💡 一句话要点

提出SearchEyes以解决多模态搜索智能中的结构性断裂问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态搜索 知识图谱 强化学习 路径优化 信息检索

📋 核心要点

  1. 现有多模态搜索代理在多跳推理中存在结构性断裂,导致训练数据和环境的构建相互独立,影响性能。
  2. 本文提出SearchEyes,通过类型知识图谱构建模拟搜索世界,统一训练数据、环境和奖励信号,提升多模态搜索能力。
  3. 实验结果显示,SearchEyes在六个基准测试中表现优异,SearchEyes-27B在开源基线基础上平均提升6.2分,达到最先进水平。

📝 摘要(中文)

训练多模态搜索代理以进行多跳推理面临挑战,现有方法在构建训练数据、搜索环境和奖励信号时相互独立,导致结构元数据被丢弃、环境依赖不可重现的外部引擎以及稀疏的强化学习奖励。本文提出SearchEyes,利用类型知识图谱作为模拟搜索世界的基础,统一这三部分。我们提出了感知-知识链(PKC),在Wikidata5M的视觉-知识交集上采样受限的多跳路径,保留跳级实体元数据,定义自包含的搜索世界和步骤级奖励锚点。此外,我们提出了跳锚策略优化(HaPO),重用这些锚点进行步骤级信用分配,无需单独训练的过程奖励模型。实验表明,SearchEyes在六个多模态知识密集基准上实现了最先进的性能,SearchEyes-27B在最强开源基线基础上平均提升6.2分。

🔬 方法详解

问题定义:本文旨在解决现有多模态搜索代理在多跳推理中面临的结构性断裂问题,现有方法在训练数据、搜索环境和奖励信号的构建上相互独立,导致性能下降。

核心思路:论文提出SearchEyes,利用类型知识图谱构建一个统一的模拟搜索世界,整合训练数据、环境和奖励信号,确保信息的连贯性和可重现性。

技术框架:SearchEyes的整体架构包括三个主要模块:类型知识图谱作为基础、感知-知识链(PKC)用于采样多跳路径、跳锚策略优化(HaPO)用于步骤级奖励分配。

关键创新:最重要的创新在于引入了PKC和HaPO,前者保留了跳级实体元数据,后者实现了无需单独训练的过程奖励模型的步骤级信用分配,这与现有方法的设计有本质区别。

关键设计:在设计中,PKC通过在Wikidata5M的视觉-知识交集上采样路径,确保了每一步的奖励锚点的有效性,HaPO则通过重用这些锚点来优化策略,提升了训练效率和效果。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,SearchEyes在六个多模态知识密集基准上表现优异,SearchEyes-27B在最强开源基线的基础上平均提升6.2分,显示出其在多模态搜索智能领域的领先地位。

🎯 应用场景

该研究的潜在应用领域包括智能搜索引擎、问答系统和信息检索等,能够显著提升多模态搜索代理的推理能力和准确性。未来,SearchEyes有望在更广泛的人工智能应用中发挥重要作用,推动多模态学习的发展。

📄 摘要(原文)

Training multimodal search agents to perform multi-hop reasoning remains challenging due to a fundamental structural disconnect: existing pipelines construct training data, search environments, and reward signals independently, causing synthesized structural metadata to be discarded, environments to rely on irreproducible external engines, and RL rewards to remain sparse at the trajectory level. We present \textbf{SearchEyes}, which uses a typed knowledge graph as the backbone of a \emph{simulated search world} that unifies all three components. We propose \textbf{Perception-Knowledge Chains (PKC)} to sample constrained multi-hop paths over the visual-knowledge intersection of Wikidata5M, retaining hop-level entity metadata that simultaneously defines a self-contained search world and step-level reward anchors. We further propose \textbf{Hop-Anchored Policy Optimization (HaPO)}, which reuses these anchors for step-level credit assignment without a separately trained process reward model. Experiments on six multimodal knowledge-intensive benchmarks show that SearchEyes achieves state-of-the-art performance among open-source multimodal search agents, with SearchEyes-27B improving over the strongest open-source baseline by 6.2 points on average.%