MM-IFEval-Pro: A Multilingual and Attack-Resistant Benchmark for Instruction-Following in Vision-Language Models

📄 arXiv: 2609.04859v1 📥 PDF

作者: Changming Xiao, Zhenliang Ni, Jinhui He, Han Shu, Jie Hu

分类: cs.AI

发布日期: 2026-09-04


💡 一句话要点

提出MM-IFEval-Pro以解决多模态指令跟随评估不足问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态指令跟随 视觉语言模型 对抗安全 跨语言评估 强化学习训练集

📋 核心要点

  1. 现有多模态指令跟随基准在语言覆盖和对抗安全场景方面存在不足,无法满足真实应用需求。
  2. 本文提出MM-IFEval-Pro基准,涵盖多语言任务和复杂指令劫持案例,增强评估的全面性和安全性。
  3. 通过构建强化学习训练集,模型在MM-IFEval-Pro上的表现显著提升,并有效迁移到其他基准,展示良好的泛化能力。

📝 摘要(中文)

随着视觉语言模型(VLMs)在图像理解、跨模态推理和复杂指令执行方面的快速发展,指令跟随能力已成为其可靠性和实用性的关键指标。然而,现有的多模态指令跟随基准在语言覆盖和对抗安全场景方面仍存在不足,无法有效评估真实世界中的多语言和安全敏感环境。为了解决这些问题,本文提出了MM-IFEval-Pro,这是一个涵盖中文和英文任务以及多样化指令劫持案例的多模态指令跟随基准。该基准包括4个主要任务类别和24个子类别,以及8个指令类别和52个子类别,每个样本平均包含3.0个约束,以真实模拟复杂的指令场景。我们还构建了一个强化学习训练集,丰富了中文和对抗指令,显著提升了模型在MM-IFEval-Pro上的表现,并有效迁移到其他主流多模态基准,展示了强大的跨任务和跨语言泛化能力。

🔬 方法详解

问题定义:本文旨在解决现有多模态指令跟随基准在语言覆盖和对抗场景方面的不足,现有方法无法有效评估真实世界中的多语言和安全敏感环境。

核心思路:提出MM-IFEval-Pro基准,涵盖中文和英文任务以及多样化的指令劫持案例,通过丰富的约束条件来真实模拟复杂指令场景,从而提升评估的有效性。

技术框架:MM-IFEval-Pro基准包括4个主要任务类别和24个子类别,8个指令类别和52个子类别,样本设计上平均包含3.0个约束,构建了一个强化学习训练集,增强了对抗指令的覆盖。

关键创新:最重要的创新点在于构建了一个多语言和对抗安全的评估基准,显著提升了模型在复杂指令场景下的表现,与现有方法相比,提供了更全面的评估标准。

关键设计:在参数设置上,样本设计考虑了多样化的指令劫持情况,损失函数和网络结构经过优化,以确保模型在多语言和对抗场景下的有效性和鲁棒性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,模型在MM-IFEval-Pro基准上的表现显著提升,尤其是在对抗指令处理方面,相较于基线模型,性能提升幅度达到20%以上,展示了强大的跨任务和跨语言泛化能力。

🎯 应用场景

该研究的潜在应用领域包括多语言人机交互、智能助手和自动化系统等,能够提升这些系统在复杂指令执行中的可靠性和安全性。未来,随着多模态技术的不断发展,MM-IFEval-Pro将为评估和优化视觉语言模型提供重要参考。

📄 摘要(原文)

As vision-language models (VLMs) rapidly advance in image understanding, cross-modal reasoning, and complex instruction execution, instruction-following capability has become a key indicator of their reliability and practicality. However, existing multimodal instruction-following benchmarks still suffer from limited language coverage and insufficient adversarial safety scenarios, making them inadequate for evaluating real-world multilingual and safety-sensitive settings. To address these gaps, we present MM-IFEval-Pro, a multimodal instruction-following benchmark covering Chinese and English tasks as well as diverse instruction hijacking cases. MM-IFEval-Pro includes 4 major task categories and 24 subcategories and 8 instruction categories with 52 subcategories, with each sample containing an average of 3.0 constraints to realistically simulate complex instruction scenarios. We further construct a reinforcement-learning training set enriched with Chinese and adversarial instructions, which significantly improves model performance on MM-IFEval-Pro and transfers effectively to other mainstream multimodal benchmarks, demonstrating strong cross-task and cross-language generalization.