MEOX: Compact Multimodal Mixture-of-Experts for Earth Observation

📄 arXiv: 2609.05351v1 📥 PDF

作者: Mohanad Albughdadi

分类: cs.CV

发布日期: 2026-09-04

备注: Submitted to IEEE Transactions on Geoscience and Remote Sensing


💡 一句话要点

提出MEOX以解决地球观测中的多模态学习问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态学习 地球观测 掩蔽自编码器 专家模型 参数优化

📋 核心要点

  1. 现有方法通常依赖于更大的模型架构,难以有效处理异构传感器和缺失数据的问题。
  2. MEOX通过多模态掩蔽自编码器和共享稀疏专家模块,优化了模态依赖处理和参数使用效率。
  3. 在多个基准任务上,MEOX在精度和性能上均超越了现有的CSMoE结果,展现出强大的迁移学习能力。

📝 摘要(中文)

近年来,地球观测表示学习的进展适应了异构传感器和缺失观测,通常通过更大的架构实现。我们提出了MEOX(多模态地球观测专家模型),这是一种具有293.9万参数的多模态掩蔽自编码器,总参数量为311.5万。该模型通过传感器特定适配器、显式有效性信号和共享稀疏专家模块,保持模态依赖处理,随后进行学习的块级融合。模型在122.8万MMEarth64样本上进行预训练,采用模态平衡的掩蔽重建和结构化传感器丢失。经过评估,模型在多个任务上表现优异,展示了在紧凑参数预算下的传感器灵活表示学习和强大的任务迁移能力。

🔬 方法详解

问题定义:本论文旨在解决地球观测中多模态学习的挑战,尤其是如何有效处理来自不同传感器的数据和缺失观测的问题。现有方法往往依赖于更大的模型架构,导致计算资源的浪费和效率低下。

核心思路:MEOX的核心思路是通过引入多模态掩蔽自编码器和共享稀疏专家模块,来实现模态依赖处理的优化,同时控制参数增长,提升模型的灵活性和适应性。

技术框架:MEOX的整体架构包括一个293.9万参数的编码器,多个传感器特定适配器,以及一个共享的稀疏专家模块。模型通过14个编码器块处理输入的空间序列,并结合四个元数据标记进行学习。

关键创新:MEOX的主要创新在于其共享专家投影与私有低秩残差的设计,这一设计有效限制了参数的增长,同时通过旋转注意力机制支持不同的下游空间网格处理。

关键设计:模型采用模态平衡的掩蔽重建和结构化传感器丢失作为预训练策略,确保了模型在多模态数据上的有效学习。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

MEOX在64像素的腰果分割任务中达到了64.42%的平均交并比,在224像素的EuroSAT任务中获得了90.56%的平均准确率,均超越了现有的CSMoE结果。此外,经过BigEarthNet微调后,模型达到了72.95%的微平均精度,展示了其强大的任务迁移能力。

🎯 应用场景

该研究的潜在应用领域包括环境监测、农业监测和城市规划等。MEOX能够有效整合来自不同传感器的数据,提升地球观测的准确性和效率,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

Recent advances in Earth Observation representation learning accommodate heterogeneous sensors and missing observations, often through larger architectures. We present MEOX (Multimodal Earth Observation with eXperts), a multimodal masked autoencoder with a 2.939 million-parameter encoder and 3.115 million parameters in total. Sensor-specific adapters, explicit validity signals, and a shared sparse-expert block preserve modality-dependent processing before a learned patch-wise fusion. Four metadata tokens then accompany a single spatial sequence through fourteen further encoder blocks. Shared expert projections with private low-rank residuals constrain parameter growth, while rotary attention supports downstream spatial grids different from pretraining. The model is pretrained on 1.228 million MMEarth64 samples using modality-balanced masked reconstruction and structured sensor dropout. Frozen transfer is evaluated on six GEO-Bench tasks at both 64 and 224 pixels. The model reaches 64.42% mean intersection-over-union on cashew segmentation at 64 pixels and 90.56% average accuracy on EuroSAT at 224 pixels, exceeding the corresponding reported CSMoE results. BigEarthNet finetuning reaches 72.95% micro-average precision. Routing diagnostics distinguish expert participation, spatial dependence, modality association, and functional contribution. A held-out WorldCover probe measures a 0.64-percentage-point benefit from metadata, while retrieval separates same-sensor semantics from cross-sensor alignment. These results demonstrate sensor-flexible representation learning and strong task transfer using a compact parameter budget.