MMRM: A Multiplex Multimodal Representation Model for Product Ranking in E-commerce Search

📄 arXiv: 2607.11030v1 📥 PDF

作者: Zhen-Lin Chen, Maosen Sheng, Peng Lin, Jianmin Chen, Zhuojian Xiao, Dongyue Wang, Xiwei Zhao

分类: cs.IR, cs.LG, cs.MM

发布日期: 2026-07-13

备注: Accepted by SIGIR2026

DOI: 10.1145/3805712.3808434


💡 一句话要点

提出MMRM以解决电商搜索中的多模态信息利用不足问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态信息 电商搜索 排名模型 用户行为建模 协同信号 机器学习 深度学习

📋 核心要点

  1. 现有电商搜索排名方法依赖单一协同信号,未能充分利用多任务排名所需的异构信号。
  2. 提出MMRM框架,通过共享主干网络与任务特定标记,整合多种协同信号生成商品表示。
  3. 实验结果显示MMRM在效率和效果上优于现有方法,并已在京东电商搜索引擎成功应用。

📝 摘要(中文)

多模态信息在电商搜索排名中至关重要。现有方法通常通过单一协同信号对通用多模态大语言模型(MLLMs)进行微调,随后将生成的表示整合到排名模型中作为商品特征。然而,这些方法存在两个主要局限:一是依赖单一协同信号,未能充分利用多任务排名所需的异构信号;二是将多模态表示视为常规商品特征,未能充分挖掘其在用户行为建模中的潜力。为了解决这些挑战,本文提出了多重多模态表示模型(MMRM),该框架将MLLM与多样的协同信号对齐,通过共享主干网络和任务特定的标记及投影层,MMRM能够在单次推理中同时学习多个信号并生成全面的多重商品表示。实验结果表明,MMRM在效率和效果上均优于现有方法,并已成功部署于京东电商搜索引擎,为数百万日活用户带来了显著的性能提升。

🔬 方法详解

问题定义:本文旨在解决电商搜索中多模态信息利用不足的问题。现有方法仅依赖单一协同信号进行微调,未能充分挖掘多模态数据的潜力,导致用户行为建模效果不佳。

核心思路:论文提出的MMRM框架通过对多种协同信号的整合,利用共享主干网络和任务特定标记,能够在单次推理中生成全面的商品表示,从而提升排名效果。

技术框架:MMRM的整体架构包括共享主干网络、任务特定的标记和投影层。通过这些模块,模型能够同时处理多种信号,生成多重商品表示,并在排名模型中引入多重用户表示策略。

关键创新:MMRM的主要创新在于其多重信号整合能力和多重用户表示策略,这与现有方法将多模态表示视为常规特征的做法有本质区别,充分挖掘了多模态数据的潜力。

关键设计:在模型设计中,采用了共享主干网络以减少计算开销,同时引入任务特定的投影层以增强表示能力。损失函数设计上,结合了多任务学习的目标,以优化模型在不同任务上的表现。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,MMRM在电商搜索排名任务中显著优于传统方法,具体性能提升幅度达到XX%(具体数据未知)。该模型已成功部署于京东电商搜索引擎,为数百万用户提供了更精准的搜索结果。

🎯 应用场景

该研究的潜在应用领域包括电商搜索引擎、推荐系统和用户行为分析等。通过提升多模态信息的利用效率,MMRM能够显著改善用户体验,推动电商平台的智能化发展,未来可能在更多领域得到推广和应用。

📄 摘要(原文)

Multimodal information is pivotal for e-commerce search ranking. Existing works leverage multimodal data typically by fine-tuning general Multimodal Large Language Models (MLLMs) via collaborative signals, subsequently integrating the derived representations into ranking models as item features. Despite their efficacy, these methods face two primary limitations: (1) they rely on a single collaborative signal for MLLM fine-tuning, failing to exploit the heterogeneous signals essential for multitask ranking; and (2) they treat multimodal representations as regular item features in ranking models, underutilizing their latent potential for user behavior modeling. To address these challenges, we propose the Multiplex Multimodal Representation Model (MMRM), a unified framework that aligns MLLMs with diverse collaborative signals. By employing a shared backbone with task-specific tokens and projection layers, MMRM simultaneously learns from multiple signals and generates comprehensive multiplex item representations in a single inference pass. Furthermore, we introduce a multiplex user representation strategy in ranking models, which derives task-specific user representations via search-based behavior sequence modeling leveraging multiplex item representations. Extensive experiments demonstrate MMRM's superior efficiency and effectiveness. Notably, MMRM has been successfully deployed in the JD e-commerce search engine, yielding significant performance gains for millions of daily users.