User-Centric Modeling of Transactional Sequences with Explainable State Space Models

📄 arXiv: 2607.20228v1 📥 PDF

作者: Ivan Palagin

分类: cs.LG

发布日期: 2026-07-22


💡 一句话要点

提出用户中心的交易序列建模方法以解决现有模型不足问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 用户行为建模 对比表示学习 状态空间模型 个性化推荐 长序列处理

📋 核心要点

  1. 现有的RNN和Transformer编码器在处理长序列时面临梯度消失和计算复杂度过高的问题,限制了用户行为建模的效果。
  2. 本文提出了一种将对比表示学习与选择性状态空间模型相结合的混合方法,以提高用户交易序列建模的效率和准确性。
  3. 在三个公共数据集上的实验结果显示,混合模型在性能上优于单一模型,并且收敛速度显著加快,验证了方法的有效性。

📝 摘要(中文)

本文提出了一种用户中心的交易事件序列建模混合方法,结合了对比表示学习(CoLES)与状态空间模型(SSMs)。对比方法能够生成高质量的用户压缩表示,但现有的编码器如RNN和Transformer存在梯度消失或复杂度过高的问题。Mamba是一种选择性状态空间模型,能够有效处理长距离依赖,但在个性化用户分析中尚未得到充分探索。我们研究了两种集成策略:将Mamba的隐藏状态初始化为CoLES嵌入,以及将投影后的CoLES嵌入作为前缀令牌添加到输入序列中。实验结果表明,混合模型在三个公共数据集上均表现出比单独的Mamba和CoLES更好的性能,并且收敛速度比基础SSM快2-3倍。可解释性分析显示了在行为丰富数据集上的选择性事件过滤,并识别出最具信息量的交易特征。

🔬 方法详解

问题定义:本文旨在解决现有用户行为建模方法在处理长交易序列时的不足,尤其是RNN和Transformer在梯度消失和计算复杂度方面的挑战。

核心思路:通过将对比表示学习(CoLES)与选择性状态空间模型(Mamba)结合,提供更高效的用户表示和长距离依赖建模能力,从而提升个性化分析的效果。

技术框架:整体架构包括两个主要模块:首先是CoLES用于生成用户的压缩表示,然后将该表示与Mamba模型结合,采用两种策略进行集成:初始化Mamba的隐藏状态和将CoLES嵌入作为前缀令牌。

关键创新:最重要的创新在于将对比学习与状态空间模型的结合,尤其是Mamba在个性化用户分析中的应用,突破了传统模型的局限性。

关键设计:在模型设计中,采用了特定的损失函数以优化用户表示,同时在参数设置上进行了精细调整,以确保模型在长序列处理中的稳定性和效率。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,混合模型在三个公共数据集上均显著优于单独的Mamba和CoLES,收敛速度提高了2-3倍,验证了方法的有效性和实用性。可解释性分析进一步揭示了模型在行为丰富数据集上的选择性事件过滤能力。

🎯 应用场景

该研究的潜在应用领域包括个性化推荐系统、用户行为分析和市场预测等。通过提高交易序列建模的准确性和效率,能够为商业决策提供更有力的数据支持,进而提升用户体验和业务收益。未来,该方法还可能扩展到其他领域,如金融交易分析和社交网络行为建模。

📄 摘要(原文)

We propose a hybrid approach for user-centric modeling of transactional event sequences that combines contrastive representation learning (CoLES) with State Space Models (SSMs). While contrastive methods yield high-quality compressed user representations, existing encoders -- RNNs and Transformers -- suffer from vanishing gradients or quadratic complexity, respectively. Mamba, a selective SSM, efficiently handles long-range dependencies but remains underexplored for personalized user analysis. We investigate two integration strategies: (1)~initializing the Mamba hidden state with a CoLES embedding, and (2)~prepending the projected CoLES embedding as a prefix token to the input sequence. Both approaches supply the model with an informative user prior from the first step. Experiments on three public datasets -- Age (multiclass age-group prediction), MBD (multi-label product acquisition), and Taobao (binary purchase prediction) -- demonstrate consistent improvements over standalone Mamba and CoLES with a linear classifier, with the hybrid models converging 2--3$\times$ faster than the plain SSM baseline. Explainability analysis via discretization-step maps and Integrated Gradients reveals selective event filtering on behavior-rich datasets and identifies the most informative transaction features.