Semantic Pareto-DQN: A Multi-Objective Reinforcement Learning Framework for Financial Anomaly Detection

📄 arXiv: 2607.09641v1 📥 PDF

作者: Cláudio Lúcio do Val Lopes, Lucca Machado da Silva

分类: cs.LG, cs.AI

发布日期: 2026-07-10

备注: BRACIS 2026 - 36th Brazilian Conference on Intelligent Systems


💡 一句话要点

提出Semantic Pareto-DQN以解决金融异常检测中的类不平衡问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 金融异常检测 多目标强化学习 类不平衡 自然语言处理 深度学习

📋 核心要点

  1. 现有的金融异常检测方法在面对极端类不平衡时,往往导致模型偏向多数类,无法有效识别少数类异常。
  2. 本文提出的Semantic Pareto-DQN框架通过多目标强化学习,利用自然语言叙述来优化异常检测过程,避免了数据重采样的失真问题。
  3. 实验结果表明,Semantic Pareto-DQN在E-Commerce欺诈和UCI信用数据集上,显著提高了少数类的召回率,打破了传统方法的局限。

📝 摘要(中文)

金融异常检测面临极端的类不平衡问题,导致传统的单目标算法出现“欺诈崩溃”,偏向多数类,无法平衡异常拦截与客户摩擦。为此,本文提出了Semantic Pareto-DQN,一个多目标强化学习框架。该方法将异构交易特征合成一致的自然语言叙述,通过大型语言模型编码,从而生成稳健的、尺度不变的状态表示。代理优化一个明确解耦金融效益、操作摩擦和语义发现的向量奖励。通过映射连续的Pareto前沿,系统动态导航错过异常与假阳性之间的不对称成本。实证评估显示,Semantic Pareto-DQN成功打破零召回陷阱,相较于标量化基线,显著提高了少数类的召回率,为金融异常发现提供了替代方案。

🔬 方法详解

问题定义:本文旨在解决金融异常检测中的类不平衡问题,现有方法往往导致模型偏向多数类,无法有效识别少数类异常,造成“欺诈崩溃”。

核心思路:提出Semantic Pareto-DQN框架,通过多目标强化学习,利用自然语言模型将异构交易特征合成一致的叙述,优化异常检测过程,避免数据重采样带来的失真。

技术框架:整体架构包括状态表示模块、奖励优化模块和策略学习模块。状态表示模块通过大型语言模型生成自然语言叙述,奖励优化模块则解耦金融效益、操作摩擦和语义发现,策略学习模块则基于优化的奖励进行学习。

关键创新:最重要的技术创新在于引入多目标强化学习框架,明确解耦不同目标的奖励机制,使得模型能够动态平衡异常检测的效果与操作摩擦,突破了传统单目标方法的局限。

关键设计:在参数设置上,采用向量化奖励机制,损失函数设计为考虑多目标的加权和,网络结构则基于深度学习模型,确保能够处理复杂的交易特征。通过这些设计,模型能够有效提高少数类的召回率。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果显示,Semantic Pareto-DQN在E-Commerce欺诈和UCI信用数据集上,相较于标量化基线,少数类召回率显著提高,成功打破了零召回陷阱,展示了其在金融异常检测中的有效性。

🎯 应用场景

该研究的潜在应用领域包括金融欺诈检测、信用评分和风险管理等。通过提高少数类异常的检测能力,能够有效降低金融损失,提升客户体验,具有重要的实际价值和未来影响。

📄 摘要(原文)

Financial anomaly detection suffers from extreme class imbalance, causing traditional single-objective algorithms to exhibit ``fraud collapse'', defaulting to the majority class and failing to balance anomaly interdiction with customer friction. To overcome this without distortive data resampling, we propose the Semantic Pareto-DQN, a multi-objective reinforcement learning framework. Our approach synthesizes heterogeneous transaction features into cohesive natural-language narratives, encoded by large language models, thereby producing a robust, scale-invariant state representation. The agent optimizes a vectorial reward that explicitly decouples financial efficacy, operational friction, and semantic discovery. By mapping the continuous Pareto frontier, the system dynamically navigates the asymmetric costs of missed anomalies versus false positives. Empirical evaluations across E-Commerce fraud and UCI Credit datasets show that semantic Pareto-DQN successfully shatters the zero-recall trap. It achieves superior minority-class recall compared to scalarized baselines, providing an alternative to trade bounded operational friction for financial anomaly discovery.