Adversarial Training for Tabular Credit Scoring: A Multi-Attack Robustness Evaluation in P2P Lending

📄 arXiv: 2609.09945v1 📥 PDF

作者: Gijs A. F. Niewzwaag, Marijn G. S. Veth, Manuele Massei, Marcos R. Machado

分类: cs.LG, q-fin.RM, stat.ML

发布日期: 2026-09-09


💡 一句话要点

提出对抗训练以提升P2P信贷评分的鲁棒性

🎯 匹配领域: 支柱一:机器人控制 (Robot Control)

关键词: 对抗训练 信贷评分 P2P借贷 鲁棒性评估 机器学习 模型泛化 多攻击机制

📋 核心要点

  1. 现有的信贷评分模型在面对申请者的对抗操控时,鲁棒性不足,缺乏系统评估。
  2. 本文提出了一种系统的训练-测试鲁棒性基准评估方法,涵盖多种模型和攻击方式。
  3. 实验结果显示,对抗训练在特定攻击下显著提升鲁棒性,混合训练在多种攻击中表现最佳。

📝 摘要(中文)

基于机器学习的信贷评分在P2P借贷中日益重要,但其对申请者故意修改自报输入以获得有利决策的对抗操控的抵御能力仍不明确。现有的对抗鲁棒性证据主要来自图像和文本领域,且通常只评估单一攻击与相应防御的匹配,缺乏对表格信贷数据中防御在不同攻击类型间的泛化能力的指导。本文通过对大规模Lending Club子集进行系统的训练-测试鲁棒性基准评估,涵盖三种模型家族(逻辑回归、前馈神经网络和用于表格数据的变换器)及四种针对申请者可变特征的攻击方法,提出了一种混合攻击机制。实验结果表明,对抗训练显著提高了对训练攻击的鲁棒性,并在基于梯度的攻击中具有良好的迁移性,但在非梯度干扰中迁移性较弱,单一攻击防御可能高估了实际的鲁棒性。混合训练在不同攻击间提供了最平衡的鲁棒性,同时保持了干净测试性能,支持信贷模型治理中的多攻击压力测试。

🔬 方法详解

问题定义:本文旨在解决基于机器学习的信贷评分模型在P2P借贷中对抗操控的鲁棒性不足问题。现有方法主要集中在图像和文本领域,缺乏对表格数据的全面评估,导致防御策略的泛化能力不明确。

核心思路:论文通过系统的训练-测试基准评估,比较不同模型和攻击方式的鲁棒性,提出混合攻击机制,以提高模型在多种攻击下的抵御能力。

技术框架:研究采用了三种模型(逻辑回归、前馈神经网络和变换器),并针对申请者可变特征设计了四种攻击(FGSM、PGD、盐和胡椒噪声、DeepFool),通过分层交叉验证评估模型性能。

关键创新:最重要的创新在于提出了混合训练方法,该方法在不同攻击类型中提供了更平衡的鲁棒性,而不仅仅依赖于单一攻击的防御策略。

关键设计:在实验中,采用了不同的损失函数和参数设置,以确保模型在对抗训练中的有效性,同时保持干净测试性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,对抗训练在特定攻击下的鲁棒性提升显著,尤其在基于梯度的攻击中表现良好。混合训练方法在多种攻击下的鲁棒性最为平衡,且在干净测试中保持了较高的性能,支持了信贷模型的多攻击压力测试。

🎯 应用场景

该研究的潜在应用领域包括P2P借贷平台、金融科技公司及信贷评分系统。通过提升模型对对抗操控的鲁棒性,能够更好地保护借贷决策的公正性和准确性,减少欺诈风险,增强用户信任,未来可能推动信贷评分模型的广泛应用与改进。

📄 摘要(原文)

Machine learning-based credit scoring is increasingly central to Peer-to-Peer (P2P) lending, yet its resilience to adversarial manipulation, where applicants strategically alter self-reported inputs to secure favourable decisions, remains poorly understood. Most adversarial-robustness evidence comes from image and text domains and evaluates a single attack against a matching defence, offering little guidance on how defences generalise across attack types in tabular credit data. We address this with a systematic train-test robustness benchmark on a large Lending Club subset, spanning three model families (logistic regression, a feed-forward neural network, and a transformer for tabular data) and four attacks confined to applicant-mutable features: Fast Gradient Sign Method (FGSM), Projected Gradient Descent (PGD), Salt-and-Pepper (S&P) noise, and DeepFool, plus a mixed-attack regime. Across a full grid evaluated with stratified cross-validation, adversarial training sharply improves robustness against the attack it is trained on and transfers well within the gradient-based family, but transfers weakly to non-gradient corruption, so single-attack defences overstate real-world resilience. Mixed training delivers the most balanced robustness across heterogeneous attacks while preserving clean-test performance, supporting multi-attack stress testing in credit-model governance.