TOUR: A Trajectory-Level Unlearning Benchmark for Offline Reinforcement Learning

📄 arXiv: 2607.21111v1 📥 PDF

作者: Chaofan Pan, Lingfei Ren, Xiangyu Jiang, Yanhua Li, Xuemei Cao, Xiangkun Wang, Hao Yu, Wei Wei, Xin Yang

分类: cs.LG, cs.AI

发布日期: 2026-07-23


💡 一句话要点

提出TOUR基准以解决离线强化学习中的轨迹级别遗忘问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 离线强化学习 轨迹删除 隐私保护 数据评估 再训练 性能锚点 多攻击审计

📋 核心要点

  1. 现有的离线强化学习方法在轨迹删除时面临评估困难,导致隐私和效用之间的权衡不稳定。
  2. 本文提出TOUR基准,通过结合多种技术手段来评估轨迹级别的删除效果,旨在提高删除评估的准确性和可靠性。
  3. 实验结果表明,TOUR在不同环境下的隐私-效用行为表现出显著差异,且再训练和微调方法的效用参考优于传统基线。

📝 摘要(中文)

离线强化学习(RL)代理在固定的行为轨迹上进行训练,因此在训练后删除选定数据时,轨迹级别的删除显得尤为重要。然而,评估这种删除的难度在于,较低的成员资格评分可能反映出轨迹的移除、对另一种攻击的残余记忆,或是导致有用行为丧失的策略崩溃。为此,本文提出了轨迹级别记忆与遗忘基准(TOUR),该基准结合了轨迹级别分区、匹配的非成员控制、再训练参考、保留性能锚点和多攻击隐私审计。通过D4RL运动实验和AntMaze扩展,TOUR显示出常见的删除基线在隐私-效用行为上依赖于环境。再训练和微调通常提供比均匀GA+Refit更强的保留效用参考,而TrajDeleter仍然是有用的比较器,但在相同审计下并不总是更强。

🔬 方法详解

问题定义:本文旨在解决离线强化学习中轨迹级别删除的评估问题。现有方法在删除后评估隐私和效用时存在不稳定性,难以准确反映轨迹的真实删除效果。

核心思路:TOUR基准通过引入轨迹级别分区、匹配的非成员控制和多种攻击审计方法,提供了一种全面的评估框架,以提高对轨迹删除效果的理解和分析。

技术框架:TOUR的整体架构包括轨迹分区、非成员构建、再训练参考、性能锚点设置和隐私审计模块。每个模块相互配合,形成一个完整的评估流程。

关键创新:TOUR的主要创新在于其综合性评估方法,结合了多种攻击类型和参考模型,能够更全面地反映轨迹删除的效果,与现有方法相比,提供了更为可靠的评估结果。

关键设计:在TOUR中,关键设计包括对非成员的匹配构建、再训练的相对校准、以及对不同攻击类型的审计策略。这些设计确保了评估的准确性和有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,TOUR在D4RL运动实验中,常见的删除基线在隐私和效用之间表现出环境依赖性,且再训练和微调方法在保留效用方面显著优于传统的GA+Refit方法,提供了更强的参考标准。

🎯 应用场景

TOUR基准的提出为离线强化学习中的数据隐私保护提供了新的思路,能够帮助研究者和开发者在训练后有效评估和删除不必要的轨迹数据,具有广泛的应用潜力,尤其是在需要保护用户隐私的领域,如自动驾驶、医疗决策等。

📄 摘要(原文)

Offline Reinforcement Learning (RL) agents are trained on fixed behavioral trajectories, which makes trajectory-level deletion important when selected data must be removed after training. Evaluating such deletion is difficult because a lower membership score can reflect trajectory removal, residual memorization visible to another attack, or policy collapse that destroys useful behavior. We introduce Trajectory-level memOrization and Unlearning in offline RL (TOUR), a benchmark that combines trajectory-level partitioning, matched non-member controls, retraining references, retained-performance anchors, and multi-attack privacy auditing. Across D4RL locomotion experiments and an exploratory AntMaze extension, TOUR shows that common deletion baselines have environment-dependent privacy-utility behavior. Retraining and fine-tuning often provide stronger retained-utility references than uniform GA+Refit, while TrajDeleter remains a useful comparator but is not uniformly stronger under the same audit. Reference-model, threshold, deviation, equivalence, action-error, representation-based, and query-limited attacks further show that a single likelihood-based membership score can overstate deletion quality. In the evaluated settings, conclusions about offline RL unlearning are therefore not stable under single-score auditing. They depend on matched non-member construction, retraining-relative calibration, attack family, retained utility, and explicit scope for diagnostic architecture or component-level evidence.