SelectFormer: Private and Practical Data Selection for Transformers

📄 arXiv: 2310.02373v4 📥 PDF

作者: Xu Ouyang, Felix Xiaozhu Lin, Yangfeng Ji

分类: cs.LG, cs.CR

发布日期: 2023-10-03 (更新: 2025-03-01)


💡 一句话要点

提出SelectFormer以解决私有数据选择问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control)

关键词: 私有数据选择 多方计算 Transformer模型 低维MLP 数据隐私 机器学习 高效评估

📋 核心要点

  1. 现有方法在多方计算下评估Transformer模型成本高昂,导致私有数据选择过程不够实用。
  2. 本文提出了一种新的私有数据选择流程,通过低维MLP模拟高维算子并采用并行调度来提高效率。
  3. 实验表明,所提方法显著降低了延迟,并在准确度上保持了较小的下降,展示了其有效性。

📝 摘要(中文)

在自由数据市场中,私有数据选择至关重要,即模型所有者在交易前从数据所有者那里选择并评估训练数据。为了保护数据和模型的隐私,该过程需在多方计算(MPC)下评估目标模型。尽管先前研究表明在MPC下评估基于Transformer的模型成本高昂,本文提出了一种实用的方法以实现数据选择。主要贡献包括:1)提出了一个新的MPC下私有数据选择流程;2)通过在小样本数据上训练低维多层感知机(MLP)来模拟高维非线性算子;3)采用并行多阶段调度MPC。实验结果显示,与直接在MPC下评估目标模型相比,延迟从数千小时减少到数十小时,且选定数据的训练准确度仅下降约0.20%。

🔬 方法详解

问题定义:本文旨在解决在多方计算环境下,如何高效且私密地选择训练数据的问题。现有方法在评估Transformer模型时,计算成本过高,导致实际应用受限。

核心思路:论文的核心思路是通过引入低维多层感知机(MLP)来模拟高维非线性算子,从而减少计算复杂度,并通过并行调度优化MPC的执行效率。

技术框架:整体架构包括三个主要模块:私有数据选择流程、低维MLP训练模块和并行多阶段MPC调度。首先,模型所有者选择数据,然后通过低维MLP进行高效评估,最后在MPC中并行执行选择和评估过程。

关键创新:最重要的技术创新在于提出了一种新的私有数据选择流程,结合低维MLP和并行调度,使得在MPC下评估Transformer模型变得可行且高效。这与现有方法的本质区别在于显著降低了计算延迟。

关键设计:在设计中,低维MLP的结构经过精心选择,以确保在小样本数据上训练时能够有效捕捉高维特征。同时,MPC的调度策略采用了多阶段并行执行,以进一步提升整体效率。实验中还对损失函数和超参数进行了优化,以确保模型性能的稳定性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,所提SelectFormer方法在不同的Transformer模型和NLP/CV基准上表现出色。与直接在MPC下评估目标模型相比,延迟显著降低,从数千小时减少到数十小时,同时训练准确度仅下降约0.20%,证明了该方法的有效性和实用性。

🎯 应用场景

该研究的潜在应用领域包括数据市场、隐私保护计算和机器学习模型训练等。通过实现高效的私有数据选择,模型所有者能够在保护数据隐私的前提下,选择最优的训练数据,从而提升模型性能。这一方法的实际价值在于为数据交易提供了新的解决方案,未来可能会影响数据共享和隐私保护的相关政策与实践。

📄 摘要(原文)

Critical to a free data market is $\textit{private data selection}$, i.e. the model owner selects and then appraises training data from the data owner before both parties commit to a transaction. To keep the data and model private, this process shall evaluate the target model to be trained over Multi-Party Computation (MPC). While prior work suggests that evaluating Transformer-based models over MPC is prohibitively expensive, this paper makes it practical for the purpose of data selection. Our contributions are three: (1) a new pipeline for private data selection over MPC; (2) emulating high-dimensional nonlinear operators with low-dimension MLPs, which are trained on a small sample of the data of interest; (3) scheduling MPC in a parallel, multiphase fashion. We evaluate our method on diverse Transformer models and NLP/CV benchmarks. Compared to directly evaluating the target model over MPC, our method reduces the delay from thousands of hours to tens of hours, while only seeing around 0.20% accuracy degradation from training with the selected data.