SCOReD: Student-Aware CoT Optimization for Recommendation Distillation

📄 arXiv: 2607.05734v1 📥 PDF

作者: Haz Sameen Shahgir, Yufei Li, Frank Shyu, Luke Simon, Sandeep Pandey, Xi Liu, Yue Dong

分类: cs.IR, cs.AI

发布日期: 2026-07-07

备注: 31 pages


💡 一句话要点

提出SCOReD以解决推荐领域的CoT蒸馏问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 推荐系统 蒸馏训练 链式思维 学生模型 动态编辑

📋 核心要点

  1. 现有的推荐系统蒸馏方法在处理教师模型的推理轨迹时存在冗长且不够精确的问题,导致学生模型学习效果不佳。
  2. SCOReD框架通过解析教师轨迹并根据学生模型的注意力动态选择编辑策略,从而优化推荐领域的CoT蒸馏过程。
  3. 实验结果表明,SCOReD优化的CoT训练在NDCG和Recall@5上分别提升了1.56%和1.9%,同时推理长度减少了27.3%。

📝 摘要(中文)

链式思维(CoT)蒸馏在推荐领域是强化学习训练的必要前置步骤,但原始教师轨迹不适合此任务。大型教师在推荐任务中表现出较高的推理不确定性,反复检查答案却不进行修正;在此类轨迹上进行监督微调会导致学生模型冗长且不修正初始猜测。此外,由于推荐领域的创新性,教师的推理轨迹对于小型学生LLM来说高度分布外。我们提出了学生感知的CoT优化框架SCOReD,首先将每个教师轨迹解析为类型化段落,并利用学生LLM的注意力评分每个段落的重要性。然后,SCOReD根据输出长度和相对对数概率提升动态选择每个段落的编辑(保留/重写/融合/修剪)。因此,SCOReD修剪冗余部分,同时保留信息密集的部分,并将原始教师轨迹适应于学生的输出分布。基于SCOReD优化的CoT训练为学生模型提供了更清晰的学习信号,相较于基线SFT提升了1.56%的NDCG和1.9%的Recall@5,同时推理长度减少了27.3%。

🔬 方法详解

问题定义:本论文旨在解决推荐领域中教师模型的推理轨迹不适合学生模型学习的问题。现有方法导致学生模型生成冗长且不修正的答案,影响学习效果。

核心思路:论文提出的SCOReD框架通过解析教师轨迹为类型化段落,并利用学生模型的注意力机制评分每个段落的重要性,从而动态选择编辑策略,优化学习信号。

技术框架:SCOReD的整体架构包括教师轨迹解析模块、重要性评分模块和动态编辑选择模块。首先解析教师轨迹为多个段落,然后根据学生模型的输出特征进行重要性评分,最后选择合适的编辑策略(保留、重写、融合或修剪)。

关键创新:SCOReD的主要创新在于其动态编辑选择机制,能够根据学生模型的输出分布调整教师轨迹,显著提高了学习信号的质量。这一方法与传统的静态蒸馏方法本质上不同。

关键设计:在SCOReD中,重要性评分基于学生模型的注意力机制,编辑策略的选择则考虑了输出长度和对数概率提升,确保保留信息密集的部分并去除冗余信息。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,SCOReD优化的CoT训练在NDCG指标上提升了1.56%,在Recall@5上提升了1.9%,同时推理长度减少了27.3%,显著优于基线SFT方法,展示了其有效性。

🎯 应用场景

该研究的潜在应用领域包括个性化推荐系统、智能助手和内容推荐等。通过优化推荐系统的学习过程,SCOReD能够提高推荐的准确性和用户满意度,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

Chain-of-thought (CoT) distillation in the recommendation domain is a necessary precursor to RL training, but raw teacher traces are ill-suited to this task. Large teachers approach the recommendation task with unusually high reasoning uncertainty, repeatedly rechecking their answers without revising them; supervised fine-tuning on such traces produces verbose students that never revise their initial guess. Furthermore, due to the novelty of the recommendation domain, the teacher's reasoning traces are highly out-of-distribution for the small student LLM. We propose Student-Aware CoT Optimization for Recommendation Distillation (SCOReD), a CoT optimization framework tailored to recommendation that first parses each teacher trace into typed segments and uses the student LLM's attention to score the importance of each segment. Then SCOReD dynamically selects a per-segment edit (KEEP / REWRITE / FUSE / PRUNE) based on the output length and comparative log probability lift of the answer given the edit as per the student. Therefore, SCOReD prunes redundant sections of the reasoning trace while preserving information-dense sections and adapts raw teacher traces to the student's output distribution. Training on SCOReD-optimized CoTs provides a cleaner learning signal to the student model and improves over baseline SFT by 1.56% NDCG and 1.9% Recall@5, while reducing reasoning length by 27.3%.