SocialRL: Refining LLMs' Social Intelligence through Multi-turn Reinforcement Learning and Reward Design

📄 arXiv: 2609.09764v1 📥 PDF

作者: Jianing Wang, Xintao Wang, Aili Chen, Jie Shi, Hongcheng Guo, Jun Gao, Wenxuan Zhao, Chengkun Lang, Yuanli Guo, Yanghua Xiao

分类: cs.CL

发布日期: 2026-09-09

备注: 30pages 2figures


💡 一句话要点

提出SocialRL以解决多轮对话中的社交智能问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 社交智能 多轮对话 强化学习 奖励设计 PPO算法 人机交互 语言模型

📋 核心要点

  1. 现有的强化学习方法主要集中于单轮对话,难以处理多轮交互中的目标与关系的复杂性。
  2. 本文提出SocialRL框架,通过多轮强化学习和奖励设计,优化对话中的社交智能表现。
  3. 实验结果表明,SocialRL在多个社交对话基准上平均提高了9.2个百分点,显示出显著的性能提升。

📝 摘要(中文)

社交智能使得智能体能够理解社交背景、推断意图并在持续对话中适应。随着语言模型成为自主协作伙伴,构建有效且可信的人机交互变得至关重要。现有的强化学习方法主要优化单轮发言和稀疏结果奖励,导致短视策略在多轮交互中难以管理目标与关系的张力。为此,本文提出了SocialRL,一个多轮强化学习框架,解决了上述挑战。首先,采用PPO算法进行多轮强化学习,将延迟结果奖励传播回每一轮,实现长远规划。其次,设计了六个过程奖励维度,捕捉目标与关系之间的权衡。通过在多个社交对话基准上进行实验,SocialRL在目标达成率上平均提高了9.2个百分点,验证了其在合成和真实社交场景中的有效性。

🔬 方法详解

问题定义:本文旨在解决现有强化学习方法在多轮对话中短视的问题,特别是在处理目标与关系的张力时的不足。现有方法往往只优化单轮发言,导致无法有效管理多轮交互中的复杂性。

核心思路:SocialRL框架通过引入多轮强化学习,利用PPO算法将延迟的结果奖励传播回每一轮,从而实现长远规划。此外,设计了六个过程奖励维度,以捕捉目标与关系之间的权衡。

技术框架:SocialRL的整体架构包括多个模块:首先是多轮对话的输入处理,其次是基于PPO的强化学习模块,最后是动态生成奖励的模型。奖励模型根据对话的不同阶段生成细粒度的评分标准。

关键创新:最重要的创新点在于引入了多轮强化学习和六个过程奖励维度的设计,使得模型能够在不同阶段优先考虑关系建立、目标推进和均衡收尾。这与现有方法的单轮优化策略形成了本质区别。

关键设计:在奖励设计中,采用了动态权重调度策略,早期阶段优先考虑关系建立,中期关注目标推进,后期则实现均衡收尾。此外,奖励模型的细粒度评分标准能够更准确地反映对话的社交智能表现。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果显示,SocialRL在多个社交对话基准上平均提高了9.2个百分点的目标达成率,相较于基线模型表现出显著的性能提升。这一结果验证了SocialRL在合成和真实社交场景中的有效性。

🎯 应用场景

该研究的潜在应用领域包括人机交互、社交机器人、在线客服系统等。通过提升语言模型的社交智能,能够增强人机之间的互动质量,提升用户体验,未来可能在教育、心理辅导等领域产生深远影响。

📄 摘要(原文)

Social intelligence enables agents to read social context, infer intent, and adapt over sustained dialogue. As language models become autonomous collaborators, it is central to building effective and trustworthy human-AI interaction. Existing reinforcement learning methods optimize single-turn utterances and sparse outcome rewards, producing short-sighted policies that struggle to manage goal-relationship tensions across multi-turn interactions. We propose SocialRL, a multi-turn reinforcement learning framework addressing both challenges. First, we apply multi-turn reinforcement learning using PPO that propagates delayed outcome rewards back to each turn, enabling long-horizon planning. Second, we design six process reward dimensions capturing the goal-relationship trade-off, including goal advancement, relational attunement, contextual coherence, etc. A reward model dynamically generates fine-grained scoring criteria for each dimension, while a stage-aware weight schedule prioritizes relationship-building in early turns, goal advancement mid-way, and balanced closure late. Across multiple social-dialogue benchmarks, SocialRL improves Goal Achievement by an average of 9.2 percentage points over the corresponding Base models. These results demonstrate the effectiveness of SocialRL across synthetic and real social scenes, as well as standard and challenging social scenarios.