Learning Personalized Alignment for Evaluating Open-ended Text Generation
作者: Danqing Wang, Kevin Yang, Hanlin Zhu, Xiaomeng Yang, Andrew Cohen, Lei Li, Yuandong Tian
分类: cs.CL
发布日期: 2023-10-05 (更新: 2024-10-04)
备注: 19 pages
💡 一句话要点
提出PerSE框架以解决开放式文本生成评估中的人类偏好对齐问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 开放式文本生成 个性化评估 人类偏好对齐 可解释性 大型语言模型
📋 核心要点
- 现有评估方法过于依赖词汇相似性,导致与人类判断的相关性较低,无法有效反映人类偏好的多样性。
- 本文提出PerSE框架,通过个人档案推断特定偏好,评估生成内容与这些偏好的对齐,增强评估的可解释性。
- 实验结果表明,PerSE在Kendall相关性和准确率上均显著超越GPT-4,展示了其在新领域的良好迁移能力。
📝 摘要(中文)
近年来,研究者越来越关注大型语言模型(LLMs)在开放式任务(如故事生成)中与人类多样化价值观和偏好的对齐评估。传统评估指标过于依赖与人类参考文本的词汇相似性,往往与人类判断的相关性较差,且未能考虑人类偏好的多样性。为了解决这些挑战,本文提出了PerSE,一个可解释的评估框架,旨在评估与特定人类偏好的对齐。PerSE通过从上下文个人档案中推断特定偏好,并评估生成内容与个人偏好的对齐,增强了可解释性,提供详细评论和细粒度评分,从而促进更个性化的内容生成。基于13B LLaMA-2的PerSE在与GPT-4的比较中,Kendall相关性提高了15.8%,准确率提升了13.7%,在新领域的Kendall相关性上超越GPT-4达46.01%,显示出其良好的迁移能力。
🔬 方法详解
问题定义:本文旨在解决开放式文本生成中评估方法与人类多样化偏好的对齐问题。现有方法主要依赖词汇相似性,导致评估结果与人类判断不一致,无法反映个体偏好的差异性。
核心思路:PerSE框架的核心思想是通过分析用户的个人档案,推断出其特定的偏好,并基于这些偏好评估生成内容的质量。这种方法不仅提高了评估的准确性,还增强了评估的可解释性。
技术框架:PerSE的整体架构包括两个主要模块:个人偏好推断模块和内容对齐评估模块。前者通过分析用户提供的上下文信息,提取出个性化偏好;后者则基于这些偏好对生成的文本进行评分和评估。
关键创新:PerSE的主要创新在于其可解释性和个性化评估能力。与传统方法相比,PerSE不仅提供了定量评分,还附带详细的评估评论,帮助用户理解生成内容的优缺点。
关键设计:在技术细节上,PerSE使用了特定的损失函数来优化偏好对齐的准确性,并采用了基于LLaMA-2的13B模型进行内容生成和评估。模型的参数设置经过精细调优,以确保在多样化任务中的表现。
🖼️ 关键图片
📊 实验亮点
实验结果显示,基于PerSE的13B LLaMA-2模型在Kendall相关性上比GPT-4提高了15.8%,在准确率上提升了13.7%。此外,在新领域的Kendall相关性上,PerSE超越GPT-4达46.01%,显示出其良好的迁移能力和广泛适用性。
🎯 应用场景
该研究的潜在应用领域包括个性化内容生成、智能写作助手和教育领域的自动评估系统。通过更好地理解和评估用户偏好,PerSE能够为用户提供更符合其需求的文本生成服务,提升用户体验和满意度。未来,PerSE可能在多种开放式生成任务中发挥重要作用,推动个性化AI应用的发展。
📄 摘要(原文)
Recent research has increasingly focused on evaluating large language models' (LLMs) alignment with diverse human values and preferences, particularly for open-ended tasks like story generation. Traditional evaluation metrics rely heavily on lexical similarity with human-written references, often showing poor correlation with human judgments and failing to account for alignment with the diversity of human preferences. To address these challenges, we introduce PerSE, an interpretable evaluation framework designed to assess alignment with specific human preferences. It is tuned to infer specific preferences from an in-context personal profile and evaluate the alignment between the generated content and personal preferences. PerSE enhances interpretability by providing detailed comments and fine-grained scoring, facilitating more personalized content generation. Our 13B LLaMA-2-based PerSE shows a 15.8% increase in Kendall correlation and a 13.7% rise in accuracy with zero-shot reviewers compared to GPT-4. It also outperforms GPT-4 by 46.01% in Kendall correlation on new domains, indicating its transferability.