RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization
作者: Qiming Bao, Juho Leinonen, Paul Denny, Michael J. Witbrock
分类: cs.CL, cs.AI
发布日期: 2026-07-20
💡 一句话要点
提出RLearner-LLM以解决逻辑对齐与流畅性之间的平衡问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 逻辑对齐 直接偏好优化 知识密集型生成 NLI信号 验证LLM评分 流畅性与逻辑性 自动化偏好优化 生物医学文本生成
📋 核心要点
- 现有的直接偏好优化方法在知识密集型生成任务中存在逻辑对齐不足的问题,导致生成文本流畅但逻辑性差。
- 本文提出RLearner-LLM,通过混合DPO方法,结合DeBERTa-v3的NLI信号与验证LLM评分,消除了人工标注的需求。
- 实验结果显示,RLearner-LLM在多个领域的NLI表现上实现了显著提升,尤其在Gemma 4 E4B-it模型中,NLI提升幅度达到+11.9%至+2.4倍。
📝 摘要(中文)
直接偏好优化(DPO)作为基于PPO的强化学习人类反馈(RLHF)的高效替代方案,在知识密集型生成任务中表现不足。现有的偏好信号存在系统性的冗长偏见,导致流畅性被奖励而逻辑正确性被忽视。为此,本文提出了RLearner-LLM与混合DPO,融合DeBERTa-v3的NLI信号与验证LLM评分,消除了人工标注并克服了单一信号优化的“对齐税”。在生物学、医学和法律等五个学术领域的评估中,RLearner-LLM在NLI上实现了最高6倍的提升,并在15个评估单元中有11个获得了NLI的增益。
🔬 方法详解
问题定义:本文旨在解决现有直接偏好优化方法在知识密集型生成任务中逻辑对齐不足的问题。现有方法在生成流畅文本的同时,往往忽视了逻辑正确性,导致生成结果的逻辑一致性较差。
核心思路:论文提出的RLearner-LLM通过混合DPO方法,结合DeBERTa-v3的NLI信号与验证LLM评分,旨在消除人工标注的依赖,同时克服单一信号优化带来的“对齐税”。这种设计使得模型能够在保证流畅性的同时,增强逻辑一致性。
技术框架:RLearner-LLM的整体架构包括两个主要模块:一个是用于生成NLI信号的DeBERTa-v3模型,另一个是用于验证生成结果的LLM评分模块。通过这两个模块的结合,形成了一个自动化的偏好优化管道。
关键创新:本文的主要创新在于提出了混合DPO方法,首次将NLI信号与验证LLM评分相结合,从而有效提升了生成文本的逻辑一致性,并消除了对人工标注的依赖。与现有方法相比,这种方法在逻辑对齐上表现出显著优势。
关键设计:在模型设计中,采用了DeBERTa-v3作为NLI信号生成器,并通过调整损失函数来优化逻辑一致性与流畅性之间的平衡。此外,模型在不同规模的基础架构上进行了评估,确保了在小型模型上也能保持对齐税的减轻效果。
🖼️ 关键图片
📊 实验亮点
实验结果表明,RLearner-LLM在NLI上实现了最高6倍的提升,并在15个评估单元中有11个获得了NLI的增益。在Gemma 4 E4B-it模型中,NLI提升幅度达到+11.9%至+2.4倍,且在所有五个领域中均实现了更快的推理速度。
🎯 应用场景
RLearner-LLM的研究成果在多个知识密集型领域具有广泛的应用潜力,包括生物医学、法律文本生成等。通过提升生成文本的逻辑一致性,该模型能够为专业领域的自动化内容生成提供更高质量的支持,未来可能在智能问答、自动摘要等任务中发挥重要作用。
📄 摘要(原文)
Direct Preference Optimization (DPO), the efficient alternative to PPO-based RLHF, falls short on knowledge-intensive generation: standard preference signals from human annotators or LLM judges exhibit a systematic verbosity bias that rewards fluency over logical correctness. This blindspot leaves a logical alignment gap -- SFT models reach NLI entailment of only 0.05-0.22 despite producing fluent text. We propose RLearner-LLM with Hybrid-DPO: an automated preference pipeline that fuses a DeBERTa-v3 NLI signal with a verifier LLM score, removing human annotation while overcoming the "alignment tax" of single-signal optimization. Evaluated across five academic domains (Biology, Medicine, Law) with three base architectures (LLaMA-2-13B, Qwen3-8B, Gemma 4 E4B-it), RLearner-LLM yields up to 6x NLI improvement over SFT, with NLI gains in 11 of 15 cells and consistent answer-coverage gains. On Gemma 4 E4B-it (4.5B effective params), Hybrid-DPO lifts NLI in four of five domains (+11.9% to +2.4x) with faster inference across all five, scaling down to compact base models without losing the alignment-tax mitigation. Our Qwen3-8B RLearner-LLM wins 95% of pairwise comparisons against its own SFT baseline; GPT-4o-mini in turn wins 95% against our concise output -- alongside the 69% win the same judge gives a verbose SFT over our DPO model, this replicates verbosity bias on a frontier comparator and motivates logic-aware metrics (NLI, ACR) over LLM-as-a-judge for knowledge-intensive generation.