Reinforcement Learning for improving Large Language Models' Catalan text simplification capabilities
作者: Arnau Ayguadé Domingo, Stefan Bott, Horacio Saggion
分类: cs.CL, cs.AI
发布日期: 2026-09-04
备注: Accepted at CLEAR-TEXT 2026: Readability and text simplification workshop at the International Conference Computational Linguistics in Bulgaria (CLIB 2026)
💡 一句话要点
提出强化学习方法以提升大语言模型的加泰罗尼亚文本简化能力
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 自动文本简化 强化学习 大语言模型 加泰罗尼亚语 跨语言迁移学习
📋 核心要点
- 现有的自动文本简化方法在低资源语言上效果不佳,无法满足可及性需求。
- 论文提出通过强化学习和新颖的奖励函数,优化大语言模型的文本简化能力,特别针对加泰罗尼亚语。
- 实验结果显示,后训练后的模型在加泰罗尼亚语基准上表现显著提升,同时减少了负面行为。
📝 摘要(中文)
尽管自动文本简化(ATS)对可及性至关重要,但其进展未能跟上自然语言处理技术的快速演变。本文探讨了应用强化学习(RL)来提高低资源语言的ATS质量,利用大型语言模型(LLMs)。论文引入了一种新颖的奖励函数,旨在通过群体相对策略优化(GRPO)引导LLMs朝向特定的简化风格,该函数结合了SARI指标和特定的惩罚组件。通过对IberianLLM-7B-Instruct在ASSET数据集上的后训练,证明了GRPO与该奖励函数的有效性。模型在英语ASSET上后训练后,其在两个策划的加泰罗尼亚基准上的ATS表现有所提升,同时成功抑制了先前观察到的负面行为。通过将ASSET翻译成加泰罗尼亚语和西班牙语并对每个版本进行后训练,探索了跨语言迁移学习,但未能在域外基准上显示出显著改善。
🔬 方法详解
问题定义:本文旨在解决低资源语言的自动文本简化(ATS)能力不足的问题。现有方法在处理加泰罗尼亚语等语言时,未能有效提升简化质量,影响了可及性。
核心思路:论文提出利用强化学习(RL)来优化大型语言模型(LLMs)的文本简化能力。通过设计新颖的奖励函数,结合SARI指标与惩罚组件,引导模型朝向特定的简化风格。
技术框架:整体架构包括数据预处理、模型后训练和评估三个主要阶段。首先,将ASSET数据集用于模型训练,然后通过GRPO方法进行后训练,最后在加泰罗尼亚语基准上进行评估。
关键创新:最重要的技术创新在于引入了结合SARI指标和惩罚组件的奖励函数,通过GRPO方法优化模型的简化风格。这一设计与传统的监督学习方法本质上不同,后者通常依赖于固定的损失函数。
关键设计:在参数设置上,模型后训练过程中采用了特定的学习率和批量大小。损失函数设计中,除了SARI指标外,还加入了针对不良简化行为的惩罚项,以确保模型输出的文本质量。
🖼️ 关键图片
📊 实验亮点
实验结果表明,后训练后的模型在加泰罗尼亚语基准上的ATS性能显著提升,具体表现为在两个策划基准上均有明显改善,同时成功抑制了先前观察到的负面行为,展示了新方法的有效性。
🎯 应用场景
该研究的潜在应用领域包括教育、信息获取和辅助技术等,能够帮助低资源语言的用户更好地理解和使用文本信息。通过提升文本简化能力,未来可在更多语言和领域推广此技术,促进信息的可及性。
📄 摘要(原文)
Although automatic text simplification (ATS) is critical for accessibility, its progress has not matched the rapid evolution of broader natural language processing techniques. This paper investigates the application of reinforcement learning (RL) to improve the quality of ATS for low-resource languages using Large Language Models (LLMs). The paper introduces a novel reward function, designed to guide LLMs toward a targeted simplification style with Group Relative Policy Optimization (GRPO), that combines the SARI metric with specific penalty components. The effectiveness of GRPO with this reward function is motivated and demonstrated by post-training IberianLLM-7B-Instruct on the ASSET dataset. After post-training on the English ASSET, the model's ATS performance improves on two curated Catalan benchmarks while also successfully suppressing previously observed negative behaviors. Cross-lingual transfer learning is explored by translating ASSET into Catalan and Spanish and post-training the model on each version, but these fail to show a significant improvement on the out-of-domain benchmark.