DiaLLM: An Investigation into the Robustness-Generation Gap in English Dialect Adaptation

📄 arXiv: 2607.07669v1 📥 PDF

作者: Jordan Painter, Dipankar Srirag, Adarsh Kappiyath, Diptesh Kanojia, Aditya Joshi, Lu Yin

分类: cs.CL, cs.AI

发布日期: 2026-07-08


💡 一句话要点

提出DiaLLM以解决英语方言生成的鲁棒性问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 方言生成 语言模型 鲁棒性 预训练 对齐策略 自然语言处理 生成质量

📋 核心要点

  1. 现有的大型语言模型在理解方言英语方面表现良好,但在生成方言内容时仍然局限于标准英语,未能有效解决方言生成问题。
  2. 论文提出DiaLLM,通过持续预训练和多种后训练策略,结合不同的模型对齐方法,进行方言生成的系统性研究与比较。
  3. 实验结果显示,方言的鲁棒性与生成能力之间存在差异,显式的方言适应方法在生成质量上优于广泛对齐,但人类评估者的偏好却不一致。

📝 摘要(中文)

大型语言模型在理解方言英语方面取得了进展,但在生成方言内容时仍然主要倾向于标准的美国英语,导致方言生成问题未得到充分解决。本文提出了DiaLLM,通过对三种开放权重语言模型进行持续预训练,并结合隐式和显式的后训练范式及三种模型对齐策略,首次对澳大利亚、印度和北英方言进行控制比较。研究结果表明,方言的鲁棒性与生成能力是分离的,基准测试受持续预训练和微调的影响,而对齐策略则在生成方面产生了显著变化。显式的针对方言的适应方法能够可靠地产生被识别为方言的输出,但最优化方言奖励的策略并不被人类评估者所偏好。独立的语言学分析证实了这一奖励与质量之间的差距,尤其在三种模型中有明显表现。所有代码、检查点和偏好数据集均已公开。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在生成方言英语时的鲁棒性不足问题。现有方法主要集中在理解方言,而在生成方面仍然偏向标准英语,导致方言生成的挑战未得到充分应对。

核心思路:DiaLLM的核心思路是通过持续预训练和后训练策略,结合多种模型对齐方法,系统性地研究方言生成的效果,探索鲁棒性与生成能力之间的关系。

技术框架:整体架构包括三个主要阶段:首先是对三种开放权重语言模型进行持续预训练,其次应用隐式和显式的后训练范式,最后结合不同的模型对齐策略进行方言生成的优化。

关键创新:最重要的创新在于首次对不同方言的生成能力进行控制比较,揭示了方言鲁棒性与生成能力之间的分离现象,并提出了显式适应方法在生成质量上的优势。

关键设计:在模型训练中,采用了多种对齐策略和奖励设计,特别是针对方言的奖励机制,尽管最优化的奖励策略并未获得人类评估者的偏好,显示出奖励与生成质量之间的复杂关系。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,显式的方言适应方法在生成输出的方言识别上表现优异,且相较于广泛对齐方法更受偏好。然而,最优化方言奖励的策略并未获得人类评估者的青睐,显示出奖励设计与生成质量之间的复杂关系。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理中的方言生成、对话系统、以及语言教育等。通过提升方言生成的鲁棒性,能够更好地满足多样化用户的需求,促进语言的多样性和包容性。未来,该研究可能推动更多针对方言的资源开发和应用。

📄 摘要(原文)

Large language models increasingly \emph{understand} dialectal English, yet still \emph{produce} only standard, US-leaning English, leaving dialectal generation, the harder half of the problem, largely unaddressed. We introduce \textbf{DiaLLM}, which continually pretrains three open-weight language model families on the International Corpus of English and applies implicit and explicit post-training paradigms, each combined with three model alignment strategies, giving the first controlled comparison of these components across Australian, Indian, and Northern British English. Our results reveal that dialectal robustness and generation are \emph{dissociated}: benchmarks are shaped by continual pretraining and SFT, while alignment visibly reshapes generation in ways benchmarks do not capture. Explicit variety-targeted adaptation produces output reliably recognised as dialectal and preferred over broad alignment, yet the method that most aggressively optimises the dialectal reward is not preferred by human evaluators. Independent linguistic analysis corroborates this reward-quality gap, most clearly on two of the three families. No single alignment method dominates, and closing the gap will require richer reward designs and continued investment in dialectal resources. We release all code, checkpoints, and preference datasets.