Inference-Time Steering for Cross-Lingual Factual Consistency in LLMs
作者: Alexander Manev
分类: cs.CL, cs.AI
发布日期: 2026-07-21
备注: 8 pages (21 in total), 2 figures, 4 tables. Original manuscript for a Guided Research project conducted at the Technical University of Munich, detailing the complete methodology, full data pipeline, and comprehensive experimental results. A related, condensed subset of this work was subsequently adapted and published at the StereACuLT 2026 workshop
💡 一句话要点
提出推理时间引导以解决跨语言事实一致性问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 跨语言一致性 大型语言模型 推理时间引导 个性化提示 对比激活添加 直接偏好优化 多语言处理
📋 核心要点
- 现有大型语言模型在多语言处理上存在偏见,导致跨语言的事实一致性问题,尤其在低资源语言中表现不佳。
- 本文提出在推理时通过个性化提示、对比激活添加和直接偏好优化等策略,来减轻模型的语言偏见。
- 实验结果显示,个性化提示在效率和安全性上表现最佳,而CAA和DPO则在特定条件下提供了不同程度的改进。
📝 摘要(中文)
尽管大型语言模型(LLMs)在多语言流利度方面表现出色,但其内部知识表示仍然偏向高资源语言,导致跨语言事实不一致。本文研究了在推理时是否可以减轻这些偏见,迫使以英语提示的模型像在目标语言(德语、西班牙语、保加利亚语)中查询一样回答。我们评估了四种干预策略,包括零样本上下文引导、对比激活添加(CAA)和直接偏好优化(DPO)。实验结果表明,个性化提示是最有效的干预方法,能够平衡效率、安全性和领域外泛化能力。尽管CAA在一致性基准上表现出显著变化,但其配置敏感且可能导致知识退化。DPO适配器提供了持久但较窄和不易转移的增益。这些发现表明,跨语言不一致至少部分是选择问题,简单的上下文干预可能优于更具侵入性的方法。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在跨语言推理中存在的事实不一致性问题,尤其是模型在不同语言提示下的回答偏差。现有方法未能有效处理低资源语言的知识表示,导致信息不对称。
核心思路:通过在推理阶段引入上下文引导和内部表示操控,迫使模型在不同语言环境中保持一致的回答。设计的核心在于利用简单的上下文干预来优化模型的输出,而非复杂的模型重训练。
技术框架:研究中采用了四种干预策略:零样本上下文引导、对比激活添加(CAA)、直接偏好优化(DPO),并结合多语言事实数据集和文化根植查询的基准进行评估。
关键创新:最重要的创新在于提出了个性化提示作为干预手段,显示出在跨语言一致性问题上优于传统的复杂方法。与现有方法相比,个性化提示更具有效性和安全性。
关键设计:在实验中,个性化提示的设计强调了上下文的相关性,CAA则依赖于特定的配置以实现激活添加,而DPO则通过训练适配器来优化模型的偏好设置。
🖼️ 关键图片
📊 实验亮点
实验结果表明,个性化提示在多语言事实一致性任务中表现最佳,显著提高了模型在德语、西班牙语和保加利亚语中的回答准确性。CAA虽然在一致性基准上有明显提升,但其效果依赖于配置,DPO则提供了持久但较窄的改进。
🎯 应用场景
该研究的潜在应用领域包括多语言客服系统、跨语言信息检索和国际化内容生成等。通过提高模型在不同语言环境中的一致性,能够增强用户体验并提升信息的准确性,未来可能对全球化业务产生深远影响。
📄 摘要(原文)
Although Large Language Models (LLMs) demonstrate remarkable multilingual fluency, their internal knowledge representations remain disproportionately biased toward high-resource languages. This leads to cross-lingual factual inconsistency, where they shift their empirical answer distributions based solely on the prompt language. We investigate whether these biases can be mitigated at inference time, forcing an English-prompted model to answer as if it were queried in target languages (German, Spanish, Bulgarian), and evaluate four intervention strategies: zero-shot contextual steering (persona prompting), internal representation manipulation via Contrastive Activation Addition (CAA), and lightweight weight modification via Direct Preference Optimization (DPO) trained on benchmark-derived factual data as well as conceptual generalization data. To assess alignment, we curate a multilingual factual dataset alongside a novel generalization benchmark comprising culturally rooted queries to determine whether factual interventions transfer to broader target-centric preferences. Experiments on Gemma 3 12B Instruct reveal persona prompting to be the strongest overall intervention, balancing efficacy, safety, and out-of-domain generalization. While CAA yields sharp inconsistency benchmark shifts, it is configuration-sensitive and risks knowledge degradation. DPO-based adapters offer permanent, yet narrower and less transferable gains. These findings suggest that cross-lingual inconsistency is at least partly a selection problem, and that simple contextual interventions may outperform more invasive methods for robust, transferable alignment.