Found in the Middle: Permutation Self-Consistency Improves Listwise Ranking in Large Language Models

📄 arXiv: 2310.07712v2 📥 PDF

作者: Raphael Tang, Xinyu Zhang, Xueguang Ma, Jimmy Lin, Ferhan Ture

分类: cs.CL, cs.LG

发布日期: 2023-10-11 (更新: 2024-04-22)

备注: Accepted for publication at NAACL 2024. First two authors contributed equally; 10 pages, 6 figures

🔗 代码/项目: GITHUB


💡 一句话要点

提出置换自一致性以改善大语言模型的列表排名问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大语言模型 列表排名 位置偏差 自一致性 信息检索 段落重排名 机器学习 自然语言处理

📋 核心要点

  1. 现有的大语言模型在处理上下文时存在位置偏差,导致列表排名效果不佳。
  2. 本文提出的置换自一致性方法,通过打乱输入提示中的列表顺序,减少了位置偏差,生成更为一致的排名结果。
  3. 在多个数据集上进行的实验表明,该方法在GPT-3.5和LLaMA v2上均显著提升了排名性能,超越了现有技术水平。

📝 摘要(中文)

大语言模型(LLMs)在使用上下文时表现出位置偏差,这使得列表排名变得更加复杂。为了解决这个问题,本文提出了一种置换自一致性的方法,旨在通过对黑箱LLMs的排名列表输出进行自一致性处理,减少位置偏差。具体而言,我们通过不断打乱提示中的列表顺序,并保持指令不变,来生成一个与顺序无关的排名。我们通过计算与所有样本排名距离最接近的中心排名来聚合结果,从而在过程中消除提示顺序偏差。理论上,我们证明了该方法的鲁棒性,显示在随机扰动下收敛到真实排名。实证结果表明,在五个排序和段落重排名的数据集上,该方法在GPT-3.5上提高了7-18%的得分,在LLaMA v2(70B)上提高了8-16%的得分,超越了段落重排名的先前最佳水平。

🔬 方法详解

问题定义:本文旨在解决大语言模型在列表排名中因位置偏差导致的性能不足问题。现有方法未能有效消除提示顺序对排名结果的影响,导致排名结果不稳定。

核心思路:论文提出的置换自一致性方法通过对输入提示中的列表进行多次打乱,生成多个不同的排名结果,并通过聚合这些结果来获得一个更为稳定和一致的排名,从而减少位置偏差的影响。

技术框架:整体流程包括:首先接收输入提示,然后多次打乱提示中的列表顺序,接着将每个打乱后的提示输入到LLM中,最后通过计算与所有生成排名的距离最小的中心排名来聚合结果。

关键创新:该方法的创新在于通过置换自一致性来消除位置偏差,理论上证明了在随机扰动下收敛到真实排名的能力,这与传统方法的直接排名输出形成了鲜明对比。

关键设计:在实现过程中,关键参数包括打乱次数、距离计算方法等,损失函数设计旨在最小化聚合排名与真实排名之间的差距,确保最终结果的准确性和一致性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,置换自一致性方法在五个列表排名数据集上显著提升了模型性能,GPT-3.5的得分提高了7-18%,而LLaMA v2(70B)则提高了8-16%。这些结果超越了之前的段落重排名技术,展示了该方法的有效性和优越性。

🎯 应用场景

该研究的潜在应用领域包括信息检索、推荐系统和自然语言处理等场景,能够有效提升基于大语言模型的排名任务的准确性和稳定性。随着大语言模型的广泛应用,该方法的实际价值将体现在更高效的信息获取和用户体验上,未来可能推动相关领域的进一步发展。

📄 摘要(原文)

Large language models (LLMs) exhibit positional bias in how they use context, which especially complicates listwise ranking. To address this, we propose permutation self-consistency, a form of self-consistency over ranking list outputs of black-box LLMs. Our key idea is to marginalize out different list orders in the prompt to produce an order-independent ranking with less positional bias. First, given some input prompt, we repeatedly shuffle the list in the prompt and pass it through the LLM while holding the instructions the same. Next, we aggregate the resulting sample of rankings by computing the central ranking closest in distance to all of them, marginalizing out prompt order biases in the process. Theoretically, we prove the robustness of our method, showing convergence to the true ranking in the presence of random perturbations. Empirically, on five list-ranking datasets in sorting and passage reranking, our approach improves scores from conventional inference by up to 7-18% for GPT-3.5 and 8-16% for LLaMA v2 (70B), surpassing the previous state of the art in passage reranking. Our code is at https://github.com/castorini/perm-sc.