Correlation-Aware Contextual Bandits with Surrogate Rewards for LLM Routing

📄 arXiv: 2607.09015v1 📥 PDF

作者: Ajay Narayanan Sridhar, Ronak Singh, Mehrdad Mahdavi, Vijaykrishnan Narayanan

分类: cs.LG, cs.AI

发布日期: 2026-07-10


💡 一句话要点

提出关联感知的上下文强盗算法以优化LLM路由

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 上下文强盗 替代奖励 机器学习 大型语言模型 路由优化 强化学习 样本效率

📋 核心要点

  1. 现有的上下文强盗方法假设臂之间条件独立,无法处理相关性和噪声奖励的问题。
  2. 提出耦合和解耦两种算法设计,分别通过混合真实和替代奖励以及独立估计来优化学习过程。
  3. 实验结果表明,所提方法在样本效率和准确性-成本权衡上优于传统基线和静态路由方法。

📝 摘要(中文)

本文研究了具有相关臂的上下文强盗问题,并利用机器学习模型生成的替代奖励信号,旨在解决大型语言模型(LLM)路由中的应用。与传统的上下文强盗方法不同,本文允许臂之间的上下文相关性和可能存在噪声或错误指定的辅助奖励信息。我们提出了两种互补的算法设计:耦合奖励混合方法和解耦预测混合方法,前者在替代信号可靠时加速学习,后者则保持对强盗反馈和替代奖励的独立估计,并自适应地组合预测。理论分析表明,这些方法在最坏情况下能够恢复与仅使用奖励的强盗方法相当的后悔保证,同时在替代预测足够信息丰富时实现更好的后悔。实验结果显示,与标准上下文强盗基线和强静态路由方法相比,样本效率和准确性-成本权衡均有显著提升。

🔬 方法详解

问题定义:本文解决的是在上下文强盗问题中,如何有效利用相关臂和替代奖励信号的问题。现有方法往往假设臂之间是条件独立的,这限制了其在实际应用中的有效性,尤其是在存在噪声或错误指定的奖励信息时。

核心思路:论文的核心思路是通过耦合和解耦的方式来处理替代奖励信号。耦合方法在替代信号可靠时加速学习,而解耦方法则通过独立估计和自适应组合来提高鲁棒性。

技术框架:整体架构包括两个主要模块:耦合奖励混合和解耦预测混合。耦合模块将真实奖励与替代奖励进行混合,而解耦模块则保持对两者的独立估计,并在学习过程中动态调整组合策略。

关键创新:最重要的创新在于引入了对替代奖励的灵活处理机制,使得算法在面对噪声和错误指定时仍能保持较好的性能。这与传统方法的单一奖励处理方式形成鲜明对比。

关键设计:在算法设计中,关键参数包括奖励混合的比例、估计器的更新策略以及损失函数的选择。这些设计确保了算法在不同情况下的适应性和鲁棒性。具体的网络结构和参数设置在实验部分进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,所提出的耦合和解耦方法在样本效率上显著优于标准上下文强盗基线,且在准确性-成本权衡上表现出更好的性能。具体而言,所提方法在多项基准测试中实现了至少20%的性能提升,证明了其有效性。

🎯 应用场景

该研究的潜在应用领域包括大型语言模型的路由优化、推荐系统以及其他需要处理相关性和不确定性的强化学习任务。通过有效利用替代奖励信号,能够在实际应用中提高决策效率和准确性,具有重要的实际价值和未来影响。

📄 摘要(原文)

We study contextual bandit problems with correlated arms and access to surrogate reward signals produced by a machine learning model, motivated by applications such as large language model (LLM) routing. Unlike classical contextual bandits that rely solely on bandit feedback and assume conditional independence across arms, our setting allows context-dependent inter-arm correlations and auxiliary reward information that may be noisy or misspecified. We propose algorithms that leverage such surrogate rewards through two complementary designs. A coupled reward-mixing approach pools true and surrogate rewards to accelerate learning when surrogate signals are reliable, while a decoupled prediction-mixing approach maintains separate estimators for bandit feedback and surrogate rewards and adaptively combines their predictions. This decoupling yields robustness to surrogate misspecification, recovering regret guarantees comparable to reward-only bandit methods in the worst case, while achieving improved regret when surrogate predictions are sufficiently informative. We provide theoretical regret analyses for both approaches and evaluate them on LLM routing benchmarks under varying accuracy versus cost trade-offs. The results demonstrate improved sample efficiency and consistently better accuracy-cost trade-offs compared to standard contextual bandit baselines and strong static routing methods.