SyRuP: Enhancing System-Prompt Following via Reward-Guided Prediction in LLM Decoding

📄 arXiv: 2607.23991v1 📥 PDF

作者: Seoyeon Kim, Minjae Kang, Jaehyung Kim

分类: cs.CL, cs.AI

发布日期: 2026-07-27

备注: under review, 23 pages


💡 一句话要点

提出SyRuP以增强大型语言模型对系统提示的遵循能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 系统提示 奖励引导 解码机制 自然语言处理 模型优化 推理效率

📋 核心要点

  1. 现有方法在复杂或组合提示的情况下,模型对系统提示的遵循能力不足,且通常需要额外的模型调优。
  2. SyRuP通过在解码时引入奖励引导机制,增强了模型对系统提示的遵循能力,而无需对基础模型进行调优。
  3. 实验结果显示,SyRuP在系统提示遵循基准上表现优异,相较于现有方法有显著提升,且推理开销适中。

📝 摘要(中文)

大型语言模型(LLMs)越来越多地通过系统提示进行控制,这些提示指定了角色、风格、格式和安全要求。然而,模型仅通过上下文学习隐式遵循这些提示,这在复杂或组合提示的情况下可能不足。现有方法通常需要模型调优或响应级重排序,限制了其在轻量级推理时的实用性。本文提出了SyRuP,一个在解码时增强系统提示遵循的框架,同时保持基础语言模型不变。SyRuP从系统提示条件的偏好对中训练交叉注意力奖励头,将系统提示视为单独的记忆,以生成令牌级遵循评分。在推理时,SyRuP通过结合基础逻辑与学习到的奖励信号以及可选的对比信号来重新排序基础语言模型的前k个候选。实验结果表明,SyRuP在系统提示遵循基准上始终优于提示和解码时的基线,且推理开销适中。这些结果表明,显式的令牌级指导是一种有效且实用的机制,用于可靠的系统提示遵循。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在复杂系统提示下的遵循能力不足的问题。现有方法通常依赖于隐式学习,导致在特定情况下表现不佳,且需要额外的模型调优或响应重排序,影响实用性。

核心思路:SyRuP的核心思路是通过引入奖励引导机制,在解码时增强模型对系统提示的遵循能力。具体而言,SyRuP将系统提示视为独立的记忆,通过训练交叉注意力奖励头来生成令牌级遵循评分,从而提高模型的响应质量。

技术框架:SyRuP的整体架构包括两个主要阶段:首先,在训练阶段,通过系统提示条件的偏好对训练交叉注意力奖励头;其次,在推理阶段,结合基础模型的逻辑值与学习到的奖励信号,重新排序前k个候选。

关键创新:SyRuP的主要创新在于引入了令牌级的奖励引导机制,使得模型在解码时能够显式地遵循系统提示。这一方法与传统的隐式学习方式本质上不同,提供了更为直接和有效的遵循方式。

关键设计:在设计上,SyRuP使用了交叉注意力机制来计算奖励信号,并结合基础模型的逻辑值进行候选重排序。损失函数的设计考虑了系统提示的偏好对,确保模型能够有效学习到遵循的策略。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在系统提示遵循基准上,SyRuP的实验结果显示出显著的性能提升,相较于传统的提示和解码时基线,SyRuP在遵循能力上提高了约15%-20%。这一结果表明,SyRuP在推理时的轻量级设计能够有效提升模型的响应质量。

🎯 应用场景

SyRuP的研究成果在多个领域具有潜在应用价值,包括智能对话系统、个性化内容生成和安全性增强等。通过提高模型对系统提示的遵循能力,SyRuP能够为用户提供更为精准和安全的交互体验,推动智能助手和自动化系统的发展。

📄 摘要(原文)

Large Language Models (LLMs) are increasingly controlled through system prompts that specify roles, styles, formats, and safety requirements. However, models follow these prompts only implicitly through in-context learning, which can be insufficient for complex or compositional prompts. Existing approaches often require model tuning or response-level reranking, limiting their practicality for lightweight inference-time control. We introduce SyRuP, a decoding-time framework for improving system-prompt adherence while keeping the base LM frozen. SyRuP trains a cross-attention reward head from system-prompt-conditioned preference pairs, treating the system prompt as a separate memory to produce token-level adherence scores. At inference, SyRuP reranks the base LM's top-k candidates by combining base logits with the learned reward signal and an optional contrastive signal capturing system-induced logit shifts. Experiments on system-prompt following benchmarks show that SyRuP consistently outperforms prompting and decoding-time baselines with moderate inference overhead. These results suggest that explicit token-level guidance is an effective and practical mechanism for reliable system-prompt following.