LOCUS: Task-Aware Low-Rank Post-Training for Token-Efficient Language Generation
作者: Dongfang Zhao
分类: cs.CL, cs.AI, cs.LG
发布日期: 2026-09-10
💡 一句话要点
提出LOCUS以解决语言生成中的输出序列长度问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 低秩适应 语言生成 模型优化 自然语言处理 对话系统
📋 核心要点
- 现有的大型语言模型在生成过程中,输出序列长度的增加直接导致服务成本上升,且标准的偏好对齐方法未能有效提升实用性。
- LOCUS方法通过选择任务感知的低秩适应子空间,旨在在不改变对齐损失的情况下,最小化输出令牌的成本。
- 实验结果表明,LOCUS在Pythia-2.8B上续写长度减少了最多39.84%,在Qwen2.5-3B上减少了14.87%至17.58%,且仅更新了极少量的模型参数。
📝 摘要(中文)
大型语言模型的服务成本与输出序列长度直接相关,然而标准的偏好对齐往往会导致响应冗长而不提高实用性。本文研究了后训练更新的参数化如何影响生成长度,提出了一种低秩适应方法LOCUS,选择任务感知的低秩子空间,以在保持效用约束的前提下最小化输出令牌成本。在此子空间内,后训练保留了原有的偏好目标,同时冻结了主干网络。通过对比Anthropic HH-RLHF对话偏好,评估了两个约3B的解码器主干,Pythia-2.8B和Qwen2.5-3B,结果显示LOCUS在Pythia-2.8B上将续写长度减少了最多39.84%,在Qwen2.5-3B上减少了14.87%至17.58%,同时仅更新了0.24%至0.28%的模型参数,内部偏好诊断没有实质性变化。
🔬 方法详解
问题定义:本文旨在解决大型语言模型生成过程中输出序列长度过长的问题,现有方法在偏好对齐时往往导致响应冗长,增加了计算成本。
核心思路:LOCUS方法通过引入低秩适应的概念,选择一个任务感知的低秩子空间,以在保持效用的前提下,减少输出令牌的数量,从而降低生成成本。
技术框架:LOCUS的整体架构包括选择低秩子空间、冻结主干网络并进行后训练,确保在优化过程中保留原有的偏好目标。
关键创新:LOCUS的主要创新在于其低秩适应的选择机制,能够在不改变对齐损失的情况下有效减少生成长度,这与传统方法的本质区别在于其关注于参数更新的效率和生成的经济性。
关键设计:在参数设置上,LOCUS仅更新了0.24%至0.28%的模型参数,损失函数保持原有偏好目标不变,网络结构上则采用了冻结的主干网络以确保生成的稳定性。
🖼️ 关键图片
📊 实验亮点
在实验中,LOCUS在Pythia-2.8B上实现了续写长度最多减少39.84%的显著效果,而在Qwen2.5-3B上减少了14.87%至17.58%。这些结果表明,LOCUS在仅更新0.24%至0.28%的模型参数的情况下,能够有效降低生成成本,同时保持内部偏好的稳定性。
🎯 应用场景
LOCUS方法在对话生成、文本摘要等自然语言处理任务中具有广泛的应用潜力。通过有效控制输出长度,该方法可以降低计算资源的消耗,提高生成效率,适用于需要实时响应的场景,如智能客服和对话系统。未来,LOCUS有望推动更高效的语言生成模型的发展,提升用户体验。
📄 摘要(原文)
Large language model serving costs scale directly with output sequence length, yet standard preference alignment often inflates response verbosity without improving utility. We study whether the parameterization of post-training updates affects generation length: low-rank subspaces alter sequence length without modifying the alignment loss. We present LOCUS, a method that selects a task-aware low-rank adaptation subspace to minimize output-token cost subject to a utility constraint. Within this subspace, post-training retains the native preference objective with a frozen backbone. Across Anthropic HH-RLHF dialogue preferences, we evaluate two $\sim$3B decoder backbones, Pythia-2.8B and Qwen2.5-3B, against protocol-matched full-parameter DPO and DrDPO branches and the released SamPO checkpoint. LOCUS reduces continuation length by up to 39.84\% on Pythia-2.8B and by 14.87--17.58\% on Qwen2.5-3B while updating only 0.24--0.28\% of model parameters, with no material change in the internal preference diagnostic.