Test-Time Scaling via Error Localization
作者: Rajiv Shailesh Chitale, Rahul Madhavan, Taneesh Gupta, Deepanway Ghosal, Aravindan Raghuveer
分类: cs.LG
发布日期: 2026-07-23
备注: 10 pages, 8 figures (With appendix: 27 pages, 11 figures)
💡 一句话要点
提出测试时错误定位的缩放方法以提升推理效率
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 推理效率 错误定位 大型语言模型 环境反馈 序列推理
📋 核心要点
- 现有推理方法如独立采样缺乏token级的错误定位,导致有效推理前缀的浪费。
- TTEL算法通过环境反馈进行token级错误定位,识别错误发生的具体步骤并重用有效前缀。
- 在LiveCodeBench上,TTEL在生成token数量减少的情况下,达到了71.0%的pass@64,显著优于基线方法。
📝 摘要(中文)
推理时间计算的缩放已成为提升大型语言模型在复杂推理和编程任务中性能的可靠方法。然而,现有方法如独立采样和顺序多轮优化缺乏基于token的信用分配,导致计算效率低下,因为有效的推理前缀常常被丢弃。本文提出了测试时缩放通过错误定位(TTEL)算法,该算法利用固定或环境反馈进行token级错误定位。通过将有信息反馈下的条件概率与无上下文基线进行比较,TTEL能够识别错误发生的步骤。该算法随后截断轨迹并分支出新的生成,最大限度地重用有效前缀。广泛的评估表明,TTEL在顺序推理领域建立了严格主导的Pareto前沿,在pass-at-k与生成token成本的比较中表现优异。
🔬 方法详解
问题定义:本文旨在解决现有推理方法在推理时间计算中的低效问题,特别是缺乏token级错误定位导致的有效推理前缀浪费。
核心思路:TTEL算法通过利用固定或环境反馈进行token级错误定位,识别错误发生的步骤,从而截断无效轨迹并重用有效前缀,提升推理效率。
技术框架:TTEL的整体架构包括两个主要模块:错误定位模块和轨迹重用模块。错误定位模块通过比较条件概率来识别错误步骤,轨迹重用模块则负责截断并生成新的推理轨迹。
关键创新:TTEL的核心创新在于引入了token级错误定位机制,能够有效识别并重用有效的推理前缀,与传统方法相比显著提高了推理效率。
关键设计:TTEL在设计上采用了固定反馈和环境反馈的结合,使用条件概率比较来实现错误定位,确保了算法在不同推理任务中的适应性和有效性。具体的参数设置和损失函数设计在实验中经过优化,以实现最佳性能。
🖼️ 关键图片
📊 实验亮点
TTEL在LiveCodeBench上实现了71.0%的pass@64,同时生成的token数量约为独立采样的一半(360.4k对735.0k)。在数学基准AIME-2025和HMMT-2025上,TTEL也显著优于其他测试时基线,展示了其在多种任务中的优越性能。
🎯 应用场景
该研究的潜在应用领域包括复杂推理任务、编程辅助工具和自然语言处理等。TTEL算法的高效性和准确性使其在实际应用中能够显著提升大型语言模型的推理能力,具有广泛的实际价值和未来影响。
📄 摘要(原文)
Scaling inference-time computation has emerged as a reliable method to improve the performance of large language models on complex reasoning and programming tasks. However, standard approaches such as independent sampling and sequential multi-turn refinement operate without token-level credit assignment, resulting in computational inefficiency, since valid reasoning prefixes are frequently discarded. In this work, we introduce Test-Time Scaling via Error Localization (TTEL), an inference-time algorithm that utilizes fixed or environment feedback to perform token-level error localization. By comparing conditional probabilities under informed feedback against a null-context baseline, TTEL isolates the step at which an error occurred. The algorithm then truncates the trajectory and branches a new generation, maximally reusing the valid prefix. Extensive evaluations demonstrate that TTEL establishes strictly dominating Pareto frontiers across sequential reasoning domains, measured by pass-at-k vs. generated-token cost. With Qwen3-8B on LiveCodeBench, TTEL attains a pass@64 of 71.0% while generating approximately half as many tokens as independent sampling (360.4k vs. 735.0k). Generalizing to math benchmarks AIME-2025 and HMMT-2025, TTEL cleanly outperforms competing test-time baselines across both Qwen3-8B and Qwen3-4B-Thinking-2507.