Test-Time Scaling via Error Localization
作者: Rajiv Shailesh Chitale, Rahul Madhavan, Taneesh Gupta, Deepanway Ghosal, Aravindan Raghuveer
分类: cs.LG
发布日期: 2026-07-23 (更新: 2026-07-24)
备注: 10 pages, 8 figures (With appendix: 27 pages, 11 figures)
💡 一句话要点
提出测试时错误定位的缩放方法以提升推理性能
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 推理优化 错误定位 大型语言模型 计算效率 自然语言处理
📋 核心要点
- 现有推理方法在计算效率上存在不足,常常丢弃有效的推理前缀,导致性能下降。
- TTEL算法通过错误定位技术,利用反馈信息进行token级别的错误分析,从而优化推理过程。
- 实验结果显示,TTEL在多个基准测试中显著优于现有方法,尤其是在生成token数量和推理准确性上。
📝 摘要(中文)
推理时计算的缩放已成为提升大型语言模型在复杂推理和编程任务中表现的可靠方法。然而,现有方法如独立采样和顺序多轮优化缺乏基于token的信用分配,导致计算效率低下,因为有效的推理前缀常常被丢弃。本文提出了测试时缩放通过错误定位(TTEL)算法,该算法利用固定或环境反馈进行token级错误定位。通过比较在知情反馈下的条件概率与无上下文基线,TTEL能够隔离错误发生的步骤。该算法随后截断轨迹并分支新的生成,最大限度地重用有效前缀。广泛的评估表明,TTEL在顺序推理领域建立了严格主导的Pareto前沿,表现为通过pass-at-k与生成token成本的对比。使用Qwen3-8B在LiveCodeBench上,TTEL在生成约一半token的情况下达到了71.0%的pass@64。
🔬 方法详解
问题定义:本文旨在解决现有推理方法在计算效率和有效性上的不足,尤其是独立采样和多轮优化缺乏token级信用分配的问题。
核心思路:TTEL算法通过利用固定或环境反馈进行token级错误定位,能够有效识别错误发生的具体步骤,从而优化推理过程,最大限度地重用有效的推理前缀。
技术框架:TTEL的整体架构包括三个主要模块:首先是错误定位模块,通过比较条件概率来识别错误步骤;其次是轨迹截断模块,截断错误发生后的生成过程;最后是新生成分支模块,基于有效前缀进行新的推理生成。
关键创新:TTEL的主要创新在于引入了token级错误定位机制,与传统方法相比,能够更精确地识别和利用有效推理前缀,从而提升推理效率和准确性。
关键设计:TTEL在设计上采用了条件概率比较的技术细节,确保在知情反馈下进行有效的错误定位。此外,算法在生成过程中优化了token的使用,减少了不必要的计算开销。
🖼️ 关键图片
📊 实验亮点
实验结果表明,TTEL在LiveCodeBench上使用Qwen3-8B模型时,达到了71.0%的pass@64,同时生成的token数量约为独立采样的一半(360.4k对735.0k)。在数学基准AIME-2025和HMMT-2025上,TTEL也显著优于其他测试时基线,展示了其强大的性能提升。
🎯 应用场景
该研究的潜在应用领域包括复杂推理任务、编程辅助工具以及其他需要高效推理的自然语言处理场景。TTEL算法的引入可以显著提高大型语言模型在实际应用中的表现,具有广泛的实际价值和未来影响。
📄 摘要(原文)
Scaling inference-time computation has emerged as a reliable method to improve the performance of large language models on complex reasoning and programming tasks. However, standard approaches such as independent sampling and sequential multi-turn refinement operate without token-level credit assignment, resulting in computational inefficiency, since valid reasoning prefixes are frequently discarded. In this work, we introduce Test-Time Scaling via Error Localization (TTEL), an inference-time algorithm that utilizes fixed or environment feedback to perform token-level error localization. By comparing conditional probabilities under informed feedback against a null-context baseline, TTEL isolates the step at which an error occurred. The algorithm then truncates the trajectory and branches a new generation, maximally reusing the valid prefix. Extensive evaluations demonstrate that TTEL establishes strictly dominating Pareto frontiers across sequential reasoning domains, measured by pass-at-k vs. generated-token cost. With Qwen3-8B on LiveCodeBench, TTEL attains a pass@64 of 71.0% while generating approximately half as many tokens as independent sampling (360.4k vs. 735.0k). Generalizing to math benchmarks AIME-2025 and HMMT-2025, TTEL cleanly outperforms competing test-time baselines across both Qwen3-8B and Qwen3-4B-Thinking-2507.