PoTRE: Test-Time Reasoning inspired by Cognitive Heterogeneity
作者: Anmol Kankariya, Sercan Ö. Arık
分类: cs.AI, cs.CL
发布日期: 2026-07-22
备注: Accepted at Transactions on Machine Learning Research (TMLR 2026)
期刊: Transactions on Machine Learning Research, 2026
💡 一句话要点
提出PoTRE框架以解决复杂推理问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 复杂推理 长远规划 异构代理 任务自适应 多视角推理
📋 核心要点
- 现有大型语言模型在复杂推理和长远规划方面表现不佳,且在面对新抽象时容易失效。
- 本文提出PoTRE框架,通过四个异构代理解耦推理过程,以提高推理性能和适应性。
- PoTRE在HLE基准上取得49.92%的准确率,超越了之前的最佳成绩,展示了其有效性。
📝 摘要(中文)
尽管大型语言模型(LLMs)在许多任务中表现出色,但在需要长远规划和迭代错误修正的复杂推理方面常常面临挑战。此外,标准的单流提示在模型遇到新抽象或严格领域约束时显得脆弱。为此,本文提出了PoTRE(多拓扑推理集成),一个异构框架,将推理过程解耦为四个代理:对抗精炼代理、层次战略规划代理、谱搜索代理和直接链代理。最终的任务自适应聚合层动态整合这些视角,通过最终候选选择、语义合成或神经符号验证,生成稳健的全局解决方案。我们在三个前沿基准上评估了PoTRE,HLE的准确率达到了49.92%,超越了之前的最佳官方得分。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在复杂推理和长远规划中的不足,尤其是在面对新抽象和严格约束时的脆弱性。
核心思路:PoTRE框架通过将推理过程分解为多个异构代理,利用不同的推理策略来增强模型的适应性和准确性。这样的设计使得模型能够从多种视角进行推理,提升整体性能。
技术框架:PoTRE的整体架构包括四个主要代理:对抗精炼代理负责优化推理结果,层次战略规划代理进行长远规划,谱搜索代理探索多种可能性,直接链代理则提供简单直接的推理路径。最终的任务自适应聚合层将这些代理的输出进行整合,形成最终决策。
关键创新:PoTRE的最大创新在于其异构代理的设计,允许模型在推理过程中结合多种策略,而不是依赖单一的推理流。这种方法在处理复杂问题时表现出更高的灵活性和准确性。
关键设计:在设计中,PoTRE采用了动态聚合机制,通过候选选择和语义合成等方式来优化最终输出。此外,模型在推理过程中使用了较少的推理令牌,保持了高效性。
🖼️ 关键图片
📊 实验亮点
在HLE基准测试中,PoTRE达到了49.92%的准确率,超越了之前的最佳官方得分,展示了其在复杂推理任务中的优越性能。与传统的同质基线相比,PoTRE在使用相似或更少的推理令牌的情况下,显著提高了推理效果。
🎯 应用场景
该研究的潜在应用领域包括教育评估、金融分析和复杂决策支持等场景。通过提高推理能力,PoTRE能够为这些领域提供更准确的分析和建议,具有重要的实际价值和未来影响。
📄 摘要(原文)
While Large Language Models (LLMs) excel at many tasks, they frequently struggle with complex reasoning that requires long-horizon planning and iterative error correction. Furthermore, standard single-stream prompting proves brittle when models encounter novel abstractions or rigorous domain constraints. We introduce PoTRE (Poly-Topological Reasoning Ensembles), a heterogeneous framework that decouples inference into four agents: (1) Adversarial Refinement Agent, (2) Hierarchical strategic Planning Agent, (3) Spectrum Search Agent, and (4) Direct Chain Agent. A final Task-Adaptive Aggregation Layer dynamically reconciles these perspectives -- via final candidate selection, semantic synthesis, or neuro-symbolic verification -- to produce a robust global solution. We evaluate PoTRE on three frontier benchmarks: ARC-AGI-2, Humanity's Last Exam (HLE), and PRBench Finance. PoTRE achieves state-of-the-art accuracy of 49.92% on HLE, surpassing the previous best official score. We demonstrate that this architectural heterogeneity achieves improved reasoning performance using similar or fewer inference tokens compared to heavily scaled homogeneous baselines.