Deep Interaction: An Efficient Human-AI Interaction Method for Large Reasoning Models

📄 arXiv: 2607.14049v1 📥 PDF

作者: Hefeng Zhou, Jinxuan Zhang, Jiong Lou, Yuxin Liu, Chaochao Lu, Jingjing Qu, Jie Li

分类: cs.AI

发布日期: 2026-07-15


💡 一句话要点

提出深度交互方法以高效纠正大型推理模型的错误

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 人机交互 推理模型 深度学习 错误纠正 链式思维 蒸馏训练 大型语言模型

📋 核心要点

  1. 现有方法在处理大型语言模型的推理错误时,通常需要重新生成响应,导致重复错误或用户手动标记错误步骤的低效。
  2. 本文提出的深度交互方法允许用户直接编辑错误响应,精确纠正推理错误,同时保留正确的推理步骤。
  3. 实验结果显示,该方法在STEM任务中的纠正成功率提高超过25%,并且令牌使用量减少约40%,显著提升了效率。

📝 摘要(中文)

链式思维(CoT)推理的出现显著提升了大型语言模型(LLMs)处理复杂多步骤任务的能力。然而,当出现错误时,现有的交互方法通常需要重新生成响应,可能再次出错,或者用户需要费力地标记错误步骤。为了解决这一问题,本文提出了一种高效的人机干预机制,称为深度交互(Deep Interaction),允许直接编辑原始响应,纠正错误部分,同时保留准确的推理步骤。我们将编辑后的CoT精炼为蒸馏提示,从而引导LLM沿着修正后的推理路径进行推理。实验结果表明,该方法在STEM任务推理中的纠正成功率提高了25%以上,且令牌使用量减少了约40%。

🔬 方法详解

问题定义:本文解决的是大型语言模型在推理过程中出现错误时的纠正效率问题。现有方法往往需要重新生成响应,导致错误重复或用户手动干预的低效。

核心思路:深度交互方法通过允许用户直接编辑错误的响应,精准纠正推理错误,同时保留正确的推理步骤,从而提高了纠正效率。

技术框架:该方法的整体架构包括用户编辑模块、错误识别模块和蒸馏提示生成模块。用户可以直接对错误部分进行修改,系统随后将编辑后的内容转化为蒸馏提示,引导LLM进行正确推理。

关键创新:最重要的创新点在于引入了直接编辑机制,使用户能够在推理过程中实时纠正错误,而不是依赖于重新生成响应。这一设计显著提高了纠正的准确性和效率。

关键设计:在技术细节上,本文对编辑后的CoT进行了精炼,形成蒸馏提示,确保引导LLM沿着修正后的推理路径进行推理。具体的参数设置和损失函数设计未在摘要中详细说明,需参考原文获取更多信息。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,深度交互方法在STEM任务推理中的纠正成功率提高超过25%,同时令牌使用量减少约40%。这一显著提升相较于基线方法,展示了该方法在实际应用中的有效性和高效性。

🎯 应用场景

该研究的潜在应用领域包括教育、自动问答系统和智能助手等,能够有效提升人机交互的效率和准确性。未来,深度交互方法可能会在更广泛的推理任务中得到应用,推动大型语言模型的实用化进程。

📄 摘要(原文)

The emergence of Chain-of-Thought (CoT) reasoning has significantly enhanced the ability of large language models (LLMs) to tackle complex, multi-step tasks. However, when errors occur, current interaction approaches typically involve re-generating another response that may make mistakes again, or users laboriously flag the faulty step in follow-up turns that may get responses followed by similar errors recurring. To address this issue, we propose an efficient human intervention mechanism for precisely correcting reasoning errors in LLMs, termed Deep Interaction. Our approach enables direct editing of the original response, allowing erroneous parts to be corrected while preserving accurate reasoning steps. We refine the edited CoT into a distilled prompt, which then steers the LLM along the corrected reasoning path. Experimental results show that our method achieves over a 25% improvement in correction success rate and reduces token usage by approximately 40% on STEM tasks reasoning compared to baseline approaches.