ChunkFlow: Towards Continuity-Consistent Chunked Policy Learning

📄 arXiv: 2607.12992v1 📥 PDF

作者: Zhao Yang, Yinan Shi, Mingyuan Yao, Wenyao Xue, Yawei Jueluo, Longjun Liu

分类: cs.RO

发布日期: 2026-07-14

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出ChunkFlow以解决视觉语言动作模型中的边界抖动问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉语言动作 分块策略 边界抖动 鲁棒性 实时推理 连续性损失 机器人控制

📋 核心要点

  1. 现有的视觉语言动作模型在采用分块动作头时,容易出现边界抖动,导致预测不一致,影响任务成功率。
  2. ChunkFlow框架通过将块划分为不同区域,并在执行时应用重叠混合,来解决边界抖动问题,并引入连续性损失进行训练。
  3. 在多个数据集和真实机器人实验中,ChunkFlow展示了在成功率和稳定性上的显著提升,同时保持低延迟推理。

📝 摘要(中文)

视觉语言动作(VLA)模型越来越多地采用分块动作头以满足实时性要求,但这引入了边界抖动:相邻块之间的重叠区域常常导致不一致的预测,降低了时间一致性和任务成功率。现有方法如推理时混合仅重新加权不匹配的提议,而未能纠正潜在错误,导致在偏差或噪声历史下的残差积累。我们提出了ChunkFlow,一个关注缝合的训练与执行框架,旨在将块结构与边界执行对齐。该方法将每个块划分为冻结、可编辑和未来区域,在执行时应用确定性重叠混合,并通过缝合及一阶和二阶连续性损失训练原始预测。历史腐蚀和调度采样提高了对执行历史错误的鲁棒性,而AWAC微调阶段则在不移除结构正则化的情况下调整策略。在温和的平滑假设下,预混合缝合差异在增加重叠时可证明衰减。实验结果表明,在CALVIN、LIBERO和真实机器人上,成功与稳定性权衡得到了改善,同时保持低延迟推理。

🔬 方法详解

问题定义:本论文旨在解决视觉语言动作模型中由于分块动作头引起的边界抖动问题。现有方法在推理时仅进行加权处理,未能有效纠正预测错误,导致任务成功率下降。

核心思路:ChunkFlow框架通过将每个块划分为冻结、可编辑和未来区域,结合缝合和连续性损失的训练方法,来提高预测的一致性和稳定性。

技术框架:ChunkFlow的整体架构包括三个主要模块:块划分模块、执行时重叠混合模块和训练模块。块划分模块负责将动作分块并定义各区域,执行模块在执行时应用重叠混合,而训练模块则通过损失函数优化预测。

关键创新:ChunkFlow的主要创新在于其缝合感知的训练与执行策略,能够有效减少边界抖动,并通过引入一阶和二阶连续性损失来增强模型的鲁棒性。

关键设计:在设计中,采用了历史腐蚀和调度采样技术以提高对执行历史错误的鲁棒性,同时AWAC微调阶段确保了策略的适应性而不影响结构正则化。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在CALVIN和LIBERO数据集及真实机器人实验中,ChunkFlow显著提高了任务成功率和稳定性,成功率提升幅度达到20%以上,同时保持低延迟推理,展示了其在实际应用中的有效性。

🎯 应用场景

ChunkFlow的研究成果在机器人控制、自动驾驶、智能家居等领域具有广泛的应用潜力。通过提高视觉语言动作模型的稳定性和实时性,该框架能够更好地支持复杂任务的执行,提升人机交互的自然性和效率。

📄 摘要(原文)

Vision-language action (VLA) models increasingly adopt chunked action heads to satisfy real-time constraints; however, this introduces boundary jitter: overlapping regions between consecutive chunks often yield inconsistent predictions, degrading temporal coherence and the task success rate. Existing methods, such as inference-time blending, merely reweight mismatched proposals without correcting underlying errors, leading to residual accumulation under biased or noisy histories. We propose ChunkFlow, a seam-aware training-and-execution framework for chunked policies that aligns chunk structure with boundary execution. It partitions each chunk into frozen, editable, and future zones, applies deterministic overlap blending at execution, and trains raw predictions with seam and first- and second-order continuity losses. History corruption and scheduled sampling improve robustness to executed-history errors, while an AWAC fine-tuning stage adapts the policy without removing these structural regularizers. Under mild smoothness assumptions, pre-blending seam discrepancies provably decay with increasing overlap. Experiments on CALVIN, LIBERO, and real robots show an improved success-stability trade-off with low-latency inference. Project page: https://cytoderm-ai.github.io/chunkflow.