FreeFlow: A Bias-free Hierarchical Transformer for Optical Flow Estimation
作者: Vladislav Bargatin, Alexander Yakovenko, Khaled Abud, Dmitriy Vatolin
分类: cs.CV
发布日期: 2026-09-10
备注: Accepted at ECCV 2026. Project page: https://github.com/msu-video-group/freeflow
DOI: 10.1007/978-3-032-37132-4_11
💡 一句话要点
提出FreeFlow以解决光流估计中的偏差问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 光流估计 层次化变换器 注意力机制 计算效率 深度学习
📋 核心要点
- 现有光流估计方法依赖于特定的归纳偏差,限制了模型的灵活性和表达能力。
- FreeFlow采用层次化变换器架构,使用单一的前馈编码器-解码器,避免了流特定组件。
- 在主要基准测试中,FreeFlow实现了最先进的性能,同时保持了内存效率。
📝 摘要(中文)
光流估计方法通常依赖于特定任务的归纳偏差,如相关体积、特征扭曲和迭代细化等,以达到高精度。尽管有效,这些偏差限制了模型的表达能力,并导致更复杂的管道和额外的计算成本。本文提出了FreeFlow,一种不包含任何流特定组件的层次化变换器,采用单一的前馈编码器-解码器结构。FreeFlow结合了三种注意力变体:局部处理的窗口注意力、跨窗口信息交换的偏移窗口注意力,以及在降低分辨率下操作的全局注意力。该架构自然地随着模型容量的增加而扩展,从小型到大型变体均能实现一致的精度提升。尽管缺乏标准的归纳偏差,FreeFlow在主要基准测试上取得了最先进的结果,包括Sintel(0.68/1.48 EPE在Clean/Final)、KITTI-2015(3.23 Fl-all)和Spring(3.192 1px),同时在1080p推理时保持内存效率。
🔬 方法详解
问题定义:光流估计通常依赖于特定的归纳偏差,这限制了模型的灵活性和表达能力,导致更复杂的计算管道和额外的计算成本。
核心思路:FreeFlow通过构建一个不包含流特定组件的层次化变换器,采用单一的前馈编码器-解码器结构,旨在提高模型的表达能力和计算效率。
技术框架:FreeFlow结合了三种注意力机制:窗口注意力用于局部处理,偏移窗口注意力用于跨窗口信息交换,以及在降低分辨率下操作的全局注意力。这种设计使得模型能够自然扩展,适应不同的容量需求。
关键创新:FreeFlow的主要创新在于其不依赖于传统的光流估计归纳偏差,采用统一的变换器架构,显著简化了模型设计。
关键设计:模型的关键设计包括三种注意力机制的有效结合,确保了在不同分辨率下的信息处理能力,同时保持了内存效率,适用于1080p的推理任务。
🖼️ 关键图片
📊 实验亮点
FreeFlow在多个主要基准测试中表现出色,Sintel数据集上达到了0.68/1.48 EPE(Clean/Final),KITTI-2015上为3.23 Fl-all,Spring数据集上为3.192 1px,展现了显著的性能提升,同时在1080p推理时保持了内存效率。
🎯 应用场景
FreeFlow在光流估计领域具有广泛的应用潜力,能够用于视频分析、自动驾驶、增强现实等场景。其高效的计算性能和优越的准确性使其在实时处理和高分辨率图像分析中具备实际价值,未来可能推动相关技术的发展与应用。
📄 摘要(原文)
Optical flow methods typically rely on task-specific inductive biases, such as correlation volumes, feature warping, and iterative refinement, among others, to reach high accuracy. While effective, such biases constrain the model to predefined heuristics, which can limit its expressivity and lead to more complex pipelines and additional computational cost. We present FreeFlow, a hierarchical transformer built without any flow-specific components, using instead a single feed-forward encoder--decoder. FreeFlow combines three attention variants: window attention for local processing, shifted-window attention for cross-window information exchange, and a global attention operating at a reduced resolution. The resulting architecture scales naturally with model capacity, enabling a consistent accuracy gain from small to large variants. Despite the absence of standard inductive biases, FreeFlow achieves state-of-the-art results on major benchmarks, including Sintel (0.68/1.48 EPE on Clean/Final), KITTI-2015 (3.23 Fl-all), and Spring (3.192 1px), while remaining memory efficient at 1080p inference.