Motion-Conditioned Multi-View Fusion for Myocardial Infarction Localization from Echocardiography

📄 arXiv: 2607.15268v1 📥 PDF

作者: Guang Yang, Wentian Xu, Siyu Wang, Betty Raman, Lei Li, Vicente Grau

分类: cs.CV

发布日期: 2026-07-16


💡 一句话要点

提出MCF-Net以解决心肌梗死定位中的视图依赖性模糊问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 心肌梗死 超声心动图 多视图融合 运动分析 深度学习 医学影像 稀疏监督

📋 核心要点

  1. 现有的心肌运动分析方法依赖于手工特征或密集监督,导致标注需求高且适用性差。
  2. MCF-Net通过运动引导的多视图融合框架,结合心肌运动线索与视觉特征,实现心肌梗死的精准定位。
  3. 在段级MI定位任务中,MCF-Net取得72.4%的F1分数和84.9%的准确率,显著优于现有的运动、视觉和融合基线方法。

📝 摘要(中文)

心肌梗死(MI)是全球主要的死亡原因之一,超声心动图(Echo)是评估MI的重要手段。现有基于学习的方法多依赖手工特征或密集监督,导致应用受限。本文提出MCF-Net,一个新颖的运动引导多视图融合框架,通过融合心肌运动线索与基础模型表示来实现心肌梗死的定位。该方法在极少监督下建模心脏运动,利用运动导出的软掩膜增强特征,最终在段级MI定位任务中取得72.4%的F1分数和84.9%的准确率,超越了现有的基准方法。

🔬 方法详解

问题定义:本文旨在解决心肌梗死定位中的视图依赖性模糊问题。现有方法多依赖于单一视图,导致在不同视图下的定位不可靠,尤其是在心尖视图中。

核心思路:MCF-Net通过运动引导的多视图融合,将心肌运动线索与基础模型的视觉特征相结合,从而提高心肌梗死的定位精度。该设计旨在减少对密集标注的依赖,利用稀疏监督进行有效的运动建模。

技术框架:MCF-Net的整体架构包括两个主要模块:首先,使用预训练的EchoPrime模型从双视图中提取视觉特征;其次,通过运动导出的软掩膜增强特征,并在多视图间进行运动条件融合,以精细化预测。

关键创新:MCF-Net的创新之处在于其运动条件融合机制,能够在不覆盖强视觉线索的情况下,整合运动与视觉信息。这一方法显著提高了在复杂情况下的定位准确性。

关键设计:该方法采用极少的监督信息,仅需一个标注的模板帧进行点跟踪,避免了密集标签的需求。同时,运动导出的软掩膜为难以定位的心肌区域提供了粗略的空间先验,增强了特征的选择性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

MCF-Net在段级心肌梗死定位任务中取得了72.4%的F1分数和84.9%的准确率,显著优于现有的运动、视觉和融合基线方法,展示了其在复杂心脏影像分析中的有效性和优势。

🎯 应用场景

该研究的潜在应用领域包括心脏病学中的超声影像分析,能够为临床医生提供更为准确的心肌梗死定位工具,提升诊断效率和准确性。未来,该方法有望推广至其他医学影像领域,促进多模态数据的融合与分析。

📄 摘要(原文)

Myocardial infarction (MI) remains a leading cause of mortality worldwide. Echocardiography (Echo) is a widely available modality for MI assessment, where regional wall motion abnormality is a key indicator. Prior learning based methods for myocardial motion analysis often use handcrafted descriptors or densely supervised estimation, but the need for extensive annotation limits applicability. Foundation models have recently improved vision-based Echo analysis; however, most methods operate on single views and segment-level localization remains unreliable under view-dependent ambiguity, especially in apical views. To address this, we propose MCF-Net, a novel motion-guided multi-view fusion framework that fuses myocardial motion cues with foundation model representations to localize infarction. Visual features are extracted using EchoPrime, a pretrained Echo foundation model shared across dual views. Cardiac motion is modeled with extremely sparse supervision: a single annotated template frame is transferred across videos to initialize point tracking, avoiding dense labels. Motion-derived segment-aware soft masks provide coarse spatial priors that selectively enhance features for challenging myocardial segments. A motion-conditioned fusion mechanism then integrates motion and vision across views, refining predictions without overriding strong appearance cues. On segment-level MI localization, MCF-Net achieves 72.4\% F1 and 84.9\% accuracy, outperforming state-of-the-art motion-only, vision-only, and fusion baselines.