Semantic-aware Temporal Channel-wise Attention for Cardiac Function Assessment

📄 arXiv: 2310.05428v1 📥 PDF

作者: Guanqi Chen, Guanbin Li

分类: cs.CV

发布日期: 2023-10-09

备注: Accepted by ISBI 2022 (oral)


💡 一句话要点

提出语义感知时序通道注意力以改善心脏功能评估

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 心脏功能评估 左心室分割 时序通道注意力 半监督学习 智能医疗

📋 核心要点

  1. 现有方法在心脏功能评估中未能充分关注左心室区域及其运动变化,导致评估准确性不足。
  2. 本文提出了一种结合左心室分割任务的半监督学习范式,并引入时序通道注意力模块以增强运动信息的建模。
  3. 在斯坦福数据集上,本文方法实现了MAE提升0.22,RMSE提升0.26,$R^2$提升1.9%的显著效果。

📝 摘要(中文)

心脏功能评估旨在根据超声心动图视频预测左心室射血分数(LVEF),要求模型关注心动周期中左心室的变化。现有基于视频的方法未能充分关注左心室区域及其运动引起的变化。本文提出了一种半监督辅助学习范式,结合左心室分割任务,增强左心室区域的表示学习。为更好地建模运动信息的重要性,本文引入了时序通道注意力(TCA)模块,激活描述运动的通道。此外,TCA模块通过将左心室的分割图作为输入进行语义感知,聚焦于左心室的运动模式。最后,采用基于锚点的分类和回归方法预测LVEF。我们的方案在斯坦福数据集上实现了最先进的性能,MAE提升0.22,RMSE提升0.26,$R^2$提升1.9%。

🔬 方法详解

问题定义:本文旨在解决如何从超声心动图视频中准确自动评估心脏功能的问题。现有方法未能有效关注左心室区域及其运动变化,导致评估结果不够准确。

核心思路:论文提出了一种半监督辅助学习范式,结合左心室分割任务,以增强左心室区域的表示学习。同时,引入时序通道注意力模块,专注于运动信息的建模。

技术框架:整体架构包括左心室分割、时序通道注意力模块和基于锚点的分类与回归方法。首先进行左心室的分割,然后通过TCA模块提取运动特征,最后进行LVEF的预测。

关键创新:最重要的技术创新在于引入了语义感知的时序通道注意力模块,利用左心室的分割图作为输入,聚焦于左心室的运动模式。这一设计显著提升了模型对运动信息的敏感性。

关键设计:在模型设计中,采用了特定的损失函数以平衡分割与回归任务,同时在TCA模块中设置了通道激活机制,以增强运动特征的表达能力。网络结构经过优化,以提高整体性能和稳定性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,本文方法在斯坦福数据集上实现了MAE提升0.22,RMSE提升0.26,$R^2$提升1.9%。这些结果表明,所提出的方法在心脏功能评估任务中显著优于现有基线,展示了其有效性和潜力。

🎯 应用场景

该研究具有广泛的应用潜力,特别是在智能辅助医疗领域。通过提高心脏功能评估的准确性,能够为临床医生提供更可靠的决策支持,进而改善患者的治疗效果和预后。此外,相关技术可扩展至其他医学影像分析任务中,推动智能医疗的发展。

📄 摘要(原文)

Cardiac function assessment aims at predicting left ventricular ejection fraction (LVEF) given an echocardiogram video, which requests models to focus on the changes in the left ventricle during the cardiac cycle. How to assess cardiac function accurately and automatically from an echocardiogram video is a valuable topic in intelligent assisted healthcare. Existing video-based methods do not pay much attention to the left ventricular region, nor the left ventricular changes caused by motion. In this work, we propose a semi-supervised auxiliary learning paradigm with a left ventricular segmentation task, which contributes to the representation learning for the left ventricular region. To better model the importance of motion information, we introduce a temporal channel-wise attention (TCA) module to excite those channels used to describe motion. Furthermore, we reform the TCA module with semantic perception by taking the segmentation map of the left ventricle as input to focus on the motion patterns of the left ventricle. Finally, to reduce the difficulty of direct LVEF regression, we utilize an anchor-based classification and regression method to predict LVEF. Our approach achieves state-of-the-art performance on the Stanford dataset with an improvement of 0.22 MAE, 0.26 RMSE, and 1.9% $R^2$.