<p>Current AI approaches for cardiac diagnosis require condition-specific supervised learning with extensive labeled datasets, leading to fundamental scalability barriers. We developed an ECG-CLIP model, applying contrastive multimodal learning to enable zero-shot cardiac diagnosis from 12-lead ECGs using natural language supervision. Trained on 800,034 ECG-text pairs from MIMIC-IV-ECG, ECG-CLIP evaluated 18 cardiac conditions without condition-specific training. The model achieved superior performance for rhythm abnormalities (AUROC &gt; 0.90) compared to morphological conditions. External validation demonstrated robust AUROC rank consistency (<InlineEquation ID="IEq1"> <InlineMediaObject> <ImageObject Color="BlackWhite" FileRef="41746_2025_2074_Article_IEq1.gif" Format="GIF" Height="12" Rendition="HTML" Resolution="72" Type="Linedraw" Width="13" /> </InlineMediaObject> <EquationSource Format="TEX">\({\rm{\rho }}\)</EquationSource> <EquationSource Format="MATHML"><math> <mi mathvariant="normal">ρ</mi> </math></EquationSource> </InlineEquation> = 0.934), including remarkable zero-shot performance for pediatric patients despite no pediatric training cases. Direct comparison showed ECG-CLIP approached supervised models while providing broader diagnostic coverage. Demographic analysis revealed U-shaped age-dependent performance and condition-specific sex-age patterns. By eliminating dependence on labeled data, ECG-CLIP enables diagnosis of various cardiac conditions via text-based queries. This paradigm shift from rigid task-specific models to flexible unified systems addresses critical deployment barriers, potentially expanding global access to expert-level ECG interpretation.</p>

错误:搜索内容不能为空,请输入英文关键词
错误:关键词超出字数限制,请精简
高级检索

Diagnosis of cardiac conditions from 12-lead electrocardiogram through natural language supervision

  • Xue Zhou,
  • Tianhui Li,
  • Hiromasa Hayama,
  • Keijiro Nakamura,
  • Shing-Hong Liu,
  • Wenxi Chen,
  • Xin Zhu

摘要

Current AI approaches for cardiac diagnosis require condition-specific supervised learning with extensive labeled datasets, leading to fundamental scalability barriers. We developed an ECG-CLIP model, applying contrastive multimodal learning to enable zero-shot cardiac diagnosis from 12-lead ECGs using natural language supervision. Trained on 800,034 ECG-text pairs from MIMIC-IV-ECG, ECG-CLIP evaluated 18 cardiac conditions without condition-specific training. The model achieved superior performance for rhythm abnormalities (AUROC > 0.90) compared to morphological conditions. External validation demonstrated robust AUROC rank consistency ( \({\rm{\rho }}\) ρ  = 0.934), including remarkable zero-shot performance for pediatric patients despite no pediatric training cases. Direct comparison showed ECG-CLIP approached supervised models while providing broader diagnostic coverage. Demographic analysis revealed U-shaped age-dependent performance and condition-specific sex-age patterns. By eliminating dependence on labeled data, ECG-CLIP enables diagnosis of various cardiac conditions via text-based queries. This paradigm shift from rigid task-specific models to flexible unified systems addresses critical deployment barriers, potentially expanding global access to expert-level ECG interpretation.