An Explainable Biomedical Foundation Model via Large-Scale Concept-Enhanced Vision–Language Pretraining
Published in Nature Biomedical Engineering 2026, 2026
In this work, we present ConceptCLIP, an explainable biomedical foundation model pretrained on MedConcept-23M with joint image–text and region–concept alignment, enabling strong medical image understanding together with concept-level explanations across diverse imaging modalities.
Recommended citation: Yuxiang Nie*, Sunan He*, Yequan Bie*, Yihui Wang, Zhixuan Chen, Shu Yang, Zhiyuan Cai, Linshan Wu, Hongmei Wang, Xi Wang, Ngai Shing Cheng, Luyang Luo, Mingxiang Wu, Haibo Jin, Xian Wu, Ronald Cheong Kin Chan, Yuk Ming Lau, Zhengyu Zhang, Sushan Xiao, Can Yang, Yinghua Zhao, Xiaohui Duan, Li Zhang, Li Liang, Yefeng Zheng, Pranav Rajpurkar, and Hao Chen. 2026. An explainable biomedical foundation model via large-scale concept-enhanced vision–language pretraining. Nature Biomedical Engineering. https://doi.org/10.1038/s41551-026-01764-x. (* equal contribution) https://www.nature.com/articles/s41551-026-01764-x
