FedCMAS: Cross-Modal Contrastive Learning and Shapley Value-Driven Client Selection in Multimodal Federated Learning
摘要
Federated Learning (FL) enables privacy-preserving distributed learning by uploading model parameters instead of raw data. With the rise of multimodal data, Multimodal Federated Learning (MFL) integrates FL with multimodal learning to collaboratively process heterogeneous data. However, existing MFL approaches face challenges from modality disparities and data heterogeneity, with random client selection hindering effective multimodal integration. This paper proposes a multimodal federated learning framework based on cross-modal contrastive learning and approximate Shapley value-driven client selection (FedCMAS). FedCMAS aligns modal representations locally and employs differential privacy for secure transmission. On the server side, it prioritizes high-contribution clients using Shapley values. Experiments on MSCOCO and Flickr30K demonstrate that FedCMAS surpasses baseline methods in cross-modal retrieval tasks, with ablation studies validating each component’s role in enhancing performance.