FusionDanceNet for real time dance recognition using multisensor fusion and domain regularized learning
摘要
Real-time dance recognition is central to interactive training, immersive media, and digital choreography analytics, yet it remains difficult due to fine grained motion structure, heterogeneous wearable signals, and distribution shifts across dancers, styles, and capture setups. In practice, recognition systems must fuse multi-location IMUs and optional foot pressure cues while operating under strict latency constraints and maintaining reliability when modalities are missing or sensor conditions drift. This study addresses these challenges with FusionDanceNet, a multisensor fusion and domain regularized architecture that couples cross modal gated fusion with multi-scale temporal encoding and factorized spatio-temporal attention to capture both micro step dynamics and longer rhythmic phrases. To improve portability across datasets, FusionDanceNet integrates a domain regularized objective that reduces domain-specific nuisance variation while preserving dataset specific class discrimination. For deployable feedback, this study further provides sensor level attribution and quantifies explanation fidelity using a deletion-based metric. FusionDanceNet is evaluated on three domains, ImperialDance, CMU-MoCap (inertial), and AIST++ (inertial) using accuracy, Macro-F1, latency, robustness under tempo, drift, and node drop perturbations, and explanation fidelity (EF). FusionDanceNet achieves 96.6% accuracy and 94.2% Macro-F1 on ImperialDance with 8.3 ms latency, and maintains 95.2% and 92.8% on CMU-MoCap and 95.0% and 92.5% on AIST++ with comparable latency. Robustness remains stable at 0.87 to 0.88 and explanation fidelity (EF) consistently high at 0.76 to 0.78, supporting real-time, interpretable dance recognition under domain shift.