Deep Learning for Speech Separation: A Comprehensive Review
摘要
Integrating deep learning in speech separation has revolutionized audio signal processing, impacting fields like speech recognition, audio-visual content creation, telecommunication, hearing aid technologies, etc. In time-frequency domain separation, models leverage amplitude and phase information while the waveform is used for training in the time-domain speech separation model. An emerging approach uses complex values, capturing intricate audio nuances for improved performance. Modern models prioritize speaker-independent separation, adapting to dynamic or unknown speaker identities. Their ability to simultaneously separate multiple speakers is crucial for applications like conference calls, overlapping dialogues, and surveillance. This review explores deep models in speech separation, offering insights into the time domain, and time-frequency domain strategies. We outline the current state of models and state-of-the-art learning methods for audio segmentation.