Integrating deep learning in speech separation has revolutionized audio signal processing, impacting fields like speech recognition, audio-visual content creation, telecommunication, hearing aid technologies, etc. In time-frequency domain separation, models leverage amplitude and phase information while the waveform is used for training in the time-domain speech separation model. An emerging approach uses complex values, capturing intricate audio nuances for improved performance. Modern models prioritize speaker-independent separation, adapting to dynamic or unknown speaker identities. Their ability to simultaneously separate multiple speakers is crucial for applications like conference calls, overlapping dialogues, and surveillance. This review explores deep models in speech separation, offering insights into the time domain, and time-frequency domain strategies. We outline the current state of models and state-of-the-art learning methods for audio segmentation.

错误:搜索内容不能为空,请输入英文关键词
错误:关键词超出字数限制,请精简
高级检索

Deep Learning for Speech Separation: A Comprehensive Review

  • Duyen Nguyen Thi,
  • Ha Minh Tan,
  • Trung-Nghia Phung,
  • Duc-Quang Vu

摘要

Integrating deep learning in speech separation has revolutionized audio signal processing, impacting fields like speech recognition, audio-visual content creation, telecommunication, hearing aid technologies, etc. In time-frequency domain separation, models leverage amplitude and phase information while the waveform is used for training in the time-domain speech separation model. An emerging approach uses complex values, capturing intricate audio nuances for improved performance. Modern models prioritize speaker-independent separation, adapting to dynamic or unknown speaker identities. Their ability to simultaneously separate multiple speakers is crucial for applications like conference calls, overlapping dialogues, and surveillance. This review explores deep models in speech separation, offering insights into the time domain, and time-frequency domain strategies. We outline the current state of models and state-of-the-art learning methods for audio segmentation.