首页 /研究 /An improvement in audio-visual voice activity detection for automatic speech recognition
OTHER

An improvement in audio-visual voice activity detection for automatic speech recognition

Takami Yoshida, Kazuhiro Nakadai, Hiroshi G. Okuno

发表年份
2010
引用次数
6

摘要

Abstract. Noise-robust Automatic Speech Recognition (ASR) is essential for robots which are expected to communicate with humans in a daily environment. In such an environment, Voice Activity Detection (VAD) strongly affects the performance of ASR because there are many acoustically and visually noises. In this paper, we improved Audio-Visual VAD for our two-layered audio visual integration framework for ASR by using hangover processing based on erosion and dilation. We implemented proposed method to our audio-visual speech recognition system for robot. Empirical results show the effectiveness of our proposed method in terms of VAD.

关键词

Computer scienceSpeech recognitionVoice activity detectionAudio visualNoise (video)Dilation (metric space)Speech processingSpeaker recognitionAudio miningArtificial intelligence

相关论文

查看 OTHER 分类全部论文