Speaker adaptation of deep neural network acoustic models using Gaussian mixture model framework in … - SLUB Dresden

Media type: Text; Electronic Thesis; E-Book

Title: Speaker adaptation of deep neural network acoustic models using Gaussian mixture model framework in automatic speech recognition systems ; Utilisation de modèles gaussiens pour l'adaptation au locuteur de réseaux de neurones profonds dans un contexte de modélisation acoustique pour la reconnaissance de la parole

Contributor: Tomashenko, Natalia [Author]

Published: theses.fr, 2017-12-01

Language: English

Keywords: Deep learning ; Apprentissage adaptatif au locuteur (SAT) ; Acoustic models ; Modèles acoustiques ; Speaker adaptation ; Paramètres acoustiques dérivés de GMM (GMMD) ; Speaker adaptive training ; Gaussian mixture model (GMM) ; Adaptation au locuteur ; Apprentissage profond ; Deep neural network (DNN) ; Réseaux de neurones profonds ; GMM-derived (GMMD) features ; Reconnaissance automatique de la parole (RAP) ; Modèles de mélanges Gaussiens (GMM) ; Automatic speech recognition (ASR)

Origination:

Footnote: Diese Datenquelle enthält auch Bestandsnachweise, die nicht zu einem Volltext führen.

Description: Les différences entre conditions d'apprentissage et conditions de test peuvent considérablement dégrader la qualité des transcriptions produites par un système de reconnaissance automatique de la parole (RAP). L'adaptation est un moyen efficace pour réduire l'inadéquation entre les modèles du système et les données liées à un locuteur ou un canal acoustique particulier. Il existe deux types dominants de modèles acoustiques utilisés en RAP : les modèles de mélanges gaussiens (GMM) et les réseaux de neurones profonds (DNN). L'approche par modèles de Markov cachés (HMM) combinés à des GMM (GMM-HMM) a été l'une des techniques les plus utilisées dans les systèmes de RAP pendant de nombreuses décennies. Plusieurs techniques d'adaptation ont été développées pour ce type de modèles. Les modèles acoustiques combinant HMM et DNN (DNN-HMM) ont récemment permis de grandes avancées et surpassé les modèles GMM-HMM pour diverses tâches de RAP, mais l'adaptation au locuteur reste très difficile pour les modèles DNN-HMM. L'objectif principal de cette thèse est de développer une méthode de transfert efficace des algorithmes d'adaptation des modèles GMM aux modèles DNN. Une nouvelle approche pour l'adaptation au locuteur des modèles acoustiques de type DNN est proposée et étudiée : elle s'appuie sur l'utilisation de fonctions dérivées de GMM comme entrée d'un DNN. La technique proposée fournit un cadre général pour le transfert des algorithmes d'adaptation développés pour les GMM à l'adaptation des DNN. Elle est étudiée pour différents systèmes de RAP à l'état de l'art et s'avère efficace par rapport à d'autres techniques d'adaptation au locuteur, ainsi que complémentaire. ; Differences between training and testing conditions may significantly degrade recognition accuracy in automatic speech recognition (ASR) systems. Adaptation is an efficient way to reduce the mismatch between models and data from a particular speaker or channel. There are two dominant types of acoustic models (AMs) used in ASR: Gaussian mixture models (GMMs) ...

Access State: Open Access

Search in field:

Recently searched for: