reconnaissance automatique de la parole

Construction de modèles grapheme-to-phoneme dans le système de reconnaissance automatique de la parole à base de ressources linguistiques accessibles sur le Web

gestionnaire — Tue, 10 Oct 2023 13:11:11 +0000

Construction de modèles grapheme-to-phoneme dans le système de reconnaissance automatique de la parole à base de ressources linguistiques accessibles sur le Web gestionnaire mar 10/10/2023 - 15:11

Auteur

Hayoung SEO

Année

2022

Résumé

Le système de reconnaissance automatique de la parole d’aujourd’hui a atteint un niveau significatif avec les avancées technologiques. Cependant, les ressources linguistiques à grande échelle constituant les modèles linguistiques tels que modèle de prononciation pour améliorer la qualité de ce système ne peuvent être appréciées que par les langues les plus économiquement réalisables. Répondre à ces problèmes dépendants des ressources linguistiques est l’un des défis majeurs dans le domaine de la reconnaissance vocale. Ce mémoire a donc pour l’objectif de proposer une méthode de développement rapide et pertinent de modèle de prononciation à l’aide de Phonetisaurus, un convertisseur Grapheme to-phoneme (G2P), s’appuyant sur l’ensemble des dictionnaires accessibles sur le Web afin de capitaliser le dictionnaire de prononciation de qualité. Nous utiliserons Wiktionnaire, un dictionnaire multilingue accessible sur le Web, et Lexique4linguists, une base de données lexicale du français. Ensuite, nous comparons ces dictionnaires avec un autre dictionnaire de prononciation, qui est le résultat de la prédiction d’un modèle de phonétisation existant, et corrigeons le résultat de la prédiction avec une connaissance phonologique et un effort humain minimal. Enfin, en répartissant l’ensemble des trois dictionnaires, nous entraînons trois modèles de phonétisation et les évaluons avec notre méthode d’évaluation WPER (Weighted Phoneme Error Rate) basée sur l’algorithme de Weighted Levenshtein. Nous avons obtenu un modèle grapheme-to-phoneme avec une performance de 97,88 % d’accuracy.

Mots-clés

dictionnaire de prononciation

weighted-levenshtein

reconnaissance automatique de la parole

phonetisaurus

g2p

per

Fichier

SEO.pdf

Étude de la pertinence des évaluations des systèmes de reconnaissance automatique de la parole

gestionnaire — Wed, 03 Feb 2021 14:38:38 +0000

Étude de la pertinence des évaluations des systèmes de reconnaissance automatique de la parole gestionnaire mer 03/02/2021 - 15:38

Auteur

Lucie Warckol

Année

2020

Résumé

La Reconnaissance Automatique de la Parole est devenue un outil incontournable dans les nouvelles technologies, et elle est de plus en plus utilisée dans des applications quotidiennes (automobile, domotique, aviation, administration, médical . . . ). Ces applications étant de plus en plus pointues, spécifiques, exigeantes, les modèles de RAP doivent s’adapter pour accompagner cette évolution. Pour les rendre plus sophistiqués et plus robustes sont utilisées des méthodes d’évaluation qui doivent elles aussi s’adapter. Ce mémoire a pour objet d’étudier la pertinence de ces méthodes d’évaluation. À travers l’état de l’art sont d’abord décrits les principaux modèles de RAP, les traditionnels et les modernes, ainsi que les principales méthodes d’évaluation correspondantes. Ensuite l’outil Kaldi a été testé sur deux corpus. Mais l’expérience a mis en évidence la complexité du processus, et ses résultats n’ont pas été probants. En conclusion, les méthodes d’évaluation présentent encore des faiblesses (formatage des chiffres, entités nommées et ponctuation ...) face aux applications
d’aujourd’hui, mais la démocratisation des processus et le développement des techniques d’optimisation contribuent à leur perfectionnement.

Mots-clés

reconnaissance automatique de la parole

méthodes d’évaluation des systèmes de RAP

Kaldi

WER

Fichier

WARCKOL_Lucie_2020.pdf

Mise en place d’un système robuste de reconnaissance automatique de la parole appliqué au domaine médical

gestionnaire — Tue, 02 Feb 2021 10:54:09 +0000

Mise en place d’un système robuste de reconnaissance automatique de la parole appliqué au domaine médical gestionnaire mar 02/02/2021 - 11:54

Auteur

Lucía Ormaechea Grijalba

Année

2020

Résumé

Le bon fonctionnement des systèmes de reconnaissance automatique de la parole s’avère un défi complexe dans le contexte de la traduction speech-to-speech utilisée dans le domaine médical. Ce mémoire présente un travail de recherche qui vise à construire un système robuste de reconnaissance vocale dans le cadre du projet BabelDr, un outil de traduction vocale quasi instantanée qui a été mis en place dans les Hôpitaux Universitaires de Genève (HUG) afin de favoriser l’interaction médecin-patient lorsqu’aucune langue n’est partagée. Actuellement, sa technologie de reconnaissance de la parole est issue d’un système boîte noire fourni par une société privée. Le but principal de cette étude est de rompre la dépendance à un dispositif externe en se basant sur des outils libres et qui pourront évoluer selon les besoins des HUG. Pour cela, nous proposons un système de reconnaissance vocale pour le français appuyé sur la boîte à outils Kaldi. Celle-ci permet d’effectuer une transcription automatique en temps réel, utilisant des modèles acoustiques hybrides HMM-DNN et une modélisation linguistique adaptée au discours médical caractéristique du contexte d’urgences. À la lumière des résultats globaux observés, une importante amélioration est constatée par rapport à l’approche boîte noire précédemment utilisée.

Mots-clés

reconnaissance automatique de la parole

modélisation acoustique

modélisation linguistique

Kaldi

BabelDr

traduction vocale quasi instantanée

Fichier

memoireormaechea.pdf

Modèle de reconnaissance statistique pour le turc oral

Anonyme — Thu, 05 Nov 2020 23:00:00 +0000

Modèle de reconnaissance statistique pour le turc oral Anonyme (non vérifié) ven 06/11/2020 - 00:00

Année

2016

Résumé

Kristina est un agent social capable d'interagir avec les humains. Le système ASR a besoin de trois modèles: modèle de langage modèle acoustique et lexique de prononciation. Le but du travail est de collecter des données en ligne et de trouver les meilleures données pour KRISTINA. Nous utilisons deux façons différentes de comparaison: selection par perplexité et par recherche de l'information.

Mots-clés

traitement de la parole

reconnaissance automatique de la parole

modèle de langage

recherche de l'information

turc

polonais

Études lexico-morphosyntaxique des erreurs des systèmes de reconnaissance de la parole

Anonyme — Thu, 05 Nov 2020 23:00:00 +0000

Études lexico-morphosyntaxique des erreurs des systèmes de reconnaissance de la parole Anonyme (non vérifié) ven 06/11/2020 - 00:00

Auteur

Goryainova

Année

2013

Résumé

Le mémoire porte sur les études lexico-morphosyntaxiques des erreurs de système de reconnaissance de la parole. Le travail effectué consiste en différentes analyses des erreurs de transcription automatique de la parole. Les analyses en question représentent notamment une étude lexicale et morphosyntaxique des mots se trouvant dans les zones d'erreur de la transcription, dans le contexte gauche et le contexte droit. De même l'analyse lexicale a été réalisée sur les cas de substitution de mots dans des zones d'erreur. Ces analyses ont été complétées par le calcul de la distance d'édition des zones d'erreur. Au final, l'analyse lexicale et morphosyntaxique a été appliquée sur le corpus supplémentaire qui était annoté par des humains au niveau de gravité d'erreur.

Les résultats révélés ont été comparés avec ceux qui étaient observés dans des articles mentionnés.

Mots-clés

reconnaissance automatique de la parole

erreurs de transcription automatique

analyse lexicale et morphosyntaxique