lda

Détection automatique de l’innovation lexicale dans des corpus diachroniques

Résumé
Le figement lexical est un phénomène central du langage et les expressions figées représentent une importante proportion du lexique de toute langue. Leur détection demeure un des enjeux du TAL. Après avoir effectué un résumé détaillé de l’état de l’art dans ce domaine, ce mémoire présente une méthode non supervisée permettant de détecter la formation de nouvelles expressions figées au sein de corpus diachroniques d’articles de presse en français. On utilisera un modèle LDA (allocation de Dirichlet latente) pour extraire les expressions les plus représentatives du corpus que l’on considèrera comme des candidats au figement. Puis, partant du principe établi par les linguistes qu’une expression est figée si ses termes n’admettent pas d’être remplacés par des synonymes, nous utiliserons des plongements de mots pour établir une liste d’expressions synonymes pour chaque expression candidate. Enfin, nous calculerons l’évolution au fil du corpus du taux d’apparition d’une expression par rapport à ses « synonymes » (nous dresserons automatiquement pour chaque candidat une liste de potentiels synonymes en remplaçant les mots de l’expression candidate par des mots dont la représentation en vecteur est similaire).

Application des méthodes de l’extraction de thématique sur un corpus homogène dans le domaine des parfums d’ambiance

Résumé
Nous avons étudié deux méthodes pour faire l’extraction automatique de thématique : la Latent semantic Indexing (LSI, ou Latent Semantic Analysis, LSA) et la Latent Dirichlet Allocation (LDA). Elles ont été appliquées sur un corpus composé des commentaires des consommateurs britanniques dans le domaine des parfums d’ambiance. Comme ces commentaires sont assez courts et homogènes dans leur contenu, nous avons pris en considération ces particularités et expérimenté des stratégies de la sélection des traits linguistiques et du paramétrage pour essayer d’améliorer la performance de ces deux méthodes. Nous avons aussi étudié une méthode pour évaluer automatiquement la cohérence des thèmes extraits. Elle a été mise en pratique pour évaluer les résultats obtenus avec la LSI/LSA et la LDA.