NLP - Natural Language Processing. Topic model : algorithme LDA - Latent Dirichlet Allocation. Utilisation de la librairie Gensim pour Python, après une préparation des documents à l'aide de la boîte à outils NLTK - Natural Language Toolkit, pour Python également. Objectif : extraction de thématiques (topics) décrits par les termes (tokens). Réduction de dimensionnalité par la représentation des documents dans l'espace des topics, ouvrant la porte à des post-traitements de machine learning. Ici, simple représentation graphique des documents, illustrés par leur polarité (positif, négatif), dans l'espace des topics pris par paires à l'aide de la bibliothèque graphique Seaborn. Utilisation de la base "Imdb Reviews". Notebook Python + Corpus : http://tutoriels-data-mining.blogspot...
00:00 Topic Modeling - Gensim
03:23 Le corpus Imdb Reviews
04:45 Jupyter Notebook - Versions des packages NLTK et GENSIM
06:30 Chargement du corpus
07:23 Pré-traitement du corpus (casse, ponctuations)
10:42 Tokenisation avec NLTK
14:28 Lemmatisation
18:32 Retrait des stopwords
21:09 Retrait des tokens trop courts
22:06 Dictionnaire des mots - Représentation bag-of-words
27:10 LDA - Latent dirichlet allocation
29:12 Description succincte des topics
29:43 Description détaillée du topic n°0
31:50 Topics pour lesquels pèse le terme "bad"
32:30 Description des documents dans l'espace des topics
38:40 Représentation graphique
40:00 Tuning des hyperparamètres de LDA