NLP - Natural Language Processing. Prolongement lexical, représentation des termes à l'aide d'un vecteur numérique, contextualisée par le voisinage. Algorithme Word2Vec avec la librairie Gensim sous Python. Représentation des termes, calcul des similarités, identification des intrus. Utilisation des modèles pré-entraînés sur des grands corpus en Français. L'exemple Karim Benzema de la fin des années 2000, partenaires à l'Olympique Lyonnais (OL) et en Equipe de France. La méthode Doc2Vec, basé sur Word2Vec, pour une représentation des documents basée sur les termes. Identification des incongruités dans une représentation graphique. Lien possible avec la polarité des documents. Un aparté rapide enfin avec le modèle pré-entraîné BERT. Notebook Python + Corpus Imdb Reviews : http://tutoriels-data-mining.blogspot...
00:00 Présentation
04:16 Le corpus Imdb Reviews
05:26 Vérification des versions des packages
06:49 Importation et pré-traitement des données
12:08 Word2Vec avec Gensim
16:50 La propriété "wv" (word vector)
18:17 Liste des termes (tokens)
18:34 Vecteurs de représentation des termes
19:05 Coordonnées du terme "boring"
19:27 Similarité cosinus entre termes
21:30 Voisinages des termes
23:54 Recherche des incongruités
25:04 Représentation des termes dans le plan
27:55 Utilisation des modèles pré-entraînés en français
33:09 L'exemple Benzema avec l'OL et en Equipe de France
37:30 Doc2Vec avec Gensim
39:15 Documents tagués
40:33 Construction du dictionnaire
41:59 Coordonnées des termes (tokens)
42:08 Vecteur de représentation des documents
43:36 Scatterplot - Repérage des documents atypiques
46:47 Lien avec la polarité des documents