Déploiement d'un modèle de clustering (classification automatique, non-supervisée) sous la forme d'une Web App développée à l'aide de la technologie « streamlit » pour Python. Le « modèle » correspond en réalité à un processus encapsulé dans une structure Pipeline de « scikit-learn ». Il comprend un mécanisme d'imputation des données manquantes (SimpleImputer), la standardisation des données (StandardScaler) et la méthode K-Means (KMeans). Il est utilisable en déploiement c.-à-d. il peut s'appliquer en généralisation sur des individus supplémentaires sans qu'il soit nécessaire d'avoir accès aux données d'entraînement. Elaboration enfin d'une application streamlit permettant de saisir les caractéristiques d'un individu, d'obtenir son groupe d'affectation, la distance aux barycentres des groupes, de disposer d'indications sur le mécanisme d'affectation à travers les valeurs prises par les variables.
Notebook et données : http://tutoriels-data-science.blogspo...
Page de cours : https://cours-machine-learning.blogsp...
00:00 Déploiement dans un processus Clustering
04:25 Les sempiternelles données "Iris" en non-supervisé
05:08 Démarrage du notebook, chargement et inspection des données
05:55 Définition et entraînement du pipeline
10:22 Obtention des groupes d'appartenance des individus
11:00 Interprétation : moyennes conditionnelles sur données standardisées
13:37 Radarplot pour identifier les "profils" des clusters
17:04 Exportation du pipeline pour le déploiement (package "dill")
17:40 Liste des fichiers utilisés pour le déploiement
19:42 Code source de l'application streamlit
24:42 Lancement de l'application
25:19 Utilisation (saisie, lecture des résultats, interprétation de l'affectation)