Techniques pour le choix du nombre de composantes en ACP (analyse en composantes principales). (1) Les seuils directement calculés : règle du coude, règle de Kaiser-Gutman, règle de Karlis-Saporta-Spinaki, test des bâtons brisés (Legendre). (2) Les procédures basées sur des méthodes de Monte-Carlo (simulation). Deux axes : analyse parallèle où l'on définit des données H0 par randomisation (les relations entre les individus et les variables sont perturbées aléatoirement), on en déduit des valeurs seuils à comparer avec les valeurs propres observées ; l'analyse bootstrap où, cette fois-ci, toujours par simulation, on cherche à obtenir les distributions des valeurs propres pour pouvoir en déduire leurs intervalles de confiance. Traitements sous Python avec la librairie "scientisttools".
Page GitHub de Scientitsttools : https://github.com/enfantbenidedieu/s...
Page de cours : https://cours-machine-learning.blogsp...
00:00 Préambule - Nombre de composantes à retenir en ACP
06:18 Description des données "Protein"
07:45 Démarrage du notebook
08:12 Importation et description des données
11:20 ACP avec "scientisttools" - Valeurs propres
12:38 Graphiques et différents seuils pour le choix des composantes
18:50 Analyse parallèle (via la perturbation aléatoire des données)
30:00 Graphique - Courbe des valeurs propres et seuils issus de l'analyse parallèle
32:40 Analyse bootstrap
36:15 Graphique - Intervalle de confiance des valeurs propres