Niveau d'étude
BAC +5
ECTS
3 crédits
Composante
Sciences économiques, gestion, mathématiques et informatique
Volume horaire
32h
Période de l'année
Enseignement neuvième semestre
Description
Ce cours offre un approfondissement théorique et pratique des méthodes fondamentales du Statistical et Machine Learning. Les étudiants y acquièrent les outils nécessaires pour comprendre le compromis biais-variance, maîtriser les stratégies de régularisation, construire des modèles ensemblistes performants et interpréter leurs résultats dans des contextes applicatifs — notamment en actuariat et data science. Le cours s'appuie sur des données réelles et des implémentations en Python et R.
CONTENU DU COURS
- Cadre général de l'apprentissage supervisé : risque théorique et empirique, fléau de la dimension, compromis biais-variance, validation croisée et sélection de modèle.
- Régularisation et sélection de variables : régression Ridge, Lasso et Elastic Net ; applications en grande dimension.
- Méthodes arborescentes : arbres de décision (algorithme CART), élagage, critères d'impureté ; Bootstrap et Bagging ; Forêts Aléatoires (Random Forests) et importance des variables.
- Méthodes ensemblistes séquentielles : AdaBoost, Gradient Boosting, XGBoost et LightGBM ; régularisation, early stopping ; SHAP values et interprétabilité.
- Introduction aux réseaux de neurones : perceptron multicouche, rétropropagation, régularisation (dropout, batch normalization.
- Applications métier : tarification en assurance, détection de fraude.
Objectifs
- Analyser la structure d'un jeu de données pour identifier les défis algorithmiques et choisir une stratégie de modélisation adaptée.
- Maîtriser le cadre théorique du compromis biais-variance et des techniques de régularisation.
- Sélectionner et justifier la méthode d'apprentissage supervisé la plus appropriée à un problème donné, en tenant compte des contraintes de performance et d'interprétabilité.
- Implémenter de manière autonome les algorithmes du cours en Python ou R.
- Évaluer et comparer rigoureusement les modèles via des protocoles de validation croisée et des métriques adaptées.
- Interpréter les résultats d'un modèle complexe.
Évaluation
Modalités : CC
SESSION 1 :
Contrôle Continu
• Type : Écrit, Dossier
• Durée :
Régime Dérogatoire
• Type : Écrit, Dossier
• Durée : 2h00
SESSION 2 :
• Type : Écrit
• Durée : 2h00
Utilisation de l'intelligence artificielle :
Dans le cadre de cet EC, l’usage de l’IA pour aider à la réalisation des travaux de contrôle continu soumis à évaluation est interdit. Vous n’avez pas le droit de faire appel à une IA générative à des fins de documentation, recherche d’idées, construction, rédaction ou édition (hors usages de recherche web augmentée, de correction orthographique et syntaxique).
Heures d'enseignement
- CMCM16h
- TDTD16h
