• Niveau d'étude

    BAC +5

  • ECTS

    3 crédits

  • Composante

    Sciences économiques, gestion, mathématiques et informatique

  • Volume horaire

    36h

  • Période de l'année

    Enseignement neuvième semestre

Description

Ce cours traite de l'ingénierie des données et des connaissances au service des grands modèles de langage (LLM). Il fait le pont entre bases de données relationnelles et non-relationnelles, graphes de connaissances et systèmes génératifs, autour des approches RAG et KG-RAG. Les étudiants apprennent à concevoir des architectures combinant données structurées, métadonnées et LLM afin de produire des systèmes fiables, traçables et explicables, en maîtrisant les enjeux de qualité des données, de provenance et de gouvernance. Le cours alterne apports conceptuels et TD outillés en Python, articulés autour des cas réalistes.

Lire plus

Objectifs

Donner une vision d'ensemble de l'écosystème données–connaissances–LLM et des compétences pratiques pour concevoir, mettre en œuvre et évaluer des architectures LLM ancrées dans des données structurées et non structurées. Le cours développe un regard critique sur les limites des LLM (hallucinations, obsolescence) et sur le rôle central de la donnée, de sa structure, de sa provenance et de son interprétabilité, jusqu'à la production d'une analyse d'architecture sur un cas concret.

Lire plus

Évaluation

Modalités : Mixte : CC + CT
SESSION 1 :
Contrôle Continu
• Type : Écrit, QCM, Oral
• Durée : 2h00
• Précisions : Une durée indicative de 2h00, susceptible d’être ajustée en fonction des contraintes pédagogiques, matérielles ou logistiques, dans le respect des M3C applicables.

Contrôle Terminal
• Type : Écrit
• Durée : 2h00
• Précisions : Une durée indicative de 2h00, susceptible d’être ajustée en fonction des contraintes pédagogiques, matérielles ou logistiques, dans le respect des M3C applicables.

Régime Dérogatoire
• Type : Écrit
• Durée : 2h00
• Précisions : Une durée indicative de 2h00, susceptible d’être ajustée en fonction des contraintes pédagogiques, matérielles ou logistiques, dans le respect des M3C applicables.

SESSION 2 :
• Type : Écrit
• Durée : 2h00
• Précisions : Une durée indicative de 2h00, susceptible d’être ajustée en fonction des contraintes pédagogiques, matérielles ou logistiques, dans le respect des M3C applicables.

Utilisation de l'intelligence artificielle :
L’utilisation de l’Intelligence Artificielle est interdite lors des évaluations.

Lire plus

Heures d'enseignement

  • CMCM18h
  • TDTD18h

Compétences visées

  • Expliquer les limites des LLM (hallucinations, obsolescence) et l'importance de la donnée, de la structure, de la provenance et de l'interprétabilité.
  • Concevoir une architecture LLM + données adaptée à un besoin (RAG, KG-RAG, agents outillés) et en justifier les choix.
  • Mettre en place, au moins à petite échelle, un pipeline RAG : indexation, chunking, embeddings, retrieval, re-ranking, filtrage, analyse d'échecs.
  • Concevoir des solutions de recherche hybride (SQL + embeddings) et raisonner sur performance, coûts et métadonnées.
  • Modéliser un graphe de connaissances métier et articuler KG + retrieval + génération (robustesse, explicabilité).
  • Comprendre les principes de l'apprentissage de représentations pour données structurées et savoir mobiliser un modèle de fondation pour tableaux (table foundation model) afin d'encoder, comparer ou enrichir des données tabulaires.
  • Analyser l'impact de données incomplètes, bruitées ou multimodales sur un système IA et proposer des mitigations.
  • Utiliser un LLM comme outil d'ingénierie des données (nettoyage, annotation, compréhension de schéma, génération de requêtes) en identifiant risques et limites.
  • Produire une analyse critique et une synthèse d'architecture sur un cas réaliste.
Lire plus