← Back to courses
Caplogy course

Data Engineering pour l'IA

IA pour l'IT

Construire et fiabiliser les pipelines de données nécessaires aux projets IA/ML

Niveau : Intermédiaire · Domaine : Data Engineering pour l'IA

1235 HT / participant
Request information
Data Engineering pour l'IA
Format
Présentiel / distanciel / hybride
Duration
2 days (14 hours)
Participants / session
10
Session guarantee
Session maintenue dès 4 inscrits
Deadline
Unlimited

Target audience

Data engineers, développeurs

Prerequisites

Bases de programmation (Python), SQL

Séquence 1 — Ce que l'IA exige des données

  • Un pipeline analytique n'est pas un pipeline d'apprentissage : les exigences diffèrent
  • Reproductibilité : pouvoir rejouer à l'identique le jeu d'un entraînement passé
  • Traçabilité : d'où vient chaque colonne, et qui l'a transformée
  • Les trois couches : brut, nettoyé, prêt pour l'entraînement

Séquence 2 — Ingestion et validation

  • Sources : bases, fichiers, interfaces, flux — et ce que chacune impose
  • Ingestion complète ou incrémentale : le critère, et le piège de l'incrémental
  • Valider à l'entrée : schéma, types, plages, unicité, complétude
  • Arrêter ou mettre en quarantaine : la décision se prend à l'écriture du contrat
  • Le contrat de données entre producteur et consommateur

Séquence 3 — Transformation

  • Transformations idempotentes : pourquoi rejouer deux fois doit donner le même résultat
  • Jointures et duplication : l'erreur qui gonfle un jeu sans qu'on la voie
  • Valeurs manquantes : les traiter, pas les effacer
  • Construire des variables : ce qui se calcule en amont, ce qui se calcule au moment de la prédiction

Séquence 4 — Le temps

  • Fraîcheur : ce qu'on promet au modèle, et comment on le mesure
  • Historisation : conserver l'état à une date, et non le seul état courant
  • La fuite temporelle : utiliser une information postérieure à l'instant de la prédiction
  • Découper un jeu par le temps plutôt qu'au hasard, et pourquoi

Séquence 5 — Exploiter au quotidien

  • Orchestration : dépendances, planification, reprise sur échec
  • Idempotence et point de reprise : reprendre sans tout recalculer
  • Surveiller : volumétrie, fraîcheur, taux de rejet, durée
  • Documenter : le catalogue qui évite de reconstruire deux fois la même table

Dates & locations

StartEndLocation
08/02/2027 09/02/2027 Présentiel / distanciel / hybride

Practical information

Enrolment terms and lead time
Enrolment online or by email, up to 21 days before the session starts and subject to available seats — this lead time lets us send your joining instructions, then your access details for remote sessions. After that, write to us: we consider every request. For a tailored or on-site session, we reply within 48 working hours.
Accessibility and disability
Poste de travail adapté sur demande (périphériques, agrandissement, synthèse vocale) ; supports d'exercice fournis avec les éléments de départ déjà en place ; temps majoré d'un tiers sur les travaux pratiques, avec possibilité de traiter deux parties sur trois ; extraits de code remis en fichier texte sélectionnable ; salle accessible PMR Our disability officer is available from enrolment through to the end of the course, to discuss the arrangements you need. Write to contact@caplogy.com.