← Retour aux formations
Formation Caplogy

Data Engineering pour l'IA

IA pour l'IT

Construire et fiabiliser les pipelines de données nécessaires aux projets IA/ML

Niveau : Intermédiaire · Domaine : Data Engineering pour l'IA

1235 HT / participant
Demander des infos
Data Engineering pour l'IA
Modalité
Présentiel / distanciel / hybride
Durée
2 jours (14 heures)
Participants / session
10
Maintien de session
Session maintenue dès 4 inscrits
Date limite
Illimité

Public concerné

Data engineers, développeurs

Prérequis

Bases de programmation (Python), SQL

Séquence 1 — Ce que l'IA exige des données

  • Un pipeline analytique n'est pas un pipeline d'apprentissage : les exigences diffèrent
  • Reproductibilité : pouvoir rejouer à l'identique le jeu d'un entraînement passé
  • Traçabilité : d'où vient chaque colonne, et qui l'a transformée
  • Les trois couches : brut, nettoyé, prêt pour l'entraînement

Séquence 2 — Ingestion et validation

  • Sources : bases, fichiers, interfaces, flux — et ce que chacune impose
  • Ingestion complète ou incrémentale : le critère, et le piège de l'incrémental
  • Valider à l'entrée : schéma, types, plages, unicité, complétude
  • Arrêter ou mettre en quarantaine : la décision se prend à l'écriture du contrat
  • Le contrat de données entre producteur et consommateur

Séquence 3 — Transformation

  • Transformations idempotentes : pourquoi rejouer deux fois doit donner le même résultat
  • Jointures et duplication : l'erreur qui gonfle un jeu sans qu'on la voie
  • Valeurs manquantes : les traiter, pas les effacer
  • Construire des variables : ce qui se calcule en amont, ce qui se calcule au moment de la prédiction

Séquence 4 — Le temps

  • Fraîcheur : ce qu'on promet au modèle, et comment on le mesure
  • Historisation : conserver l'état à une date, et non le seul état courant
  • La fuite temporelle : utiliser une information postérieure à l'instant de la prédiction
  • Découper un jeu par le temps plutôt qu'au hasard, et pourquoi

Séquence 5 — Exploiter au quotidien

  • Orchestration : dépendances, planification, reprise sur échec
  • Idempotence et point de reprise : reprendre sans tout recalculer
  • Surveiller : volumétrie, fraîcheur, taux de rejet, durée
  • Documenter : le catalogue qui évite de reconstruire deux fois la même table

Dates & lieux

DébutFinLieu
08/02/2027 09/02/2027 Présentiel / distanciel / hybride

Informations pratiques

Modalités et délais d'accès
Inscription en ligne ou par courriel, jusqu'à 21 jours avant le début de la session et dans la limite des places disponibles — ce délai nous permet de vous adresser votre convocation, puis vos accès si la session est à distance. Passé ce délai, écrivez-nous : nous étudions chaque demande. Pour une session sur mesure ou en intra, nous répondons sous 48 heures ouvrées.
Accessibilité et situation de handicap
Poste de travail adapté sur demande (périphériques, agrandissement, synthèse vocale) ; supports d'exercice fournis avec les éléments de départ déjà en place ; temps majoré d'un tiers sur les travaux pratiques, avec possibilité de traiter deux parties sur trois ; extraits de code remis en fichier texte sélectionnable ; salle accessible PMR Notre référent handicap est mobilisable dès l'inscription et jusqu'à la fin de la formation : il étudie avec vous les aménagements nécessaires. Écrivez-nous à contact@caplogy.com.