← Back to courses
Caplogy course
Data Engineering pour l'IA
IA pour l'IT
Construire et fiabiliser les pipelines de données nécessaires aux projets IA/ML
Niveau : Intermédiaire · Domaine : Data Engineering pour l'IA
1235 € HT / participant
- Format
- Présentiel / distanciel / hybride
- Duration
- 2 days (14 hours)
- Participants / session
- 10
- Session guarantee
- Session maintenue dès 4 inscrits
- Deadline
- Unlimited
Target audience
Data engineers, développeurs
Prerequisites
Bases de programmation (Python), SQL
Séquence 1 — Ce que l'IA exige des données
- Un pipeline analytique n'est pas un pipeline d'apprentissage : les exigences diffèrent
- Reproductibilité : pouvoir rejouer à l'identique le jeu d'un entraînement passé
- Traçabilité : d'où vient chaque colonne, et qui l'a transformée
- Les trois couches : brut, nettoyé, prêt pour l'entraînement
Séquence 2 — Ingestion et validation
- Sources : bases, fichiers, interfaces, flux — et ce que chacune impose
- Ingestion complète ou incrémentale : le critère, et le piège de l'incrémental
- Valider à l'entrée : schéma, types, plages, unicité, complétude
- Arrêter ou mettre en quarantaine : la décision se prend à l'écriture du contrat
- Le contrat de données entre producteur et consommateur
Séquence 3 — Transformation
- Transformations idempotentes : pourquoi rejouer deux fois doit donner le même résultat
- Jointures et duplication : l'erreur qui gonfle un jeu sans qu'on la voie
- Valeurs manquantes : les traiter, pas les effacer
- Construire des variables : ce qui se calcule en amont, ce qui se calcule au moment de la prédiction
Séquence 4 — Le temps
- Fraîcheur : ce qu'on promet au modèle, et comment on le mesure
- Historisation : conserver l'état à une date, et non le seul état courant
- La fuite temporelle : utiliser une information postérieure à l'instant de la prédiction
- Découper un jeu par le temps plutôt qu'au hasard, et pourquoi
Séquence 5 — Exploiter au quotidien
- Orchestration : dépendances, planification, reprise sur échec
- Idempotence et point de reprise : reprendre sans tout recalculer
- Surveiller : volumétrie, fraîcheur, taux de rejet, durée
- Documenter : le catalogue qui évite de reconstruire deux fois la même table
Dates & locations
| Start | End | Location |
|---|---|---|
| 08/02/2027 | 09/02/2027 | Présentiel / distanciel / hybride |
Practical information
- Enrolment terms and lead time
- Enrolment online or by email, up to 21 days before the session starts and subject to available seats — this lead time lets us send your joining instructions, then your access details for remote sessions. After that, write to us: we consider every request. For a tailored or on-site session, we reply within 48 working hours.
- Contact
- contact@caplogy.com — Contact us
- Accessibility and disability
- Poste de travail adapté sur demande (périphériques, agrandissement, synthèse vocale) ; supports d'exercice fournis avec les éléments de départ déjà en place ; temps majoré d'un tiers sur les travaux pratiques, avec possibilité de traiter deux parties sur trois ; extraits de code remis en fichier texte sélectionnable ; salle accessible PMR Our disability officer is available from enrolment through to the end of the course, to discuss the arrangements you need. Write to contact@caplogy.com.