← Retour aux formations
Formation Caplogy

IA multimodale

IA expert

Concevoir des modèles et applications combinant texte, image, son et vidéo

Niveau : Expert · Domaine : IA multimodale

1820 HT / participant
Demander des infos
IA multimodale
Modalité
Présentiel / distanciel / hybride
Durée
2 jours (14 heures)
Participants / session
8
Maintien de session
Session maintenue dès 4 inscrits
Date limite
Illimité

Public concerné

Data scientists, ingénieurs ML confirmés

Prérequis

Deep Learning, NLP (ou équivalent)

Dans le parcours

Séquence 1 — L'espace commun

  • Représenter une image et un texte dans le même espace : l'idée fondatrice
  • L'entraînement contrastif : rapprocher les paires, éloigner le reste
  • Ce que cela permet : chercher une image par du texte, et l'inverse
  • Ce que cela ne permet pas : raisonner sur une scène complexe

Séquence 2 — Les familles d'architectures

  • Encodeurs séparés avec projection commune : recherche et appariement
  • Fusion précoce et fusion tardive : ce que chacune conserve
  • Modèles de langage dotés d'un encodeur visuel : description et question-réponse
  • Génération conditionnée : de la consigne textuelle à l'image ou au son

Séquence 3 — Données et alignement

  • Construire des paires : légendes, transcriptions, annotations — et leur qualité
  • Le bruit d'alignement : la légende qui ne décrit pas l'image
  • Déséquilibre entre modalités et effondrement d'une modalité à l'entraînement
  • Droits sur les images et les voix : la question à traiter avant la technique

Séquence 4 — Évaluer

  • Recherche : rappel aux premiers rangs, sur un jeu de référence construit à part
  • Description : les métriques automatiques et ce qu'elles manquent
  • Question-réponse visuelle : l'écueil de la réponse juste par hasard
  • L'évaluation humaine : quand elle devient indispensable, et comment la cadrer

Séquence 5 — Risques et coûts

  • Biais visuels : ce que les corpus d'images véhiculent
  • Données personnelles dans les images : visages, plaques, documents en arrière-plan
  • Coût d'inférence : la modalité visuelle est la plus chère, et de loin
  • Traçabilité des contenus générés et marquage

Dates & lieux

DébutFinLieu
22/03/2027 23/03/2027 Présentiel / distanciel / hybride

Informations pratiques

Modalités et délais d'accès
Inscription en ligne ou par courriel, jusqu'à 21 jours avant le début de la session et dans la limite des places disponibles — ce délai nous permet de vous adresser votre convocation, puis vos accès si la session est à distance. Passé ce délai, écrivez-nous : nous étudions chaque demande. Pour une session sur mesure ou en intra, nous répondons sous 48 heures ouvrées.
Accessibilité et situation de handicap
Chaque schéma et chaque visualisation font l'objet d'une description textuelle équivalente, fournie dans les notes du support ; les jeux d'images sont accompagnés de leurs annotations en texte ; poste adapté et temps majoré d'un tiers sur demande ; salle accessible PMR Notre référent handicap est mobilisable dès l'inscription et jusqu'à la fin de la formation : il étudie avec vous les aménagements nécessaires. Écrivez-nous à contact@caplogy.com.