← Back to courses
Caplogy course

IA multimodale

IA expert

Concevoir des modèles et applications combinant texte, image, son et vidéo

Niveau : Expert · Domaine : IA multimodale

1820 HT / participant
Request information
IA multimodale
Format
Présentiel / distanciel / hybride
Duration
2 days (14 hours)
Participants / session
8
Session guarantee
Session maintenue dès 4 inscrits
Deadline
Unlimited

Target audience

Data scientists, ingénieurs ML confirmés

Prerequisites

Deep Learning, NLP (ou équivalent)

In the learning path

Séquence 1 — L'espace commun

  • Représenter une image et un texte dans le même espace : l'idée fondatrice
  • L'entraînement contrastif : rapprocher les paires, éloigner le reste
  • Ce que cela permet : chercher une image par du texte, et l'inverse
  • Ce que cela ne permet pas : raisonner sur une scène complexe

Séquence 2 — Les familles d'architectures

  • Encodeurs séparés avec projection commune : recherche et appariement
  • Fusion précoce et fusion tardive : ce que chacune conserve
  • Modèles de langage dotés d'un encodeur visuel : description et question-réponse
  • Génération conditionnée : de la consigne textuelle à l'image ou au son

Séquence 3 — Données et alignement

  • Construire des paires : légendes, transcriptions, annotations — et leur qualité
  • Le bruit d'alignement : la légende qui ne décrit pas l'image
  • Déséquilibre entre modalités et effondrement d'une modalité à l'entraînement
  • Droits sur les images et les voix : la question à traiter avant la technique

Séquence 4 — Évaluer

  • Recherche : rappel aux premiers rangs, sur un jeu de référence construit à part
  • Description : les métriques automatiques et ce qu'elles manquent
  • Question-réponse visuelle : l'écueil de la réponse juste par hasard
  • L'évaluation humaine : quand elle devient indispensable, et comment la cadrer

Séquence 5 — Risques et coûts

  • Biais visuels : ce que les corpus d'images véhiculent
  • Données personnelles dans les images : visages, plaques, documents en arrière-plan
  • Coût d'inférence : la modalité visuelle est la plus chère, et de loin
  • Traçabilité des contenus générés et marquage

Dates & locations

StartEndLocation
22/03/2027 23/03/2027 Présentiel / distanciel / hybride

Practical information

Enrolment terms and lead time
Enrolment online or by email, up to 21 days before the session starts and subject to available seats — this lead time lets us send your joining instructions, then your access details for remote sessions. After that, write to us: we consider every request. For a tailored or on-site session, we reply within 48 working hours.
Accessibility and disability
Chaque schéma et chaque visualisation font l'objet d'une description textuelle équivalente, fournie dans les notes du support ; les jeux d'images sont accompagnés de leurs annotations en texte ; poste adapté et temps majoré d'un tiers sur demande ; salle accessible PMR Our disability officer is available from enrolment through to the end of the course, to discuss the arrangements you need. Write to contact@caplogy.com.