Skip to main content
Multimodal Models

Multimodal Models

Connecting Vision and Language

Multimodal models understand multiple types of data — images, text, audio — in a shared representation space. Key applications:
  • Image-text search
  • Visual question answering
  • Image captioning
  • Text-to-image generation

CLIP: Contrastive Language-Image Pretraining

CLIP Architecture

Core Idea

Learn a shared embedding space where matching image-text pairs are close together. L=1Ni=1Nlogexp(sim(Ii,Ti)/τ)j=1Nexp(sim(Ii,Tj)/τ)\mathcal{L} = -\frac{1}{N}\sum_{i=1}^{N} \log \frac{\exp(\text{sim}(I_i, T_i)/\tau)}{\sum_{j=1}^{N} \exp(\text{sim}(I_i, T_j)/\tau)}

CLIP Implementation


Using Pretrained CLIP

Zero-Shot Classification


Visual Question Answering (VQA)


Image Captioning


LLaVA: Large Language-and-Vision Assistant

Connecting vision encoders with LLMs:

Building a Multimodal Model

Vision-Language Projector


Image-Text Retrieval


Multimodal Model Comparison


Exercises

Build a zero-shot image classifier using CLIP for a custom set of classes.
Create a text-to-image search system using CLIP embeddings.
Fine-tune BLIP on a custom VQA dataset and evaluate performance.

What’s Next

Module 25: Foundation Models & LLMs

Scaling laws, emergent capabilities, and training large language models.