AI Architecture & Systems

Multimodal Foundation Models

6.22.1Vision Encoder, Projector, and Language Backbone#

6.22.2CLIP/SigLIP, ViT, and Contrastive Learning#

6.22.3LLaVA-Style Alignment and Visual Instruction Tuning#

6.22.4Early Fusion, Late Fusion, and Native Multimodality#

6.22.5Cross-Attention, Image Tokens, and Dynamic Resolution#

6.22.6Audio/Video Tokenization and Cross-Modal Temporal Alignment#

6.22.7ASR, TTS, Codec LMs, and Omni Models#