94

什么是多模态大模型(MLLM)?主流架构有哪些?

前沿技术与发展趋势中等

📋 面试问题

什么是多模态大模型(MLLM)?主流架构有哪些?

✅ 期望回答

MLLM能同时理解和生成文本、图像、音频、视频等多种模态

主流架构:
  • Encoder-Decoder型:如Flamingo(冻结视觉编码器+冻结LLM,中间加Perceiver Resampler)
  • 投影对齐型:如LLaVA(CLIP视觉编码器 -> 线性投影 -> LLM)、Qwen-VL
  • 统一架构:如GPT-4o、Gemini(原生多模态,训练阶段就融合)

关键技术:视觉编码器(ViT/CLIP)、跨模态对齐(对比学习)、指令微调(多模态指令数据)
#多模态#MLLM#LLaVA