94
什么是多模态大模型(MLLM)?主流架构有哪些?
前沿技术与发展趋势中等
📋 面试问题
什么是多模态大模型(MLLM)?主流架构有哪些?
✅ 期望回答
MLLM能同时理解和生成文本、图像、音频、视频等多种模态
主流架构:- Encoder-Decoder型:如Flamingo(冻结视觉编码器+冻结LLM,中间加Perceiver Resampler)
- 投影对齐型:如LLaVA(CLIP视觉编码器 -> 线性投影 -> LLM)、Qwen-VL
- 统一架构:如GPT-4o、Gemini(原生多模态,训练阶段就融合)
#多模态#MLLM#LLaVA