多模态大模型实战11

发布时间:2026/7/22 10:33:40
多模态大模型实战11 第11章 视频理解与生成——从Video-LLaVA到Sora学习目标掌握视频理解模型的核心技术(帧采样、时序编码)用VLM实现视频问答和摘要了解视频生成模型(Sora/CogVideoX)的架构完成视频生成实战11.1 视频理解模型视频理解 = 图像理解 + 时序建模。代表模型模型架构视频长度特色Video-LLaVA拼接式短视频统一图片/视频编码LLaVA-Video拼接式中等视频专优化Qwen2.5-VL拼接式长动态帧率Gemini 2.5原生统一超长1小时+视频