Mage-ViT技术解密:微软如何从零训练出 codec-native 视觉编码器?

发布时间:2026/7/31 19:27:24
Mage-ViT技术解密:微软如何从零训练出 codec-native 视觉编码器? Mage-ViT技术解密微软如何从零训练出 codec-native 视觉编码器【免费下载链接】Mage-VL项目地址: https://ai.gitcode.com/hf_mirrors/microsoft/Mage-VLMage-VL是微软推出的一款高效的 codec-native 流式多模态基础模型专为图像和视频理解而设计。其视觉编码器 Mage-ViT 完全从零开始训练规模紧凑至 4B。它旨在解决现代 VLM 的“莫拉维克悖论”——在复杂的离线推理任务上表现出色但在简单的实时流感知任务上却速度缓慢且计算量大。什么是 codec-native 视觉编码器传统的视频理解模型通常将视频解码为均匀采样的帧然后通过冻结的网络预训练 ViT 推送密集的补丁标记网格。而 Mage-VL 则遵循现代视频编解码器的结构将流分离为锚定I帧和预测P帧保留每个锚定补丁并仅保留编解码器花费比特的预测帧补丁——即携带真实运动和新细节的区域。这种与编解码器对齐的稀疏性使得 Mage-VL 在保持高视觉质量的同时能够显著降低计算成本和延迟。Mage-ViT 的训练方法Mage-ViT 是从两阶段从零开始的 ViT 预训练中提取的独立视觉编码器。这是仅 ViT 预训练的检查点它没有经过与语言模型的联合 VLM 训练。微软通过以下关键步骤从零训练出 Mage-ViT数据准备收集了大量的图像和视频数据包括各种场景、物体和动作。这些数据经过预处理以适应编解码器原生的输入格式。架构设计设计了一种与编解码器对齐的视觉编码器架构。该架构能够有效地处理锚定帧和预测帧并提取其中的关键信息。预训练使用大规模的图像和视频数据对 Mage-ViT 进行预训练。预训练过程中模型学习如何从编解码器原生的输入中提取视觉特征。微调在预训练的基础上对 Mage-ViT 进行微调以适应特定的下游任务如图像理解、视频理解和实时流感知等。Mage-VL 的整体架构Mage-VL 是一个统一的模型其中投影的视觉标记和文本标记共享一个因果 Qwen3 解码器。静态图像成为单个空间块视频成为时间有序的编解码器窗口。在流模式下轻量级认知门预测每个滚动窗口的p_speak g(h_t)通过事件保留特征提取器保持的循环流内存并在p_speak ≥ τ时触发生成响应由冻结的基础模型从最近编解码器段的本地滑动窗口解码文本查询可以随时注入。Mage-VL 的整体架构包括以下几个关键组件Mage-ViT 视觉编码器负责从图像和视频中提取视觉特征。Qwen3 语言解码器负责处理文本输入和生成文本输出。认知门负责控制实时流感知任务中的生成时机。事件保留特征提取器负责保持循环流内存以便认知门能够准确预测生成时机。Mage-VL 的性能表现Mage-VL 在多个视频和时间接地基准测试中表现出色。在保持 4B Qwen3 骨干网络固定且仅交换 ViT 的情况下Mage-VL 在所有报告的视频和时间接地基准测试中均优于 Qwen3-VL-4B——在本地化繁重的任务上优势最大22.5 QVHighlight17.1 ActivityNet11.0 VSI-Bench24.5 VideoEval-Pro。在 SoccerNet 基准测试中Mage-VL-4B 在响应时间方面表现出色具有较高的 TriggerAcc、Precision、Recall、F1 和 Latency 指标。在 OVO-Bench 基准测试中Mage-VL 在流式架构中设置了新的最先进总体得分。如何使用 Mage-VLMage-VL 提供了一个单一的检查点microsoft/Mage-VL它同时提供图像和视频理解以及主动流门——相同的权重可以回答离线图像/视频问题并驱动事件门控评论。它涵盖了所有 Mage-VL 功能图像理解、帧采样视频、传统 H.264/HEVC 编解码器视频、神经 DCVC-RT 编解码器视频和事件门控流。该存储库捆绑了编解码器处理器、神经编解码器包和主动门权重——不需要单独的理解、NVC 或流检查点。要使用 Mage-VL 进行图像和帧采样视频推理只需安装transformers库然后使用以下代码model_id microsoft/Mage-VL model AutoModelForCausalLM.from_pretrained(model_id, trust_remote_codeTrue) processor AutoProcessor.from_pretrained(model_id, trust_remote_codeTrue)对于在线模式可以与 OpenAI 兼容的 SGLang 服务器通信。首先使用 Mage-VL SGLang 分支构建并启动服务器构建需要protobuf-compiler和 Rust 工具链git clone https://gitcode.com/hf_mirrors/microsoft/Mage-VL cd Mage-VL git checkout sglang cargo build --release ./target/release/sglang-server --model-path microsoft/Mage-VL总结Mage-ViT 是微软从零训练的 codec-native 视觉编码器它通过与编解码器对齐的稀疏性在保持高视觉质量的同时显著降低了计算成本和延迟。Mage-VL 作为一个统一的模型涵盖了图像理解、视频理解和实时流感知等多种功能在多个基准测试中表现出色。如果你正在寻找一种高效的多模态基础模型Mage-VL 绝对值得一试。Mage-VL 采用 Apache-2.0 许可证发布你可以在遵守许可证条款的前提下自由使用和修改它。【免费下载链接】Mage-VL项目地址: https://ai.gitcode.com/hf_mirrors/microsoft/Mage-VL创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考