
微软开源 Mage:4B 参数多模态模型,视觉 token 压缩 75%,推理提速 3.5 倍,单模型支持图像和视频理解。
微软研究院刚开源的 Mage,4B 参数,两个模型一个体系:Mage-VL 负责看,Mage-Flow 负责画。
核心突破在视觉理解这边。Mage-VL 把视频理解的推理速度提升了 3.5 倍,视觉 token 压缩了 75% 以上,单模型支持图像和视频理解。

看了下技术细节。它用了一个叫 I/P 预测补丁机制的东西,模仿生物视觉的处理方式——关键信息直接传,冗余信息压缩掉。
同一段视频,传统方法要处理 1000 个 token,Mage 只处理 200 多个。
GitHub:https://github.com/microsoft/Mage
01 它是什么
Mage 是微软研究院开源的多模态模型系列,4B 参数预算,主打轻量高效。
整个家族分三块:
- • Mage-VL:图像和视频理解模型,支持主动流式处理
- • Mage-Flow:文生图和指令编辑模型
- • Mage-ViT:视觉编码器,从训练到推理都针对效率优化
三个模型共享一套设计理念——把计算资源花在最值得花的地方,视觉 token 能省就省,该精细的地方绝不糊弄。

02 Mage-VL 的核心突破
VLM 有一个老问题:复杂推理很强,实时感知很弱。看到一张图能分析半天,但看视频流就卡。
Mage-VL 的解法是 codec-native 的主动流式架构。
传统视频理解的方式是密集帧采样——每帧都处理,token 量大得吓人。Mage-VL 用预测补丁机制,只处理变化的部分,静止区域直接跳过。
效果很明显。同一段视频,传统方法要 1000 个 token,Mage 只处理 180 个左右。token 减少 75% 以上,推理速度提升 3.5 倍。
更关键的是,一个 checkpoint,同时支持图像理解和视频理解。
03 性能表现
在 4B 这个规模里,Mage-VL 的表现挺能打。
静态图像理解和对标 Qwen3-VL-4B 基本持平。视频理解和空间智能明显领先——QVHighlight 评测 +22.5 分,VSI-Bench +11 分,CrossPoint +53.1 分。
这些数字说明什么?Mage-VL 不只是速度快,质量也没降。在视频理解这个它最擅长的领域,它是 4B 量级的标杆。
04 Mage-Flow 做什么
生成这边,Mage-Flow 是文生图和指令编辑模型。
它用了一个自研的 VAE 做潜空间编码,配合原生分辨率的多模态扩散 Transformer。简单说,就是直接在高分辨率上生成,不需要先降分辨率再放大。
支持三种变体:基础版、RL 对齐版、4 步 Turbo 版。Turbo 版生成速度最快,4 步就能出图。
05 怎么用
项目结构很清晰。README 里写得很详细:
- • 安装依赖:Python 3.10+,pip install -r requirements.txt
- • 推理:官方提供了脚本,直接跑就行
- • API:支持 OpenAI 兼容格式,方便接入现有工作流
许可证方面,Mage-Flow 和 Mage-ViT 是 MIT,Mage-VL 是 Apache 2.0。商业使用没问题。
写在最后
大模型越做越大, Mage 走了一条反过来的路——做小,但做精。
4B 参数,3.5 倍速度,75% token 压缩。
微软这次开源,轻量、高效、开源,三个词加在一起,这是实打实的效率提升。





评论(0)