作者: · 发布:

实时视频感知!微软开源 4B 流式多模态模型

微软开源 Mage:4B 参数多模态模型,视觉 token 压缩 75%,推理提速 3.5 倍,单模型支持图像和视频理解。

微软研究院刚开源的 Mage,4B 参数,两个模型一个体系:Mage-VL 负责看,Mage-Flow 负责画。

核心突破在视觉理解这边。Mage-VL 把视频理解的推理速度提升了 3.5 倍,视觉 token 压缩了 75% 以上,单模型支持图像和视频理解。

实时视频感知!微软开源 4B 流式多模态模型

看了下技术细节。它用了一个叫 I/P 预测补丁机制的东西,模仿生物视觉的处理方式——关键信息直接传,冗余信息压缩掉。

同一段视频,传统方法要处理 1000 个 token,Mage 只处理 200 多个。

GitHub:https://github.com/microsoft/Mage

01 它是什么

Mage 是微软研究院开源的多模态模型系列,4B 参数预算,主打轻量高效。

整个家族分三块:

  • • Mage-VL:图像和视频理解模型,支持主动流式处理
  • • Mage-Flow:文生图和指令编辑模型
  • • Mage-ViT:视觉编码器,从训练到推理都针对效率优化

三个模型共享一套设计理念——把计算资源花在最值得花的地方,视觉 token 能省就省,该精细的地方绝不糊弄。

实时视频感知!微软开源 4B 流式多模态模型

02 Mage-VL 的核心突破

VLM 有一个老问题:复杂推理很强,实时感知很弱。看到一张图能分析半天,但看视频流就卡。

Mage-VL 的解法是 codec-native 的主动流式架构。

传统视频理解的方式是密集帧采样——每帧都处理,token 量大得吓人。Mage-VL 用预测补丁机制,只处理变化的部分,静止区域直接跳过。

效果很明显。同一段视频,传统方法要 1000 个 token,Mage 只处理 180 个左右。token 减少 75% 以上,推理速度提升 3.5 倍。

更关键的是,一个 checkpoint,同时支持图像理解和视频理解。

03 性能表现

在 4B 这个规模里,Mage-VL 的表现挺能打。

静态图像理解和对标 Qwen3-VL-4B 基本持平。视频理解和空间智能明显领先——QVHighlight 评测 +22.5 分,VSI-Bench +11 分,CrossPoint +53.1 分。

这些数字说明什么?Mage-VL 不只是速度快,质量也没降。在视频理解这个它最擅长的领域,它是 4B 量级的标杆。

04 Mage-Flow 做什么

生成这边,Mage-Flow 是文生图和指令编辑模型。

它用了一个自研的 VAE 做潜空间编码,配合原生分辨率的多模态扩散 Transformer。简单说,就是直接在高分辨率上生成,不需要先降分辨率再放大。

支持三种变体:基础版、RL 对齐版、4 步 Turbo 版。Turbo 版生成速度最快,4 步就能出图。

05 怎么用

项目结构很清晰。README 里写得很详细:

  • • 安装依赖:Python 3.10+,pip install -r requirements.txt
  • • 推理:官方提供了脚本,直接跑就行
  • • API:支持 OpenAI 兼容格式,方便接入现有工作流

许可证方面,Mage-Flow 和 Mage-ViT 是 MIT,Mage-VL 是 Apache 2.0。商业使用没问题。

写在最后

大模型越做越大, Mage 走了一条反过来的路——做小,但做精。

4B 参数,3.5 倍速度,75% token 压缩。

微软这次开源,轻量、高效、开源,三个词加在一起,这是实打实的效率提升。

GitHub:https://github.com/microsoft/Mage

颜资源站长
颜资源站长 已发布 825 篇文章

资深互联网从业者,专注AI工具研究与实战应用。长期跟踪ChatGPT、Claude、Stable Diffusion等前沿AI技术,擅长将复杂的技术概念转化为通俗易懂的教程。运营颜资源小站,致力于为中文用户提供高质量的AI教程、开源项目推荐和数字资源整理。