
小红书 FireRed 团队最新开源 FireRedAudio。
小红书 FireRed 团队最新开源 FireRedAudio。它把音频理解和语音生成,塞进同一个模型里。

是真·一个模型,既能”听懂”,又能”说出”。
项目简介
FireRedAudio 是小红书 Super Intelligence(超级智能)团队 开源的通用音频语言模型。
9B 参数的 LLM 骨架,配了两条独立的音频输入通路——理解用 Audio Encoder,生成用 RedAE。
技术论文已经挂在了 arXiv(编号 2608.24168),Demo 页面也有,直接能体验。
这不是 FireRed 团队第一次开源音频模型了。
之前他们已经放出过 FireRedASR2S(普通话字错率 2.89%、支持 20+ 方言的语音识别)、FireRedTTS3(24 种语言 + 21 种中文方言的零样本克隆),以及 FireRedChat(全双工语音交互)。
FireRedAudio 是这个系列里的”集大成者”——把之前分散的能力收进一个统一框架。
核心设计:解耦连续表示
论文摘要里有一句话我印象特别深:“To the best of our knowledge, it is the first publicly disclosed unified audio-language model to provide separate continuous input representations for understanding and generation within a single trainable autoregressive LLM.”
翻译过来就是:我们可能是第一个公开披露的、在同一个可训练自回归 LLM 里给理解和生成分配独立连续表示的统一音频语言模型。
具体怎么做的?
- • 理解通路:输入音频 → Audio Encoder → 12.5 Hz 感知表示 → LLM 理解。这条路径的特征经过精心压缩,适合长录音的语义分析。
- • 生成通路:输入音频 → RedAE(一个带语义蒸馏的自编码器) → 连续声学 latent → LLM 条件生成 → Flow-Matching DiT 解码成 24 kHz 波形。这条路径保留了重建所需的全部细节。
两条路喂给同一个 9B LLM,共享语言和推理能力,但输入表示各自优化。这就解决了之前说的那个”既要又要”的矛盾。
一个模型,覆盖六件事
FireRedAudio 不是”做一件事做到极致”,而是”一件事都能做”。它同时支持:
- 1. ASR 语音识别:支持多种语言,FLEURS-102 多语言平均字错率 14.94%,超过 Qwen3-Omni-30B
- 2. 音频理解与问答:MMAU 测试集 82.0 分、MMSU 83.3 分,两个榜单都是第一
- 3. 长录音结构化分析:支持最长 1 小时录音,输出带时间戳的结构化内容,秒级时间对齐
- 4. Zero-Shot TTS 声音克隆:一段参考音频 + 一段文本,Seed-ZH CER 0.83%、相似度 0.74,中文零样本克隆领先
- 5. Instruct TTS 声音设计:用自然语言描述音色——”女性高音区的清亮音色,青年特质,语速略快,带急切情感”——直接出全新声音
- 6. 语音编辑:语义级(删除/插入/替换内容)+ 声学级(调音调速调音量),Ming-Freeform-Audio-Edit 数据集上全面碾压 Ming-UniAudio-Edit
快速上手
# 克隆仓库
git clone https://github.com/FireRedTeam/FireRedAudio.git
cd FireRedAudio
# 用 uv 同步依赖(注意:会编译 causal-conv1d 和 flash-attn,需要 CUDA 环境)uv sync --extra accel --extra accel-build --group tools
下载模型权重
两种方式,任选其一:
# 方式一:从 HuggingFace 下载(推荐)
uv run hf download FireRedTeam/FireRedAudio --local-dir pretrained_models/
# 方式二:从 ModelScope 下载(国内更快)uv pip install modelscope
uv run modelscope download --model FireRedTeam/FireRedAudio --local_dir pretrained_models/
Python API 使用
import torch
import torchaudio
from inference import FireRedAudioInference
# 初始化模型# 注意:理解任务只需要 model_path
# 生成任务(TTS / 编辑 / 声音设计)还需要 vae_decoder_pathengine = FireRedAudioInference(
model_path="pretrained_models/FireRedAudio",
vae_decoder_path="pretrained_models/RedAE_decoder/model.pt",
device="cuda:0",
)
# 1️⃣ 语音识别res = engine.understand(
"assets/examples/asr_zh_fleurs.wav",
"Transcribe speech to text.",
task="asr"
)
print(res.answer)
# 2️⃣ 音频理解 + 思维链推理res = engine.understand(
"assets/examples/assets_mmau_test.wav",
"What illness did Second speaker's friend suffer from?",
task="understand",
enable_thinking=True,
max_new_tokens=10240,
)
print("推理过程:", res.reasoning)
print("答案:", res.answer)
# 3️⃣ Zero-Shot 声音克隆res = engine.tts(
prompt_text="同时,他强调微调要科学有序。",
prompt_audio="assets/examples/tts_zh_prompt.wav",
target_text="安徽淮南秦师傅发现,停在小区的爱车右前驾驶窗玻璃被砸。",
language="zh",
)
torchaudio.save("tts.wav", res.audio.cpu(), sample_rate=24000)
# 4️⃣ 语义编辑(删除)res = engine.edit(
"assets/examples/edit_semantic_zh_ref.wav",
"delete '比普通的茶叶要'",
edit_type="semantic"
)
torchaudio.save("edit_semantic.wav", res.audio.cpu(), sample_rate=24000)
# 5️⃣ 声学编辑(升调 +3 个半音)res = engine.edit(
"assets/examples/edit_acoustic_zh_ref.wav",
"shift the pitch by 3 steps",
edit_type="acoustic"
)
torchaudio.save("edit_acoustic.wav", res.audio.cpu(), sample_rate=24000)
# 6️⃣ 声音设计(纯描述生成全新音色)res = engine.voice_design(
instruction="以女性高音区的清亮音色,表现出青年阶段的特质,音量略强,语速适中稍快,语调带有解释意味和急切的情感流露,确保语音流畅自然。",
text="是我请他来的,可他什么也不知道,他来只是想打听一下,你们厂是不是有旧锅炉?",
)
torchaudio.save("voice_design.wav", res.audio.cpu(), sample_rate=24000)
性能对比
直接上官方基准测试数据,我摘几个最有代表性的:
音频理解(Audio Understanding)
| 模型 | MMAU test-mini | MMAU test | MMSU |
|---|---|---|---|
| Qwen3.5-Omni-Plus | 81.4 | 79.9 | 80.7 |
| Gemini 3.1 Pro | 80.7 | 78.8 | 82.7 |
| FireRedAudio | 82.0 | 80.9 | 83.3 |
三个榜单全第一。
Zero-Shot TTS(中文 Seed-TTS-eval)
| 模型 | CER ↓ | 相似度 ↑ |
|---|---|---|
| CosyVoice 2 | 1.45 | 0.75 |
| CosyVoice 3 | 1.12 | 0.78 |
| DiTAR (1B) | 1.02 | 0.75 |
| FireRedAudio | 0.83 | 0.74 |
CER 比第二名还低 19%,说明克隆出来的语音文字准确性极高。相似度虽然不是第一,但 0.74 也在第一梯队。
Instruct TTS(中文指令遵循)
| 模型 | APS ↑ | DSD ↑ | RP ↑ |
|---|---|---|---|
| Qwen3-TTS-VD | 83.7 | 81.7 | 65.8 |
| FireRedAudio | 86.0 | 84.1 | 70.1 |
三个指标全领先。APS 是指令遵循的准确性,DSD 是说话人描述匹配度,RP 是自然度。
语音编辑
Ming-Freeform-Audio-Edit 数据集上,无论是语义编辑(删除/插入/替换)还是声学编辑(调音调速调音量),FireRedAudio 的 WER 更低、相似度更高、任务完成准确率显著领先。
写在最后
FireRedAudio 的核心价值,不在于某个单项指标刷了榜,而在于它证明了一件事:
理解和生成,不需要分开两套模型。给它们分配各自优化的表示空间,用同一个 LLM 当”大脑”,就能既听懂又说对。
这个”解耦连续表示”的设计思路,可能会成为下一代音频大模型的标配。
之前 Qwen-Omni 用 Thinker-Talker 绕路,Ming-UniAudio 用 token 类型拆分,FireRedAudio 直接给了个更干净的答案。
9B 参数的规模也很讨喜——不算太大,推理成本可控;不算太小,有足够的语言理解能力。对于想做本地化音频 AI 应用的团队来说,这个体量是个不错的起点。





评论(0)