模型简介
音乐从来不只是"听见歌词"或"识别声音事件"。一首歌的表层有歌声、乐器、旋律与制作质感,更深处则有和弦、和声走向、调式、速度、节拍、段落结构与情绪张力。过去的通用音频模型往往更擅长识别"发生了什么声音",而 MOSS-Music 关心的是:这些声音如何组织成一首歌,它的调式是什么,副歌从哪里进入,歌词、人声、配器与和弦之间有什么关系。
MOSS-Music 由 MOSI.AI、OpenMOSS 团队与上海创智学院联合开源。它沿用 MOSS-Audio 的模块化架构,由专用音频编码器、模态适配器和大语言模型三部分组成:原始音频先编码为 12.5 Hz 的连续时序表征,再投影到语言模型的嵌入空间。在此基础上,模型在大规模音乐语料上进行持续预训练与指令微调,重点覆盖歌唱、歌词、完整歌曲、和声、结构与长时理解。本次开源两个 8B 模型:MOSS-Music-8B-Instruct 面向直接指令跟随,适合音乐描述、问答、歌词 ASR 与自动打标;MOSS-Music-8B-Thinking 支持显式推理过程,适合需要展开分析的和声、结构、风格与长时音乐理解任务。
功能描述
歌词 ASR,带时间戳
在伴奏干扰下识别中英文歌唱内容,并支持句级 / 词级时间戳输出。在 MUSDB18、MIR-1K、Opencpop 三个歌声场景上,Thinking 版本取得 15.88% 的平均 WER / CER。
音乐描述与自动打标
从风格、情绪、速度、配器、人声、旋律、和声、结构、制作质感与使用场景等维度生成自然语言描述,也可按要求输出精简标签。在 GPT-5.4 评判的 9 维打分中,MOSS-Music 在 MusicCaps 与 SDD 两个基准上均领先,结构与段落描述的提升尤为明显。
和声、调式与节奏分析
识别调式、节拍、下拍、BPM 与和弦进行,支持和弦转录以及带时间戳的和弦转录,可用于和声分析、伴奏参考与音乐教育。
结构切分
将完整歌曲切分为 intro、verse、chorus、bridge、outro 等段落,并给出段落边界时间,帮助模型理解音乐的长期组织方式。
乐器与声部识别
识别主奏乐器、人声类型、独唱 / 合唱、性别与音区等信息。
长时音乐问答与推理
围绕一首完整作品进行开放式提问,支持对前后段落、歌词、结构、情绪变化和音乐元素的回溯分析。Thinking 版本会先给出分析过程,再输出最终答案。
时间感知的模型设计
预训练阶段按固定时间间隔向音频帧表征插入时间 token,让模型在统一的文本生成框架中学习"什么在什么时候发生";同时采用 DeepStack 式跨层特征注入,将编码器早期、中间与最终层特征分别投影并注入语言模型前几层,保留节奏瞬态、音色细节等低层信息。无需额外对齐模块即可支持带时间戳的歌词 ASR、节拍 / 下拍定位与段落边界检测。
开源数据流水线
同步开源 MOSS-Music-Data-Pipeline,覆盖从原始音频到 chat 格式训练样本的完整流程:时长统计、整曲 MIR 分析与结构标注、按结构切分、分段歌词 ASR 与调式 / 和弦分析、元数据清洗,以及 caption / query 生成。支持 JSONL 分片,便于在 HPC、Kubernetes 或 Ray 集群上构建大规模语料。
评测结果
音乐问答与理解(准确率 ↑)
Avg 为 8 个公开音乐问答基准的平均值:MMAU-music、MMAU-mini-music、MMAU-Pro-music、MMAR-music、MuChoMusic、Music-AVQA、GTZAN、Medley-Solos-DB。NSynth 三个单音识别任务单独列出,不计入平均。
| Model | MMAU-music | MMAU-mini | MMAU-Pro | MMAR | MuChoMusic | Music-AVQA | GTZAN | Medley-Solos-DB | Avg |
|---|---|---|---|---|---|---|---|---|---|
| MOSS-Music-8B-Instruct | 79.33 | 80.78 | 71.02 | 59.70 | 89.39 | 76.78 | 93.59 | 92.42 | 80.38 |
| Gemini-3.1-Pro | 71.69 | 77.18 | 73.06 | 71.64 | 79.53 | 61.51 | 86.39 | 80.34 | 75.17 |
| MOSS-Music-8B-Thinking | 74.09 | 77.78 | 67.98 | 50.25 | 82.90 | 68.90 | 84.78 | 87.42 | 74.26 |
| MusicFlamingo | 76.83 | 76.35 | 65.60 | 48.66 | 74.58 | 73.60 | 84.45 | 90.86 | 73.87 |
| Audio-Flamingo-Next | 72.39 | 72.07 | 61.64 | 45.27 | 75.62 | 62.94 | 77.68 | 91.47 | 69.89 |
| MiMo-Audio-7B-Instruct | 66.36 | 72.97 | 66.50 | 45.77 | 75.40 | 57.05 | 65.67 | 93.81 | 67.94 |
| Step-Audio-R1 | 66.46 | 75.08 | 62.34 | 50.75 | 72.62 | 57.98 | 73.67 | 82.45 | 67.67 |
| Qwen3-Omni | 65.76 | 68.77 | 66.27 | 48.54 | 78.77 | 56.05 | 80.15 | 69.65 | 66.75 |
| Kimi-Audio-7B-Instruct | 47.95 | 52.25 | 59.10 | 45.27 | 70.18 | 68.90 | 39.54 | 71.98 | 56.90 |
音乐描述(GPT-5.4 评判,1–5 分)
在风格、情绪、速度、配器、人声、旋律 / 和声、结构、制作、场景 9 个维度上打分并取平均。
| Model | MusicCaps Avg | SDD Avg |
|---|---|---|
| MOSS-Music-8B-Thinking | 4.53 | 4.45 |
| MOSS-Music-8B-Instruct | 4.36 | 4.58 |
| Gemini-3.1-Pro | 4.42 | 4.48 |
| MusicFlamingo | 4.21 | 4.26 |
| Audio-Flamingo-Next | 4.10 | 4.16 |
| Qwen3-Omni | 3.96 | 4.02 |
| MiMo-Audio-7B-Instruct | 3.98 | 4.05 |
| Step-Audio-R1 | 3.90 | 3.98 |
| Kimi-Audio-7B-Instruct | 3.73 | 3.80 |
歌词 ASR(WER / CER ↓)
MUSDB18 为带伴奏英文流行歌(WER),MIR-1K 为带伴奏中文卡拉 OK 片段(CER),Opencpop 为干净的普通话录音室歌声(CER)。
| Model | MUSDB18 WER | MIR-1K CER | Opencpop CER | Avg |
|---|---|---|---|---|
| MOSS-Music-8B-Thinking | 29.19% | 15.84% | 2.60% | 15.88% |
| MOSS-Music-8B-Instruct | 32.99% | 23.96% | 4.62% | 20.52% |
| Gemini-3.1-Pro-Preview | 26.25% | 36.37% | 6.00% | 22.87% |
| MusicFlamingo | 23.41% | 38.98% | 18.73% | 27.04% |
| Qwen3-Omni-30B-A3B-Instruct | 62.67% | 20.48% | 2.26% | 28.47% |
| MiMo-Audio-7B-Instruct | 94.16% | 23.34% | 6.77% | 41.42% |
| Kimi-Audio-7B-Instruct | 97.53% | 25.83% | 4.90% | 42.75% |
| Step-Audio-R1 | 81.67% | 48.03% | 4.15% | 44.62% |
| Audio-Flamingo-Next | 94.93% | 55.63% | 12.47% | 54.34% |
和弦转录
支持和弦转录与带时间戳的和弦转录,详细基准结果将在后续更新中发布。