• 音乐理解
  • 歌词识别
  • 音乐描述
  • 和弦分析
  • 长时音乐问答

MOSS-Music

开源音乐理解大模型。基于 MOSS-Audio 音频骨干,在大规模音乐数据上持续预训练,支持歌词 ASR、音乐描述、和弦/调式/节奏分析、结构切分与长时音乐问答,让模型不仅"听见音乐",更理解音乐内部的组织方式。

作者
OpenMOSS Team
版本
8B Instruct / 8B Thinking
开源许可
Apache 2.0

模型简介

音乐从来不只是"听见歌词"或"识别声音事件"。一首歌的表层有歌声、乐器、旋律与制作质感,更深处则有和弦、和声走向、调式、速度、节拍、段落结构与情绪张力。过去的通用音频模型往往更擅长识别"发生了什么声音",而 MOSS-Music 关心的是:这些声音如何组织成一首歌,它的调式是什么,副歌从哪里进入,歌词、人声、配器与和弦之间有什么关系。

MOSS-Music 由 MOSI.AI、OpenMOSS 团队与上海创智学院联合开源。它沿用 MOSS-Audio 的模块化架构,由专用音频编码器、模态适配器和大语言模型三部分组成:原始音频先编码为 12.5 Hz 的连续时序表征,再投影到语言模型的嵌入空间。在此基础上,模型在大规模音乐语料上进行持续预训练与指令微调,重点覆盖歌唱、歌词、完整歌曲、和声、结构与长时理解。本次开源两个 8B 模型:MOSS-Music-8B-Instruct 面向直接指令跟随,适合音乐描述、问答、歌词 ASR 与自动打标;MOSS-Music-8B-Thinking 支持显式推理过程,适合需要展开分析的和声、结构、风格与长时音乐理解任务。

功能描述

歌词 ASR,带时间戳

在伴奏干扰下识别中英文歌唱内容,并支持句级 / 词级时间戳输出。在 MUSDB18、MIR-1K、Opencpop 三个歌声场景上,Thinking 版本取得 15.88% 的平均 WER / CER。

音乐描述与自动打标

从风格、情绪、速度、配器、人声、旋律、和声、结构、制作质感与使用场景等维度生成自然语言描述,也可按要求输出精简标签。在 GPT-5.4 评判的 9 维打分中,MOSS-Music 在 MusicCaps 与 SDD 两个基准上均领先,结构与段落描述的提升尤为明显。

和声、调式与节奏分析

识别调式、节拍、下拍、BPM 与和弦进行,支持和弦转录以及带时间戳的和弦转录,可用于和声分析、伴奏参考与音乐教育。

结构切分

将完整歌曲切分为 intro、verse、chorus、bridge、outro 等段落,并给出段落边界时间,帮助模型理解音乐的长期组织方式。

乐器与声部识别

识别主奏乐器、人声类型、独唱 / 合唱、性别与音区等信息。

长时音乐问答与推理

围绕一首完整作品进行开放式提问,支持对前后段落、歌词、结构、情绪变化和音乐元素的回溯分析。Thinking 版本会先给出分析过程,再输出最终答案。

时间感知的模型设计

预训练阶段按固定时间间隔向音频帧表征插入时间 token,让模型在统一的文本生成框架中学习"什么在什么时候发生";同时采用 DeepStack 式跨层特征注入,将编码器早期、中间与最终层特征分别投影并注入语言模型前几层,保留节奏瞬态、音色细节等低层信息。无需额外对齐模块即可支持带时间戳的歌词 ASR、节拍 / 下拍定位与段落边界检测。

开源数据流水线

同步开源 MOSS-Music-Data-Pipeline,覆盖从原始音频到 chat 格式训练样本的完整流程:时长统计、整曲 MIR 分析与结构标注、按结构切分、分段歌词 ASR 与调式 / 和弦分析、元数据清洗,以及 caption / query 生成。支持 JSONL 分片,便于在 HPC、Kubernetes 或 Ray 集群上构建大规模语料。

评测结果

音乐问答与理解(准确率 ↑)

Avg 为 8 个公开音乐问答基准的平均值:MMAU-music、MMAU-mini-music、MMAU-Pro-music、MMAR-music、MuChoMusic、Music-AVQA、GTZAN、Medley-Solos-DB。NSynth 三个单音识别任务单独列出,不计入平均。

ModelMMAU-musicMMAU-miniMMAU-ProMMARMuChoMusicMusic-AVQAGTZANMedley-Solos-DBAvg
MOSS-Music-8B-Instruct79.3380.7871.0259.7089.3976.7893.5992.4280.38
Gemini-3.1-Pro71.6977.1873.0671.6479.5361.5186.3980.3475.17
MOSS-Music-8B-Thinking74.0977.7867.9850.2582.9068.9084.7887.4274.26
MusicFlamingo76.8376.3565.6048.6674.5873.6084.4590.8673.87
Audio-Flamingo-Next72.3972.0761.6445.2775.6262.9477.6891.4769.89
MiMo-Audio-7B-Instruct66.3672.9766.5045.7775.4057.0565.6793.8167.94
Step-Audio-R166.4675.0862.3450.7572.6257.9873.6782.4567.67
Qwen3-Omni65.7668.7766.2748.5478.7756.0580.1569.6566.75
Kimi-Audio-7B-Instruct47.9552.2559.1045.2770.1868.9039.5471.9856.90

音乐描述(GPT-5.4 评判,1–5 分)

在风格、情绪、速度、配器、人声、旋律 / 和声、结构、制作、场景 9 个维度上打分并取平均。

ModelMusicCaps AvgSDD Avg
MOSS-Music-8B-Thinking4.534.45
MOSS-Music-8B-Instruct4.364.58
Gemini-3.1-Pro4.424.48
MusicFlamingo4.214.26
Audio-Flamingo-Next4.104.16
Qwen3-Omni3.964.02
MiMo-Audio-7B-Instruct3.984.05
Step-Audio-R13.903.98
Kimi-Audio-7B-Instruct3.733.80

歌词 ASR(WER / CER ↓)

MUSDB18 为带伴奏英文流行歌(WER),MIR-1K 为带伴奏中文卡拉 OK 片段(CER),Opencpop 为干净的普通话录音室歌声(CER)。

ModelMUSDB18 WERMIR-1K CEROpencpop CERAvg
MOSS-Music-8B-Thinking29.19%15.84%2.60%15.88%
MOSS-Music-8B-Instruct32.99%23.96%4.62%20.52%
Gemini-3.1-Pro-Preview26.25%36.37%6.00%22.87%
MusicFlamingo23.41%38.98%18.73%27.04%
Qwen3-Omni-30B-A3B-Instruct62.67%20.48%2.26%28.47%
MiMo-Audio-7B-Instruct94.16%23.34%6.77%41.42%
Kimi-Audio-7B-Instruct97.53%25.83%4.90%42.75%
Step-Audio-R181.67%48.03%4.15%44.62%
Audio-Flamingo-Next94.93%55.63%12.47%54.34%

和弦转录

支持和弦转录与带时间戳的和弦转录,详细基准结果将在后续更新中发布。

模型演示