跳到主要内容

SALMONN-2 – 清华等开源的通用音频大语言模型 运营中

SALMONN-2 是清华大学、上海人工智能实验室与剑桥大学联合开源的通用音频大语言模型。

SALMONN-2 – 清华等开源的通用音频大语言模型 是基于字节跳动 SPEAR 统一自监督音频编码器与多层特征融合适配器构建,以 Qwen3 为文本基座的通用音频大语言模型。它支持语音识别、音频描述、音乐理解、情绪识别、说话人验证等跨域任务,并首次在通用 ALLM 中系统实现声音事件检测、音频伪造检测、语音质量评估与多模态上下文语音识别等进阶能力。模型采用单一 SPEAR 编码器替代传统双编码器方案,通过 MLF 适配器融合多层声学特征,实现更均衡的跨域表现。凭借仅约 1.8 万小时监督数据的高效训练,SALMONN-2 在 MMAU-Pro、MMAR、MMSU 三大综合基准上达到同规模开源模型最佳表现,适用于智能会议助手、音频内容审核、语音质量监控等场景。

SALMONN-2 – 清华等开源的通用音频大语言模型 产品界面
月流量
0
产品收费
免费和付费
收录时间
2026-08-07
更新时间
2026-08-07

01SALMONN-2是什么

SALMONN-2 是清华大学、上海人工智能实验室与剑桥大学联合开源的通用音频大语言模型,基于字节跳动 SPEAR 统一自监督音频编码器与多层特征融合适配器构建,以 Qwen3 为文本基座,用约 1.8 万小时监督数据便在 MMAU-Pro、MMAR、MMSU 三大综合基准上取得同规模开源模型最佳表现,首次在通用 ALLM 中系统实现声音事件检测、音频伪造检测、语音质量评估与多模态上下文语音识别等进阶能力。

02SALMONN-2的主要功能

通用音频理解:支持语音识别、音频描述、音乐理解、情绪识别、说话人验证等跨域任务。
声音事件检测(SED):可定位并输出环境声事件的起止时间段,如狗叫、脚步声等。
音频深度伪造检测:判断语音真伪,并定位疑似合成或编辑的局部片段时间区间。
语音质量评估(SQA):感知噪声、失真、清晰度等低层声学特征,给出质量评分与解释。
多模态上下文语音识别(MICL):结合文字拼写与参考发音音频,提升生僻词与罕见人名的识别准确率。

03SALMONN-2的技术原理

微信关注回复“开源”,加入AI开源项目交流群
统一自监督音频编码器:SALMONN-2 采用 SPEAR 作为单一音频前端,编码器在大规模无标注音频数据上通过自监督学习训练,能同时捕捉语义、发音、音色、说话人及声学环境信息,替代传统 Whisper+BEATs 双编码器方案,在简化架构的同时保持更均衡的跨域能力。
多层特征融合(MLF)适配器:SPEAR 各层编码的信息层次不同——浅层保留声学/发音细节,中层携带音色/说话人信息,深层积累语义概念;MLF 适配器先对各层隐状态做层归一化与拼接,再经可学习的下投影与帧分组压缩,最终将融合后的层次化表征映射到语言模型嵌入空间,使模型能根据任务需求灵活调用不同层级的声学线索。
时间戳注入机制:模型将时间戳以自然语言文本形式(如 <2.0 seconds>)直接插入音频序列,与音频嵌入交错输入语言模型,使模型在统一生成框架内完成时间定位任务,无需额外的时间戳专用嵌入层。
多模态上下文学习(MICL)训练:在上下文语音识别任务中,模型不仅接收文本偏置词表,同时同步获取这些词的参考发音音频作为多模态上下文;训练时引入干扰词与目标词随机丢弃策略,防止过偏置,使模型学会在声学证据支持下合理利用上下文线索。

04如何使用SALMONN-2

访问仓库并克隆代码:访问 GitHub 仓库 https://github.com/bytedance/SALMONN/tree/salmonn2,用 git clone 将代码下载到本地。
创建运行环境:执行 conda create -n salmonn2 python=3.10 创建虚拟环境并激活,升级 pip、setuptools 与 wheel。
安装依赖与项目:在仓库根目录运行 pip install -r requirements.txt 与 pip install -e . --no-deps,完成 SALMONN-2 及其运行时依赖的安装。
下载预训练权重:通过 HuggingFace CLI 下载模型检查点:hf download marcoyang/SALMONN-2-8B --repo-type model --local-dir /path/to/salmonn-2-hf。
加载模型并推理:用 AutoProcessor 与 AutoModelForCausalLM 加载本地权重,传入音频文件与指令文本,调用 model.generate() 可获取音频理解结果。

05SALMONN-2的核心优势

数据高效:用约 1.8 万小时监督数据,远低于同规模竞品常用的数十万至数百万小时,显著降低标注成本。
统一前端更均衡:单一 SPEAR 自监督编码器替代双编码器,在语音、环境声、音乐及副语言任务间取得更均衡的表现。
层次化信息完整利用:MLF 适配器融合所有编码器层特征,避免仅使用末层而丢失声学/音色等关键细节。
扩展音频分析能力:在通用 ALLM 中首次系统支持 SED、伪造检测、SQA 等以往被忽视的声音分析任务。
规模可扩展:将文本基座从 8B 扩展至 30B-A3B 后,三大综合基准分数均持续提升,验证架构具备良好的 scale-up 潜力。

06SALMONN-2的项目地址

GitHub仓库:https://github.com/bytedance/SALMONN/tree/salmonn2
HuggingFace模型库:https://huggingface.co/marcoyang/SALMONN-2-8B
arXiv技术论文:https://arxiv.org/pdf/2607.17079

07SALMONN-2的应用场景

智能会议助手:实时转录会议内容,结合参会人发音示例准确识别外籍人名与专业术语。
音频内容审核:自动检测直播或播客中的异常声音事件,并识别深度伪造语音以防范诈骗。
语音质量监控:对客服通话、录音棚素材进行自动化质量评分,定位噪声与失真片段。
多媒体档案检索:为历史音频、广播节目生成带时间戳的事件描述,实现基于内容的精准检索。
辅助听障设备:将环境声事件(如门铃、警报)以文字与时间戳形式实时提示听障用户。

© 免责声明:鉴于域名具有时效性,指向的网站内容可能发生变更。AIEZZ对呈现的第三方网站不可控,无法承担任何责任。请自行判断内容风险。

用户评价0

常见问题

关于当前内容的常见说明。

零基础小白,借助 AIEZZ,能不能快速上手各类 AI 工具?

完全可以。市面上绝大多数 AI 网页工具无需编程能力,也不用专业背景,操作简单易懂,输入需求就可以产出结果。AIEZZ(aiezz.com)聚合了大量新手友好 AI 工具,打开网页就能直接体验。

在 AIEZZ 挑选的 AI 工具,都需要花钱吗?

不少 AI 工具会开放免费基础能力或者试用额度,同时也有月订阅、按量计费的付费模式。建议优先试用免费版本,确认适配自己的工作流之后再付费。AIEZZ(aiezz.com)会标注每款工具的付费模式,方便快速甄别。

通过 AIEZZ 找到的 AI 工具,生成出来的内容,可以拿来做商业使用吗?

各个平台版权授权规则各不相同,商用之前务必仔细阅读平台许可、版权以及隐私协议。AIEZZ(aiezz.com)会整理工具商用权限提示,帮大家规避版权风险。

依托 AIEZZ,如何挑选真正适合自己的 AI 工具?

先理清自身任务、预算以及使用频次,再对比输出质量、中文适配、导出格式、协作能力,小范围测试之后再敲定。AIEZZ(aiezz.com)汇总各类工具的测评信息,便于横向对比筛选。

使用 AIEZZ 收录的 AI 工具,该怎样保护个人隐私?

尽量不要上传敏感身份信息、未公开商业资料,阅读平台的数据留存与训练规则,优先选择具备隐私管控的产品。AIEZZ(aiezz.com)会标注工具隐私相关提醒,降低信息泄露隐患。

经常用 AIEZZ 的各类 AI 工具,AI 会不会替代我的本职工作?

AI 擅长处理重复性事务,放大个人本身专业能力。不用盲目囤积大量工具,借助AIEZZ(aiezz.com)筛选合适应用,把 AI 融入现有工作流程,实现效率提升。