专栏名称: 量子位
վ'ᴗ' ի 追踪AI行业和技术动态,这里更快一步!关注我们,回复“今天”,更多大新闻等你来发现
TodayRss-海外RSS稳定源
目录
今天看啥  ›  专栏  ›  量子位

小米模型实现声音理解新SOTA!数据吞吐效率暴增20倍,推理速度快4倍 | 全量开源

量子位  · 公众号  · AI  · 2025-08-05 21:30
    

主要观点总结

小米团队开源了模型MiDashengLM-7B,基于Xiaomi Dasheng音频编码器,实现了对语音、环境声音和音乐的统一理解。该模型在多个公开评测集上取得优异成绩,具有高效推理部署性能,可广泛应用于智能座舱、智能家居等场景。模型采用创新的通用音频描述对齐范式,并使用100%公开数据集训练,欢迎全球开发者、行业伙伴及学术机构用于商业产品或学术研究。

关键观点总结

关键观点1: MiDashengLM-7B模型介绍

小米团队全量开源的模型,基于Xiaomi Dasheng音频编码器,通过创新的通用音频描述训练策略,实现对语音、环境声音和音乐的统一理解。

关键观点2: 模型性能

MiDashengLM-7B在多个公开评测集上刷新多模态大模型最好成绩,单样本推理的首Token延迟(TTFT)为业界先进模型的1/4,同等显存下的数据吞吐效率是业界先进模型的20倍以上。

关键观点3: 模型应用

MiDashengLM-7B在小米的智能家居和汽车座舱等场景有超过30项落地应用,具备可用的语音识别能力。作为该模型的重要扩展,其训练数据由100%的公开数据构成,模型以宽松的Apache License 2.0发布,支持学术和商业应用。

关键观点4: 模型特点

MiDashengLM采用创新的通用音频描述对齐范式,避免了用ASR转录数据对齐的局限性,通用描述对齐策略通过非单调的全局语义映射,迫使模型学习音频场景的深层语义关联。此外,该模型具备高效的推理部署性能,可以广泛应用于智能座舱、智能家居等场景。

关键观点5: 开源生态

MiDashengLM的训练数据100%来自公开数据集,涵盖五大类110万小时资源。不同于其他未公开训练数据细节的模型,MiDashengLM完整公开了77个数据源的详细配比,技术报告中详细介绍了从音频编码器预训练到指令微调的全流程。模型以Apache 2.0开源协议发布,诚邀全球开发者、行业伙伴及学术机构集成于商业产品或用于学术研究。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照