小米开源音频理解模型小米模型实现声音理解新SOTA声音理解能力新SOTA，小米全

小米开源音频理解模型小米模型实现声音理解新SOTA

声音理解能力新SOTA，小米全量开源了音频理解模型。

MiDashengLM-7B，基于Xiaomi Dasheng作为音频编码器和Qwen2.5-Omni-7B Thinker作为自回归解码器，通过创新的通用音频描述训练策略，实现了对语音、环境声音和音乐的统一理解。

其性能在22个公开评测集上刷新多模态大模型最好成绩，单样本推理的首Token延迟（TTFT）仅为业界先进模型的1/4，同等显存下的数据吞吐效率是业界先进模型的20倍以上。

阅读：0 点赞：0

usohu