小米开源Xiaomi-CocktailASR-1,攻克“鸡尾酒会”语音识别难题
2026-09-12 23:29:33未知 作者:徽声在线
9月11日,根据徽声在线从小米技术团队获取的最新消息,小米公司正式对外发布了其自主研发的工业级目标说话人语音识别大模型——Xiaomi-CocktailASR-1,并决定将该模型开源,以推动语音识别技术的进一步发展。这一创新成果主要针对长期困扰语音识别领域的“鸡尾酒会”难题,即如何在多人同时说话的嘈杂环境中,准确识别并转录出特定目标说话人的语音内容。
Xiaomi-CocktailASR-1模型采用了先进的端到端LLM(大型语言模型)架构,通过引入目标说话人的一段参考音频作为声纹提示,实现了在复杂语音环境下的精准识别。这一设计使得模型能够自动过滤掉非目标说话人的语音干扰,仅对目标用户的语音进行提取和转录,大大提高了语音识别的准确性和实用性。


