Token导航 LogoToken导航TokenDH.com

小米开源目标说话人语音识别大模型Xiaomi‑CocktailASR‑1

更新时间 2026-09-16来源 牛新网正文 424字阅读约 2分钟1 张图片

ITCOW牛新网 9月11日消息,小米技术正式发布并开源工业级目标说话人语音识别大模型Xiaomi‑CocktailASR‑1,旨在解决语音识别领域的“鸡尾酒会难题”,也就是多人同时说话时识别效果大幅下降的问题。

小米开源目标说话人语音识别大模型Xiaomi‑CocktailASR‑1

模型采用端到端LLM架构,输入一段目标人物的参考音频作为声纹提示,就可以在多人混杂说话的嘈杂环境中,只提取转录目标说话人的语音内容。在多项多说话人公开测试集上取得SOTA最优效果。

该模型兼顾单人语音识别,单人场景识别效果对标主流标准ASR模型;拥有干扰拒识能力,如果目标说话人没有出现,模型会直接输出空文本,减少误识别误触发。还支持思维链推理,能够输出识别的推理过程,提升结果可解释性。

目前模型的相关代码与权重已经上传GitHub以及HuggingFace平台,开发者可以直接获取使用。

文章导航

阿里云Token Plan个人版加量不加价,高阶套餐新增Agent开发工具
亚马逊广告与OpenAI达成合作,广告主可在ChatGPT投放对话式广告
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多