跳到正文
IT之家 AI·· 2026-09-02评分70

Meta 发布首个实时音频感知 AI 模型,支持 20 余人分轨转写

摘要

IT之家 9 月 2 日消息,科技媒体 9to5Mac 昨日(9 月 1 日)发布博文,报道称 Meta 公司推出 Muse Voice Transcribe, 这是其首个实时音频感知模型。 开发者可通过 Meta Model API 调用该能力,定价为每 1000 分钟音频 3 美元 (现汇率约合 20.2 元人民币) ,等同每小时 0.18 美元 (现汇率约合 1.2 元人民币) 。 该模型在同一流程中整合流式自动语音识别、说话人分离与端点检测,用户说话时,系统可同步输出文字,无需等待完整录音结束后再单独处理。 IT之家注:“流式”就是边说边转写,模型不必等整段音频说完才出结果,而是会一小段一小段持续输出文字,所以延迟更低,适合实时听写、会议记录、通话字幕。 Muse Voice Transcribe 可在包含 20 余名说话者的录音中分离不同发言者,还能识别说话是否结束,从而自动确定一段输入的边界。 模型训练覆盖 70 余...

本站只提供摘要与原文入口。完整内容请阅读原文。

来源:IT之家 AI · ithome.com