跳到正文
IT之家 AI·· 19 天前评分68

基于全国产化算力训练,讯飞星火语音基座大模型 Spark-Audio-1.0-Preview 上线

摘要

IT之家 9 月 16 日消息,科大讯飞今日宣布 Spark-Audio-1.0-Preview 上线,这是一款基于全国产化算力训练的语音基座大模型。 过去,大模型处理音频大多采用级联方案:先把语音转成文字,再交给大模型理解。这种做法有两个明显短板: 信息丢失。文字只能记录说了什么,会丢掉语音里自带的语气、情绪,还有背景环境音等关键信息,导致模型对场景的判断不完整,自然也会影响到最后的结果。 链路割裂。这套系统把语音转写、声纹识别、语音翻译等能力拆成独立模块串联运行,模块之间存在断点,不仅容易累积错误,在使用体验上也会出现延迟、卡顿。 据IT之家了解,语音基座大模型就解决了上面的这些问题:它不再只做语音转文字,而是直接理解语音。语音基座大模型一次性听懂人声、环境音、音乐等等,而且还能理解声音里的语义、情绪和场景。 此次首发的 Spark-Audio-1.0-Preview 采用 0.65B(Dense 结构)的音频编码器,搭配 ...

本站只提供摘要与原文入口。完整内容请阅读原文。

来源:IT之家 AI · ithome.com