IT之家 AI·· 24 天前评分74
OpenAI 扩大实时语音模型能力:GPT-Live-1 上线 API,支持打断处理、工具调用和电话语音智能体
摘要
IT之家 9 月 11 日消息,OpenAI 今日宣布将 GPT-Live-1 引入 API,开发者可据此打造支持实时语音交互的应用和业务流程。该模型支持全双工对话,能够同时听取和输出语音,并在对话过程中处理打断、停顿及背景噪声。 GPT-Live-1 还支持电话场景,可用于预订餐厅、客户服务等全双工语音智能体。OpenAI 表示,开发者可以将其与 Codex 等工具连接,也可以通过 OpenAI Presence 开发能够查询企业系统、执行获批操作并在必要时转交人工的语音工作。 据介绍,GPT-Live-1 将语音理解与语音输出整合在同一模型中,减少传统“语音转文字 — 大语言模型 — 文字转语音”的多次衔接,从而降低延迟。模型还支持将复杂推理和工具调用交由后端文本模型处理。 开发者可以通过系统提示词调整其语气、语速和对话风格,也可以配置后端模型、工具及智能体框架。 OpenAI 表示,GPT-Live-1 支持原生语音识别转...
本站只提供摘要与原文入口。完整内容请阅读原文。
来源:IT之家 AI · ithome.com