Cloudflare 推出开放权重决策 AI 模型 Clef-omni,新增支持音频 / 视频输入
IT之家 10 月 10 日消息,Cloudflare 昨日(10 月 9 日)发布公告, 宣布推出开放权重决策模型 Clef-omni,支持单次 API 调用处理文本、图像、音频和视频等。 定位方面, 该模型在此前 Clef 系列模型基础上 ,扩展支持多模态输入,模型权重已在 Hugging Face 开放。 多模态支持方面,此前的 Clef 支持文本、图像及从视频中抽取的连续画面(把视频按时间抽取成一张张静态图像,再把这些图像按顺序作为输入交给模型),而 Clef-omni 新增音频和完整视频输入,支持 wav、mp3、mp4 和 webm 格式。 Cloudflare 称,开发者无需另行搭建语音转写及音视频拆分流程,可用一个模型处理多种输入。 Cloudflare 称,Clef-omni 基于 Qwen3-Omni-30B-A3B-Instruct 构建,并保留其主要理解能力。模型面向结构化决策任务,不生成常规文本输出。公...
来自IT之家 AI的《Cloudflare 推出开放权重决策 AI 模型 Clef-omni,新增支持音频 / 视频输入》。重点看模型能力与工程、产品发布。摘要提到:IT之家 10 月 10 日消息,Cloudflare 昨日(10 月 9 日)发布公告, 宣布推出开放权重决策模型 Clef-omni,支持单次 API 调用处理文本、图像、音频和视频等。 定位方面, 该模型在此前 Clef 系列模型基础上 ,扩展支持多模态输入,模型权重已在 Hugging Face 开放。 多模态支持方面,此前的 Clef 支持文本、图像及从视频中抽取的连续画面(把视频按时间抽取成一张张静态图像,再把这些图像按顺序作为输入交给模型),而 Clef-omni 新增音频和完整视频输入,支持 wav、mp3、mp4 和 webm 格式。 Cloudflare 称,开发者无需另行搭建语音转写及音视频拆分流程,可用一个模型处理多种输入。 Cloudflare 称,Clef-omni 基于 Qwen3-Omni-30B-A3B-Instruct 构建,并保留其主要理解能力。模型面向结构化决策任务,不生成常规文本输出。公...
本站只提供摘要与原文入口。完整内容请阅读原文。
来源:IT之家 AI · ithome.com