跳到正文
Cloudflare Blog·· 1 天前精选AI 评分60

Cloudflare 发布 Clef-omni 多模态决策模型,Clef 提速、Clef-flash 降价

Introducing Clef-omni with full multimodality, plus a faster Clef and a cheaper Clef-flash

AI 导读

Cloudflare 发布开放权重决策模型 Clef-omni,支持音频、视频、图像和文本输入,基于 Qwen3-Omni-30B-A3B-Instruct MoE 底座,权重已在 HuggingFace 开放。

推荐理由

官方同时给出多模态能力、降价与提速的具体数字,读者可以据此评估决策模型在自家工作流中的成本与延迟。

正文 · AI 翻译

继上周发布 Clef 和 Clef-flash(Cloudflare 的开权重决策模型)之后,我们决定带来更多礼物。今天,我们发布 Clef-omni,它除了文本和图像外,还能接收音频和视频输入。我们还降低了 Clef-flash 的价格,使其现在比 Jev 更便宜,并让 Clef 变得更快。

虽然模型领域对 Cloudflare 来说仍处于早期,但创新和迭代已深植于我们的基因之中,我们将这些原则应用于我们所做的一切。事实上,Clef 的故事在不到一周的时间里就成型了。我们在一个周五晚上决定要在决策模型领域做点什么,周末训练了模型,并在周四发布了它。即便时间线如此之短,我们仍能为社区交付性能强劲、高质量的开放权重模型——想象一下未来我们还能做些什么。

今天,我们很高兴能通过为 Clef 系列模型增添新成员和改进来保持这一势头。这仅仅是个开始,我们将继续变得更好、更快、更便宜、更具创新性。

Clef-omni 可接收音频、视频、图像和文本输入

我们的新模型 Clef-omni 能够接收音频、视频、图像和文本输入。这改变了决策模型的范式,自 TypeSafe 的 Jev 首次亮相以来,这类模型主要局限于文本。通过 Clef,我们支持了图像和视频帧数组,但 Clef-omni 能够处理音频(wav 或 mp3)和视频(mp4 或 webm),以及文本和图像。

你无需搭建级联的模型流水线来进行语音转文本,也无需将音频和图像通道从视频中分离,只需调用一个模型即可跨任何模态做出决策。我们现在离一个能够像我们体验世界那样与世界交互的模型又近了一步——通过音频、视觉和文本交流,三位一体。

查看我们的开发者文档以了解新的 Clef-omni 模型。我们还在 HuggingFace 上以开放权重形式发布了该模型。如需快速上手,以下是如何向 Clef-omni 发送新模态输入:

curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef-omni \
  -X POST \
  -H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "clef-omni",
    "state": "Review the installation: a photo of the unit, an audio recording of it running, and a video of the fan.",
    "images": ["data:image/png;base64,<base64-png>"],
    "audio": ["data:audio/mpeg;base64,<base64-mp3>"],
    "videos": ["data:video/mp4;base64,<base64-mp4>"],
    "questions": {
      "label_visible": {"type": "noul", "instructions": "Is the model and serial number label visible in the photo?"},
      "sounds_normal": {"type": "noul", "instructions": "Does the unit sound like it is running smoothly, without rattling or grinding?"},
      "fan_running": {"type": "noul", "instructions": "Is the fan running in the video?"}
    }
  }'

Clef-omni 将我们的开放权重决策架构扩展至原生处理多模态工作流。我们基于 Qwen3-Omni-30B-A3B-Instruct 混合专家(MoE)基础构建了它,该模型本身已能够在单一流水线内直接处理文本、图像、音频和视频。但我们采用其主要理解主干,并舍弃了文本转语音输出组件。在生产环境中,Clef-omni 会对完整有效载荷执行一次快速预填充遍历,同时对所有模态和有效参数选项进行评分。

由于 Clef 模型不是大型语言模型(LLM),我们跳过输出 token 生成,从而消除了转录或为传入文件添加字幕的开销。媒体元素直接映射到统一序列中,视频和音频与视觉帧同步以进行联合处理。随后,Clef-omni 利用我们的两阶段注意力路由直接从内部嵌入中提取候选值:每个有效选项都会从输入中收集关键证据(无论它们藏在文本片段、视觉元素还是音频流中),然后字段向量在整个上下文上进行交叉注意力计算,以得出置信度分数。我们加入了一个内置的词法语法来保留选项的语义,从而能够对每种输入类型进行快速、模式约束的评分。

我们使用与训练 Clef 相同的技术来训练该模型——冻结 Qwen3 主干网络,训练低秩适配器(LoRA),并应用我们标准的后训练方法:将标签平滑的交叉熵损失与 Brier 分数校准相结合。最终得到的模型具有强大的韧性,无论模式变化、字段顺序和提示结构如何,都能成功完成任务。

这为 Clef 模型家族带来了多项核心升级。经过校准、受模式约束的决策现在可以在单次 API 调用中无缝处理文本、图像、音频和同步视频。而且速度很快。纯文本决策的中位响应时间约为 130 毫秒,图像输入约为 150 毫秒,音频片段在几百毫秒内完成。即使是带声音的完整 21 秒视频片段,也能在约 1.5 秒内完成评分,全部在单次 API 调用中完成。

我们的基准测试显示,即使在引入新模态和 MoE 架构的情况下,各项基准测试仍表现强劲。

基准测试

Clef-omni

Clef

Clef-flash

Jev

BFCL · case exact

98.2

98.47

98.76

95.75

ToolRet · nDCG@10

66.6

69.19

66.43

65.28

API-Bank · accuracy

92.7

91.93

93.11

88.19

Home appliances · case exact

69.3

82.95

97.73

52.27

When2Call · accuracy

63.3

72.37

65.58

80.97

BANKING77 · macro-F1

94.8

94.20

90.93

79.74

CLINC150+OOS · macro-F1

97.7

97.43

66.77

89.27

BRIGHT · nDCG@10

42.0

45.91

39.26

47.52

Amazon ESCI · macro-F1

57.8

57.48

57.39

55.21

PhishNChips · accuracy

73.2

79.60

75.05

62.55

我们还针对TypeSafe 评估进行了基准测试,以展示 Clef-omni 的表现。

工作流

指标

Clef-Omni

Clef

Clef-flash

Jev

发票处理

精确动作

60.2

64.7

57.1

61.8

发票处理

主要动作

82.0

86.2

73.3

83.1

客户服务

精确动作

71.6

76.3

77.0

76.0

安全事件

精确动作

61.7

62.9

61.7

61.7

智能体轨迹可观测性

主要动作

65.8

68.5

69.8

71.6

Clef-flash 模型现已更便宜

我们听到了您的反馈——您希望有一个价格足够实惠、可以融入任何工作流的决策模型。我们做了一些优化,现在可以以更低的价格提供 Clef-flash。我们希望 Clef 能够为您在所有智能体工作流中做出可扩展的决策,而现在我们的定价也在激励这一点。

我们成功优化了模型,使 Clef-flash 现在比 Jev 更便宜,同时仍然保持高性能和高质量。请查看开发者文档,随时获取最新的定价信息,包括有关图像和音频模态如何转换为输入 token 以进行计价的更多细节。

  • Clef-flash – 原价每 M 输入 token 0.09 美元,现在每 M 输入 token 0.038 美元
  • Clef – 保持每 M 输入 token 0.24 美元
  • Clef-omni – 今日发布,每 M 输入 token 0.15 美元

然而,为了实现更便宜的定价,我们必须做出一个权衡,那就是削减 Clef-flash 的上下文窗口。托管版 Clef-flash 现在的上下文窗口为 24k,而不是之前宣传的 64k。Hugging Face 上的模型权重未做改动,其训练支持 256k 上下文窗口,如果您选择自托管的话。

从我们的使用数据来看,只有 0.24% 的请求超过 24k 输入 token。基于这一数据,我们决定将 Clef-flash 的上下文窗口降至 24k,以便以更易接受的入门价格提供。我们的 Clef 模型仍保持 64k 上下文窗口,我们鼓励有更大上下文需求的用户改用 Clef 而不是 Clef-flash。

Clef 模型现已更快

Clef 模型的速度也更快了,我们为 Workers AI 上托管的 Clef 版本带来了新的优化。我们没有发布新的模型权重,因为我们所做的大部分优化都是在服务基础设施层,而非模型权重或架构上。来看看我们最新的速度:

输入规模

之前:中位数 / p95(毫秒)

现在:中位数 / p95(毫秒)

中位数加速比

约 800 个 token

262 / 438

152 / 351

1.7×

约 3,400 个 token

616 / 777

305 / 531

2.0×

约 16,000 个 token

2,721 / 3,250

1,635 / 1,805

1.7×

我们所做的一项优化是改用 SGLang 来服务模型。我们与 SGLang 团队合作并提交了拉取请求以纳入 Clef(PR #42721),该功能将在 SGLang 0.5.22 中发布。由于我们已经发布了权重,你也可以自行托管 Clef,新的 SGLang 启动命令已发布在我们更新后的 Hugging Face 仓库以及 SGLang cookbooks 上。

大家如何使用 Clef?

在 Cloudflare,我们已有团队在试验将 Clef 作为一个能够帮助在通用领域进行分类的模型。观察团队采用 Clef 最酷的一点是,检测和分类的能力已经转移到了模型层,任何人都可以开始将决策模型融入自己的用例中。此前,即便是零样本分类器,小型模型也可能不够强大,无法在不做进一步调优的情况下对任何领域进行分类。你可能需要组建一个专门的机器学习团队来针对你的特定领域进行训练,并收集一批数据来训练出更好的模型。现在,你只需调用一个模型,就能立即精准地解析输入数据。

Cloudflare 各团队使用 Clef 的一些亮点:我们的公共 GitHub 文档仓库使用 Clef 来即时检测并关闭垃圾问题。我们的内容管理系统 EmDash 对插件库进行钓鱼内容审核。我们的数据丢失防护团队正在扫描数据中可能存在的个人身份信息(PII),例如政府证件。而我们的威胁情报团队正在使用 Clef 来帮助检测恶意域名。

来试试吧!

我们很高兴为你带来 Clef 模型家族的更多内容,包括音频和视频等新模态,以及通过更便宜的定价和更快的速度让模型更易获取。Clef 完全兼容 Jev-API,并可通过 AI Gateway 使用,因此今天想试用 Clef,只需更改模型 ID 即可。查看我们的开发者文档了解更多信息。

感谢大家对 Cloudflare 首批模型的所有喜爱与热情欢迎——我们正专注于为你带来更多内容。试试我们的 Clef 模型家族,并告诉我们你的想法。

来源:Cloudflare Blog · blog.cloudflare.com