Cloudflare 开源决策模型 Clef:基于 Qwen3.8-27B 与 Qwen3.5-9B
Original title: 又一个多模态版本Jev决策模型?再看Clef的实现思路及训练机制
The title and summary in the selected language are awaiting translation.
Cloudflare 在 Birthday Week 期间开源两个决策模型 Clef(27B)与 Clef-flash(9B),Apache 2.0 许可,权重挂在 HuggingFace,分别基于 Qwen3.8-27B 和 Qwen3.5-9B,原生带视觉编码器,上下文窗口扩展到 64k。
The full text in the selected language is awaiting translation. The original is shown for now.
今天是2026年10月3日,星期六,北京,天气晴。
假期第三天,继续看技术,看看决策模型进展之Clef的一些细节,整个轮子还在往前滚,有新的轮子出来。
特别的,关于多模态决策模型,我们在之前的文章《多模态版本的Jev决策模型?也看Intern-Decision的实现思路及几点思考》(https://mp.weixin.qq.com/s/OSFqlYS_5XiJXWGs9nKMbQ)中介绍过ntern-Decision,基于Qwen3.5微调实现,Clef也是类似。
本文来看看,温故知新。跟进不拉下就有机会,找出核心差异点。
一、决策模型Clef何为?
先看进展,2026年10月1日,Cloudflare在Birthday Week期间发布两个开源权重"决策模型"(DecisionModel):Clef(27B)与Clef-flash(9B),Apache2.0许可,权重挂载HuggingFace,亮点是:Clef 基于 Qwen3.8-27B,Clef-flash 基于 Qwen3.5-9B;原生配备视觉编码器,可直接解析图像输入,而同类模型(如 Jev)目前仅支持纯文本;上下文窗口:拓展至 64k(Jev 为 32k);
基于此,其实一整个的jev系列模型已经有多个了,可以对比如下表:
技术播客在:https://blog.cloudflare.com/clef-decision-models/,https://developers.cloudflare.com/changelog/post/2026-10-01-clef-workers-ai/,
权重在:https://huggingface.co/Cloudflare/clef
从中也可以看下技术实现:
backbone是完全冻结的 Qwen 基座(Clef 用 Qwen3.8-27B,Clef-flash 用 Qwen3.5-9B),可训练的部分只有两块:rank-256 的 LoRA 低秩适配器,以及一个新加的模式约束打分头(schema-bound scoring head,模型卡中文件名为 joint_head.safetensors)。
实现步骤如下,四步走:
Step1.编码输入。调用方传入一个 state 字符串(当前情境,可含 JSON、最多四张图像)与一组 questions(最多 64 个,分 noul / choice / score 三类)。视觉编码器处理图像后与文本一起进入骨干网【注意,它能做多模态,回想下我们之前说的那个interlm】;
Step2.单次 prefill。冻结的 Qwen 骨干对整个输入只跑一遍前向,得到内部表示。
Step3.两阶段注意力路由。打分头做两级注意力:第一级让每个候选选项从提示中拉取与自己相关的证据(option-specific evidence routing);第二级允许不同问题字段之间交叉注意力(joint cross-field attention),例如"严重程度"的判断可以参考"是否紧急"的判断。另有一个 lexical prior 保留跨选项的语义意图,缓解候选项表述差异带来的偏置。
Step4.并行打分输出。模式约束头对全部合法选项同时输出概率,noul 返回"是"的概率,choice 返回每个选项的概率加置信度,score 返回概率加权的分值与每档概率分布。
这个设计的逻辑在于:判读与打分能力主要来自骨干网的语言理解,而"把表示对齐到有限选项"这件事只需要小容量模块,冻结骨干同时保证了基座已有的多语言与长文本能力不被灾难性遗忘破坏。
二、决策模型Clef的训练机制
然后呢,在训练上,也有一些思路,后训练配方由三部分组成,标签平滑交叉熵(选对)+ Brier 损失(概率诚实)+ RLCD(评分档错一档轻罚)。主线的核心就是校准,这个是核心细节,可重点关注:
其一,企业标签平滑交叉熵。负责"选对"。这是分类任务的常规选择,标签平滑隐含了对边界模糊样本的宽容。
其二,Brier 损失。衡量"预测概率"与"真实结果"差距的损失函数,直接优化概率的诚实度。负责"概率诚实",Brier 分数衡量预测概率与真实结果(0 或 1)之间的均方差,直接惩罚"过度自信"与"信心不足"。这是气象预报领域校准概率的经典工具,用在 LLM 后训练上是个务实的选择。
其三,RLCD(Reinforcement Learning for Calibrated Decisions)。Cloudflare 自命名的方法,用强化学习给校准决策施加奖励,相邻评分档给部分得分,防止模型只会非黑即白。负责"序数合理性"。对 score 类问题,模型把"轻微"判成"严重"要重罚,判成相邻的"一般"只轻罚(部分得分);同时奖励完全精确的输出,并用参考惩罚约束模型不偏离初始分布。目的是解决评分档任务里"错一档和错三档代价不同"的问题,是普通交叉熵覆盖不到的。
另外,训练数据也很重要,核心是位置敏感性。采用合成数据:对字段顺序、提示词与 schema 结构做系统性排列组合,迫使模型对提问形式的变化保持不变性,而不是记住某种提问模板,形成过拟合。
值得注意的是,Clef-flash 在多项任务上反超 27B 的 Clef(BFCL、API-Bank、家电分类),说明决策能力对参数量不敏感、对训练目标更敏感。
最后,怎么用,这种做法带来了二次开发空间:骨干冻结意味着可以只重训 LoRA 与打分头,把自己的分类数据灌进去做二开;另外,从架构的角度上看,"冻结强骨干 + 模式约束头 + Brier/RLCD 校准"这套配方不依赖 Clef 本身,可以移植到任何开源基座上,为自己的业务定制决策头。
参考文献
1、https://huggingface.co/Cloudflare/clef
2、https://blog.cloudflare.com/clef-decision-models/
老刘,主页:https://liuhuanyong.github.io。
Source: 老刘说NLP · mp.weixin.qq.com