Перейти к содержимому
Оригинал
PaperAgent· PaperAgent·· 4 дня назадОценка ИИ36

Jev 论文潮来袭:LLM2Jev 与 Chinese-Jev 等一批 System One 决策模型研究

Оригинальный заголовок: 炸裂,一大波Jev论文来袭

Заголовок и краткое изложение на выбранном языке ожидают перевода.

Краткий обзор ИИ

9 月 15 日发布的 System One 决策模型 Jev 一周内 GitHub 相关项目超两千个、star 破四万,一批论文随之涌现。

Полный текст

Jev 是9月15日发布的一类 System One 决策模型。它不生成文字,只做一件事:给你几个候选选项,它直接输出每个选项的概率。

发布才一周,GitHub 上就冒出两千多个相关项目,star 数冲破四万。论文潮紧随其后,从医疗到星际争霸,从手机端到6G边缘网络,从Agent记忆到GUI-Agent,几乎每个角落都有人在试它。

领域

代表工作

关键结果

评测

Benchmarking-Jev(arXiv:2609.37647)

在 27 个数据集上击败 Qwen3.8-27B 直接读数;

医疗

放射科报告核查;德州五年车祸笔录筛查(arXiv:2609.34024,2609.27607,2610.00213)

与 GPT-6 Sol 几乎战平(78.4% vs 78.2%),2823 题花 8 美分;

Agent

手机GUI智能体高频动作选择;星际争霸亚秒级动作决策;智能体记忆路由与停止(arXiv:2609.30186,2609.27331,2609.23986)

AndroidWorld 成功率 79%,执行时间省 30%;查询延迟降40%

行业落地

网络入侵检测;6G 边缘网络意图解析;推荐重排序(arXiv:2610.01079,2609.22753,2609.40241,2609.23959,2609.33538)

比 GPT-5.6 Luna 快 4.8 倍、便宜 3.8 倍,新攻击召回更高;6G 决策延迟砍 20%-60%

这篇论文问了一个很「省」的问题:既然 Jev 类模型只是把概率铺在候选答案上,通用 LLM 的下一个 token 概率里,是不是本来就藏着这个能力?

图:LLM2Jev 的四件套——编号选项、候选后缀 trie、免训练配方、可选微调

做法朴素得可爱。给选项编上号,[1] [2] 一直到 [12],然后在提示词末尾预填一句「Best answer: [」,模型下一个 token 落在哪个数字上,概率就是哪个选项的。

妙处在那枚闭括号。它让所有候选后缀天然前缀无关,选项数量不再设限——Banking77 的77个意图,一次前向就能读完整个分布。

表:免训练的4B模型在 JevBench 拿到81.4%,与同底座社区专用模型持平(来源:论文 Table 2)

结果相当能打。冻结的 Qwen3.5-4B 在 JevBench 公开231题中答对188题,准确率81.4%,不输任何同底座的社区专用 Jev 模型,还把单字母 logit 读数法甩在身后。更难得的是 ECE 只有0.057,概率出厂即校准,不需要任何事后缩放。

两个细节值得玩味。一是打分与生成高度一致:让模型先给概率再自由作答,两条路径的答案几乎总相同,说明决策并非「表演」。二是这套接口天然多模态,MMBench、MMStar 上的视觉选择题也能直接读,微调时完全没见过图像也不妨碍。

那还要不要微调?论文给出了一份诚实的「劝退指南」。微调目标设计得很讲究:listwise 损失沿候选 trie 分解,再配上三个 KL 锚点,防止模型忘了怎么聊天。

结论一句话:规模决定收益。0.6B 小模型微调后 Banking77 暴涨42.6个百分点;而4B模型跑完一整个 epoch,JevBench 反而从81.4%跌到76.2%。作者的实用建议是:弱模型放心全参微调,强模型用 LoRA 点到为止,KL 锚点务必保留。

动机很直接:现有 Jev 模型在中文任务上水土不服。团队的解法是先从数据下手——搭一条统一管线,把来源各异的中文标注全部转成「候选选项上的概率目标」,八类任务共1000万条训练决策,语义匹配占24%,评论评分占19%。

图:1000万条通用训练决策在八类任务上的分布(来源:论文 Figure 1)

图:轻量 encoder-only 主干联合编码输入与候选,共享打分器输出 choice、noul、score 三种决策(来源:论文 Figure 4)

架构走轻量路线:encoder-only 主干配上决策头和共享打分 MLP,choice、noul、score 三种决策形式一套模型通吃。训练目标也有巧思,在交叉熵之外叠加了 RLCD 强化项——对每个决策的 logits 施加高斯扰动并复用编码结果,用奖励信号把概率推向 calibrated 的方向。

训练分两步:先在通用语料上预训练,再针对医疗、法律、金融做领域微调。团队还放出了含30.79万条 held-out 决策的 CJ-Bench,准确率与校准一并考。

数字相当漂亮。通用集上准确率69.20%,反超闭源 Jev 的68.35%;ECE 从11.45%压到3.78%;单条决策延迟14毫秒,对 Jev API 的284毫秒,整整20.3倍速。

表:领域专家版达到 Jev 平均准确率的92%,每个决策始终15毫秒(来源:论文 Table 2)

值得点赞的是作者的诚实:领域微调后平均 ECE 为12.08%,仍高于 Jev 的5.57%,论文明确提醒「校准要和准确率分开评估」。这种不藏短处的写法,比单纯刷榜有说服力得多。

https://arxiv.org/pdf/2610.02076
LLM2Jev: LLMs Are Already Jev-Style Decision Models—When and How to Fine-Tune Them
Chinese-Jev: Bringing System One Model to
Chinese-Language Tasks
https://arxiv.org/pdf/2609.36965
https://gulucaptain.github.io/Chinese-Jev/

Источник: PaperAgent · mp.weixin.qq.com