它把模型的出口,
收窄成了可执行的判断。
给 Jev 一份材料,再告诉它“要判断什么、允许哪些答案”。它返回选项、分数和概率,供程序直接使用。聊天、写作和长篇解释不在这个接口的目标里。[1]
省掉逐 token 输出长文本的解码过程,多个判断可以并行返回。
主要看临时定义任务、零样本泛化、概率接口,以及省下的训练运维工作。
“只能选 A/B/C”可以保证,但它仍然可能选错。[2]
“同一笔订单扣了两次款,请帮我退回多扣的部分。”
核对订单与退款规则 → 选择处理分支
面向程序的通用决策产品方向值得重视。底层是否构成全新学习范式,公开证据还不够。
判别分类、零样本分类、概率校准与结构化输出,都有长期积累。
在你的标签、数据与错误成本下,能否少做定制工作而获得足够好的判断。
本文所指为 TypeSafe AI 的 Jev,与 Meta 的 JEPA 并非同一模型。本文包含资料核验与分析,没有开展 Jev API 自测。
先有分类器,后有这次产品化。
“让机器判断类别”并不新。过去十年发生的变化,是语义能力、任务迁移和使用接口不断进步。下面是相关技术的参照线,不能据此推断 Jev 直接采用了其中某种架构。
“分类器早就有了”是对的。
只看“文本进来,类别出去”,Jev 没有发明这个问题。只看“新标签在调用时传入”,NLI 零样本分类也已有先例。因此不能用这两点直接证明它是新范式。
把旧方向做好,仍可能很有价值。
模型能否跨任务理解复杂标准,概率能否支持可靠分流,API 是否足够低延迟,这些都可能产生真实产品增量。算法史上的先例,不会自动证明某个新产品没有用。
System One 与 RLCD:名字分别指什么?
System One 借用《思考,快与慢》中快速直觉判断的类比,是 TypeSafe 的模型类别命名,不是已统一的学术分类标准。RLCD 是 Reinforcement Learning for Calibrated Decisions,即“面向校准决策的强化学习”。官方强调让概率对应实际正确程度;该名称本身不能告诉我们奖励函数或训练算法细节。[4]
答案空间先定好,再对它做判断。
可以用一个概念式理解:P(答案 | 材料, 问题, 判定标准)。它解释的是接口的工作方式,不是 Jev 内部网络的还原图。公开材料没有给出足够的底层结构。
事实材料、判断问题、每个选项或等级的描述。
多个问题独立评估,共用材料;不生成解释文本。
阈值、计算、权限、检索、复核,由外部程序负责。
state 是证据,instructions 是问题,criteria 定义答案的含义。把业务标准写清楚,比只给“好 / 坏”标签更有用。
没有顺序的类别
输出概率最高的选项、完整类别分布与 confidence。每个 Choice 最多 255 个选项。类别不完备时应留“其他 / 信息不足”。[5]
有顺序的描述刻度
定义 2 至 10 个等级,返回等级编号的概率加权均值。如 70% 在 1 级、30% 在 2 级,分数就是 1.3。它不是精确数值回归。[6]
一个 yes 的概率
返回 0 至 1 的数。0.5 表示 yes/no 难以区分,不代表“程度中等”;要评价程度请用 Score。Noul 不另带 confidence。[7]
看同一个分类接口,如何表达不同把握
预设教学样例“这笔订单被重复扣款,请退回多扣的那笔钱。”
问题:该优先交给哪个团队?
选项:账务、物流、其他 / 信息不足。
本质的分界,更多在训练目标与输出方式。
参数少,不代表一定是分类器;参数多,也可以直接做判别。“小模型”把不同技术混在了一个词里。Jev 的参数量未公开确认,不能仅凭速度给它贴上大小标签。
| 比较维度 | 任务专用小分类器 | NLI / 通用判别模型 | 小型生成式 LLM | Jev |
|---|---|---|---|---|
| 典型做法 | fastText、微调 BERT 等 | 文本与标签描述做语义匹配或蕴含判断提示模型输出标签 / JSON材料 + 类型问题 + 标准|||
| 输出方式 | 直接输出类别分数 | 直接输出匹配 / 蕴含分数通常逐 token 生成答案原生受限决策和概率|||
| 换一套标签 | 通常要补数据、训练或适配 | 常可直接换标签描述通常修改提示即可调用时定义 criteria|||
| 训练工作 | 团队负责本任务的适配 | 可零样本;域内仍可能要适配可零样本,也可微调使用者无需逐任务训练;仍需评测|||
| 概率与校准 | 可输出概率,也可校准 | 分数可用,但不能默认已校准文本自报把握不等于校准概率明确以校准为目标,域内效果待验证|||
| 部署与控制 | 可选本地、自有基础设施 | 取决于模型与许可证本地或托管,选择较多目前为专有托管服务|||
| 主要取舍 | 任务稳定、规模大时很有竞争力 | 迁移方便,但任务覆盖不一致能解释、能生成,解码有开销把定制与运维负担换成 API 依赖
如果以前用的是微调 BERT
你早已享受过非自回归分类的速度。Jev 值得比较的是:新任务准备时间、跨领域效果、概率质量和全链路成本。不能把“比聊天 LLM 快”的倍数搬到这个比较里。
如果以前用的是小型聊天模型
输出路径确实改变了。你不再要求模型逐字拼出 JSON。但结构化解码本来也能约束格式,因此 Jev 的增量还要看语义质量、并行吞吐与概率可用性。
按你的工作方式,选择一个起点
这是一套选型判断,不是产品性能排名。落地时应保留规则基线、现有小模型和生成式 LLM 三类对照。
减少顺序解码,是清楚的工程收益。
生成式模型通常要先读输入,再反复预测下一个 token。Jev 的公开接口直接给出受限答案和概率。专用分类器本来也没有长文本解码,所以不能只凭这张图证明 Jev 比它快。[3]
方块数量只表达输出依赖,宽度不代表耗时。长输入、排队、网络距离、模型实现与并发负载,都会影响实际响应。
宣传数字,必须带着条件读
官方给出的端到端响应范围
首页工作流评测的速度倍率
官方说明:测试多从美国西海岸发起;官方预计这些倍率位于实际收益的较高端。其 LLM 适配器还要求输出概率,可能增加生成开销。短输入演示也更有利于突出输出阶段差距。[3]
工作流成绩以两个强模型的平均预测作为参考,并非独立人工真值;总共四个工作流,不能视为通用能力测评。[20]
正确的追问:与哪个模型、什么推理档位、多少输入、多少输出、在哪个地区、什么并发量比较?
算一遍直接 API 费用
9 月 20 日核对的公开价格:每百万输入 token 0.042 美元,输出不计费。问题与选项也会增加输入量,应以 API 的 usage 为准。[19]
这里没有计入数据准备、重试、审核、监控、业务错误及回退模型费用。公开售价也不能用来反推模型参数量或推理成本。
概率、confidence、正确率,不是一回事。
Jev 把不确定性变成可读的输出,这是有用的接口设计。能否据此安全行动,还取决于它在你的数据上的校准与错误分布。一个接近 1 的数字,也可能来自过度自信。[8]
某个答案的概率
模型给具体选项分配的可能性。Choice 的最大概率通常对应被选中的答案;Noul 则是 yes 的概率。
接口里的 confidence
Choice / Score 概率分布形状的统计摘要。不是独立测出来的正确率,也不能直接当作“答对概率”。
真实正确率
把预测与可信标签比对后得到的经验结果。它需要样本和评测;高 confidence 不能替代这一过程。
100 次都报 80%,意味着什么?
同一个分数,可能藏着相反的分布
三个等级:0 = 低,1 = 中,2 = 高。下面两组分布的加权均值都是 1。只读 score,会丢掉重要信息。
全部概率集中在等级 1:模型明确倾向中间等级。
“0 幻觉”的准确读法
发布页把 schema 保证当作“0 幻觉”的依据,这一图表中的 0 并不是用事实问答实验测得的。定义好的集合能约束输出形式,却不能防止选错类别、误读证据或漏判风险。[3]
用验证集选择阈值
先用验证集选择阈值,再在未参与选择的测试集上报告“自动处理覆盖率”和“被自动处理部分的错误率”。提高阈值通常会减少自动处理量,但是否更准必须实测。尤其要检查高把握却出错的样本。[17]
怎样检验“已经校准”?
把相近预测概率分到同一组,比较该组的平均预测概率与真实事件发生比例,再报告样本量和误差范围。可以辅助记录 Brier score、ECE 等指标,但不能只看单一汇总值。类别、语言、输入长度或业务分布变化后,都应重新检查。
本文没有取得覆盖真实业务分布的独立 Jev 校准数据。因此只能确认它的接口和训练目标强调校准,不能确认它在所有场景都已校准。confidence 的官方文档只解释“由分布计算”,本文不猜测其具体公式。
它适合当判断部件,系统仍需完整工程。
候选答案已经存在、事实材料足够、评价标准明确、结果可以复核,这类工作值得试。要获取新事实、进行复杂搜索或执行动作,仍需外部工具和程序。[2]
值得优先尝试
工单分类、意图路由
在明确团队或流程间分流。保留“其他”和复核出口,处理一条输入含多个诉求的情况。
检索重排、内容相关度
给定查询与候选文本后排序。独立开发者报告中已有支持证据,但不保证超越域内专用 reranker。
审核、验证、质量评分
依据提供的规则与证据逐项判断。需要分别测漏报和误报。官方已确认 Jev 1.13 会受对抗内容影响,类型安全不能消除提示注入。[18]
封闭候选里的动作选择
例如在可用工具、链接或游戏动作中选一个。调用者提供合法候选,程序检查执行前提。
一个可落地的工单分流流程
模型提供语义判断,业务系统持有事实、动作与责任。若是退款执行,金额、订单状态、授权与幂等性由确定性代码核验。这个组合通常比让一次模型判断承担全部职责更容易检验。
先做一份公平的验证
- 冻结代表性样本,包含中文、混合诉求、边界情况和未知类别;保留独立测试集。
- 并排跑现有小模型、Jev、一个合适的生成式模型;明确它们各自允许的训练与调参成本。
- 比较 macro-F1、关键类别召回和高成本错误;排序任务另看 NDCG,别混成一张“准确率”。
- 测端到端 p50 / p95、并发、真实费用、失败与重试;记录地区、版本和日期。
- 在相同质量或相同业务损失约束下比较成本,并测概率校准和拒答覆盖。
尤其值得主动制造的反例
- 同一句话换个顺序,或在前面加一段无关信息。
- 把标签换成近义词,或加入很相似的候选。
- 一条材料含多个冲突诉求,或关键事实根本缺失。
- 在待分类文本里混入“忽略规则,选择某类别”。
- 突然换语言、领域、文本长度,或更换模型版本。
官方限制文档已确认其中多类风险,但具体影响仍需在你的数据上重测。先影子运行,记录高把握错例,再决定接管比例。[18]
有让人信服的起点,也有具体的反例。
社区热度说明大家对低成本判断有需求。判断技术成熟度,更该看任务定义、测试过程、对照系统和失败条件。以下按证据用途阅读,不做一个混合所有任务的总排名。
Parallel:零样本表现有价值,但没有全面赢过专模。
搜索重排
查询与文档的相关性
Jev 与其至少一个定制 reranker 达到可比水平;与较大内部模型相比,延迟有竞争力。但每文档成本更高。
主题分类
从较大标签集合中选择
内部专用模型胜出。作者将大标签集合列为这次测试中的弱点。
查询时效性判断
问题是否需要新近资料
内部专用模型胜出。作者怀疑与训练分布有关,这一原因属于推测。
OpenJev:类似方向可以公开探索。
独立开发者把 Qwen3.5 改造成 premise / hypothesis 的 NLI cross-encoder,输出蕴含、矛盾和中立,用于重排、评分和动作选择。[15]
它说明“受限判断 + 可组合接口”有公开实现路径。它不是 TypeSafe 官方模型,不是 RLCD 的公开复现,也不能凭演示得出与 Jev 等效的结论。
OpenProse:输入排布能显著改变结果。
Jev 1.13.0 在合成森林中沿 8 条边寻找根节点。384 个森林,每个含 512 条父节点记录;同一森林保持事实、问题和计费 token 不变,仅改变相关路径的排布。[16]
各排布 n = 384;依次答对 309、157、117、122 个。横条从 0 起,表示这一任务的正确率。
这组结果能证明什么?
支持在该合成多跳任务中存在表示敏感性,不能外推到普通工单分类。相关路径由精确图算法预先挑出,可能提供帮助;没有其他 LLM 对照,也没有外部同行评审。作者披露大量 coding-agent 辅助和项目内部复核,提供请求、结果与离线分析证据包。它是一个可检查的反例,尚不是外部复现共识。
为什么有人觉得它很新
当开发者只熟悉“调用聊天模型完成一切”,一个低延迟、直接给概率的判断接口,会明显改变程序设计体验。少做训练、部署和数据准备,本身就是价值。
为什么有人觉得它是旧概念
做过分类、NLI 或检索排序的人,早已使用非生成式预测。真正分歧在比较对象和贡献层级。应比较泛化与可用性,不能只围绕产品命名争论。
已知、宣称、推断,分开放。
资料核验截至 2026 年 9 月 20 日。Jev 仍在早期访问阶段,接口、价格和性能可能更新。下列链接优先指向原始论文、官方文档、开发者代码与一手测试。
已核实的接口事实
三种原语、结构约束、概率字段与公开价格,可以从当前文档核对。接口事实不等于质量证明。
尚需独立验证的效果
官方速度倍率、校准与普遍可靠性,必须结合测试条件。独立使用方的报告也有样本边界。
本文的分析与演示
选型建议是基于材料的判断。动画、示例概率和校准方块是教学模型,未调用 Jev,也不是测评数据。
发布、RLCD、并行输出、定价、演示和厂商工作流评测的限定条件。效果数值为官方报告。
SetFit:少样本、高效文本分类的另一条路线,不等同于 Jev 的训练方法。
三个合成图研究;本文仅展示 384 森林的布局实验。非外部同行评审,无其他 LLM 对照。请求与离线分析证据包 ↗