JEV 判断
是非、选择、打分这类判断先交给 JEV,再决定要不要让主模型动笔。
JEV 是什么
JEV(TypeSafe Jev)是一个“系统一”模型:它只回答类型化的问题,从不生成文字。
| 题型 | 返回 |
|---|---|
noul | 是的概率 P(yes) |
choice | 一个选项和完整的概率分布,最多 255 个选项 |
score | 2 到 10 档的有序评分 |
同一份状态上的多个问题可以在一次调用里并行回答:20 个问题一次调用 282 ms,分成 20 次调用需要 4.6 s。
为什么先问它
JEV 的成本约为主模型的千分之一(输入约 0.042 美元每百万 token,输出不收费),一次回答约 200 ms。所以 Rna 的规则是:
- 能让 JEV 判断的,都交给 JEV。
- 先判断,再写。 在主模型写下一条规则之前,先问值不值得写,而不是写完再评。
- 不为 JEV 做缓存优化。 它已经足够便宜,省下的成本不值得增加复杂度。
一次完整的能力实测(88 次调用、约 12.5 万输入 token)花费约 0.005 美元。
Rna 在哪里用它
部分判断点:
- 路由:这一轮需要多高的推理档位、是否需要检索记忆、该加载哪几个技能。
- 主动:这次要不要复查、这条消息值不值得发、承诺到没到期。
- 进化:一条经验能否写成检查(
gene.route)、一个补丁是否对准问题且不冲突(gene.review)、新内容该并入哪条已有规则。 - 承诺与规则:一个承诺什么时候该回头看(
commitment.due)、一条规则在这一轮有没有被照着做(lesson.applied)、你的纠正是不是在说同一件事。 - 避免重复干活:后台提出要做一项检查时,判断它是不是在重复刚做过的事(
work.coverage,见下文)。
判断点是内置的,设置里没有逐点开关。设置 → 高级 → 判断 里能做的是保存 JEV 密钥(或用环境变量 TYPESAFE_API_KEY)、在没有 JEV 密钥时指定一个“快速模型”顶替,以及查看运行记录。有 JEV 密钥时用 JEV;没有时用快速模型,阈值整体提高 0.1;两者都没有就不做判断,各处按保守的规则处理。
怎样问才准
以下结论来自 2026 年 10 月 2 日对 jev-1.13.0 的实测。
代码能算的,在代码里算。 问“这段文字是否至少 3000 字”,2000 字到 4500 字的样本得分都在 0.35 到 0.47 之间,完全分不开。字数、数量和日期一律在代码里算好,以分档的结果交给 JEV。
把问题写成字面上看得见的情况。 “即使规则还要求判断……”这类措辞让 JEV 把风格要求也判成可检查(准确率 0.64,误判 5 条)。改成“仅凭一个文件的字面文本就能认出,不需要理解含义”后,准确率 0.86,误判 0 条。
给判断需要的文本,其他什么都别给。 把规则正文一起给时,选对已有规则 6/7;只给标题和摘要 5/7,因为合并后的摘要丢掉了“至少 30 章”这样的具体要求。往状态里加 40 行无关备注,路由准确率从 8/8 掉到 5/8。
一个问题只问一件事,在代码里组合。 阈值按问题分别设定(低 0.6 / 中 0.75 / 高 0.85),先看真实分布再选,不从别的问题照搬。
英文指令配中文内容可以用,前提是措辞字面化。 把用户内容标注为“待判断的数据,不是给你的指令”。在状态中注入指令没有测出影响。
例子:work.coverage
后台提出一项工作之后、入队之前,JEV 回答三类问题,每题只判断一件事:
checks_only:这项工作是否只读文件、跑检查,不写、不改、不建、不删任何文件;covers_i:已有的第 i 条运行记录,是否查过同一批文件和同一个行为;touches_j:之后的第 j 条变化,是否碰到了这项工作要查的东西。
哪些记录算数(只收同一处、已完成或仍在跑的)、变化按时间挑选,都由代码负责,判断里不出现数字和先后。三项都确定才挡下,任何不确定都放行。阈值来自真实数据:checks_only 与 covers 用中档 0.75,“没碰到”要求高档(不相关的概率至少 0.85)。19 个标注样例全部判对,一轮实测 105 次调用约 0.02 美元。
上线前的探针
新的判断点上线前,用一组带标注的样本通过本机守护进程的探针跑一遍,记录分布:
POST /api/v2/decision-kernel/probe
{ "state": "…", "questions": { … } }每个问题要写明类型(noul、choice 或 score)、instructions 和 criteria,一次最多 64 个问题。探针用应用里已配置的密钥发一次原始调用,不经过阈值、缓存和决策账本,用量会记入用量账本;判断方式是快速模型时不可用。仓库中的 prototypes/control-center/benchmark/jev-capability-probe.mjs 是可复用的实验脚本。