Jev 是什么:一个不会聊天的 AI 模型,和大模型该怎么分工

1 查看JevTypeSafe AISystem One分类模型路由护栏大语言模型

Jev 是 TypeSafe AI 于 2026 年 9 月 15 日发布的「System One 模型」:不生成文字,只从你事先定义好的选项里做判断,并给出概率。本文按官方文档讲清它怎么工作、适合接管哪些判断、官方自己承认的短板,再对照独立测试看宣传数字能打几折,最后给出从一个判断点开始试用的步骤和与大模型分级配合的做法。

九月下旬,开发者圈里突然到处是一个叫 Jev 的模型:GitHub Trending 上连着出现带 jev 前缀的项目,技术媒体轮番报道,有人说它是「会思考的分类器」,也有人说它会让一半的大模型调用失业。它和常见的 大语言模型 最大的不同是:不写字,只做选择题。

这篇文章回答四个问题:Jev 到底是什么;它适合接管你系统里的哪些判断;它明确做不好什么;以及如果想试,该怎么和现有的大模型分工。

一只手把一张空白索引卡快速投进浅色木制分拣架三个格子中的一个,每个格子里已有几张只在边缘带一道灰绿、沙色或石板色的卡片,旁边的浅盘里单独放着两张待复核的卡片

一只手把一张空白索引卡快速投进浅色木制分拣架三个格子中的一个,每个格子里已有几张只在边缘带一道灰绿、沙色或石板色的卡片,旁边的浅盘里单独放着两张待复核的卡片

图 1:Jev 做的事更像分拣而不是写作:格子是你事先定好的,它只负责把每张卡投进最可能的那一格,并说出自己有多确定。拿不准的,留给更慢的模型或人。

一句话结论: Jev 适合接管「选项事先确定、需要大量重复、对延迟和成本敏感」的判断,比如分类、路由、审核初筛和打分;它不写文字、不擅长算数和多步推理,宣传里的百倍提速降本在独立测试中没有复现。比较稳的用法是让它当第一道关,用置信度决定哪些结果直接放行、哪些升级给大模型或人工。

下面结合 TypeSafe 的 jev-1.13.0 文档、Vercel 的采用数据和第三方测试,看看 Jev 适合处理哪些任务。它仍处于早期访问,价格、速率限制与版本要看当前官方说明。

Jev 是什么:先把事实摆清楚

  • 谁做的: TypeSafe AI,一家 2024 年成立、总部在旧金山的公司。创始人兼 CEO Diogo Almeida 此前在 OpenAI 工作约四年,参与了指令跟随相关研究;联合创始人还有 Erik Gafni 和 Sasha Sheng。
  • 什么时候: 2026 年 9 月 15 日,TypeSafe 在官方博客宣布结束两年的隐身期,发布 Jev 并开放早期访问(需排队,官方说在尽快放人)。同日公布了由 DCVC 领投的 4000 万美元种子轮。
  • 是什么: 官方称之为第一个「System One 模型」,名字借自卡尼曼《思考,快与慢》里快速、直觉式的「系统 1」。模型名 Jev 取自经济学家 William Stanley Jevons,也就是「杰文斯悖论」的那位:效率越高,需求反而越大。
  • 现在的版本: 文档列出的当前模型是 jev-1.13.0,jev-latest 和 jev-preview 两个别名目前都指向它。

关于热度,有两个数字常被引用,都要看清是谁说的:

  • Vercel 称,Jev 在其 AI Gateway 上线 24 小时内,被接近 13% 的付费团队用过,是该网关历史上采用最快的模型;Vercel 自己也补了一句,接下来要看这种早期热度能否持续。
  • 据 The Information 报道,有投资人在讨论以超过 100 亿美元的估值投资 TypeSafe。这只是融资谈判的报道,TypeSafe 没有确认,不是已完成的融资。

它怎么工作:状态加问题,换回带概率的答案

用大模型做判断,通常是这样:写一段提示词,让模型输出 JSON,再解析、校验,偶尔还要处理它答非所问或格式出错。Jev 把这一套换成了另一种接口:你交给它两样东西,state(状态)和 questions(问题)。

  • state 是需要判断的材料:一条客户留言、一段交易记录、一份政策文本,可以是字符串、JSON 对象或文本数组。
  • questions 是一组有名字的问题,每个问题属于三种类型之一,答案的形状事先就定好了。
类型问的是什么返回什么例子
Choice从一组选项里选一个选中的选项、每个选项的概率、置信度这张工单该交给账单、技术还是销售?
Score在有序的几个等级上打分分数、每个等级的概率、置信度客户情绪是平静、不满还是非常愤怒?
Noul一个陈述是否成立0 到 1 之间的概率这条消息是否在要求退款?

一次请求里可以混用这三类问题。按官方文档的说法,每个问题都针对同一份 state 并行、独立地评估,所以多加几个问题几乎不增加响应时间,问题之间也不会互相干扰。官方快速上手示例里,一条抱怨 Stripe 集成连续三天失败的工单,被 Jev 判为交给技术团队(概率 0.85),情绪等级为「不满但克制」,紧急程度的 Noul 为 1.0。

Jev 调用流程图:左侧的 state(客户留言、交易记录、退款政策)和 questions(Choice 判断交给哪个团队、Score 判断客户有多着急、Noul 判断是否在要求退款)一起送进 Jev,Jev 在一次请求里对各问题并行、独立地判断,返回带类型的答案,包括选项和各选项概率,Choice 与 Score 另附置信度,最后交给你的代码去分支、排序和路由,算术和日期比较也放在代码里

Jev 调用流程图:左侧的 state(客户留言、交易记录、退款政策)和 questions(Choice 判断交给哪个团队、Score 判断客户有多着急、Noul 判断是否在要求退款)一起送进 Jev,Jev 在一次请求里对各问题并行、独立地判断,返回带类型的答案,包括选项和各选项概率,Choice 与 Score 另附置信度,最后交给你的代码去分支、排序和路由,算术和日期比较也放在代码里

图 2:Jev 的一次调用。模型只负责「这段材料属于哪一类、程度如何、某件事是否成立」这类判断,分支逻辑、阈值和算术都留在你自己的代码里。

这种设计带来三个直接后果:

  1. 不会出现格式错误。 答案只能落在你定义的选项里,不需要解析文本,也不会冒出选项之外的值。官方博客的「0% 幻觉」说法就是这个意思,并注明这个数字「不是实测得来的」,而是由结构保证的。注意,这只说明它不会答出选项以外的东西,不代表它选得对,下文会看到独立测试里的准确率。
  2. 每个答案都带概率。 你的代码可以按概率排序、设阈值,或者在不确定时换一条处理路径,而不是只拿到一个非黑即白的结论。
  3. 价格结构不同。 官方定价是每百万输入 Token 0.042 美元,输出免费。按这个价格粗算:一千条平均 400 Token 的工单,输入约 40 万 Token,约 0.017 美元(这是本文按官方单价自行计算,实际还取决于问题数量和 state 长度)。

官方还给了几个硬边界:单次请求上下文 64k Token,其中 state 加上最长的那个问题不能超过 32k;Choice 最多支持 255 个选项;只接受文本,图片、音频、视频要先自己转成文字;速率限制写的是每秒 10 万 Token、40 次请求,但文档注明需求太大,限额可能随时调整。

和大模型怎么分工

把 Jev 理解成「更便宜的大模型」会用错地方。它和大模型擅长的是两类事,官方文档举的例子也是让两者配合,而不是替换。

大语言模型Jev
输出任意文字:回答、代码、摘要、解释预先定义好的选项和概率,不产出文字
擅长开放式问题、生成内容、多步推理、需要解释的判断选项已知的快速判断:分类、检测、打分、排序、路由
接入方式解析文本或 JSON,要处理格式错误和答非所问直接拿到带类型的值,代码可以直接分支
延迟与成本秒级,输出 Token 通常比输入贵官方称 70–500 毫秒,输出免费
不确定性需要另外让模型报置信度,通常偏乐观每个答案都附概率,可以直接设阈值

我们的判断是:凡是你已经在用大模型「做选择题」的地方,都值得评估一下 Jev;凡是需要它写点什么、解释为什么,或者要一步步推下去的,继续用大模型。

一个典型的混合结构是退款工单:先由 Jev 在一次请求里回答「是否在要求退款」「证据是否指向重复扣款」「政策是否支持退款」三个问题,代码再结合订单金额等确定性检查决定下一步。需要给客户写回复时,才调用大模型。

适合交给 Jev 的判断

结合官方用例和社区早期项目,下面几类最贴合它的形状:

  • 模型路由: 判断一条请求的意图、难度或风险,决定交给便宜模型、强模型还是人工,也就是常说的 模型路由。官方把它列为主要用例之一。
  • 护栏与安全检查: 在大模型的输入、输出和工具调用前后加一道语义检查(即 护栏),比如是否疑似越狱、是否泄露敏感信息、工具调用是否出错。它的成本低到可以每一步都查。
  • 内容审核初筛: 先用 Noul 判断是否需要审核,再用 Choice 分到骚扰、垃圾信息等政策类别,按概率决定放行、提醒、送审还是拦截。
  • 检索结果的相关性打分与重排: 在 RAG 流程里判断候选片段是否与问题相关,补充或部分替代 向量嵌入 的粗筛。
  • 批量数据打标签: 给大量日志、评论、工单打上意图、情绪、主题等标签,作为后续统计或传统机器学习模型的特征。
  • 评测与复核: 检查引用是否支持结论、回答是否符合某条规范。这和 LLM 评测 里的「用模型当评委」是同一类任务,但只适合答案形状固定的评分项。

共同点是:选项能事先列清楚,单次判断一个懂行的人几秒钟就能做出,而且要做很多次。

不适合做什么:官方自己列出的短板

TypeSafe 在文档里专门写了一页 jev-1.13 的「能力短板」(最后复核于 2026-09-17),这比任何宣传都值得先读。要点如下:

  1. 只按字面理解。 它回答的是你写下的问题,不是你心里想问的问题。否定词、限定范围和隐含条件都会按字面处理,边界情况要写进选项说明里。
  2. 不擅长数学和计数。 数一段话里出现了几次某个词、比较两个数值大小,都不可靠。官方建议:能用代码算的一律用代码算。
  3. 不擅长日期比较。 哪个日期更早、是否落在某个时间窗口内,都不要交给它。可以让它从文本里把年、月、日拆出来,比较留给代码。
  4. 多层间接推理会掉准确率。 双重否定、「某个属性的属性」这类要绕几步的问题,要拆成几个直接的问题。
  5. 无关内容越多越不准。 state 里塞了大量和问题无关的内容,会干扰判断。先在代码里过滤,只发送需要的字段。
  6. 会被对抗性内容带偏。 官方直说,Jev 默认不把 state 当成敌意内容,注入的指令或刻意误导的措辞能改变它的答案。所以拿它做 提示注入 检测时,本身也要测对抗样本。
  7. 指令和选项说明矛盾时会混乱。 比如让「是」对应「否」这种绕法。
  8. 同一个问题换个问法,概率不能互相换算。 官方举的例子:「是否在要求退款」和「是否在要求退款以外的事」两个 Noul 的概率相加是 1.19,而不是 1。用 Noul 调好的阈值,不能直接搬到 Choice 上用。
  9. 不会生成文字。 需要抽取某个值时,官方建议先用正则或生成式模型列出候选,再让 Jev 在候选里选。

另外两条对中文用户尤其重要:

  • 中文不是它的强项。 文档写明,英文是主要训练语言,准确率目前最好;中日韩等语言可以处理,但表现不如英文,官方建议先用自己的数据测过再上线,并格外关注置信度。
  • 目前是闭源托管服务。 Jev 是专有模型,权重不公开,官方文档只提供托管 API,没有私有化部署选项;企业客户可以申请零数据保留(ZDR)。数据要出境时,得先过一遍自己的合规流程。

宣传数字和独立测试差多少

TypeSafe 首页上最抢眼的是「最高快 193.6 倍、便宜 444.6 倍」。这两个数字来自它自己设计的「工作流评测」,官方博客对此写了不少限定条件,值得原样转述:

  • 参照答案用的是 GPT-6 Astra 和 Fable 5.1 两个大模型回答的平均值,所以这里的「准确」指的是「和这两个大模型的答案一致」,不是和人工标注一致;
  • 工作流是 TypeSafe 模型能力团队的成员写的,官方承认「可能存在一些偏差」;
  • 官方自己也说,这些倍数「应该属于真实场景收益的上限」。

发布后不到一周,陆续出现了第三方测试。各家任务和设置不同,下面只列能追到原文的几项:

  • AY Automate(9 月 19 日) 用 791 条带标注的判断、在意图路由和提示注入检测三个任务上,把 Jev 和 GPT-5.4 nano、Gemini 3.5 Flash-Lite、Claude Haiku 4.5、GPT-5.6 Terra 做了对比。结果是:Jev 的准确率和几个小模型持平,在 77 类意图路由上落后 GPT-5.6 Terra 约 5 个百分点,且差距有统计显著性;中位延迟 0.33 秒,约是 GPT-5.6 Terra 的 3.6 倍快;8 类路由每千次判断约 0.015 美元,比最便宜的小模型还便宜约 4.7 倍。测试方自己注明:只跑了一轮,大模型都用了最低推理档,也不是真实客户业务。
  • 一篇汇总八天社区测试的综述(9 月 24 日,DEV Community) 的结论是:Jev 每次都返回有效选项,准确率与中等价位的大模型持平,比顶尖模型低 6.5 到 11.5 个百分点。概率校准开箱即用时有偏差,但用 50 到几百条自有标注数据拟合一个温度参数,就能把大部分校准误差修正回来。
  • 钓鱼邮件检测 这个例子最能说明用法的差别:把「这是不是钓鱼邮件」作为一个问题直接问,Jev 的准确率只有 62.6%;拆成五个具体的小问题,再用一半标注数据拟合组合权重,在另一半数据上达到 95.0%。

我们的解读是:「快和便宜」是真的,但幅度远没有宣传的百倍;「准」要看任务,而且很依赖你怎么拆问题、有没有自己的标注数据做校准。把它当作一个需要调教的高速组件,比把它当作「更聪明的分类器」更接近事实。

想试的话:从一个判断点开始

如果你的系统里已经有「用大模型做选择题」的环节,可以按下面的顺序评估,不要一上来就整体替换。

  1. 挑一个判断点。 选一个选项固定、调用量大、错一次代价不高的环节,比如工单分流、评论打标签。避开涉及退款、封号这类不可撤销的动作。
  2. 准备 200 到 1000 条有人工答案的历史数据。 这是后面所有判断的基准,也是校准阈值的依据。没有这份数据,就没法知道它在你的业务上到底准不准。
  3. 把问题拆成原子问题。 一个问题只问一件事,每个选项写清楚边界,比如「交给技术团队:报错、集成失败、功能异常」。能用代码判断的条件(金额、日期、字数)先在代码里算好。
  4. 影子运行。 线上继续用原来的方案,同时把同样的输入发给 Jev,只记录、不生效。对比准确率、延迟和成本。
  5. 按置信度分级。 用标注数据找出一个置信度阈值:高于阈值的直接采用 Jev 的答案,低于阈值的升级给原来的大模型或人工。AY Automate 的测试里,按 0.80 置信度分流后,组合准确率和单用 GPT-5.6 Terra 持平,成本只有它的 26% 到 28%。
  6. 固定版本号。 生产环境里写 jev-1.13.0,不要写 jev-latest。别名会随新版本移动,你调好的阈值可能随之失效。

分级处理流程图:一条待处理的数据先由代码做确定性处理,包括过滤无关字段、计数和日期计算,然后由 Jev 回答几个原子问题;若置信度达到你用标注数据定的阈值,代码直接按答案分支,未达到则升级给大模型或推理模型再判断;若动作不可撤销或影响用户,进入人工复核,否则按大模型结果执行并记录日志

分级处理流程图:一条待处理的数据先由代码做确定性处理,包括过滤无关字段、计数和日期计算,然后由 Jev 回答几个原子问题;若置信度达到你用标注数据定的阈值,代码直接按答案分支,未达到则升级给大模型或推理模型再判断;若动作不可撤销或影响用户,进入人工复核,否则按大模型结果执行并记录日志

图 3:先 Jev、后大模型、最后人工的分级结构。阈值要用自己的标注数据定,不要照搬别人的数字。

接入方式上,官方提供 HTTP 接口(POST /v1/systemone)、Python 和 JavaScript SDK,以及一个供编程 agent 使用的技能包;第三方测试里也有通过 OpenRouter 调用的,Vercel AI Gateway 同样已上架。如果你的系统已经通过 LangChain 这类框架或统一的 API 网关 调模型,接入成本会更低。

常见坑

  • 把一个复杂判断塞进一个问题。 「这个候选人合不合适」是好几个判断的组合,直接问准确率会很差。拆成经验是否匹配、技能是否覆盖、有没有硬性不符等,再在代码里组合。
  • 把置信度当正确率。 官方文档说得清楚,校准是在一批预测上统计出来的,不保证单个答案正确;独立测试也发现开箱即用的概率存在偏差。阈值一定要用自己的数据定。
  • 忘了给「都不是」留选项。 Choice 只能在给定选项里选,如果真实情况不在其中,它也会硬选一个。加一个「以上都不是」或「信息不足」,把这类情况分出去。
  • 直接喂中文长文本。 语言和长度两个短板叠在一起,准确率会明显下降。先裁剪到必要字段,并单独评估中文样本。
  • 只看首页倍数做预算。 真实场景的提速和降本,应该以你影子运行的数据为准。

谁适合用,谁可以先等等

比较适合:

  • 已经在用大模型做分类、路由、审核初筛,调用量大、成本或延迟成为瓶颈的团队;
  • 在做 agent 或 Harness 工程,想在每一步加一道便宜的检查或路由的开发者;
  • 手里有标注数据、愿意花时间拆问题和调阈值的工程团队。

可以先等等:

  • 需求主要是生成内容、写代码、做摘要的用户,Jev 帮不上忙;
  • 主要处理中文、又没有条件做本地评测的团队,建议等更多中文场景的测试结果;
  • 需要私有化部署或数据不能出境的场景,目前官方没有对应方案;
  • 每天只有几十次判断的小流量应用,直接用小模型更省事,省下的钱不值得多维护一套组件。

替代方案

  • 大模型的结构化输出: 主流大模型都支持按 JSON Schema 输出,配合重试校验,能拿到类似「只在选项里选」的效果,只是更慢、更贵,而且不直接给概率。
  • 便宜的小模型: Claude Haiku、GPT nano 这类小模型,在 AY Automate 的测试里准确率和 Jev 大致相当,胜在接入熟悉、能顺带生成文字。
  • 传统分类器: 如果类别稳定、标注数据充足,微调一个小型文本分类模型,或用向量嵌入加逻辑回归,成本和延迟可以更低,还能完全私有部署。
  • 规则加关键词: 对边界清楚的判断(是否包含手机号、订单号格式是否正确),正则和规则仍然是最可靠的第一道关。

想系统比较这些方案的效果,可以参考本站的 《如何评测一个大模型》,用同一份标注数据横向测。

小结

Jev 值得关注,不只是因为它快、便宜,而是它把「让 AI 做判断」这件事变成了一个带类型、带概率、可以直接写进代码的函数调用。这对需要大量自动化判断的系统来说,是一种更干净的接口。

但它不是更聪明的大模型,也不是万能分类器:只擅长选项已知的快速判断,算数、日期和多步推理都要留给代码或大模型,中文表现也需要自己验证。最稳妥的做法,是从一个低风险的判断点开始影子运行,用自己的标注数据定阈值,再决定要不要扩大使用范围。

参考资料

信息有误?反馈纠错

请选择问题类型,无需登录或留下联系方式。