一文读懂 LLM 与 Jev

moye Lv6

摘要 现在的 AI 系统里,大量环节只需要「做个判断」——这条消息转给谁、这个结果可不可信、下一步调哪个工具——但我们一直在用会写作文的模型去干判断的活。Jev 是 TypeSafe AI 的「System One」模型:它不生成文本,只输出带校准概率的类型化决策,一次并行交卷,不做逐字接龙。这篇文章讲清三件事:它的机制为什么快、它和 LLM 的分界线划在哪、以及哪些活现在就该交给它、哪些必须继续留给 LLM

读完你能判断

  • 一个任务是该用 Jev 还是 LLM(五道关卡逐条过)
  • Jev 的「便宜一百倍」到底成立在哪,以及它的六个已知盲区
  • 它和自己的前四代方案(规则 / 经典 ML / BERT 分类器 / LLM-as-judge)差在哪

原理介绍

Jev 是什么,解决什么问题

Jev 是 TypeSafe AI 在 2026 年 9 月 15 日发布的第一个 “System One” 模型,发布同日公司宣布完成 DCVC 领投的 4000 万美元融资。

修的是一个错配:现在的 AI 系统里大量环节只需要做个判断,但我们一直在用会写作文的模型去做判断。判断一句话属于哪个类别、判断一次请求该路由到哪、判断一份输出该不该放行,这些环节要的答案就是一个选项或一个分数。可通用大模型(LLM)被调用时,整个逐 token 生成机制都被拖着跑,既慢又贵,还可能顺嘴编出不存在的东西。


从双系统理论说起:System 1 与 System 2

“System One” 这个名字借自卡尼曼在《思考,快与慢》里的双过程理论。人脑有两套思维系统,分工不同。

System 1 是快思考:直觉式、并行、毫秒级响应、几乎不耗注意力。老司机看到前车刹车灯亮,脚已经踩下去了,中间没有推理,是模式匹配。它快、省、稳定,对同类刺激永远给同类反应;短板是只会处理见过的模式,答不了开放题,也说不出理由。

System 2 是慢思考:推理式、串行、要靠主动注意力。做数学题、写方案、权衡利弊靠它。它能处理开放和复杂的问题,但慢、贵、容易疲劳走神。

映射到 AI,错配就显出来了。今天的 LLM 能兼职做判断,但它的工作机制(自回归生成加大上下文窗口)本质是 System 2 形态:串行、贵、结果随上下文漂移。而一个实际跑起来的 agent 系统里,System 2 型的活(规划、写代码、生成回复)只占少数步骤,大量中间步骤是 System 1 型的微判断:这条消息转给谁、这个结果可不可信、下一步调哪个工具。这些微判断一直由 System 2 形态的 LLM 兼职,就是 Jev 想修的错配。

还要说明:两套系统是分工关系,不是替代关系。人不是只靠 System 1 或只靠 System 2,而是 System 1 出直觉、System 2 在关键处复核。agent 系统同理,高频微判断交给 System 1 形态的组件,关键推理留给 LLM。Jev 补的是缺位的前者,不是要推翻后者。


核心工作原理

Jev 的用法是”喂状态、问一组带类型的判断题、一次并行交卷”。

输入是程序状态,不是聊天记录。交给它的是当前上下文(比如用户的一句话加一份选项列表)和一个问题清单。

问题必须带类型(typed questions),比如”匹配项是哪个?答案限 menu 里的枚举””有无歧义?bool”。类型约束是硬的:菜单里没有的选项,它在输出格式上就表达不出来。

回答是单次并行完成的,不做自回归解码(non-autoregressive,不一个字一个字往外蹦),直接给出结构化结果。

输出是带校准概率的类型化决策(calibrated probability),不是文本。置信度是校准过的,0.8 大致意味着十次对八次,可以拿来做阈值。

业界有人把它概括成”一个可以像调 LLM 一样调用的分类器”,因为对自动化系统而言,文本本来就是错误的输出格式。以上用法描述综合自 Eigent.ai 与 LangChain 的指南。


技术架构:Jev 为什么快

LLM 输出文本的方式就是接龙:每次只算出下一个字,而且必须等上一个字定了才能算下一个。回一句”您要测的是 T1 还是 T2”,十几个字就要串行走十几步。这不是工程偷懒,是任务性质决定的,写作文时下一个字是什么确实取决于前面写了什么。代价也就清楚了:回答越长越慢,整条路是串行的,没法靠并行提速。这种”下一个依赖上一个”的生成方式叫自回归(autoregressive),记住”接龙”这个画面,后面遇到这个词都是这个意思。

Jev 不写字,它填答题卡。它的输出不是句子,是几个带类型的答案:选哪个选项、打几分、是还是否。这些答案彼此不依赖,”选 T1”不需要等”有无歧义”先算完,所以可以所有题同时作答、一次交卷。这就是非自回归(non-autoregressive)的全部含义:不需要接龙,因为答案天生是并行的。

生成机制对比:LLM 自回归(接龙式,逐字串行)vs Jev 非自回归(答题卡式,所有问题并行作答一次交卷)

所以 Jev 的快不是同样的路线跑得更快,而是换了一条路。判断题的答案本来就是并行的,以前的模型是被按在写作文的流水线上干判断的活。这也带来一个实用推论:加问题几乎不加延迟,新问题和老问题一起并行算,只多花问题本身的 token 钱。

一次调用的完整过程:把上下文和问题清单发过去,模型一次前向计算并行出所有答案,返回的结构化结果里每个问题一个值加置信度,没有任何文本。

延迟方面,AtlasCloud 的拆解称亚 500ms,Forbes 的报道称毫秒级。两个口径差着一个量级,因为测的任务和菜单大小不同,以自己的实测为准。成本方面,输入 $0.042/百万 token,输出免费。输出免费也和架构有关:它没有”生成的输出 token”,输出就几个字段。

置信度这块值得多说两句。让普通 LLM”给个置信度,0 到 100”,它吐出来的数是它写出来的一段文字,和真实对错概率没有必然关系,过度自信很常见。Jev 声称自己的概率是校准过的,官方说法是概率”对结果优化过”(optimized against outcomes),0.8 大致十次对八次。这是拿它做阈值分流的前提,比如低于 0.7 转人工、高于 0.9 自动走。校准质量要拿自己的数据重复验证过才能信

训练方面,TypeSafe 没有公开任何细节,用什么数据、模型多大、流程如何都不知道。目前唯一的公开线索来自 Latent Space 的讨论,其中提到了 RLCD 这个方法。

RLCD 本身是个已公开发表的方法(ICLR 2024 论文,和 TypeSafe 无关)。传统对齐训练(RLHF)要雇大量真人给模型的回答打分,贵且慢;RLCD 换了个思路,先写一份自然语言的”原则说明书”,让模型自己针对同一个问题生成符合原则的正面回答和违反原则的反面回答,一正一反成对出现,再用这些正反例训练一个奖励模型,最后让主模型朝奖励高的方向反复练习。如果 Latent Space 的说法属实,Jev 的判断力就不是靠人一道题一道题标出来的,而是先写规则、自动造正反例、自己练自己。这也顺带解释了它为什么便宜:训练端就不依赖海量人工标注。但 TypeSafe 官方从未确认用的是 RLCD,这属于社区分析。

上下文窗口多大、参数规模多少,都没公布。超大菜单(几千个选项)能不能一次塞进去,只能实测,详见下文「已知局限与信息边界」。

延伸阅读(想看图的从这几个进去):



技术对比

Jev 与 LLM:机制差异与适用场景的分界

维度 LLM(生成式) Jev(System One)
生成机制 自回归逐 token,串行,越长越慢 并行采样,整组判断一次出
输出形态 自然语言(可加 schema 约束) 类型化决策 + 校准概率,格式上给不出菜单外的值
状态 有状态,受上下文和对话历史影响,同题可能不同答 无状态,同输入预期同输出
延迟 秒级 亚秒(第三方口径 <500ms)
成本 输入 $0.2–10/MTok,输出约为输入 5 倍 输入 $0.042/MTok,输出免费
推理深度 强:多步推理、长文、开放问题 弱:单轮封闭判断
领域知识 预训练世界知识(在权重里,管不了) 几乎为零,全靠输入里喂的”小抄”
典型失效 幻觉、跑题、约束被长上下文稀释 排错顺序、答”无命中”,破坏面小
适合的负载 低频高价值的生成 高频低单价的判断

这张表有两行容易误读。”闭卷、编不出菜单外的值”不是 Jev 独有,给 LLM 上结构化输出加枚举约束同样做得到。真正的质差在“状态”和”推理深度”两行:LLM 的判断会随历史漂移,实际系统里反复观察到的现象是,提示词要求某工具只调用一次,带长对话历史时模型调了 4 次,清空历史后仍调 2 次;而 Jev 是无状态的,全部输入就是这道题,不用在十几 KB 规则里找重点。

经济账也会改变用法判断便宜百倍之后,”每条消息都先过一遍分诊””Top-3 候选并行验证”这类用法才成立。贵的时候只能让总经理亲自接电话,便宜了才能雇前台。

另外别指望 Jev 判得更聪明。它的语义理解弱于大模型,领域知识为零,买它买的是便宜、稳定、不占上下文。

分界线可以这样把握。答案不封闭(要产出新内容)、输入读不完(长文档要通读)、判断依据塞不进输入(需要模型自带世界知识),占任何一条就直接用 LLM,不用再想。过了这三条硬关再看经济账:判断频率越高、单次价值越低,Jev 的优势越大;错误代价大的要有兜底;安全放行拦截类的判断两个都不该用,写确定性代码

任务该归 Jev 还是 LLM 的判断路径:封闭集合、输入塞得下、非安全类、高频低成本、错误后果可控,五道关卡依次过滤的决策流程图

典型场景对号入座:

场景 用谁 理由
“用户想做哪类操作” Jev/分诊 封闭集合,高频,错了只是候选不准
方案规划、参数建议 LLM 开放生成,要专业推理
查完结果的复核确认 Jev 可试(先影子对照) 是/否加存疑点,量最大
拦截、审批放行 都不用,代码 安全权威必须可复现可审计
“这句是闲聊还是办事” Jev/分诊 二分类,高频
任务报错的错误族归类 Jev/分诊 封闭错误族,服务侧高频
报告、文档撰写 LLM 纯生成
复杂数据归因分析 LLM 多步推理

Jev 与传统决策模型的区别

“用模型做判断”不是新鲜事,Jev 之前已经有四代方案,不摆出来就说不清 Jev 新在哪。

第一代是规则与专家系统(if-else、决策树、正则匹配),知识全部来自人工编写。它完全可解释、完全可复现、运行零成本,至今仍是流量网关和风控硬规则的主力。致命短板是自然语言一进来就失效:”帮我看看这玩意儿还活着吗”没法写成规则,规则数量随业务膨胀后也维护不动。

第二代是经典机器学习分类器(逻辑回归、SVM、GBDT),知识来自标注数据加训练。便宜、快、可本地部署,但输入必须先做特征工程,把自然语言变成结构化字段本身就要另一套系统;任务一变就得重新标注重训,对没见过的类别也没有零样本能力。

第三代是深度学习分类器(BERT 类预训练模型加微调),终于能直接吃自然语言,但每个任务仍要标注数据和微调运维,一个任务一个模型,需求改动就要重训重评。

第四代是 LLM-as-judge,用提示词让通用 LLM 做判断。零样本上手、天然理解自然语言、换个任务改提示词就行,代价是贵、慢、有状态(判断随上下文漂移)、输出约束靠提示词和后处理兜底。

Jev 想占的位置,是第四代的灵活性加上接近第二、三代的成本:

维度 规则/专家系统 经典 ML 深度分类器(BERT 类) LLM-as-judge Jev
知识来源 人工编写规则 标注数据训练 标注数据微调 预训练 + 提示词 预训练 + 输入小抄
自然语言输入 不支持 要特征工程 支持 支持 支持
新任务上手成本 每条规则手写 重新标注训练 重新标注微调 改提示词即用 改问题 + 菜单即用
输出保证 完全确定 概率(阈值后确定) 概率 约束靠提示词兜底 类型硬约束 + 校准概率
单次调用成本 ≈0 ≈0 低(本地)
延迟 微秒–毫秒 毫秒 毫秒–几十毫秒 秒级 亚秒
可复现性 完全 完全 基本确定 受上下文影响 无状态设计
可解释性 强(规则即解释) 中(特征权重) 弱(可要求解释但不可靠) 弱(选项 + 概率)
部署形态 进代码 本地 本地 云 API 云 API(暂无自部署)

四代判断方案定位散点图:横轴自然语言理解与灵活性、纵轴单次调用成本,Jev 落在"灵活但贵"的 LLM-as-judge 与"便宜但要训练"的经典方案之间的空档

反过来它也没有碾压谁。规则能写全的场景,规则永远更好,零成本、零风险、完全可解释,正确用法是规则打底、miss 再交给模型。任务稳定、标注数据充足、输入格式固定的场景(比如固定表单的风险评分),微调分类器更便宜更可控,还能本地部署;Jev 的优势场景是任务常变、没法预先标注、或判断依据需要频繁更新的。需要世界知识、开放输出、多步推理的任务,LLM 不可替代,Jev 是它门口的分诊台,不是替代品


性能数字与接入渠道

性能数字目前只有厂商和第三方说法。Jev 官方称在 System One 任务上达到与现有 LLM 相当的智能水平,同时快约两个数量级;DataCamp 的数字是快 40 到 200 倍、便宜 40 到 400 倍。定价上,输入 $0.042/百万 token、输出免费,约合持续推理 $7 一小时、单次判断 $0.0004;对照 LLM 输入 $0.20 到 10 每百万 token,且输出约贵 5 倍。接入渠道有三条:TypeSafe 官方 API、OpenRouter、LiteLLM。

延迟与成本对比(对数刻度):延迟上 LLM 约秒级、Jev 亚 500ms;输入成本上 LLM 为 $0.2–10/百万 token、Jev 仅 $0.042,两组均差出数量级



应用场景

业界应用案例

如实说明:Jev 发布仅一周多,目前公开的主要是社区实验和教程,深度生产案例还很少。可查的典型用法有四个。

Jev Codex Router 让编程任务先过 Jev 判断难度,再路由给不同档位的模型,是”用便宜判断省贵的生成”的最直接玩法(LangChain 博客和 36氪都有记录)。jev-mcp 把 Jev 挂成 MCP 工具,用于 agent 的事实核验、prompt injection 检测和语义排序(LangChain)。LangChain 官方教程演示了在 agent 循环里用 Jev 做”下一步选哪个工具”的决策位,LLM 只负责需要生成的步骤。Forbes 报道了企业方向,毫秒级响应、几美分成本的 AI 决策用于企业高频判断环节,属于报道性质,尚无落地细节。


适用与不适用

适用条件(同时满足得越多越合适):

  • 答案是封闭集合里的选择(分类、路由、排序、是/否),不需要生成新内容;
  • 判断高频发生,成本和延迟敏感;
  • 需要稳定可复现的判断(同输入同输出),最好还能离线跑题库验证;
  • 判断错误后果可控(建议级而非行动级),有兜底路径。

不适用:

  • 需要生成文本的:报告、摘要、代码,这是 System 2 的活,Jev 主动不做;
  • 需要深度多步推理的:长链条规划、复杂归因;
  • 安全边界判定:凡是”必须一万次运行结果都一样、必须可审计”的放行/拦截逻辑,应该留在确定性代码里。校准概率再好也是概率,安全机制不赌概率;
  • 知识不在输入里的问题:Jev 不带领域知识,全靠喂给它的上下文,小抄没写它就不会。

服务商与部署方式

接入渠道(截至 2026-09-23)有三条:TypeSafe 官方 API 是主渠道;OpenRouter 已上架并公示定价;LiteLLM 提供网关接入、模型注册与计费支持。

自部署目前不可行,这是两轮定向搜索后的结论。未查到 TypeSafe 开放官方权重的任何确凿信息;Hugging Face 上存在社区复现痕迹(第三方 “Jev Reproductions Tracker” Space、第三方数据集如 ctaxnagomi/INSTRUCT_JEV),但这些与官方模型的性能关系未知、成熟度不可考。官方 Jev 目前只有 API 一种形态,若合规要求数据不出站,这条路当前走不通,需等官方开放或改用替代方案。

算力要求对官方 Jev 不适用(不部署)。若走”自建同类分诊”的私有化路线,参考当前通用口径:7B 级开源模型约需 1×24GB 显存的 GPU,70B 级需 2–4×80GB(iternal.ai、Premai 的部署指南);用”小模型 + 结构化输出”实现同架构分诊,起步门槛远低于此。



已知局限与信息边界

讨论选型时建议把这节过一遍,明确”我们不知道什么”:

  1. 规格盲区:上下文窗口、参数规模未公布,超大输入场景能不能用、怎么用,只能实测;
  2. 数字口径:所有性能数字都是厂商或第三方说法,Latent Space 明确提醒宣传口径偏激进(用了 “aggressive claims” 的说法);引入方自建的评测基线才是最终裁判;
  3. 生产验证空白:发布一周,公开内容以教程和社区实验为主,没有可引用的深度生产案例;
  4. 无法私有化:官方仅 API 形态,数据出站合规过不了就一票否决,没有折中;
  5. 校准概率质量待验:0.8 是否真的十次对八次,要用重复实验验证,这是设阈值的前提;
  6. 社区复现不可考:Hugging Face 上的复现版本与官方性能关系未知,生产不碰。


参考资料

点开查看 15 条来源
  1. Introducing System One Models & Jev — TypeSafe AI 官方博客(发布、性能与定价口径)
  2. What Is Jev? A Guide to TypeSafe AI’s System One Model — LangChain(agent loop 用法、Codex Router、jev-mcp、校准概率口径)
  3. Jev: TypeSafe’s System One Model That Never Hallucinates — DataCamp(40–200x/40–400x 第三方数字)
  4. What Is Jev? TypeSafe AI’s System One Model, Explained — Eigent.ai(并行回答带类型问题、校准概率)
  5. Jev: A System One Model, Not an LLM — innfactory.ai(”可像 LLM 一样调用的分类器”)
  6. Typesafe AI’s Non-Autoregressive System-1 Model — MindStudio(非自回归架构拆解)
  7. Jev: a “System One Model” that only decides — Latent Space(RLCD 训练方式、对宣传口径的审慎态度)
  8. How TypeSafe Jev Delivers Zero Hallucination AI at Ultra-Low Latency — AtlasCloud(亚 500ms 延迟口径、微服务路由场景)
  9. Why Everyone Is Talking About Jev — Forbes(企业决策场景报道)
  10. OpenRouter / LiteLLM(第三方接入渠道与定价)
  11. On-Prem LLM Deployment: GPU Sizing — iternal.aiSelf-Hosted LLM Guide — Premai(自建路线的算力参考)
  12. Jev Non-Autoregressive System Explained — YouTube(7 分钟视频讲解)
  13. Non-Autoregressive Models — Emergent MindApple ML Research(非自回归概念与经典对照)
  14. NARVL 论文(CVPR 2024)— arXiv HTML 版(含架构图的非自回归模型实例)
  15. RLCD: Reinforcement Learning from Contrastive Distillation — OpenReview(ICLR 2024)(Latent Space 提到的训练方法原文)

注:System 1/System 2 双系统理论出自卡尼曼《思考,快与慢》(Thinking, Fast and Slow, 2011),为心理学经典背景,无需在线来源;传统决策模型(规则系统、经典 ML、BERT 类分类器)的对比基于机器学习通用知识。

  • 标题: 一文读懂 LLM 与 Jev
  • 作者: moye
  • 创建于 : 2026-09-23 17:10:00
  • 更新于 : 2026-09-23 17:10:00
  • 链接: https://www.kanes.top/2026/09/23/一文读懂LLM与Jev/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。
评论