模型 Jev 爆火:不生成文字,70 毫秒返回判断,输入 $0.042/M、输出免费

9 月 15 日,TypeSafe AI 发布了一个叫 Jev 的模型。它最容易被记住的特征,是它不会写字。不聊天,不写邮件,不解释,不生成代码。你给它一段状态,再给一组预先定义的问题,它返回一串程序可以直接消费的判断。

这个用户是否愤怒?0.91
该由哪个部门处理?technical,0.87
这条消息是否紧急?0.994

发布当天它在 Hacker News 冲上首页,拿到 1893 分和 496 条评论,5 天里 Forbes、TechCrunch、36 氪跟进了报道,LangChain、Vercel 出了官方集成,社区还长出了好几个开源复刻。一个不发标准跑分的模型,靠「不说话」刷了屏。

Jev 是什么

TypeSafe 给它起的名字叫 System One Model,取自卡尼曼《思考,快与慢》。系统 1 是快而直觉的判断,系统 2 是慢而费力的推理。带思维链的推理模型是系统 2,Jev 只做系统 1。官方对它的定义是「状态输入、类型化概率决策输出」,创始人 Diogo Almeida 的说法更形象,就是一次「前沿智能的函数调用」。

「Jev」这个名字来自经济学家杰文斯。1865 年他提出杰文斯悖论,蒸汽机效率提高后,英国煤耗不降反升,因为用得起的场景变多了。TypeSafe 的赌注一样,单次判断便宜两个数量级后,被塞进软件的调用量会指数级增长。

公司背景也不简单。Almeida 是 InstructGPT 论文联合作者,OpenAI 把他列进 GPT-4 贡献名单的「基础 RLHF 工作」一栏。TypeSafe 由他和 Erik Gafni、Sasha Sheng 在 2024 年创立,本次以 4000 万美元种子轮出场,DCVC 领投,Forbes 引述匿名信源称估值 2 亿美元。

三种判断原语

Jev 的全部能力只有三种问题,返回值固定,永远可解析。

原语

用途

返回值

Choice

从一组选项里选一个

选中项、完整概率分布、置信度

Score

沿一条有顺序的量表打分

分数(可落在两档之间)、置信度

Noul

判断一个条件是否成立

一个 0 到 1 的概率

多个问题放进同一个请求会并行执行,互相看不到对方的答案,加问题几乎不增加延迟。官方在 GDPR 全文上做过一次 13 问合并实测,同一个动作带来 12.2 倍成本差和 10 倍时间差。

返回结构长这样,代码拿到就能写 if。

{
  "department": {
    "type": "choice",
    "choice": "technical",
    "probabilities": { "technical": 0.87, "billing": 0.09, "sales": 0.04 },
    "confidence": 0.81
  },
  "is_urgent": { "type": "noul", "noul": 0.994 }
}

为什么这么快

LLM 慢不在笨,在自回归。哪怕只要一个「是」,它也得先把 {"answer": " 这串字符逐个 token 生成出来。Jev 砍掉了这一步,一次前向对所有预定义位置同时打分,直接读概率头。输出只有一个决策,官方干脆按免费定价。

价格是 9 月 20 日前的口径,输入 $0.042/M token,输出免费,速率限制 250k token/s 加 1200 请求/分钟。官方称输入价比 Claude Fable 5.1 低 238 倍。上下文 64k,其中状态加最长问题占 32k。只吃文本,不支持图像音频视频,不支持微调,所有账户共享同一套权重。

项目

Jev

生成式 LLM

输出

类型化决策,0 token

字符串,需解析校验

端到端延迟

70 至 500 毫秒

官方引用口径 3 至 329 秒

输入价格

$0.042/M

$0.20 至 $10/M

训练目标

RLCD,校准概率决策

RLHF / RLVR

训练方法叫 RLCD(Reinforcement Learning for Calibrated Decisions),优化目标不是人类偏好,而是报出的概率准不准。官方给了一组对比,LLM 自报 0.9 置信度的批次实际正确率 63%,校准过的概率说 0.9 的批次实际正确 89%。

快 200 倍要打折看

官网首页的「快 193.6 倍、便宜 444.6 倍」来自 TypeSafe 自己设计的 4 条工作流评测,参考答案是 GPT-6 Astra 与 Claude Fable 5.1 高推理档输出的平均。官方自己列了三条偏差说明,工作流出题、裁判、被测基线全是自家的,并承认这些是「现实收益的上限值」。同一份评测里,Jev 工作流准确率约 67.8%,前沿模型区间是 68% 到 74%,水平接近而非超越。

第三方实测支持「快和便宜」,但量级远没有 200 倍。评测站 Every.to 单组 777 次判断不到 0.7 秒,成本约四分之一美分,逐段判断中位 0.35 秒,对照模型 8.83 秒,故意植入的 7 处缺陷检出 6 处。Browser Use 的开源项目把 Jev 接进浏览器 Agent,任务中位耗时 9.45 秒降到 7.07 秒,浏览器协议调用从 1092 次砍到 101 次。Vercel 工程师称把命令安全分类从 GPT-5.6 Luna 换成 Jev 快 5 到 18 倍且更准,这条只有转述没有完整报告。

最扎的独立测试来自 backnotprop。作者用德州扑克 GTO 求解器当标准答案,150 个决策点 Jev 吻合率 63%。在真正有争议的 55 个点位上它只有 38%,而且只要把「对手成大同花、我方落后」这类已经得出结论的字段写进状态,它才肯改判。作者的结论是它确实在做事,但这些点位错得比对得多。

「零幻觉」的真实含义

官网最醒目的宣传是 Zero Hallucinations。它保证的只有一件事,输出分布永远定义在你给的选项上,不会编造字段、编造选项、编造 JSON。这是架构层面的结构性保证,官方也明说 0% 类型错误不是实测统计。

合法答案不等于正确答案。候选只有三个部门,它完全可能高置信度地选错。官方文档写得比宣传词诚实,校准是在一组预测上衡量的,不保证单个答案正确。Hacker News 上最典型的反驳是「约束解码也能让 LLM 输出合法结构」,Almeida 在评论区正面回应,称约束解码会让模型变笨,会给非法 token 分配概率的模型本身就是糊涂的。这个回应有技术依据,但也说明 Jev 的价值不在「不会错」,而在结构天生存在,不用拿模型能力去换。

冷水

「这不就是一个分类器吗」是发布后最常见的质疑。数学形态上确实接近,但传统分类器的标签在训练时固定,Jev 的标签和问题可以运行时定义,今天问三个部门,明天从两百个浏览器元素里选一个。Reddit 上比较中肯的说法是,它就是 BERT 式架构配上了现代 LLM 的数据、算力和训练配方,单拎出来没有革命性,但它把够聪明、够便宜、够快、够方便凑齐了,这是以前做不到的。

工程师 Sean Goedecke 的分析被广泛转发,核心三点。用约束解码加受限 logit 切片,现在就能复现类似的推理形状,他自己用 1.5B 小模型拿到 2 到 3 倍加速,Jev 未必有护城河。它没有思维链和测试时计算,智能上限可能锁在非推理 LLM 的水平。「零幻觉」是语义上的回避。

Agent 决策栈里的位置

理解 Jev 价值的方式,不是拿它替代 LLM,而是看 Agent 里有多少判断根本不值得叫醒推理模型。一个 100 步的 Agent,大部分动作只是这条信息是否相关、这个文件值不值得读、要不要重试、该路由给谁。未来的分工大概是这样的。

负责的判断

Code

文件存在吗,HTTP 200 吗,exit code 是 0 吗

Jev

这是哪类任务,风险属于哪一档,失败后重试还是降级

LLM

任务怎么拆,参数怎么构造,这段代码怎么改

Human

删文件,覆盖项目,发邮件,花钱

官方在 Doom 演示里让 Jev 每秒做约 10 次战术决策,一小时约 7 美元,一共 3.6 万个决策。游戏水平不如专门 bot,重点是「反应式智能」能进高频循环。TypeSafe 承认传统 bot 打得更好,演示卖的不是成绩,是形态。

发布 72 小时里长出来的生态也说明位置对了。LangChain 加了 TypeSafeClassifier 和用 Jev 做模型路由的中间件,Vercel AI SDK 新增的实验性 evaluate 接口第一个原生实现就是 Jev,社区已经有 jevlike、open-jev(Gemma 3 4B 底座)等复现,还有给两个模型同一批评论做对决的开源工具 jev-arena。

怎么用上

Jev 的接口不是 OpenAI 兼容的 Chat Completions,核心端点是 POST https://api.typesafe.ai/v1/systemone,请求体是 state 加 questions。国内中转站目前全部没有上架,因为它需要专门透传 /v1/systemone 路径。现实路径两条,官方直连最干净,或者走 OpenRouter,模型 ID typesafe/jev-1.13,9 月 18 日上架,价格与官方一致。

SDK 两条,Python 需 3.10 以上。

pip install typesafe-sdk
export TYPESAFE_API_KEY="jev_你的密钥"
from typesafe_sdk import Choice, Noul, Score, TypeSafeClient

resp = client.system_one(
    state=工单内容,
    questions={
        "department": Choice(
            instructions="这张工单该由哪个团队处理",
            criteria={
                "billing": "付款或订阅问题",
                "technical": "Bug 或集成故障",
                "sales": "定价或账户咨询",
            },
        ),
        "frustration": Score(
            instructions="客户表现出多大的不满",
            criteria=["平静", "不满但克制", "非常愤怒"],
        ),
        "is_urgent": Noul(instructions="这条消息传达了紧迫性"),
    },
)

if resp.answers["department"].confidence < 0.5:
    route_to_human()

注意事项

中文是明确短板。官方口径是英语为主要训练语言,中日韩可用但不均衡,中文场景下概率校准本身会退化。接入前拿自己的业务数据小批量对拍,别直接上生产。

类型安全不等于事实正确。它只是不会编出选项之外的答案,不保证选对。

置信度是群体口径。说 0.9 的批次长期约九成正确,不代表手上这一条有九成把握。高置信自动执行、中置信复核、低置信转人工的阈值,必须用自己的数据调出来。

Noul 接近 0.5 是「是」「否」概率相当,不是程度中等。测程度用 Score。

别名会漂移,答案可能在无改动的情况下变化。调好阈值后钉住 jev-1.13.0,别用 jev-latest

单字段基数上限 255,超过要改两段式流程,速度优势会被削弱。

官方承认无法证明定价没有被补贴,重度依赖此价格的架构要留预案。

官方不发布标准 benchmark,公开榜单上没有它的分数,判断是否适合你的业务只有一条路,拿真实数据跑。


未经允许不得转载:w3h5前端开发资源网 » 模型 Jev 爆火:不生成文字,70 毫秒返回判断,输入 $0.042/M、输出免费

9 月 15 日,前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 发布了 Jev。这个模型不会写字,不聊天、不写代码、不解释,只接收一段状态和一组预定义问题,返回带概率的类型化判断。官方称端到端 70 至 500 毫秒,输入 $0.042/M、输出免费。Hacker News 帖子 1893 分、496 条评论,发布 3 天后登上 OpenRouter。 (0)