JEV申请地址! 附:Jev 使用心得:一个不生成文字、只做判断的模型

火热!申请JEV的地址!TypeSafe AI 的 Jev 不生成文字,只输出带置信度的决策。

Jev 使用心得:一个不生成文字、只做判断的模型

这两天 AI 圈讨论度最高的名字,大概只有一个:Jev。

它来自 TypeSafe AI,创始人是 Diogo Almeida。这位此前在 OpenAI 工作,参与过 RLHF 和 InstructGPT 的相关研究,也就是后来让模型真正学会「说人话」、并最终催生 ChatGPT 与 GPT-4 的那套关键方法。2024 年初他离开 OpenAI 创业,隐身两年之后,拿出了 Jev。

它只做一件事:高频决策

Jev 最反常识的地方在于能力边界被砍得极窄:

  • 不能聊天;
  • 不能写代码;
  • 甚至不能生成文字。

它只做决策与判断,本质是一个通用的分类器。

X 上有个案例很能说明问题。开发者 Marcel Pociot 基于 Jev 做了一个浏览器插件,用来过滤时间线上不想看的内容:引战骗回复的帖子、加密货币和 NFT、政治争论,都可以设定规则折叠掉。每出现一条新帖,Jev 就在后台判断一次——这条内容有没有命中预设的排除分类,命中就折叠,没命中就正常展示。

这个判断的平均耗时是 380 毫秒

对比一下:用常规大模型做同样的判断,即使开了 JSON Output 也偏慢,若再打开思考模式,单次判断可能要十几秒甚至几十秒。但这类任务其实不需要模型生成任何内容,只需要它以最快速度给出 Yes 或 No。

为什么砍掉文字生成

过去两年,大模型都在努力把「回答人类」这件事做得更好。Jev 换了个方向,它要回答的问题是:

如果最终消费这个答案的,其实是一段代码呢?

代码不需要文采,也不需要解释。它只想知道:要还是不要、A 还是 B、继续还是停止。它要的是一个能直接执行的判断。

砍掉文字生成带来的收益是直接的:速度提升 20~200 倍,接近实时,官方称一秒可以完成 10 次决策;成本降低 40~400 倍,为 0.042 美元 / 百万 Token,输出 Token 免费——因为只输出一个决策,那点 Token 消耗可以忽略。

System One:赌的是快思考

TypeSafe 给自己的模型类型起名 System One Model,来自丹尼尔·卡尼曼《思考,快与慢》里的双系统理论:

系统 特征 典型场景
系统 1 快思考,自动、直觉 1+2 等于几
系统 2 慢思考,需要逐步分析 数学证明、复杂代码

现在的 GPT、Claude,尤其是各类 Reasoning Model,越来越像一套很强的系统 2。Jev 赌的是另一边:这个世界上存在海量根本不需要长篇推理的智能任务。

为此他们重做了模型架构、并行 Sampler,并提出了一套自己的训练方法 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习)。

三者的优化目标可以这样对照:

  • RLHF:优化人类更喜欢哪个回答;
  • RLVR:优化答案能不能被验证,这也是近两年数学、代码能力大幅跃升的原因;
  • RLCD:优化这个决定到底对不对,以及模型说的「我有 90% 把握」,是否真的接近 90%。

校准才是核心

要把 AI 塞进自动化系统,概率必须是有意义的。Jev 的输出可以直接用来做分级处理:

  • 置信度 > 0.90:自动执行;
  • 0.7 < 置信度 < 0.90:交给更强的大模型复核;
  • 置信度 < 0.7:交给人来决策。

所以在这条路线里,最重要的词不只是快和便宜,校准才是真正的核心。

另一个设计是并行:所有需要判断的问题可以一次性并行提问。比如扔进去一条 AI 新闻,可以同时问「是不是 AI 相关」「是不是广告」「是不是融资」「应该归到哪个分类」「值不值得推给用户」。Jev 会把这些判断一口气做完,这与传统 LLM 一个 Token 一个 Token 往外生成,是两种完全不同的思路。

用一句话概括:它像一个拥有世界知识和语义理解能力的超级 if。

实测:预筛与聚簇判断

我把 AIHOT 里的一些任务判断用 Jev 测了一遍。

任务一:预筛。 每天有几千上万条监控内容需要打分,负责精选的是稍大稍贵的模型,以保证世界知识充足、品味够好。全量交给它成本太高,所以前面用便宜模型做一道预筛,把与 AI 无关的内容先剔除掉。这个任务很简单:只判断当前信息是否与 AI 相关。

100 道测试题,我让 GLM-5.3 Flash、DeepSeek V4.1 Flash、Qwen 3.7 Flash 和 Jev 同时跑:

  • GLM 5.3 Flash 是唯一全对的,但也最慢、最贵;
  • Jev 综合表现最好:准确率第二,成本比 DeepSeek V4.1 Flash 在空闲阶段还低;受国内网络延迟影响,耗时被拉高了;
  • Qwen 3.7 Flash 依然最便宜,价格只有 Jev 的一半,但准确率与 DeepSeek V4.1 一样,稍差一些。

任务二:同事件聚簇判定。 Jev 依然保持第二的准确率,但因为内容量更大,这次它成了速度最快的那个。

任务三:并行判断。 一条新闻背后同时有十个问题需要判断并输出,这时 Jev 的优势才真正显现:最高的准确率、最快的速度、第二低的成本。

结论是:在追求精度的分类和判断场景上,Jev 是目前性价比最高的解。Qwen 3.7 Flash 便宜是便宜,但任务稍微大一点,正确率能差出 7 个百分点,这就不好用了。

而这只是第一代模型。如果几个月后出到 2.0,准确率、速度和价格会走到哪一步,很难估量。

名字里的杰文斯悖论

Jev 这个名字脱胎于经济学里著名的杰文斯悖论,提出者叫 William Stanley Jevons。

19 世纪,蒸汽机效率越来越高,理论上烧同样的煤能做更多的活,那社会是不是会少烧煤?结果恰恰相反:效率越高,用煤越划算,越多行业开始用,全社会的煤炭消费量反而上升了。效率提高、单次消耗下降,总消耗却暴涨。

TypeSafe 给模型起这个名字,意图很明确:他们赌智能也会发生杰文斯悖论。现在的模型越来越贵,但我们日常真的需要这么高智力的模型吗?是否大量判断和决策,只需要一个 Jev 就够了?

如果有一天,一次具备相当不错语义理解能力的判断便宜到接近免费,这个世界会发生什么?

结语

AI 为什么一定要生成东西?智能当然可以用来创造,也可以只用来判断。

Jev 可能代表着 Agent 时代另一块重要的拼图——一个因为 ChatGPT 太成功,我们过去反而没有认真看过的方向。

申请体验:TypeSafe AI 官网目前可以提交资格申请,审核应该比较快。急着测试的话,也可以去 Vercel 的集合平台,他们已首发接入 Jev。

Home - TypeSafe AI

本文基于公开资料与个人实测整理,涉及性能与价格的数据以官方发布为准。

分享 微博

评论 0

    昵称