Jev 这周的热度已经不需要再解释了。它的创始人 Diogo Almeida 曾在 OpenAI 担任研究员,参与过 InstructGPT 与 RLHF 项目,也就是 ChatGPT 早期对齐技术研发的核心成员之一。此番推出的 Jev 有几个明确的不做:不写长文、不做闲聊、不生成复杂代码。它只承担一项职能——替你快速拿定主意。打游戏时该走哪一步,跑流程时该套哪条规则,都归它判断。定价方面,每百万输入 token 收费 0.042 美元,输出 token 不收费,因此有人把它称作 AI 领域的蜜雪冰城。
上线尚不足一周,社区里已经出现了二十多种用法。数量看着可观,但底层的做法是同一套:把当前局面切成有限几个候选,让 Jev 挑出一个,程序拿到结果继续往下跑。

01 爆火的 Jev 究竟是什么
文本大模型的传统路线是生成式:问题抛过去,它逐词往外吐。这套机制在创作、推理、写代码上很合用,可一旦碰上选择题,就显得过重、过贵、过慢。
Jev 选的是另一条路,本质上是一个轻量的系统一分类与打分模型。调用时你提供一段上下文加一组明确选项,它返回各选项的概率分布,并挑出置信度最高的那个。延迟落在几十毫秒到几百毫秒区间,成本只相当于主流大模型的几十分之一。
创始人 Diogo Almeida 的公告帖在 X 上累计获得 3620 万浏览。外界看重的并非只有低价,更在于它把 Agent 工作流中一直缺少的低延迟决策控制面补上了。
02 社区整理的 20+ 个玩法
官方示例与社区开发者摸索出的用法,我们做了一次完整梳理,按从娱乐性玩具到真正进生产的顺序逐条列出。
- 官方:Doom 实时游戏操控
官方在发布博文中演示了让 Jev 玩初代《毁灭战士》(Doom)。它每秒完成约 10 次动作决策,实时接管角色的走位与开火。连续运行一小时的开销约为 7 美元,低于工程师原先的预估,也证明高频实时决策确实可行。
- 官方:Wikiracing 超长列表跳转
起点是一个维基百科词条,只能通过点击页面内超链接抵达目标词条。每一步的候选链接有几百乃至几千个,Jev 要从中挑出语义上离目标最近的那个。这项测试考察的是模型在高基数选项下会不会产生幻觉。
- 同时跑 50 局地铁跑酷
开发者 @_MaxBlade 搭好自动化环境,交由 Jev 同时操控 50 局《地铁跑酷》。换道、跳跃、下滑各自都是一次小判断,高并发之下调用量迅速累积,但 50 局全部跑完的总花费不到 1 美分。

- 超级马里奥开源控制器
开发者 @faadilhshaik 给经典游戏《超级马里奥》做了一套由 Jev 驱动的控制器。它直接读取结构化的游戏内存状态,起跳与加速的时机由 Jev 决定,项目已在 GitHub 开源。

- 杀戮尖塔 2 极速代打
中文开发者 paulwei 用 Jev 来跑策略卡牌游戏《杀戮尖塔 2》。此前用大模型打牌,单步思考的卡顿很明显;改用 Jev 后,一次出牌决策只需 0.7 秒,出牌动画人眼还没看清,下一步指令就已经发出。

- 3D 城市自动驾驶仿真
开发者 @jpschroeder 把 Jev 接入 3D 城市仿真环境。车辆在虚拟街道中行驶时,Jev 依据前方传感器与路况判断行驶方向,车辆移动后新状态再回传给它,整套系统搭建用时不到一小时。

- MuJoCo 物理仿真火箭回收
开发者 @uttkarsh_42 在 MuJoCo 物理引擎里训练火箭垂直起降。点火时机、开启几台发动机、何时切换着陆姿态,全部交给 Jev 判断。12 次试验之后实现成功着陆,单次完整试验消耗 245 次调用,成本约 0.04 美元。

- 逐像素概率选色拼图
开发者 @anshuc 把图像生成拆成逐像素的分类选择。每个像素位置都配上颜色选项与概率,程序按 Jev 给出的高概率颜色一点点涂抹,最终拼出完整的低保真图像。

- Browser Use 官方集成 jev-ultrafast
Jev 发布三天之内,Browser Use 团队就推出了官方集成库 jev-ultrafast,两天收获 2700 颗 Star。它把网页操作归纳为操作与目标两组选择题,全程不截图、不消耗多模态 token,单次往返输出两个决策。

- 真实航班查询 7 秒实测
Browser Use 创始人 Gregor Zunic 公开了一段无剪辑实测视频。由 Jev 驱动的浏览器在真实航司官网上完整跑完一次单程航班查询,用时 7 秒,调用成本仅 0.0039 美元。
- Vercel 命令安全审查分类器
Vercel 工程师 Pranit Sharma 把内部运行的 Shell 命令安全审查分类器从 OpenAI 大模型换成了 Jev。处理速度提高 5 到 18 倍,同时因为误判率降低,实际准确率不降反升。
- BryoAI 商业邮件高频分类
BryoAI CTO Nikhil Mudholkar 用 Jev 与 Gemini 做商业邮件意图分类的对比测试。绝对准确率上 Gemini 略占上风,但单次调用成本要贵 10 到 20 倍;更关键的一点是,Jev 输出的是经过校准的真实概率分布,下游业务系统据此设定置信度阈值更方便。
- 工单分派与自动化路由
在客户支持场景下,系统先提取每条新工单的关键描述,再由 Jev 从十几个业务小组中选出最合适的主管团队,替代了此前脆弱的手写正则匹配方案。
- 自动化 PR 合并资格预审
在持续集成(CI)流水线中,Jev 读取改动文件清单与自动化测试报告,快速给出该 PR 是否具备合并资格的初步判断,高风险的 PR 会被直接标记为待人工复查。
- 重复扣费与紧急客服分类
面向金融与电商业务,Jev 用于快速识别重复扣费等高风险客诉。当客户情绪激动或涉及退款申请时,系统在 100 毫秒内打上紧急度标签,优先推送给人工客服坐席。
- jev-mcp 事实核验与注入检测
社区开源了基于模型上下文协议(MCP)的扩展包 jev-mcp。开发者可借助 Jev 完成多来源事实的交叉核验、检测用户 Prompt 中隐藏的 Prompt Injection 越狱攻击,并为检索召回内容打语义相关度分。
- fast-jev-compaction 长上下文压缩
Coding Agent 执行长任务时,上下文会快速膨胀。fast-jev-compaction 借助 Jev 迅速判断每一轮工具调用是否值得保留,把无效日志剔除,只留下关键状态,该项目得到了 Jev 官方团队的转发与赞赏。
- Jev Codex Router 任务难度分流
这是一个多模型路由项目:任务发起之前,先由 Jev 预判该代码编辑任务的逻辑复杂度,简单改动直接交给便宜的小模型,复杂的跨文件重构才唤起大模型,整体调用开销下降 60% 以上。
- Armin Ronacher 评价的大模型前置分流
Earendil CTO、Sentry 创始人 Armin Ronacher 认为,让主流生成式大模型自己承担分流决策,在经济上并不划算。Jev 的极低延迟与极低成本,使应用在入口层部署高密度实时流量路由成为可能。
- LangChain 博客:Agent 外挂决策框架
LangChain 官方发布了专题博客《Building a Harness with Jev》。文中提到,过去 Agent 框架里的分类决策逻辑常常深埋在闭源系统的定制逻辑中;如今有了通用、便宜且确定性极高的分类模型,这套 Harness 决策层完全可以推广到每一个开源 Agent。

- 链上订单簿自动化交易
一些 Web3 开发者把 Jev 接入了去中心化交易所。模型高频读取买卖订单簿的深度数据,输出只有买入、卖出或观望三种动作。社区里的普遍看法是:这是眼下最具噱头的用法,也是在真实行情中风险最高的用法。
- PrimeLine 预注册对比测试:置信度决定胜负
独立测试机构 PrimeLine 开展的双盲预注册评测中,两项真实任务上,Claude Opus 5 与 Haiku 4.5 的初始绝对准确率原本与 Jev 持平甚至更高。但规则一旦允许模型跳过自己最不确定的样本,Jev 在两项任务上均实现反超。原因在于 Jev 输出的置信度具有数学统计意义,而通用生成大模型对自身概率的评估往往严重过自信。

03 如何用上 Jev
不少开发者翻了一圈之后,最想弄清楚的还是两点:在哪里能直接上手调用,官方又提供了哪些现成的开发者工具。目前官方与主流聚合网关都已在第一周内开放入口。
官方控制台与文档入口
TypeSafe 官方提供在线控制台(Playground)以及完整的开发者文档,可通过 HTTP API、Python SDK 和 JavaScript SDK 直接发起调用。输入价格统一为每百万 token 0.042 美元,输出免费。
官方文档:https://docs.typesafe.ai/introduction``官方控制台:https://console.typesafe.ai/playground

OpenRouter 与 Vercel AI Gateway 聚合平台
如果你已经在用现有的模型聚合层,就不必再单独申请专属 SDK:
OpenRouter:已在官方模型库上线,模型标识为 typesafe/jev,现有接入 OpenRouter 的代码只需改一下模型名称就能切换。
Vercel AI Gateway:在发布 72 小时内完成直连集成,支持全球边缘低延迟分发。

官方 Skills 技能包:教 Agent 一次多问
除基础调用接口之外,TypeSafe 官方还在 GitHub 开源了 typesafe-ai/skills 仓库。这是一套专门注入给 Coding Agent 的能力规范,针对的是 Agent 习惯一次只问一个问题的低效做法,指导它在面对模糊需求时一次性把歧义点列清,并附上候选选项。

04 写在最后
从上线第一天推特上的狂欢,到一周之内被塞进各类生产级流水线,Jev 给整个开发者生态上了一堂关于分工的课。
对日常做 Agent 开发的人来说,可以带走的启发相当明确。其一,不要指望小模型具备天马行空的推理能力,它的长处是把判断压缩成有限选项之后带来的确定性与高吞吐;其二,当业务需要接入安全拦截、分流路由、工单分拣这类非生成式任务时,用轻量决策器替换重型大模型,通常既能省下真金白银,也能把响应延迟拉回可用的毫秒级水平。

评论 共 0 条
正在加载…
还没有评论,来说两句吧。
先起个昵称
昵称只保存在你自己的浏览器里,用来显示你的评论与留言,不需要注册。
昵称需要 2 - 20 个字符。