关于ZAKER Skills GEO服务 合作
全天候科技 12小时前

速度快 193 倍、成本低 444 倍——只做“选择题”的 Jev 爆火出圈

刚刚过去的周末,一个叫Jev 的模型在开发者社区迅速出圈。

它不能像 ChatGPT 那样陪人聊天,不能写长文,也不会一本正经地生成代码。

它的工作更像一道高频选择题:继续还是停止?通过还是拦截?点哪个按钮?这封邮件该转给谁?

看起来能力被 " 砍掉 " 不少,为什么反而火了?

因为 Jev 瞄准的就是一件事情:判断,在 " 零幻觉 " 的基础上做判断。

Jev 由 ChatGPT 联合创始人 Diogo Almeida 主导开发。他在 X 上写道:" 参与共同发明 ChatGPT 之后,我一直在问自己:为什么超人级别的聊天模型没有带来 AGI?"两年隐身研发后,他给出了自己的答案——一套全新的决策模型,或许比更强的聊天更有效。

根据 TypeSafe 官网公布的测试数据,Jev 在自动化工作流任务上比现有大语言模型快 193.6 倍,成本低 444.6 倍。输入每百万 Token 仅需 0.042 美元,输出 Token 免费。上线后需求量一度超出预期,API 短暂无法正常响应。

目前,Jev 已向所有用户开放,无需候补名单,注册即获 5 美元额度(约 1.2 亿 Token)。

一个人,两件相反的事

Diogo Almeida 的履历有一种内在张力。

他曾在 OpenAI 参与构建 RLHF(基于人类反馈的强化学习)和 InstructGPT,这套方法直接催生了 ChatGPT。

然后他离开了,开始反思这套方法。

他在一场演讲中直接提出问题:" 今天的 AI 已经能挑战高等数学,为什么企业还是不敢把客服决策交给它?"

他的答案是:" 今天的 AI 非常擅长协助,但还不擅长自动化。"

协助,是人坐在屏幕前,AI 帮你干活,你来检查。

自动化,是人根本不在场,AI 在后台自己判断、自己执行。

Almeida 把问题指向了 RLHF 本身。他在演讲中说:" 为什么今天的大模型总需要有人在回路里?因为训练它的时候,我们字面意义上就把人塞进了那个回路里。"

RLHF 让模型学会了一件事:什么样的回答,人更喜欢?

这对聊天产品是优点。但对自动化系统,却是问题所在。

Jev 是什么:一个会做判断的函数

TypeSafe 官网将 Jev 定义为:" 把非结构化状态输入,输出类型化的概率决策。"

换成人话:你给它一段信息,它告诉你答案是什么,以及它有多大把握。并且不会产生一点幻觉。

它不生成文字。它只做三件事:

Noul:是非判断,返回一个 0 到 1 之间的概率,代表某件事为真的可能性

Choice:从预定义列表中选一项,最多支持 255 个选项,适合分类和路由

Score:按照设定的尺度打分,用于衡量紧迫程度、质量或风险

每次回答都附带完整的概率分布和置信度。强类型输出,不需要写 JSON 提示词,不需要额外解析器。

为什么快,为什么便宜

普通大语言模型生成答案的方式是:一个 Token 一个 Token 地往外输出,每个 Token 都依赖上一个。

Jev 的采样方式是并行的。所有输出在一次查询中同时生成。这是速度差距的根本来源。

根据 TypeSafe 官网数据:

Jev 端到端响应时间:70 毫秒至 500 毫秒

现有前沿模型:3 秒至 329 秒

速度差距:40 倍至 200 倍(System One 类型任务)

价格方面:

Jev 输入:每百万 Token 0.042 美元(每十亿 Token 42 美元)

现有前沿模型输入:每百万 Token 0.20 美元至 10 美元

输出 Token:免费

TypeSafe 官网注明,193.6 倍速度提升和 444.6 倍成本降低的数据,来自其自动化工作流评测," 预计这些数字处于实际收益的较高端 "。评测由公司模型能力团队成员制作,存在一定偏差可能性。

" 校准 " 才是真正的核心

速度和价格之外,TypeSafe 强调的另一个关键词是 " 校准 "。

现有大语言模型即使被要求给出置信度,也往往过度自信且不一致。TypeSafe 官网指出:" 如果一个模型能完成某项任务 95% 的时间,但不告诉你它什么时候处于那 5%,它就无法自动化那项任务。"

为此,TypeSafe 开发了新的训练方法 RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)。

目标是:如果模型说某件事有 80% 的概率,那么在它判断为 80% 的一批事情里,最终应该真的有大约 80% 发生。

这在自动化系统里直接决定了如何分配任务:

置信度 > 90%:直接自动执行

置信度在 70% 至 90% 之间:交给更强的大模型复核

置信度 < 70%:转给人来决策

Earendil 公司 CTO Armin Ronacher 对此解释道:" 归根结底,这种方式将幻觉问题的处理责任稍微转移到了用户身上。用户需要决定:如果这种情况出现的概率只有 50%,那或许可以忽略它。但如果概率达到 95%,那我就可以利用它了。"

并行判断:一次问十个问题

Jev 还有一个特点:同一次请求中的多个问题,共享一份输入,但独立并行评估。

公众号" 数字生命卡兹克 "做了个实测:他把一条新闻扔进去,可以同时问——是否 AI 相关?是否广告?是否融资?应归哪个分类?是否值得推送?

Jev 一口气把这些判断全部做完,速度不变。

传统大语言模型需要逐个问题生成回答,或者把所有问题塞进一个提示词,再解析输出。

这个并行特性,在多问题场景下优势最为明显。

开发者已经在用它做什么

Jev 上线后,开发者社区迅速涌现出大量实际应用案例。

信息流过滤:开发者 Marcel Pociot 接入 Jev 做了一个浏览器插件,用于过滤 X 平台上不想看的内容。每条帖子的判断平均耗时 380 毫秒。

广告分析有人用 Jev 在 40 秒内分析 724 条实时广告,共做出 8724 次判断。

浏览器代理:Browser Use 的开源项目 jev-ultrafast,将 Jev 用作浏览器操作的判断层。以查机票为例,每一轮程序同时问多个问题:下一步点击还是输入?点哪个编号?这些问题共用同一份网页状态,分别作答。

上下文压缩:将 Jev 接入 Claude Code,判断哪些上下文内容是关键信息,实现近乎即时的上下文压缩。

安全分类器:Vercel 公司软件工程师 Pranit Sharma 表示,用 Jev 替代 OpenAI 的 ChatGPT Luna 5.6 来运行命令安全性分类器后,处理速度提高了 5 到 18 倍,准确性也大幅提升。

邮件分类:Bryo AI 的 CTO Nikhil Mudholkar 测试了 Jev 和 Gemini 在分类商业邮件方面的表现。他的测试结果显示,Gemini 准确率略高,但成本高出 10 到 20 倍。

营销分析:有团队将 Jev 接入营销分析流程,扫描 Meta 广告库、比较广告格式存活周期,把原本需要人工完成的判断提速了 30 倍,成本压到 3 美元以内。

游戏演示TypeSafe 官网展示了 Jev 玩 Doom 的演示,每秒可做出约 10 次决策,Jev 依据结构化游戏状态做出实时操作判断,每小时成本约 7 美元。在 Ably Pong 演示中,Jev 在 12 秒内做出 47 次操作决策,而 Gemini、Claude 和 GPT 在同样时间里只做出两三次。

" 零幻觉 " 不等于 " 永远答对 "

Jev 官网上写着 "Zero Hallucinations",即 " 零幻觉 "。

这句话很抓眼球,也容易被误读。

TypeSafe 在技术说明中给出的含义是:Jev 的输出类型和结构预先定义,因此模型不会产生类型错误,不会突然跳出指定格式、捏造一个不存在的字段,或在限定选项外随意发挥。

例如,程序只允许它在 " 通过、拒绝、人工复核 " 三个选项里选,它不会输出一首诗,也不会附带一段 Markdown 说明。

这解决的是自动化系统中的结构可靠性问题。

但它不等于模型不会选错。TypeSafe 自己的 FAQ 也明确承认:Jev" 仍然可能出错 "。

为什么是现在爆火:Agent 需要的,可能正是这些小决定

Jev 的出现,正好踩中了 Agent 开发中的一个现实问题。

一个能操作网页、调用工具、处理文件的 Agent,在完成任务前,往往要经历大量微小判断。

下一步点击哪个元素?这个工具返回的结果是否有效?上下文里哪部分已经没用?这个任务是真的完成了,还是看起来完成了?

这些判断单独看不难,但一旦进入高频工作流,成本会迅速堆积。

Jev 这次爆火,至少有三个清晰原因。

第一,它的定位足够反常。

当行业持续追逐更长的推理、更强的聊天、更大的上下文时,Jev 直接放弃生成文本,只解决选择、分类、打分和路由。

第二,它击中了 Agent 的成本问题。

如果一个系统每天要做数十万次小判断,20 — 200 倍的速度差异、40 — 400 倍的成本差异,即使只在部分任务上成立,也足以吸引开发者测试。

第三,它把 " 不确定性 " 做成了接口的一部分。

过去,模型总能给答案;真正让自动化系统头疼的是,模型常常不知道自己什么时候会错。

Jev 给出的答案是:不只返回结论,也返回对结论的把握程度。

为什么叫 Jev,为什么叫 System One

TypeSafe 把 Jev 所在的模型类别命名为 "System One Models"。

名称来自丹尼尔 · 卡尼曼《思考,快与慢》中关于 " 系统 1" 和 " 系统 2" 的区分:前者偏快速、直觉式判断,后者偏慢速、审慎推理。

Jev 显然押注前者。

TypeSafe 的产品定位并不是让 Jev 替代所有大模型。

官方列出的适用任务包括分类、路由、打分、信息提取、工作流分支、内容审核、模型输出验证,以及在大数据上进行批量处理。

复杂推理、长文生成、写代码、创作内容,仍属于传统大语言模型更擅长的领域。

在这种分工下,Jev 负责先做大量低延迟决策;当它不够确定时,再把问题交给更慢、更贵、但更适合生成与推理的大模型,或者交给人工。

融资与开放

TypeSafe AI 由 Diogo Almeida 与 Erik Gafni、Sasha Sheng 共同创办,公司隐身运营约两年。

2026 年 9 月 15 日正式亮相,同步宣布完成 4000 万美元种子轮融资,由 DCVC 领投。

TypeSafe 表示,目前市面上采用这一路线的公司只有他们一家。Ronacher 预计,随着这种模式的实用价值逐渐被验证,跟进者会陆续出现。

被问及公司是否算前沿实验室时,Almeida 说:" 前沿实验室的主要产物要么是恐惧,要么是炒作,我希望我们的主要产品是智慧,我们不属于那种一门心思创造无限财富,或者搞宗教式叙事,或者试图在数据中心里造神的实验室。"

全天候科技

全天候科技

提供专业快速完整的科技商业资讯

订阅

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容