跳到主内容
爱游戏官方入口

AI新物种Jev刷屏:一个不会聊天的新模型,凭什么放话Claude Code时代要翻篇?

2026-09-23 · 周晨曦 · 更新于 2026-09-27

“它连一句完整的话都说不出来,凭什么能引发轰动?”

就在最近,一个名为Jev的新模型迅速走红。海外平台吸引了3500万用户关注,在Vercel AI Gateway上线后的24小时内,近13%的付费团队直接采用,创下该平台有史以来最快的采用纪录;开发者社区在两天内涌现出至少6个克隆项目,围绕它构建的开源项目迅速突破600个。

然而,比这些数据更令人震惊的,是其创始人一个月前的一句宣言。迪奥戈·阿尔梅达,前OpenAI核心研究员、RLHF和InstructGPT论文的共同作者,早在Jev发布前一个月的一次演讲中,就公开向整个行业发出挑战:Claude Code仍然属于“协助时代”的产物,下一个时代绝不是Claude Code时代。

要知道,过去两年间,Claude Code几乎被视为AI编程和Agent落地的标杆。当时TypeSafe尚未公开任何产品,这句话听起来像是一句狂妄之言。一个不会聊天、不写代码、只做判断的模型,凭什么敢于挑战这个共识?

它不聊天、不写代码、不生成任何自然语言。它只做一件事:判断。

这就引出了三个问题:Jev到底是什么?为什么它偏偏在此刻爆火?以及,它凭什么让创始人敢于定义下一个时代?

不会写字的AI,凭什么让全球程序员疯狂?

先看Jev具体能做什么。

首先,它舍弃了大模型最引以为傲的能力——生成文本。 你给它一段状态描述,再给它几个预先定义好的问题,它不会返回长篇大论,只返回结构化的选择、评分和概率。它原生支持三种输出:Choice,从你定义的列表中选一个;Score,将输入映射到有序等级;Noul,返回一个是/否的概率值。每个答案都附带置信度。

其次,它快得不像大模型,便宜得也不像大模型。 官方数据显示,Jev的端到端延迟为70到500毫秒,在特定工作流中比传统大模型快20到200倍,成本低40到400倍。每百万输入Token仅需0.042美元,输出Token完全免费。有开发者用它过滤X平台上的引战内容,平均380毫秒完成一次判断;有人让它同时运行50局《地铁跑酷》,费用不到1美分;有人用它清洗积压三个月的数据,13分钟跑完,账单仅为32美分。

最后,它真正颠覆的地方不是速度,而是“校准”。 Jev采用了一种名为RLCD的训练方法,全称“面向校准决策的强化学习”。简单来说,它不仅需要选出答案,还要确保“我有90%把握”这句话真实地接近90%。置信度高于0.9时,代码自动执行;0.7到0.9时,交由更强模型复核;低于0.7时,转交人工处理。这正是自动化系统敢于使用它的原因。

因此,你可以看到这些应用场景:工单分诊、模型路由、工具调用风控、结果校验、新闻分拣、金融质检、浏览器操作、游戏NPC、Coding Agent上下文压缩。 它就像一个具备语义理解能力的超级if语句,代码需要的不是文采,而是“要还是不要、A还是B、继续还是停止”。

当然,官方所说的“零幻觉”需要准确理解:它不会输出你定义之外的选项,不会返回乱码JSON,但这不代表它不会选错。类型安全保证的是代码契约不崩溃,而不是业务判断永远正确。

“叛逆”的Jev:与主流不同的路径选择

Jev最值得深思的,不是它有多强大,而是它选择了一条与主流完全相反的道路。

第一,传统大模型是“生成优先”,Jev是“判断优先”。 GPT、Claude、Gemini本质上都是自回归生成,一个Token一个Token地输出。哪怕最终只需要一个“finance”,它也要先写一段解释,再让代码去解析JSON。Jev直接砍掉生成,提前枚举和约束输出空间,数学上就不可能产生预定义schema之外的内容。

第二,传统大模型走的是RLHF、RLVR路线,Jev走的是RLCD路线,训练目标和产出完全不同。 RLHF优化人类主观偏好,产出聊天接口;RLVR优化封闭数理题目的正确性,产出带思维链的推理接口;RLCD优化的是“决策校准”,产出机器原生、能被软件直接调用的决策能力。传统路线让AI更像人,Jev选择让AI更像基础设施。

第三,Claude Code代表的是“协助优先”的传统路线,Jev代表的是“自动化优先”的新路线。 创始人阿尔梅达的判断很尖锐:Claude Code的内核仍是RLHF,它的使命是取悦面前的开发者,而不是彻底移除人类。它围绕单一模型、KV Cache、上下文追加构建,过度拟合于自己的测试环境。一旦接入外部工具或多Agent协作,就容易崩溃。Jev不是来取代大模型的,它是来给大模型当“监考老师”的。

未来的分工可能很清晰:Jev判断“做什么”,GPT/Claude思考“怎么做”,代码/Tool/MCP真正“去做”,Workflow/Agent Runtime保证整件事持续运行。

一方面,大模型负责慢思考、复杂推理、长文本生成;另一方面,Jev负责高频、快速、边界清晰的决策。两者不是替代关系,而是配合关系。 更关键的是,当判断成本从几美分降到万分之一美分,开发者不是把原来的100次判断做得更便宜,而是开始做10000次以前根本不会做的判断。

这就是Jev最诱人的地方:它撕开了“生成为王”的假象,让“判断”和“生成”正式分家。

Jev诞生背后:一个OpenAI“叛徒”的两年隐身与一场重构

Jev背后的人,比模型本身更有故事。

迪奥戈·阿尔梅达,前OpenAI研究员,InstructGPT和RLHF论文的共同作者,GPT-4贡献者名单中被列入“Foundational RLHF and InstructGPT work”。2024年离开OpenAI后,他创办TypeSafe AI,隐身两年,直到2026年9月15日带着Jev亮相,同期披露4000万美元种子轮融资,DCVC领投,估值约2亿美元。

他的核心反思是:RLHF可能是一次始料未及的弯路。

一方面,RLHF把人塞进了回路。它优化的是人类主观偏好,而不是客观真实结果。 于是模型学会过度承诺、自信迎合、盲目编造。你问它放屁录音是不是音乐,它能一本正经地说这是“极具阴森氛围感的环境音乐佳作”。这不是Bug,是奖励机制设计出来的特性。

另一方面,安全对齐在底层API里是类型错误。 面向C端聊天,拒答可以理解;但作为底层依赖库,模型突然拒绝执行,下游系统可能直接崩溃。阿尔梅达要的是机器原生、可编程、高可靠的“认知内核”,而不是一个坐在屏幕对面唠嗑的数字同事。

更关键的是,他重新定义了优化目标。预训练没有问题,问题在后训练。RLHF优化人类偏好,RLVR优化可验证答案,RLCD优化校准决策。Jev的名字来自“杰文斯悖论”:效率提高、成本下降,资源总消耗反而暴涨。TypeSafe赌的就是,当智能判断便宜到接近不要钱,自动化需求会爆发。

他甚至说:“即使给我十亿美元,我也不会从头预训练一个基础大模型。”因为真正的机会不在重复造轮子,而在把现有智能切片、重组、蒸馏、组合,变成软件能直接调用的决策能力。

他的终极判断是:下一个时代一定不是Claude Code时代。因为Claude Code仍然在协助人类写代码,而真正的未来是自主自动化——让软件本身变聪明,让AI退居幕后,在后台安静运行。

分水岭已至:当AI不再比谁更会聊天,行业规则正在改写

Jev的出现,不只是一款新产品,更像一道分水岭。

在架构层面,AI正在从“单一大脑”走向“分布式分工”。 过去一个Agent每一步都调用同一个大模型,又贵又慢。未来会是多层结构:前沿模型负责复杂规划,Flash模型负责普通推理,Jev负责路由、分类、验证、风控,确定性逻辑交给传统代码。大模型退回它该在的位置,不再当中央处理器,而是当公关发言人。

在需求层面,杰文斯悖论正在AI身上重演。 当判断成本暴跌,以前“不值得用AI”的地方都会用上。给每条数据库记录加语义过滤器,给每次工具调用加安全审查,给洗衣机加一个“衣服忘拿了吗”的判断。这不是降本增效,这是全新的智能消耗场景。

而在竞争层面,Coding Agents的格局也要被重写。 Claude Code和Codex建立在“单一模型世界”上,而开源团队已经可以把Jev接进去。谁先利用Jev的组合能力做出极致体验,谁就可能形成新的壁垒。Jev上线24小时被近13%付费团队采用,这个速度是GPT-5.6系列的2倍,是Claude Fable 5.1的6倍以上。

当然,挑战同样刺眼。 Jev的基准测试目前主要来自TypeSafe自建评估,尚无独立第三方验证;RLCD细节未公开发表;“零幻觉”只是格式保证,不是判断永远正确;生产环境准确率、置信度校准、高负载延迟稳定性,都需要更多实战数据。但无论如何,它已经撕开了AI行业“生成为王”的第一道裂缝。

写在最后

过去几年,整个行业都在教AI怎么更像人:更会聊天、更会写文章、更会讨好用户。Jev反其道而行,它不说话,只判断。

但恰恰是这个“不会写字”的模型,让全球程序员玩疯了。因为它证明了一件事:智能不一定要生成,判断也是智能;AI不一定要当同事,它更适合当基础设施。

ChatGPT之后最火的模型,不是另一个更会聊天的AI,而是一个闭嘴干活的AI。下一个时代,也许真的不是Claude Code时代,而是机器原生、可编程、自主自动化的时代。

当AI不再假装人类,它才真正嵌入软件的底层脉络。Jev不是来取代现有模型的,它是来给AI时代装上一套决策总线的。

本文来自微信公众号“第一新声”,作者:第一新声,36氪经授权发布。

更多文章