Token导航 LogoToken导航TokenDH.com

Jev 火的不是token速度,而是 AI 不必总靠“说话”工作

更新时间 2026-09-18来源 AIGC从0到1正文 5051字阅读约 16分钟1 张图片

9 月 15 日,TypeSafe AI 发布了一款叫 Jev 的模型。

它最容易被记住的特征,是它不会写字。

它不聊天,不写邮件,不解释,不生成代码。你给它一段状态,再给它一组预先定义的问题,它返回的是一串可以被程序直接消费的判断:

这个用户是否愤怒?0.91

该由哪个部门处理?billing,0.87

这笔交易是否可疑?0.76

TypeSafe 给它取了个颇有野心的名字:System One Model。官方的说法是,Jev 是“状态输入、类型化概率决策输出”的模型;它放弃了字符串生成,换来并行判断、低延迟和结构化输出。

新架构、新训练方法、快 200 倍、便宜 400 倍、还能打 Doom。

一个长期被大模型遮住的问题重新摆到了台面上:

软件真的总需要 AI 先说一段话吗?


一、软件从来没有想要那段“话”

过去几年,几乎所有 AI 软件都走着相似的路径:

业务状态

提示词

LLM

一段自然语言或 JSON

解析

校验

程序做决定

这套路径如此普遍,以至于人们很少觉得它有什么奇怪。

但如果软件真正想知道的只是“这个客服工单要不要升级”“这次操作是否高风险”“下一步该点哪个页面元素”,为什么要先让模型写一段像人类回答一样的话,再由程序把它翻译回一个判断?

这有点像你想要一个红绿灯,却先请一个哲学家写一篇关于交通秩序的短文。

Jev 试图把中间那一层拿掉。

它的输入不是对话上下文,而是 state;输出不是自然语言,而是决策。官方目前提供三类原语:在候选项中选择的 Choice、按量表评分的 Score,以及判断一段陈述真假的 Noul。多个问题可以在一次调用中并行完成。

TypeSafe 对它的定位很清楚:System One 不是 Agent,不负责决定整个工作流,也不生成下一步计划。代码依然控制流程;模型只接手那些写死规则很困难、却又没必要调用完整推理模型的模糊判断。

如果把传统 if 写成:

if amount > 10000:

那么 Jev 想处理的,是另一类 if:

if this_transaction_looks_suspicious > 0.92:

前者是确定性逻辑,后者是语义逻辑。

这也是 Jev 最有意思的地方。它不是“AI 版 if statement”,它更像一个可以被调用的 Semantic If。

二、为什么它偏偏在 Agent 时代突然火了

如果 Jev 在 2023 年发布,可能不会有今天这种热度。

当时大家还在问,大模型到底能写什么、聊什么、生成什么。

今天的焦点变成了:Agent 为什么还是慢、贵、脆,而且经常不值得放心交给它做事?

原因很简单。Agent 不是一次调用模型,而是一串循环:

观察

判断

行动

再观察

再判断

再行动

一次调用慢两秒,在聊天里问题不大;如果一个 Agent 要循环三十次,用户就要等一分钟。

一次调用贵几分钱,在偶尔用一次的 Copilot 里无所谓;如果一个系统每天要做数百万次路由、过滤、评分、验证、重试和工具选择,这就变成基础设施成本。

Jev 刚好卡在这个位置上。

Doom、Wikipedia 竞速、Minecraft、浏览器订票,这些 Demo 不一定是最有说服力的 benchmark,却是最好的传播媒介。你看到一个模型以接近实时的频率决定下一步动作,就会马上理解:智能判断终于能进入高频循环。

TypeSafe 自己也承认,传统 Doom bot 能打得更好;Jev 演示的重点不是游戏水平,而是“反应式智能”可以做到什么程度。它用高基数链接选择做 Wikipedia 竞速,也不是因为百科竞赛有多重要,而是为了证明模型可以在很多候选项里快速选出下一步,而不凭空造出一个不存在的选项。

这正是 Agent 最缺的那种能力:不是慢慢想一篇答案,而是在大量细小、频繁、带一点模糊性的分叉口,迅速做出可执行的判断。

三、“不就是一个分类器吗?”

Jev 发布后,技术圈最常见的一句评论是:

“这不就是一个分类器吗?”

从数学输出看,Jev 确实很接近概率分类器。它面对候选项,返回概率分布;它不自回归地一个 token 一个 token 写答案,而是并行做判断。从工程实现看,社区已经有人尝试用共享 prefill、KV cache 复用、并行 constrained decoding、受限 logit slice 等方式,复刻类似的推理形状。

换句话说,Jev 的一部分“快”,并不神秘。但“只是分类器”又不够准确。

传统分类器的标签空间通常在训练时就固定了。你训练它识别 spam 和 not spam,它就识别这两个类。Jev 的特殊之处在于,标签和问题可以在运行时定义。

今天可以问它:

billing
technical
sales

明天可以问:

low-risk
medium-risk
high-risk

后天可以让它从两百多个浏览器元素里,选出最该点击的一个。

它不需要针对每一个新的标签空间重新训练。

所以,“分类器”描述了它的数学形态;“运行时可编程的语义判断接口”,才更接近它的产品意义。

真正的问题也由此分成两层。

第一层是 inference shape:并行结构化判断、受限输出、概率直接读取。这部分很可能会被快速复刻,也很可能很快商品化。

第二层是训练与校准:TypeSafe 称之为 RLCD,也就是 Reinforcement Learning for Calibrated Decisions。它声称,模型给出的 0.8,不只是“模型看起来有八成把握”,而应当意味着在足够多的类似判断中,它大约有八成是正确的。

如果这一层成立,Jev 的价值会远高于“更快的 JSON 输出”。

如果这一层不成立,它就更像一个很快、很灵活、但仍需要谨慎对待的分类模型。

目前,真正值得等待的,是独立的校准曲线、跨领域测试和公开 benchmark,而不是更多游戏 Demo。

四、“零幻觉”是一个需要降温的说法

TypeSafe 最容易被误读的宣传是:Jev 不会 hallucinate。

严格来说,它能保证的是:不会脱离预设 schema。

如果候选项只有:

billing
sales
technical

它不会突然回答:

banana

一个 Agent 在调用工具、执行交易、进入多层依赖链时,输出格式错误本身就可能造成事故。TypeSafe 也明确说明,其 0% 幻觉指标来自架构保证,而非实测统计。

但合法答案不等于正确答案。

正确答案是 billing,模型也完全可能自信地选 sales。

同样,输出了概率也不等于概率已经校准。模型说“90%”,可能只是它比两个候选项更偏向其中一个,而不意味着它在长期统计上真有九成正确率。

TypeSafe 的文档给出了一个很合理的使用方式:高置信度自动执行,中置信度进入复核,低置信度交给人或更强模型;而且不同风险等级应该有不同阈值。

这套控制逻辑本身是对的。

但前提是,模型的置信度值得信任。否则,系统只是把“我不太确定”包装成了一个看起来很精确的小数。

Every 的早期实测很能说明这种边界:Jev 在极短时间内完成数百次判断,速度和成本确实惊人;但测试者也明确保留了判断,认为准确性仍需要更深入验证,现阶段更适合被当成早期预警工具,而不是天然可信的自动裁判。

这比“快 200 倍”更接近 Jev 的真实处境。

图片

五、200 倍不是重点,重点是调用比例变了

TypeSafe 的 193.6 倍速度、444.6 倍成本优势,来自特定 workflow,而且官方自己也写明,这些数字属于现实收益的高端。

我觉得更接近现实的说法是:在答案空间已经被限定、需要大量独立判断、瓶颈主要来自模型调用的任务里,它愿意用一部分能力上限,换取一个甚至两个数量级的速度和成本改善。

在网页加载、工具执行、外部 API、人工审批才是主要瓶颈的流程里,端到端收益就会缩小。

但这已经足够改变 Agent 的结构了。

一个 100 步的 Agent,不应该每一步都叫醒最强推理模型。

其中很大一部分动作可能只是:

  • 这条信息是否相关;
  • 这个文件值不值得读;
  • 是否需要调用工具;
  • 输出有没有明显违规;
  • 要不要重试;
  • 要不要升级给强模型;
  • 是否该请求人工确认。

这些并非不重要,只是大多数并不值得每次都付出完整推理的代价。

未来更合理的 Agent,可能长成这样:

90 次:
快速判断、筛选、评分、路由、验证

10 次:
复杂规划、长链推理、开放生成、关键决策

TypeSafe 用“System 1 + System 2”来描述它:快而频繁的判断,慢而昂贵的思考。

Kahneman 的快思考、慢思考也不是一张能直接套到模型架构上的工程蓝图。

但它背后的结构很可能会留下来:

大量廉价判断,加上少量昂贵推理。


六、AI 正从“一个模型”变成“模型栈”

过去,大家习惯想象一个前沿模型包办一切:

理解
推理
规划
路由
调用工具
验证
写作
安全审查
记忆选择

模型越强,它承担的工作越多。

但 Agent 走进真实工作流后,这种想象开始显得奢侈。

更像现实的架构可能是:

推理模型

规划器

决策与路由层

执行器

工具与环境

旁边还有:
验证器
安全分类器
记忆选择器
奖励与评估层

这并不是什么全新的思想。AlphaGo 早就把落子选择、局面评价和搜索拆开;后来的模型路由、级联调用、验证器、护栏、复杂度识别,也都在做类似的专业化分工。

Jev 没有发明“快模型判断、慢模型思考”。

它做得漂亮的地方,是把其中最常见、最容易被忽略的一类能力——判断——抽象成了一个足够简单的接口:

state
+
runtime schema

probability distribution

code

这也是为什么,Jev 的科学创新程度还无法下结论,但它的接口创新和产品化价值已经值得重视。

科技史里,很多真正改变行业的东西,并没有发明新的物理定律。

SQL 没有发明数据,REST 没有发明网络,Docker 没有发明容器。

但一个足够好的 abstraction,能让原本散落在不同地方的能力,突然变得可调用、可组合、可计价。

Jev 想成为的,可能就是 AI 软件里的这种 abstraction。

七、Jevons Paradox,才是这个名字最深的一层

Jev 的名字来自 Jevons Paradox。

19 世纪,经济学家 William Stanley Jevons 观察到:蒸汽机效率提高后,英国并没有因此少烧煤。煤动力变得更划算,使用场景反而迅速扩大,总煤耗甚至可能增加。

TypeSafe 的赌注是,智能判断也会发生同样的事。

今天,一次 AI 判断仍然足够贵,所以企业只在重要环节调用它。

如果明天一次判断的成本降两个数量级,系统可能不再只在关键节点调用,而是对几乎所有东西都多问一遍:

  • 这封邮件是否需要回复;
  • 这次操作是否有风险;
  • 这个 Agent 输出是否合格;
  • 这段代码是否值得进一步审查;
  • 这条信息是否值得更深研究;
  • 这个用户是否真的需要人工介入。

成本下降一百倍,不一定让总支出下降一百倍。

它也可能让调用量增长一千倍。

于是,AI 应用的计价方式也会变化。

今天行业习惯按每百万 token 计费。但对企业而言,更实际的问题是:

判断一次多少钱?

一个 Agent step 多少钱?

审核一张发票多少钱?

验证一次行动多少钱?

Token 仍然是底层资源。

但在应用层,更重要的单位可能会逐渐变成 Cost per Decision每次决策成本,甚至 Cost per Verified Action已验证操作的费用。

八、AI 不该总是“说话”,但人仍然需要它说话

人需要 AI 解释、讨论、写作、推理、协作。自然语言依然是人与 AI 之间最重要的界面。

但代码不需要一段漂亮的解释。

代码需要的是:该走哪条分支、该不该继续、是否可信、是否升级、是否执行。

过去,我们习惯让大模型不停说话,试图从它的话里榨出可靠的软件行为。

Jev 提出了另一种可能:把一部分智能从语言里拿出来,变成概率化、类型化、可插入控制流的判断。

TypeSafe 最终能否守住技术优势,现在还很难说。它的训练方法、校准质量和真实生产表现,都需要时间验证;它也可能很快被开源模型、推理优化和新一代路由器吞掉。

但即使 Jev 最后只是一个短暂爆红的产品,它指出的问题依然会留下来。

未来的 AI 软件,或许不再依赖一个无所不能的大模型。

它更可能是一组不同成本、不同速度、不同可靠性等级的智能部件。

其中有的负责思考,有的负责写作,有的负责执行。

还有一层,专门负责判断。


>/作者:王零壹,920.org.cn(AI Research Institute)创始人,港大AIBT研究生,前上市公司 CMO。长期研究 AI 产品、Agent 架构与商业增长,并持续观察技术变迁如何重塑人的工作、判断与生活。

*著有《AIGC从0到1》系列丛书、及东方寓言小说《飞将军》

*善于洞察先机,中文互联网第1个意识到OpenClaw范式价值的人(1月26日);

关注我,一起AIGC从0到1~

文章标签大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多