这两天最火的话题非 Jev 莫属了,这是参与构建了 RLHF/ChatGPT 的前 OpenAI 员工 Diogo Almeida 的创业公司搞出来的新模型。
简单来说 Jev 是一个低成本、低延迟、高并发的决策模型,可以输入文本和候选,并快速决策出选项。
Jev 已经发布就引起全网复刻,各种 OpenJev 横空出世。我也动手做了一个视觉版实验:Jev Visual,让模型看着图片做选择、判断和打分,并且在本地运行。
先放项目地址,欢迎体验、点个 Star:
https://github.com/hr98w/jev-visual
什么是 Jev
Jev 是 TypeSafe 推出的决策模型。你给它当前状态和问题,它直接返回程序能用的结果。最核心的能力只有三种:
这三种问题可以放进同一次请求,并行得到结果,交给代码继续执行。模型已经发布就在网上引起热烈讨论,Jev 的优势莫过于实现了低成本、低延迟、高并发的 LLM 决策,模型输出的不再是一串 token,而是简简单单的 ABC 选项,或者只是一个 yes or no.
发布后,围绕 Jev 的讨论和应用实验很快多了起来,Browser Use、AI 交易这些热门方向都有人接上了。
jev-trader 尝试把它接进链上交易:读取订单簿,选择买入或卖出,再由程序处理挂单。高频交易应该是最有噱头,但是估计最不靠谱的一个应用了。
Browser Use 的 jev-ultrafast,让 Jev 选择下一步操作和页面元素。项目展示的一次 Google Flights 航班搜索用了约 7.1 秒,包含输入文本和页面等待。

fast-jev-compaction 得到了 Jev 开发者的好评,把 jev 的分类器引入到 coding agent 的 compaction 中。
不过,目前 Jev 接收的是文本和结构化状态,还不能直接看图。 连官方玩 Doom 的演示,喂给模型的也是游戏状态数据。
那能不能做一个能看图的版本?
Jev 刚发布,社区就已经出现了 OpenJev 这样的开源尝试:用现成模型,直接读取各个候选答案的分数;同一份上下文只计算一次,再让多个问题复用,省掉逐字生成答案的过程。
我借鉴了这些思路,换上支持视觉的 Qwen3.5-0.8B,用 MLX 在 Mac 上运行。 图片和公共上下文先算一次,再批量给不同问题的选项打分,由代码组装结果。
下面两个 Demo,看看它能做什么:
AI 分拣工厂: 看传送带截图,识别物品,选择分拣通道。
打砖块: 看游戏截图,判断球在哪个编号区域,再由程序把挡板移过去。这是简化后的视觉分类玩法,目前还不能稳定通关。
复刻原理解释如下,并小小的叠个甲:这只是在 infer 层小小的复现一下 jev 的形式,肯定不如各种成熟推理框架效率高,也肯定不是 jev 的正在原理,但是作为 inference 的小入门仍旧是不错的

代码、运行方法和 Demo 都放在这里了,感兴趣可以在自己的 Mac 上试试,也环境大家 star:
https://github.com/hr98w/jev-visual







