Jev:当 AI 不再说话,只负责快速判断

最近,TypeSafe AI 发布了一个名为 Jev 的新模型。它不会聊天,也不能写文章,只负责根据当前状态作出选择、评分或概率判断。

与大语言模型逐个生成 token 不同,Jev 会并行返回预先定义好的结构化结果。按照 TypeSafe 公布的数据,它的响应时间约为 70 到 500 毫秒,每百万输入 token 的价格是 0.042 美元,不收取输出 token 费用。

官方还演示了让 Jev 玩初代《DOOM》。程序每秒调用它大约 10 次。不过,Jev 看到的不是游戏画面,而是程序整理好的敌人、生命和弹药等状态,再从有限动作中选择下一步。

这个演示让我重新想起一个很早以前思考过的问题:AI 能不能玩我非常喜欢的《毁灭战士:永恒》(DOOM Eternal,下文简称《永恒》)?

《永恒》是一款需要高速移动、射击和连续判断的复杂游戏。我以前设想过让大模型通过画面玩游戏,但一次请求可能需要几秒钟,这段时间已经足够在游戏里死上好几次。Jev 仍然没有证明 AI 能够玩好《永恒》,却移除了一个很明显的障碍:模型终于有可能在局势失效以前给出判断。

相比游戏,这种快速而便宜的判断能力,在工作中可能更有价值。

一个 Agent 每完成一步,都需要判断接下来应该调用哪个工具、继续执行、重新尝试还是向用户求助。现在这些判断通常也由大语言模型完成。如果每次都等待模型生成一段解释,整个任务就会变慢。Jev 可以只返回下一步选择和置信度,把内容生成留给大模型。

它还可以用于分类和筛选。面对大量邮件、工单、搜索结果或知识库内容,Jev 可以判断它们属于什么类型、是否相关、是否需要优先处理,再交给对应的人或程序。

另一个用途是验收。大模型生成回答、文章或代码以后,Jev 可以按照预先定义的标准,判断结果是否回答了问题、是否遗漏关键内容、是否需要重试或人工检查。

这可能才是 Jev 最值得关注的地方:大语言模型负责生成,Jev 负责判断,普通代码负责执行确定的规则和实际动作。它不是要取代大模型,而是承担工作流中大量重复、频繁的小判断。

当然,输出一定符合预设类型,并不代表判断一定正确。TypeSafe 的速度和成本优势主要来自官方测试,早期第三方评测也发现,它的概率校准会随任务变化。真正使用时,仍然需要用自己的数据验证,并为低置信度和高风险操作保留人工检查。

玩《DOOM》只是一个直观演示。Jev 更重要的意义是:当一次智能判断变得足够快、足够便宜以后,我们可以把 AI 放进更多原本不值得调用大模型的工作环节。