JOTO
Contact us
← AI 智库
大语言模型

参与研发 ChatGPT 的人,做了一个不聊天的 AI

2026 年 9 月 16 日

TypeSafe AI 推出专用于结构化判断的模型 Jev,由 InstructGPT 论文作者 Diogo Almeida 创立。它不生成文本,仅输出选项、分数或概率,在 27 个业务问题测试中响应速度比 GPT-5.6 快约 75 倍、成本约为其 1/171,但准确率非最高。Jev 定位为嵌入软件的决策组件,适用于工单分派、内容检查等高频小判断任务。

AI 判断任务的新范式

自从 ChatGPT 出现,很多人对 AI 的印象就固定在了一个输入框里:你问,它答。

写文章、改代码、解释问题,这种方式很好用。可软件里的许多任务,根本不需要一篇回答。

一封邮件是否紧急?工单该分给谁?下一步要不要转人工?

程序需要的往往只是一个选项或分数。让通用模型反复处理这些小判断,等待时间和费用就会累积。

开发者已经在用结构化输出、小模型和固定规则解决这些问题。TypeSafe AI 提出了另一种尝试:把模型专门训练成一个做判断的工具。

它叫 Jev,不会写文章,也不陪你聊天。

实际效果:速度与成本优势显著

先看它处理这些小判断的速度。

官方把同一组 27 个业务问题交给了 Jev 和 GPT-5.6 Terra。

界面记录的完成时间分别是 0.114 秒和 8.566 秒,费用分别为 0.000081 美元和 0.013880 美元。

这一次演示中,Jev 约快 75 倍,成本约为对方的 1/171。

Jev 与 GPT-5.6 Terra 同步处理 27 个问题的对比演示
▲ 视频:同一组 27 个问题的官方对照演示,原速节选;倍率仅对应本次演示。

外部测试也显示了类似取舍。

Every 用 12 段合成文字测试写作问题识别,Jev 比高推理设置的 Claude Fable 5.1 快约 25 倍,估算成本约为其 1/580;但 7 个预设问题只找到了 6 个,对方则全部找到。

样本很小,速度优势和漏检都值得保留。

当判断需要连续发生时,响应速度就更重要了。官方用 Doom 和维基百科跳转演示了这种用途:其中 Doom 输入的是整理后的文字状态,并非直接看画面。

Jev 参与 Doom 实时控制的演示
▲ 视频:Jev 参与 Doom 实时控制的官方演示,原速节选。

不过,响应快还得看判断准不准。官方的成本—准确率图把两者放在一起:越靠左越便宜,越靠上准确率越高。Jev 位于最左侧,但准确率并非最高。

这里比较的是 4 个自建工作流的平均结果,参考答案来自其他强模型的预测,不能当成通用能力排名。

Jev 与其他工作流在成本与准确率上的对比图
▲ 图:官方 4 个工作流评测。横轴为单次工作流成本,采用对数刻度;纵轴为该评测口径下的准确率。Jev 成本最低,准确率并非最高。

Jev 是什么,能做什么?

这些演示有个共同点:每一步都只需要一个判断结果。

TypeSafe AI 把专门处理这类任务的 Jev 称为决策模型。

创始人 Diogo Almeida 在 OpenAI 参与了 RLHF(基于人类反馈的强化学习)和 InstructGPT 的基础研究,研究如何让模型更好地遵循人的指令。

他是 InstructGPT 论文作者之一,也参与了 GPT-4 的指令遵循和 API 评测。

在 Jev 里,这类判断被做成了三种基本能力:从给定选项中选择(Choice)、按标准打分(Score),以及对一个陈述返回 0 到 1 的判断值(Noul)。

多个问题可以同时评估,结果直接交给软件使用。

官方文档举了一个例子:客户说 Stripe 账户连接失败已经三天,正在影响销售。

Jev 可以同时判断该分给哪个部门、客户有多不满、事情是否紧急。

程序拿到结果后,按规则分派工单;如果需要写回复,再交给能生成文字的模型。

安全告警、内容检查、邮件筛选,也可以这样拆成一连串小判断。下面这张官方示意图里,Jev 负责判断,代码负责把结果接到关闭、排队、通知等动作上。

Jev 与代码组合的安全告警处理流程示意图
▲ 图:TypeSafe 官方示例,多个 Jev 判断与普通代码组合成安全告警处理流程。

与聊天模型的本质区别

分派工单、筛选内容,聊天模型也能做。要看 Jev 的不同,得比较底层模型的输出方式:ChatGPT 是完整的助手产品,Jev 则是供软件调用的模型。

对比项聊天模型Jev
输出文字、代码,也能输出结构化结果预设选项、分数和概率
适合任务写作、解释、开放式问答分类、评分、流程中的小判断
使用方式对话或通过 API 调用作为判断环节接入软件

Jev 不生成自由文本,也不会展开解释为什么选了这个答案。

所以,区别不在于“能不能返回 JSON”,而在于专门做判断后,能否更快、更便宜,同时保持足够的准确率。

它还有一个明确的边界:选项只有 A、B、C,就不会凭空输出 D。但它仍可能把本该选 A 的题选成 B。

官方所说的类型安全,保证的是输出符合结构,不能理解成“零判断错误”。

TypeSafe 还强调概率校准:大量被赋予 80% 概率的事件,实际发生比例应接近 80%。

这是训练目标;返回一个精确到小数的数字,本身并不能证明判断可靠。是否适合自己的任务,还得拿实际材料检验。

接入方式与当前可用性

现在 Jev 仍处于 Early Access,官网有候补名单入口,也提供 Playground 和 API 接入文档。

Playground 需要登录,新账号是否立即获得权限,本文尚未验证。

拿到权限后,就可以先在 Playground 里输入一段业务材料,设定要判断的问题和选项;确认效果后,再通过 API 或 SDK 接进自己的软件。

比如内容团队可以先准备一批人工标注过的中文稿,让它检查“这段是否重复前文且没有新增信息”。

先看漏检和误报,再决定哪些结果自动处理、哪些交给编辑复核。问题越具体,越容易检验它到底有没有用。

官方当前标价是每百万输入 Token 0.042 美元,输出不收费。它是收费服务,“输出免费”也不代表整个请求免费。

适用场景与现实取舍

这样的价格,在任务反复发生时才更有吸引力。Jev 值得关注的用处也在这里:频繁地分流、检查,或选择下一步动作。

如果它能在自己的业务数据上保持可接受的错误率,速度和成本优势才会真正兑现。

对多数人来说,聊天模型仍然更通用。

但很显然聊天不是唯一的场景,很多行业内部的流程、系统、软件每天都有无数次的各种判断。

Jev 的机会,或许就在那里。

JOTO 企业落地观察

  • 企业部署决策模型需重新评估「端到端延迟」构成:传统依赖大模型生成+解析的链路,正被 Jev 类型的轻量判断组件替代,这对实时性敏感系统(如客服路由、风控拦截)意味着架构级优化空间。
  • 智能体工程中「判断-执行」解耦成为新实践:Jev 不输出解释、只返回结构化结果,倒逼团队将「可信度验证」「兜底策略」「人工复核触发」显式设计为独立模块,而非隐含在提示词中。
  • RAG 知识工程面临新分工:当判断类任务从 LLM 卸载至专用模型,RAG 系统可聚焦于高质量上下文供给与语义召回,不再被迫承担低价值分类任务,知识库构建目标更清晰。
  • AI 安全治理需覆盖新型输出边界:Jev 的「类型安全」不等于逻辑安全——它能确保输出在 A/B/C 内,但无法防止因训练数据偏差导致的系统性误判,企业需建立针对决策模型的专项偏见审计机制。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.