当只需一个标签时,为何还要生成文本?Jev 推出专为决策优化的零文本分类模型
企业正将大量本只需标签的AI决策任务(如工单分派、RAG相关性判断)从LLM迁移至轻量级分类器。TypeSafe推出的Jev以毫秒级响应、极低token成本和校准概率输出,推动决策类AI回归经典分类范式。

如今,企业软件内部运行的大量人工智能并非用于生成任何文本。它不与AI聊天机器人对话,甚至也不推理如何给出正确答案。它的作用是做出决策:支持工单应归入哪个队列、检索增强生成(RAG)文档是否相关、某笔交易是否存在异常,或哪个模型应处理某项请求。在许多企业AI技术栈中,这些决策是通过向语言模型提问以生成文本,再将该文本解析回标签来完成的。
TypeSafe AI的Jev于9月15日以早期访问形式发布,对这类决策采取了不同方法。Jev不进行对话,不通过长链思维进行推理,甚至根本不生成文本。它接收应用状态和一组类型化的提问,并返回选项、评分以及附带概率的“是/否”答案,通常耗时70至500毫秒,且按TypeSafe的说法,每百万输入token收费 0.042美元。至于输出token?实际上,它们是免费的。
数日内,Jev已集成至从可观测性平台到Pydantic AI等代理框架,以及 Pydantic AI 和 LangChain等各类系统中。TypeSafe不得不暂停其注册排队,许多人开始通过OpenRouter使用该模型。与此同时,一波开源替代方案开始在GitHub和Hugging Face上涌现。尽管当前关注焦点集中在Jev上,但其底层方法其实由来已久:分类(classification)。
当仅需一个标签时,为何还要生成文本?
聊天模型针对的是另一项任务而优化。预训练阶段教会它们预测下一个token,而借助人类反馈的强化学习(RLHF)进行的后训练则教会它们生成人们偏好的响应。这两个阶段均产出字符串。自动化系统需要的是类型化数值、可预测的延迟、每次调用稳定可控的成本,以及能轻松与真实标签(ground truth)比对评分的输出。
即使准确,使用生成式模型执行决策也意味着需为逐token解码付费,随后还需解析并验证输出,再处理模型偏离指定格式、添加评论或拒绝响应等情况。此外,当被要求说明自身置信度时,生成式模型往往校准不佳。这比听起来更为关键:若系统无法判断自身何时可能出错,就无法可靠决定何时将案例转交人工处理。TypeSafe的发布博文直接提出这一论点,将顺序生成与Jev的并行采样器相对比,并将自报置信度与经校准的概率相对比。
尽管小型语言模型已变得快速且廉价,它们仍需通过生成token来作出决策。而分类器可直接返回调用软件所需的标签或评分,无需生成文本。
变化所在:预训练终于追上了分类需求
因此,若分类始终更契合决策任务,它为何突然再度回归?主要答案在于预训练质量的提升。
早在2019年,研究人员便已证明零样本分类(zero-shot classification)切实可行。Yin等人 重新利用自然语言推理(natural language inference)模型 ,将候选标签与输入进行比对测试;而 facebook/bart-large-mnli 则成为在请求时根据所提供标签对文本进行分类的常用默认模型。但这些模型在其训练领域之外表现脆弱,因此许多部署仍需标注数据及面向特定任务的训练。
BERT在约33亿词的数据上进行了训练。 ModernBERT于2024年12月发布,其训练数据达2万亿token,上下文窗口为8192 token。更强的预训练模型如今可处理更广泛范围的、在请求时定义的分类问题,从而减少了为每项任务单独训练模型的需求。
Jev的开源复现版本使这一点清晰可见,因其内部实现完全公开。SemIf完全不训练任何模型。它直接从冻结的Qwen3.5-4B模型中读取选项概率; SemIf的开发者测量发现 回答21个问题耗时约一秒,而生成JSON则需耗时五秒以上。两种方法在21个选择中的18个上达成一致。Laya 基于4.21亿参数的ModernBERT-large主干网络构建决策模型 ,并在Nvidia T4上每个问题的回答耗时约为33至40毫秒。其他项目则对Qwen3.5应用LoRA适配器,或在DiffusionGemma上运行。各实现方式虽有差异,但共享同一核心理念:利用更强的预训练模型,在不生成文本的前提下作出决策。
这些复现版本也揭示了其局限性。Laya的开发者报告称,其基础检查点(base checkpoints)在类型化决策基准测试(typed-decisions benchmark)上的得分接近随机水平,经微调后结果显著改善。TypeSafe自身除披露一种新架构、一种并行采样器及一种名为“面向校准决策的强化学习(Reinforcement Learning for Calibrated Decisions, RLCD)”的后训练方法外,对Jev内部细节披露甚少;该方法旨在优化模型,使其返回的概率与实际正确率相匹配。将“作出经校准的决策”作为首要训练目标,正是TypeSafe的重大押注。
一个新时代:现代预训练,古老深度学习策略
Jev是更广泛趋势中最引人注目的范例:构建者们采用前沿水准的预训练成果,并在其之上应用ChatGPT问世前的经典方法论。
一种廉价分类器决定请求应交由小型本地模型、专业模型还是前沿API处理;类似FrugalGPT FrugalGPT 和 RouteLLM 等研究已正式确立了语言模型的级联(cascade)机制。Pydantic AI对Jev的集成即围绕同一逻辑构建:Jev负责回答类型化字段,而任何需要生成文本的任务则升级至语言模型处理。
知识蒸馏(distillation)与小型专业模型从未真正离开那些拥有大型且长期ML团队的公司,VentureBeat的 Beyond the Pilot 播客已记录了它们的应用方式。在LinkedIn,时任产品工程高级副总裁(现任首席技术官)的Erran Berger 描述 了如何通过在一份详尽的产品政策文档上对一个70亿参数的教师模型(teacher model)进行微调,再经由一个17亿参数的中间模型将其蒸馏,最终得到一个服务于生产流量的6亿参数学生模型(student),来构建下一代推荐系统。“我们根本不可能仅靠提示词(prompting)来实现这一点,”Berger表示。该流程如今已成为LinkedIn各AI产品中重复使用的标准化方案。 Shopify 则进一步推进了这一理念,构建了一个内部平台,使研发团队能在大约一天内将前沿模型蒸馏为针对单一子任务微调后的开源模型,并内置评估功能。Shopify工程副总裁兼工程主管Farhan Thawar表示,这些蒸馏模型的运行成本与速度较原模型低2至30倍,且在某些狭窄任务中甚至超越了其所学习的前沿模型。
共通主线在于:生成能力仅保留给真正需要它的任务——起草、摘要、编写代码。而路由、打标等更窄范围的决策,则可交由成本更低、且能满足应用在准确性与可靠性方面要求的模型处理。
企业在将决策任务从大语言模型迁移出去之前,应采取的措施
第一步是对现有大语言模型(LLM)流量进行审计,将调用分类为生成类任务和决策类任务,例如路由、分诊、打标签、审批和评分。A 开发者Flavio Copes提供的一个实际案例 展示了相关计算:一家每月在AI上花费10,000美元的公司,其中6,000美元用于决策类任务;若将这些决策任务迁移至成本仅为当前路径5%的新路径,则每月可节省5,700美元。实际节省金额取决于其中多少支出可迁移,以及替代方案的实际成本。
相关注意事项确实存在。Jev目前处于早期访问阶段,仅接受文本输入,且当前仅从美国西海岸提供服务。TypeSafe表示, 需花时间验证Jev的定价是否可持续,并指出其宣传的约194倍更快、445倍更便宜等核心数据源自其自身工作流评估,很可能代表了真实世界收益的上限。Pydantic的文档同样 指出,输入中用于引导Jev回答的文本可能奏效,因此基于Jev构建的防护机制应与确定性检查并行部署,而非取而代之。开源替代方案消除了供应商依赖,但将托管、微调、校准及监控等工作交由团队自行承担。
更长期的影响既关乎模型,也关乎人。2022年之前构建过分类器、级联系统和评估流水线的工程师所掌握的技能正重新变得重要;而将此类经验与当前预训练模型相结合的团队,将有能力构建出成本更低、速度更快、更易于审计的自动化系统。
JOTO 企业落地观察
- 对企业部署而言,文章揭示了LLM流量审计的实操价值:一家月支出1万美元的公司,若60%用于决策类调用,迁移到Jev类方案可月省5700美元;但需注意其当前仅支持文本输入、限美国西海岸服务,且定价可持续性尚待验证。
- 对智能体工程而言,Jev与Pydantic AI、LangChain等框架的快速集成表明,类型化决策正成为智能体架构的新基座——Jev处理结构化字段判断,LLM仅在必要时升维生成,形成‘分类优先、生成兜底’的分层执行逻辑。
- 对AI安全治理而言,Jev强调经校准的概率输出(而非自报置信度),使系统能可靠识别高风险误判案例并转人工;但开源替代方案虽去中心化,却将模型校准、监控与防护机制的构建责任完全交还团队,暴露运维能力缺口。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


