CoAI
指南

Jev是什么?不生成文本的AI「System One模型」详解

TypeSafe AI推出的Jev不返回文本,只返回带类型的判断和概率。本文依据官方文档梳理它的三种提问方式、速度与价格、官方公布的弱点,以及与大语言模型的搭配方式。

2026年9月19日阅读约5分钟

2026年9月15日,美国初创公司TypeSafe AI以早期访问方式发布了Jev——一个完全不生成文本的AI模型。你把程序状态和带类型的问题交给它,它只返回类型确定的判断和概率。公司由ChatGPT基础论文InstructGPT的共同作者Diogo Almeida领导。本文依据官方文档,梳理Jev以及该公司提出的新类别System One模型

Jev是什么

Jev是TypeSafe AI作为「第一个System One模型」发布的判断专用模型,当前版本为jev-1.13。它与传统大语言模型(LLM)最大的区别在于输出形式。

  • 大语言模型: 生成供人阅读的文本。即使你需要结构化数据,也得先让它写成文本,再在程序里解析
  • Jev: 不生成文本。它接收程序状态(state)与带类型的问题(questions),返回类型确定的值、概率分布与置信度

官方将这一设计解释为修正一种错配:把文本生成系统硬拧成输出结构化判断。使用Jev时无需解析、无需重试,返回值可以直接用于条件分支、排序或路由。

System One模型的思路

名称来自丹尼尔·卡尼曼的「快思考与慢思考」。长链推理和写作属于System 2,也就是大语言模型擅长的领域;一瞬间完成的判断属于System 1,而Jev专门服务后者。可以这样理解它的定位:凡是该领域专家五秒内就能判断的事,用它来大批量、低延迟地处理。

三种提问方式(基本原语)

Jev支持三种问题,并且可以在一次API调用中混合使用。多个问题针对同一状态并行且相互独立地评估;按官方文档说明,增加问题几乎不会改变响应时间。

  • Choice(选择): 从给定选项中选一个。返回所选选项、所有选项的概率分布和置信度。适合工单分流、文档类型判定。当选项可能不完备时,官方建议加入「其他」
  • Score(评分): 沿着有顺序的等级(例如:平静中立/有所不满/非常愤怒)给出位置,也可能落在两级之间。适合严重程度、满意度、熟练度的判定
  • Noul(真伪): 针对一个陈述返回0到1之间的概率。接近1.0表示「是」,接近0.5表示无法判断。适合「这是否是缺陷报告」「这是否是退款请求」这类判断

每个答案还会带回置信度(confidence),表示概率分布的集中程度。这正是「只把不确定的情况交给人或大语言模型」这一设计的着力点。

速度与价格(厂商公布值)

  • 端到端响应时间为70到500毫秒。官方称在同等智能要求的此类任务上比前沿模型快40到200倍
  • 价格为每百万输入词元0.042美元(每十亿词元42美元)。输出免费,仅按输入计费
  • 速率上限为每秒25万词元、每分钟1200次请求,官方称会随需求动态调整
  • 每次请求上下文上限为6.4万词元;状态加最长的单个问题上限为3.2万词元
  • 仅支持文本输入(字符串、JSON对象或文本数组),不支持图像、音频、视频

据TechCrunch报道,Vercel在分类任务上测得比原方案快5到18倍且精度更高,Bryo AI在邮件分类上发现其成本比Gemini低10到20倍。这些都是厂商与用户企业公布的数据,宜视作「值得用自家数据复测」的线索,而非可以直接套用的结论。

如何正确理解「不会幻觉」

Jev的宣传语包括「不会出现类型错误,也不会幻觉」。它保证的是输出的形式:不会返回选项之外的值,也不会返回损坏的JSON,因此解析错误与重试逻辑本身就不再需要。

但这并不意味着判断内容一定正确。返回的是经过校准的概率,概率0.7的判断按设计约有三成会出错。官方文档本身也建议按置信度分流处理。把「不编造事实」与「永远判断正确」区分开,是评估这一模型时最关键的一点。

官方公布的弱点

TypeSafe AI在官方文档中公开了jev-1.13的弱项。对于是否采用的决策,这一页参考价值最高。

  • 计算与计数不可靠: 字符数、出现次数、列表条目数都不可靠,输入越大误差越大。文档明确写道「Jev不是计算器」
  • 日期与时间的比较较弱: 哪个日期在前、是否落在某个区间、相隔多久,判断都不稳定
  • 多跳推理能力弱: 需要追溯「属性的属性」的问题,以及双重否定的表述,精度都会下降
  • 混入无关信息会降低精度: 状态中与判断无关的内容越多,结果越差
  • 无法生成文本: 试图用连续选择来拼出文本既慢且效果差
  • 指令按字面理解: 它回答「你写下的问题」,因此边界情况必须明确写进判定标准
  • 不保证抵御对抗性输入: 嵌入在状态中的指令可能影响输出
  • 英语优先: 官方表示中文、日文等CJK语言「可以处理,但不及英语」

用中文使用时,较现实的做法是把指令与选项说明写成英语,只把待判断的正文保留为中文,并在实测精度的基础上做设计。

适合的使用场景

  • 意图路由: 对来件分类,分派到相应部门或处理流程
  • 优先级与严重度判定: 用分数表示紧急程度,决定处理顺序
  • 护栏与监控: 毫秒级判断智能体的输入输出是否违反策略,也被用于检测大模型越狱
  • 模型路由: 简单请求交给便宜的模型,困难请求交给高性能模型
  • 重排序与检索辅助: 候选排序、相关性判定
  • 智能体的分支决策: 把「下一步做什么」的选择权留在代码里

与大语言模型搭配才是正解

由于Jev不会写文本,它的定位不是替代大语言模型,而是放在其前端或后端。

  • 大批量判断由Jev快速处理,只把置信度低的情况升级给大语言模型或人工(置信度门控)
  • 复杂判断不要写成一个大问题,而是拆成小问题并在代码里合成
  • 写作交给大语言模型,判断交给Jev

如何开始使用

  • 目前以早期访问方式提供,在控制台(console.typesafe.ai)创建API密钥后即可使用
  • 提供Python SDK、JavaScript/TypeScript SDK和HTTP API。默认模型别名为jev-latest,当前指向jev-1.13.0
  • 认证使用环境变量TYPESAFE_API_KEY。官方还发布了面向Claude Code与Codex的智能体技能
  • 官方文档仅有英语版。价格、速率上限与使用条件都可能变化,动手前请在官方页面确认最新条件

总结

Jev不是「大语言模型的下一代」,而是承担大语言模型不擅长领域的另一个零件。在不需要生成文本的判断上——分类、分流、评分、护栏——以高并发低延迟运行时收益明显;而在计算、日期处理、文本生成,以及以中文为主的细微语义判断上,则需要谨慎验证。务实的第一步:在现有流程中找出「只让大语言模型做分类」的环节,把它换成Jev,实测延迟、成本与精度。

来源: TypeSafe AI官方博客官方文档TechCrunch(2026年9月18日)。本文内容基于2026年9月19日确认的公开信息。

本文提到的工具

返回指南列表