Jev 是什么?

Jev 是一个决策模型。 语言模型写出的文字还得由你去解析,而 Jev 接收一段文本加上一份带类型的问题表,为每个问题返回一个带类型的答案——一个概率、一个具名选项,或者量表上的一个位置——每一个都附带一个校准过的数值。它由 TypeSafe 打造,通过 HTTP API 访问,并且不可能返回你定义范围之外的值。

它为什么不是语言模型

大语言模型产出的是 token;返回内容的形状只是一种期望,而非保证,所以用它来做决策的应用最后都被解析和重试包裹起来。Jev 产出的是你指定类型的值。没有东西需要解析,也没有格式错误的情况要处理——取代重试循环的,是一个在模型_不确定_时才触发的分支,而那是另一回事,也有用得多。

Jev 对比大语言模型 →

三种形状,别无其他

数字

这些是 TypeSafe 公布的;是厂商自己的数据,不是我们的测量。

70–500 毫秒

端到端响应,而前沿模型是 3–329 秒

$0.042

每百万输入 token,输出免费

64k token

每次请求的上下文

免费

输出 token

常见问题

什么是「系统一模型」?
一个为判断而不是为散文而造的模型。Jev 接收一个 state 加一组类型化问题,为每个问题返回一个类型化答案——没有流式 token,没有需要解析的东西,也没有办法吐出你定义范围之外的值。TypeSafe 的说法是:系统一负责快速的结构化判断,而当你真的需要语言时,普通大语言模型作为系统二。
置信度是什么意思?
Choice 和 Score 的答案带一个由概率分布推出的置信度:分布集中意味着确定,分散意味着模型分不开这些选项。它是第二个维度——答案告诉你「是什么」,置信度告诉你「要不要动手」。Noul 答案没有置信度字段,因为概率本身已经承载了它:0.51 就是模型在说它不知道。
Jev 会产生幻觉吗?
在输出的形状上不会。Choice 只可能返回你定义过的选项;Score 只能落在你的量表之内;Noul 是 0 到 1 之间的一个数。它仍然可能读错你的文本——而置信度正是为此存在的。
为什么叫 Jev?
取自经济学家威廉·斯坦利·杰文斯。TypeSafe 的发布文章说,他们预期机器智能会走上蒸汽机变高效之后煤炭走过的那条路——也就是杰文斯悖论:让一样东西用起来更便宜,会让它被用得更多,而不是更少。
我能在本地跑 Jev 吗?它开源吗?
不能。Jev 是通过 TypeSafe 的 HTTP API 访问的专有托管模型;没有公开可下载的权重,而且所有账号用的是同一套权重——它不会按客户做微调或 LoRA 适配。你是通过请求来塑造它的答案:你放进 state 的内容,以及你怎么写每个问题的 instructions 和 criteria。
Jev 有多快?
TypeSafe 给出的数字是端到端 70–500 毫秒,而前沿模型是 3–329 秒,在它擅长的那类查询上快 40–200 倍。这些是厂商自己的数据。本站能从自己的日志里说的是:一次九问请求通常在几百毫秒内返回——每个结果页都会显示那一次调用实测的往返时间。
Jev 多少钱?
jev-1.13.0 每百万输入 token $0.042,输出免费——没有自回归解码可计量。因为 state 只读一次、所有问题并行评估,问十件事的花费和问一件差不多。本站每个结果页都会打印那次调用确切的 token 数和费用。
Jev 是怎么训练的?
用 TypeSafe 称为 RLCD 的方法——面向校准判断的强化学习。它宣称的目标和 RLHF 或 RLVR 不同:不是人更喜欢的答案,也不是能通过检查器的答案,而是概率在认知上诚实的答案。这正是置信度值得拿来设阈值、而不只是装饰的原因。
有哪些限制?
只接受文本——不支持图像、音频或视频。每次请求 64k token,其中 state 加最长的那个问题必须装进 32k。一个 Choice 最多 255 个选项;一个 Score 是 2 到 10 个等级。早期访问的速率限制是每秒 250,000 token、每分钟 1,200 次请求,TypeSafe 提醒这些会变。
工作原理 →

把 Jev 指向你自己的文本

本页每个示例都来自真实的 API 调用。粘贴你自己的文本,看九个带类型的答案从一次请求中返回。

打开试验场