工作原理

Dejev 是围绕一次 API 调用的一层薄薄的可视化包装。结果页上的一切都来自一次 POST /v1/systemone

整个请求

state 由你提供——就是你粘贴的东西。问题由镜头提供。Jev 为每个问题返回一个类型化答案,用同样的 id 作键。

{
  "state": "Help! My payouts have been failing for 3 days.",
  "model": "jev-latest",
  "questions": {
    "is_urgent":  { "type": "noul",   "instructions": "Does this convey urgency?" },
    "department": { "type": "choice", "instructions": "Which team should handle this?",
                    "criteria": { "billing": "Payments, invoicing, refunds",
                                  "technical": "Bugs, outages, integrations",
                                  "sales": "Pricing, upgrades, new accounts" } },
    "frustration":{ "type": "score",  "instructions": "How frustrated is the customer?",
                    "criteria": ["Calm", "Frustrated", "Very angry"] }
  }
}

图形如何对应答案

Choice → 环形图
概率之和为一,所以环在这里是诚实的:它确实是部分与整体的关系。图例把每个选项连同精确数值再列一遍,因为环形图不擅长表现势均力敌,而数字擅长。
Score → 量表条
条带是你按顺序写的等级;指针落在概率加权值上,所以它通常停在两级之间。下方的条形显示概率质量如何分布——来自一个尖峰的 2.0 和来自两个相距很远的峰的 2.0,是截然不同的答案。
Noul → 刻度条
一个比值对着一个上限,所以它配的是刻度条而不是图表。中间那条灰带标出模型实际上在说「我不知道」的区间——0.51 绝不该被读成「是」。

镜头

每个镜头只是一组固定的问题,用来展示 Jev 能力的不同侧面。你也可以自己写。

  • 消息透视

    这条消息到底在要求你做什么?

    9 个问题

  • 工单分诊

    在人打开工单之前就把它路由好。

    9 个问题

  • 护栏

    在提示词抵达你的模型之前先筛一道。

    9 个问题

  • 初稿评审

    发出去之前,对这份初稿的九项解读。

    9 个问题

  • 评论解码

    一条用户评论真正在告诉你什么。

    9 个问题

  • 缺陷分诊

    严重程度、所属模块,以及有没有人能复现。

    9 个问题

  • 标题镜头

    一则新闻是被怎么框起来的。

    9 个问题

  • 推介体检

    投资人或客户会不会接着读下去?

    9 个问题

常见问题

什么是「系统一模型」?
一个为判断而不是为散文而造的模型。Jev 接收一个 state 加一组类型化问题,为每个问题返回一个类型化答案——没有流式 token,没有需要解析的东西,也没有办法吐出你定义范围之外的值。TypeSafe 的说法是:系统一负责快速的结构化判断,而当你真的需要语言时,普通大语言模型作为系统二。
为什么一切都在一次请求里跑完?
Jev 只摄入一次 state,然后并行地对每个问题作答。十个问题放在一次调用里,输入 token 大约只花一次调用的量而不是十次,耗时也和一次差不多。这就是为什么这里的每个镜头一次问九件事,而不是把提示词串起来。
置信度是什么意思?
Choice 和 Score 的答案带一个由概率分布推出的置信度:分布集中意味着确定,分散意味着模型分不开这些选项。它是第二个维度——答案告诉你「是什么」,置信度告诉你「要不要动手」。Noul 答案没有置信度字段,因为概率本身已经承载了它:0.51 就是模型在说它不知道。
Jev 会产生幻觉吗?
在输出的形状上不会。Choice 只可能返回你定义过的选项;Score 只能落在你的量表之内;Noul 是 0 到 1 之间的一个数。它仍然可能读错你的文本——而置信度正是为此存在的。
为什么叫 Jev?
取自经济学家威廉·斯坦利·杰文斯。TypeSafe 的发布文章说,他们预期机器智能会走上蒸汽机变高效之后煤炭走过的那条路——也就是杰文斯悖论:让一样东西用起来更便宜,会让它被用得更多,而不是更少。
我能在本地跑 Jev 吗?它开源吗?
不能。Jev 是通过 TypeSafe 的 HTTP API 访问的专有托管模型;没有公开可下载的权重,而且所有账号用的是同一套权重——它不会按客户做微调或 LoRA 适配。你是通过请求来塑造它的答案:你放进 state 的内容,以及你怎么写每个问题的 instructions 和 criteria。
Jev 有多快?
TypeSafe 给出的数字是端到端 70–500 毫秒,而前沿模型是 3–329 秒,在它擅长的那类查询上快 40–200 倍。这些是厂商自己的数据。本站能从自己的日志里说的是:一次九问请求通常在几百毫秒内返回——每个结果页都会显示那一次调用实测的往返时间。
Jev 多少钱?
jev-1.13.0 每百万输入 token $0.042,输出免费——没有自回归解码可计量。因为 state 只读一次、所有问题并行评估,问十件事的花费和问一件差不多。本站每个结果页都会打印那次调用确切的 token 数和费用。
Jev 是怎么训练的?
用 TypeSafe 称为 RLCD 的方法——面向校准判断的强化学习。它宣称的目标和 RLHF 或 RLVR 不同:不是人更喜欢的答案,也不是能通过检查器的答案,而是概率在认知上诚实的答案。这正是置信度值得拿来设阈值、而不只是装饰的原因。
有哪些限制?
只接受文本——不支持图像、音频或视频。每次请求 64k token,其中 state 加最长的那个问题必须装进 32k。一个 Choice 最多 255 个选项;一个 Score 是 2 到 10 个等级。早期访问的速率限制是每秒 250,000 token、每分钟 1,200 次请求,TypeSafe 提醒这些会变。
我粘贴的东西会怎样?
它会被发送给 TypeSafe 进行评估,并存进本站数据库,好让结果有一个永久链接。公开的运行会出现在「浏览」和搜索引擎里。不公开列出的运行同样会被存储,但不进入「浏览」和站点地图,并带 noindex 头返回——链接对你给出的人依然有效。无论哪种,都别粘贴敏感内容:这是一个公开演示。
这个站点会说哪些语言?
界面、镜头库和每一页说明都以 32 种语言发布,可以从页首切换,也会跟随浏览器的语言设置。你粘贴的内容一字不改,Jev 用它本来的语言读它——每个镜头背后的问题在所有语言下都以英文发送,所以无论用哪种语言运行,一次运行的含义都一样。
这是 TypeSafe 运营的吗?
不是。Dejev 是一个独立演示,用来展示把 Jev 的输出画出来是什么样子。模型、API 和文档都属于 TypeSafe。

深入了解

模型、定价、粗糙的边角,还有一长架 cookbook,都在 TypeSafe 自己的文档里。