Score — 在 Jev 里按量表评分

Score 是 TypeSafe 的 Jev 模型三种提问类型之一。它按你写下的有序等级为输入评分,返回一个可以落在两级之间的概率加权值。

Score 是一把量表。你按顺序、从低到高、用文字写下等级——答案就是这条刻度上的一个位置,从 0 开始编号。因为它是各等级的概率加权均值,所以它可以、而且经常会落在两级之间。

把等级描述出来,别只给它们编号。TypeSafe 自己的文档展示了同一段输入:对着三个有描述的等级,评分干净利落;换成光秃秃的数字,概率就散开了——没有可对照的东西,模型也就无从推理。

一个真实的答案

发给 jev-1.13.0。下面的数字就是回来的东西。

state

自 4.2.0 起,CSV 导出会在 1000 行处静默截断。没有报错。降级可修复。两个账号都复现了。这会拖垮我们的月结。

问题

这个问题有多严重?

70%
2.35 满分 4 · 严重,一条工作流断了

2.35 刚过「一条工作流断了」——但要读分布,不要只读数字。77% 落在等级 2 上,却仍有 13% 一路跑到了等级 4,因为静默截断确实可能是数据丢失。均值 2.35 和在 2.35 处的一个尖峰是不同的答案,而只有 `probabilities` 分得出来。

请求与响应原文
请求
{
  "state": "CSV export silently truncates at 1000 rows since 4.2.0. No error shown. Downgrading fixes it. Reproduced on two accounts. This breaks our month-end close.",
  "model": "jev-latest",
  "questions": {
    "severity": {
      "type": "score",
      "instructions": "How severe is this issue?",
      "criteria": [
        "Cosmetic",
        "Minor, has a workaround",
        "Major, a workflow is broken",
        "Critical, core functionality is unusable",
        "Catastrophic, data loss or a security hole"
      ]
    }
  }
}
响应
{
  "model": "jev-1.13.0",
  "answers": {
    "severity": {
      "type": "score",
      "score": 2.35,
      "confidence": 0.7,
      "legend": {
        "0": "Cosmetic",
        "1": "Minor, has a workaround",
        "2": "Major, a workflow is broken",
        "3": "Critical, core functionality is unusable",
        "4": "Catastrophic, data loss or a security hole"
      },
      "probabilities": {
        "0": 0,
        "1": 0,
        "2": 0.77,
        "3": 0.1,
        "4": 0.13
      }
    }
  }
}

答案里有什么

type "score"
与提问类型对应。
score number
各等级编号的概率加权均值。五个等级时取值 0 到 4,并且可以落在两级之间。
legend map<string, string>
每个等级编号映射回你写下的那段描述。
probabilities map<string, number>
每个等级及其概率。它们之和为 1。
confidence number
0 到 1。概率集中在某一级上就是高;散落在多级之间就是低。

规则与限制

  • criteria 是一个有序的等级描述数组,低端在前。它需要至少两级,最多十级
  • 一个等级的编号就是它在数组中的位置,从 0 开始。
  • 不同的分布会得到相同的分数:1.0 可能表示概率全压在等级 1 上,也可能表示它在等级 0 和 2 之间平分。要连同 probabilitiesconfidence 一起读。

什么时候该用 Score

  • 答案是同一把梯子上的横档——严重程度、紧急程度、沮丧程度、质量、风险。
  • 落在两级之间是有信息量的,而不是个麻烦。
  • 你想用自己掌握的权重把好几项评分合起来,而不是就「整体质量」问一个含糊的问题。

什么时候该换别的

  • 这些选项没有顺序。对无序的类目来说,Choice 才是诚实的形状。
  • 你没法把各级描述清楚。能描述几级就用几级,不要多——没有描述的等级给不了模型任何可对照的东西。

另外两个

对你自己的文本问一个 Score

试验场会把你粘贴的一切发给 Jev,并把每个答案画出来。不用账号,不用密钥。

打开试验场