Score — 在 Jev 裡依量表評分

Score 是 TypeSafe 的 Jev 模型三種提問型別之一。它依你寫下的有序等級為輸入評分,回傳一個可以落在兩級之間的機率加權值。

Score 是一把量表。你依序、從低到高、用文字寫下等級——答案就是這條刻度上的一個位置,從 0 開始編號。因為它是各等級的機率加權平均,所以它可以、而且經常會落在兩級之間。

把等級描述出來,別只給它們編號。TypeSafe 自己的文件展示了同一段輸入:對著三個有描述的等級,評分乾淨俐落;換成光禿禿的數字,機率就散開了——沒有可對照的東西,模型也就無從推理。

一個真實的答案

送給 jev-1.13.0。下面的數字就是回來的東西。

state

自 4.2.0 起,CSV 匯出會在 1000 列處靜默截斷。沒有錯誤訊息。降版可修復。兩個帳號都重現了。這會拖垮我們的月結。

問題

這個問題有多嚴重?

70%
2.35 滿分 4 · 嚴重,一條工作流斷了

2.35 剛過「一條工作流斷了」——但要讀分布,不要只讀數字。77% 落在等級 2 上,卻仍有 13% 一路跑到了等級 4,因為靜默截斷確實可能是資料遺失。平均 2.35 和在 2.35 處的一個尖峰是不同的答案,而只有 `probabilities` 分得出來。

請求與回應原文
請求
{
  "state": "CSV export silently truncates at 1000 rows since 4.2.0. No error shown. Downgrading fixes it. Reproduced on two accounts. This breaks our month-end close.",
  "model": "jev-latest",
  "questions": {
    "severity": {
      "type": "score",
      "instructions": "How severe is this issue?",
      "criteria": [
        "Cosmetic",
        "Minor, has a workaround",
        "Major, a workflow is broken",
        "Critical, core functionality is unusable",
        "Catastrophic, data loss or a security hole"
      ]
    }
  }
}
回應
{
  "model": "jev-1.13.0",
  "answers": {
    "severity": {
      "type": "score",
      "score": 2.35,
      "confidence": 0.7,
      "legend": {
        "0": "Cosmetic",
        "1": "Minor, has a workaround",
        "2": "Major, a workflow is broken",
        "3": "Critical, core functionality is unusable",
        "4": "Catastrophic, data loss or a security hole"
      },
      "probabilities": {
        "0": 0,
        "1": 0,
        "2": 0.77,
        "3": 0.1,
        "4": 0.13
      }
    }
  }
}

答案裡有什麼

type "score"
與提問型別對應。
score number
各等級編號的機率加權平均。五個等級時取值 0 到 4,並且可以落在兩級之間。
legend map<string, string>
每個等級編號對應回你寫下的那段描述。
probabilities map<string, number>
每個等級及其機率。它們之和為 1。
confidence number
0 到 1。機率集中在某一級上就是高;散落在多級之間就是低。

規則與限制

  • criteria 是一個有序的等級描述陣列,低端在前。它需要至少兩級,最多十級
  • 一個等級的編號就是它在陣列中的位置,從 0 開始。
  • 不同的分布會得到相同的分數:1.0 可能表示機率全壓在等級 1 上,也可能表示它在等級 0 與 2 之間平分。要連同 probabilitiesconfidence 一起讀。

什麼時候該用 Score

  • 答案是同一把梯子上的橫檔——嚴重程度、急迫程度、沮喪程度、品質、風險。
  • 落在兩級之間是有資訊量的,而不是個麻煩。
  • 你想用自己掌握的權重把好幾項評分合起來,而不是就「整體品質」問一個含糊的問題。

什麼時候該換別的

  • 這些選項沒有順序。對無序的類別來說,Choice 才是誠實的形狀。
  • 你沒辦法把各級描述清楚。能描述幾級就用幾級,不要多——沒有描述的等級給不了模型任何可對照的東西。

另外兩個

對你自己的文字問一個 Score

試驗場會把你貼上的一切送給 Jev,並把每個答案畫出來。不用帳號,不用金鑰。

打開試驗場