Score — Jev에서 루브릭에 대해 평가하기

Score는 TypeSafe Jev 모델의 세 가지 질문 유형 중 하나입니다. 여러분이 쓴 순서 있는 등급에 대해 입력을 평가하고, 두 등급 사이에도 떨어질 수 있는 확률 가중값을 돌려줍니다.

Score는 루브릭입니다. 등급을 낮은 것부터 순서대로 말로 씁니다 — 그리고 답은 그 척도 위의 위치이며 0부터 번호가 붙습니다. 등급들의 확률 가중 평균이기 때문에 두 등급 사이에 떨어질 수 있고 실제로 자주 그렇습니다.

등급에는 번호를 매기기보다 설명을 붙이세요. TypeSafe의 문서 자체가, 같은 입력이 설명 있는 세 등급에 대해서는 깔끔하게 채점되고 맨 숫자만 주면 확률이 갈라진다는 것을 보여 줍니다. 대조할 것이 없으면 모델도 추론할 근거가 없습니다.

실제 답

jev-1.13.0에 보냈습니다. 아래 숫자가 돌아온 그대로입니다.

state

4.2.0부터 CSV 내보내기가 1000행에서 조용히 잘립니다. 오류 표시는 없습니다. 버전을 낮추면 해결됩니다. 두 계정에서 재현했습니다. 이러면 월말 마감이 안 됩니다.

질문

이 문제는 얼마나 심각한가요?

70%
중간
2.35 4 중 · 중대함, 워크플로 하나가 끊김

2.35는 "워크플로 하나가 끊김"을 막 넘어선 자리입니다 — 하지만 숫자가 아니라 분포를 읽으세요. 77%는 등급 2에 있지만 13%는 저 멀리 등급 4까지 올라가 있습니다. 조용한 잘림은 정말로 데이터 손실일 수 있으니까요. 평균 2.35와 2.35에 뾰족한 봉우리가 선 경우는 다른 답이고, 그 둘을 갈라 주는 것은 `probabilities`뿐입니다.

요청과 응답 원문
요청
{
  "state": "CSV export silently truncates at 1000 rows since 4.2.0. No error shown. Downgrading fixes it. Reproduced on two accounts. This breaks our month-end close.",
  "model": "jev-latest",
  "questions": {
    "severity": {
      "type": "score",
      "instructions": "How severe is this issue?",
      "criteria": [
        "Cosmetic",
        "Minor, has a workaround",
        "Major, a workflow is broken",
        "Critical, core functionality is unusable",
        "Catastrophic, data loss or a security hole"
      ]
    }
  }
}
응답
{
  "model": "jev-1.13.0",
  "answers": {
    "severity": {
      "type": "score",
      "score": 2.35,
      "confidence": 0.7,
      "legend": {
        "0": "Cosmetic",
        "1": "Minor, has a workaround",
        "2": "Major, a workflow is broken",
        "3": "Critical, core functionality is unusable",
        "4": "Catastrophic, data loss or a security hole"
      },
      "probabilities": {
        "0": 0,
        "1": 0,
        "2": 0.77,
        "3": 0.1,
        "4": 0.13
      }
    }
  }
}

답에 담긴 것

type "score"
질문 유형과 일치합니다.
score number
등급 번호의 확률 가중 평균. 다섯 등급이면 0에서 4까지이며 등급 사이에도 떨어질 수 있습니다.
legend map<string, string>
각 등급 번호를 여러분이 쓴 설명으로 되돌려 대응시킨 것.
probabilities map<string, number>
각 등급과 그 확률. 합은 1입니다.
confidence number
0에서 1. 한 등급에 봉우리가 하나면 높고, 여러 등급에 확률이 퍼지면 낮습니다.

규칙과 한계

  • criteria는 낮은 쪽부터 놓인 등급 설명의 순서 있는 배열입니다. 최소 두 등급, 최대 열 등급이 필요합니다.
  • 등급의 번호는 배열에서의 위치이며 0부터 시작합니다.
  • 서로 다른 분포가 같은 점수를 냅니다. 1.0은 확률이 전부 등급 1에 있다는 뜻일 수도, 등급 0과 2에 반씩 갈렸다는 뜻일 수도 있습니다. probabilitiesconfidence를 함께 읽으세요.

Score을(를) 꺼낼 때

  • 답이 하나의 사다리의 단일 때 — 심각도, 긴급도, 답답함, 품질, 위험.
  • 두 등급 사이에 떨어지는 것이 문제가 아니라 정보가 될 때.
  • 전체 품질에 대해 모호한 질문 하나를 던지는 대신, 여러 평가를 직접 정한 가중치로 합치고 싶을 때.

다른 것을 써야 할 때

  • 선택지에 순서가 없을 때. 순서 없는 카테고리에는 Choice가 정직한 모양입니다.
  • 등급을 뚜렷이 구분해 설명할 수 없을 때. 설명할 수 있는 만큼만 쓰고 그 이상은 쓰지 마세요 — 설명 없는 등급은 모델에 대조할 것을 주지 못합니다.

나머지 둘

여러분의 텍스트에 Score을(를) 물어보세요

실험실은 붙여 넣은 것을 Jev에 보내고 모든 답을 그립니다. 계정도, 키도 필요 없습니다.

실험실 열기