Score — Jev에서 루브릭에 대해 평가하기
Score는 TypeSafe Jev 모델의 세 가지 질문 유형 중 하나입니다. 여러분이 쓴 순서 있는 등급에 대해 입력을 평가하고, 두 등급 사이에도 떨어질 수 있는 확률 가중값을 돌려줍니다.
Score는 루브릭입니다. 등급을 낮은 것부터 순서대로 말로 씁니다 — 그리고 답은 그 척도 위의 위치이며 0부터 번호가 붙습니다. 등급들의 확률 가중 평균이기 때문에 두 등급 사이에 떨어질 수 있고 실제로 자주 그렇습니다.
등급에는 번호를 매기기보다 설명을 붙이세요. TypeSafe의 문서 자체가, 같은 입력이 설명 있는 세 등급에 대해서는 깔끔하게 채점되고 맨 숫자만 주면 확률이 갈라진다는 것을 보여 줍니다. 대조할 것이 없으면 모델도 추론할 근거가 없습니다.
실제 답
jev-1.13.0에 보냈습니다. 아래 숫자가 돌아온 그대로입니다.
4.2.0부터 CSV 내보내기가 1000행에서 조용히 잘립니다. 오류 표시는 없습니다. 버전을 낮추면 해결됩니다. 두 계정에서 재현했습니다. 이러면 월말 마감이 안 됩니다.
질문
이 문제는 얼마나 심각한가요?
70%
중간
2.35 4 중 · 중대함, 워크플로 하나가 끊김
2.35
- 0 외형 문제 0%
- 1 경미함, 우회 방법 있음 0%
- 2 중대함, 워크플로 하나가 끊김 77%
- 3 치명적, 핵심 기능을 쓸 수 없음 10%
- 4 재앙적, 데이터 손실 또는 보안 구멍 13%
2.35는 "워크플로 하나가 끊김"을 막 넘어선 자리입니다 — 하지만 숫자가 아니라 분포를 읽으세요. 77%는 등급 2에 있지만 13%는 저 멀리 등급 4까지 올라가 있습니다. 조용한 잘림은 정말로 데이터 손실일 수 있으니까요. 평균 2.35와 2.35에 뾰족한 봉우리가 선 경우는 다른 답이고, 그 둘을 갈라 주는 것은 `probabilities`뿐입니다.
요청과 응답 원문
요청
{
"state": "CSV export silently truncates at 1000 rows since 4.2.0. No error shown. Downgrading fixes it. Reproduced on two accounts. This breaks our month-end close.",
"model": "jev-latest",
"questions": {
"severity": {
"type": "score",
"instructions": "How severe is this issue?",
"criteria": [
"Cosmetic",
"Minor, has a workaround",
"Major, a workflow is broken",
"Critical, core functionality is unusable",
"Catastrophic, data loss or a security hole"
]
}
}
}응답
{
"model": "jev-1.13.0",
"answers": {
"severity": {
"type": "score",
"score": 2.35,
"confidence": 0.7,
"legend": {
"0": "Cosmetic",
"1": "Minor, has a workaround",
"2": "Major, a workflow is broken",
"3": "Critical, core functionality is unusable",
"4": "Catastrophic, data loss or a security hole"
},
"probabilities": {
"0": 0,
"1": 0,
"2": 0.77,
"3": 0.1,
"4": 0.13
}
}
}
}답에 담긴 것
- type "score"
- 질문 유형과 일치합니다.
- score number
- 등급 번호의 확률 가중 평균. 다섯 등급이면 0에서 4까지이며 등급 사이에도 떨어질 수 있습니다.
- legend map<string, string>
- 각 등급 번호를 여러분이 쓴 설명으로 되돌려 대응시킨 것.
- probabilities map<string, number>
- 각 등급과 그 확률. 합은 1입니다.
- confidence number
- 0에서 1. 한 등급에 봉우리가 하나면 높고, 여러 등급에 확률이 퍼지면 낮습니다.
규칙과 한계
-
criteria는 낮은 쪽부터 놓인 등급 설명의 순서 있는 배열입니다. 최소 두 등급, 최대 열 등급이 필요합니다. - 등급의 번호는 배열에서의 위치이며 0부터 시작합니다.
- 서로 다른 분포가 같은 점수를 냅니다. 1.0은 확률이 전부 등급 1에 있다는 뜻일 수도, 등급 0과 2에 반씩 갈렸다는 뜻일 수도 있습니다.
probabilities와confidence를 함께 읽으세요.
Score을(를) 꺼낼 때
- 답이 하나의 사다리의 단일 때 — 심각도, 긴급도, 답답함, 품질, 위험.
- 두 등급 사이에 떨어지는 것이 문제가 아니라 정보가 될 때.
- 전체 품질에 대해 모호한 질문 하나를 던지는 대신, 여러 평가를 직접 정한 가중치로 합치고 싶을 때.
다른 것을 써야 할 때
- 선택지에 순서가 없을 때. 순서 없는 카테고리에는 Choice가 정직한 모양입니다.
- 등급을 뚜렷이 구분해 설명할 수 없을 때. 설명할 수 있는 만큼만 쓰고 그 이상은 쓰지 마세요 — 설명 없는 등급은 모델에 대조할 것을 주지 못합니다.