Score — avaliar contra uma rubrica no Jev
Um Score é um dos três tipos de pergunta do modelo Jev, da TypeSafe. Ele avalia a entrada contra níveis ordenados que você escreve e devolve um valor ponderado por probabilidade que pode cair entre dois níveis.
Um Score é uma rubrica. Você escreve os níveis em ordem, do menor para o maior, em palavras — e a resposta é uma posição nessa escala, numerada a partir de 0. Como é uma média ponderada por probabilidade dos níveis, ela pode cair, e muitas vezes cai, entre dois deles.
Descreva os níveis em vez de numerá-los. A própria documentação da TypeSafe mostra a mesma entrada pontuando de forma limpa contra três níveis descritos e dividindo a probabilidade quando recebe apenas números — sem nada com que comparar, o modelo não tem de onde raciocinar.
Uma resposta real
Enviada para jev-1.13.0. Os números abaixo são o que voltou.
A exportação CSV corta silenciosamente em 1000 linhas desde a 4.2.0. Nenhum erro exibido. Voltar de versão resolve. Reproduzido em duas contas. Isso quebra nosso fechamento mensal.
Quão grave é este problema?
- 0 Cosmético 0%
- 1 Menor, tem contorno 0%
- 2 Grave, um fluxo de trabalho está quebrado 77%
- 3 Crítico, a funcionalidade principal não dá para usar 10%
- 4 Catastrófico, perda de dados ou brecha de segurança 13%
2,35 fica logo depois de “um fluxo de trabalho está quebrado” — mas leia a distribuição, não o número. 77% está no nível 2 e, ainda assim, 13% vai lá para o nível 4, porque truncamento silencioso pode mesmo ser perda de dados. Uma média de 2,35 e um pico estreito em 2,35 são respostas diferentes, e só `probabilities` separa as duas.
A requisição e a resposta, na íntegra
{
"state": "CSV export silently truncates at 1000 rows since 4.2.0. No error shown. Downgrading fixes it. Reproduced on two accounts. This breaks our month-end close.",
"model": "jev-latest",
"questions": {
"severity": {
"type": "score",
"instructions": "How severe is this issue?",
"criteria": [
"Cosmetic",
"Minor, has a workaround",
"Major, a workflow is broken",
"Critical, core functionality is unusable",
"Catastrophic, data loss or a security hole"
]
}
}
}{
"model": "jev-1.13.0",
"answers": {
"severity": {
"type": "score",
"score": 2.35,
"confidence": 0.7,
"legend": {
"0": "Cosmetic",
"1": "Minor, has a workaround",
"2": "Major, a workflow is broken",
"3": "Critical, core functionality is unusable",
"4": "Catastrophic, data loss or a security hole"
},
"probabilities": {
"0": 0,
"1": 0,
"2": 0.77,
"3": 0.1,
"4": 0.13
}
}
}
}O que a resposta contém
- type "score"
- Corresponde ao tipo da pergunta.
- score number
- A média ponderada por probabilidade dos números de nível. Com cinco níveis vai de 0 a 4, e pode cair entre níveis.
- legend map<string, string>
- Cada número de nível mapeado de volta para a descrição que você escreveu.
- probabilities map<string, number>
- Cada nível com sua probabilidade. Elas somam 1.
- confidence number
- De 0 a 1. Um pico único num nível é alta; probabilidade espalhada entre níveis é baixa.
Regras e limites
-
criteriaé uma lista ordenada de descrições de nível, do menor para o maior. Precisa de pelo menos dois níveis e aceita até dez. - O número de um nível é sua posição na lista, começando em 0.
- Distribuições diferentes produzem a mesma nota: 1,0 pode significar que toda a probabilidade está no nível 1, ou que ela se divide igualmente entre os níveis 0 e 2. Leia
probabilitieseconfidencejunto.
Use um Score quando
- As respostas são degraus de uma mesma escada — gravidade, urgência, frustração, qualidade, risco.
- Cair entre dois níveis é informativo e não um problema.
- Você quer combinar várias avaliações com pesos que controla, em vez de fazer uma pergunta vaga sobre qualidade geral.
Use outra coisa quando
- As opções não são ordenadas. Um Choice é a forma honesta para categorias sem ordem.
- Você não consegue descrever os níveis de forma distinta. Use quantos conseguir descrever e nada além — níveis sem descrição não dão ao modelo nada com que comparar.
Os outros dois
Noul
Um Noul é um dos três tipos de pergunta do modelo Jev, da TypeSafe. Ele faz uma única pergunta de sim/não e responde com a probabilidade de a resposta ser sim, como um número de 0 a 1.
Choice
Um Choice é um dos três tipos de pergunta do modelo Jev, da TypeSafe. Ele escolhe exatamente uma opção de um conjunto que você define e devolve a vencedora, uma probabilidade para cada opção e um valor de confiança.
Faça um Score sobre o seu próprio texto
O playground manda para o Jev o que você colar e desenha cada resposta. Sem conta, sem chave.
Abrir o playground