Score — avaliar contra uma rubrica no Jev

Um Score é um dos três tipos de pergunta do modelo Jev, da TypeSafe. Ele avalia a entrada contra níveis ordenados que você escreve e devolve um valor ponderado por probabilidade que pode cair entre dois níveis.

Um Score é uma rubrica. Você escreve os níveis em ordem, do menor para o maior, em palavras — e a resposta é uma posição nessa escala, numerada a partir de 0. Como é uma média ponderada por probabilidade dos níveis, ela pode cair, e muitas vezes cai, entre dois deles.

Descreva os níveis em vez de numerá-los. A própria documentação da TypeSafe mostra a mesma entrada pontuando de forma limpa contra três níveis descritos e dividindo a probabilidade quando recebe apenas números — sem nada com que comparar, o modelo não tem de onde raciocinar.

Uma resposta real

Enviada para jev-1.13.0. Os números abaixo são o que voltou.

O state

A exportação CSV corta silenciosamente em 1000 linhas desde a 4.2.0. Nenhum erro exibido. Voltar de versão resolve. Reproduzido em duas contas. Isso quebra nosso fechamento mensal.

A pergunta

Quão grave é este problema?

70%
média
2.35 de 4 · Grave, um fluxo de trabalho está quebrado

2,35 fica logo depois de “um fluxo de trabalho está quebrado” — mas leia a distribuição, não o número. 77% está no nível 2 e, ainda assim, 13% vai lá para o nível 4, porque truncamento silencioso pode mesmo ser perda de dados. Uma média de 2,35 e um pico estreito em 2,35 são respostas diferentes, e só `probabilities` separa as duas.

A requisição e a resposta, na íntegra
Requisição
{
  "state": "CSV export silently truncates at 1000 rows since 4.2.0. No error shown. Downgrading fixes it. Reproduced on two accounts. This breaks our month-end close.",
  "model": "jev-latest",
  "questions": {
    "severity": {
      "type": "score",
      "instructions": "How severe is this issue?",
      "criteria": [
        "Cosmetic",
        "Minor, has a workaround",
        "Major, a workflow is broken",
        "Critical, core functionality is unusable",
        "Catastrophic, data loss or a security hole"
      ]
    }
  }
}
Resposta
{
  "model": "jev-1.13.0",
  "answers": {
    "severity": {
      "type": "score",
      "score": 2.35,
      "confidence": 0.7,
      "legend": {
        "0": "Cosmetic",
        "1": "Minor, has a workaround",
        "2": "Major, a workflow is broken",
        "3": "Critical, core functionality is unusable",
        "4": "Catastrophic, data loss or a security hole"
      },
      "probabilities": {
        "0": 0,
        "1": 0,
        "2": 0.77,
        "3": 0.1,
        "4": 0.13
      }
    }
  }
}

O que a resposta contém

type "score"
Corresponde ao tipo da pergunta.
score number
A média ponderada por probabilidade dos números de nível. Com cinco níveis vai de 0 a 4, e pode cair entre níveis.
legend map<string, string>
Cada número de nível mapeado de volta para a descrição que você escreveu.
probabilities map<string, number>
Cada nível com sua probabilidade. Elas somam 1.
confidence number
De 0 a 1. Um pico único num nível é alta; probabilidade espalhada entre níveis é baixa.

Regras e limites

  • criteria é uma lista ordenada de descrições de nível, do menor para o maior. Precisa de pelo menos dois níveis e aceita até dez.
  • O número de um nível é sua posição na lista, começando em 0.
  • Distribuições diferentes produzem a mesma nota: 1,0 pode significar que toda a probabilidade está no nível 1, ou que ela se divide igualmente entre os níveis 0 e 2. Leia probabilities e confidence junto.

Use um Score quando

  • As respostas são degraus de uma mesma escada — gravidade, urgência, frustração, qualidade, risco.
  • Cair entre dois níveis é informativo e não um problema.
  • Você quer combinar várias avaliações com pesos que controla, em vez de fazer uma pergunta vaga sobre qualidade geral.

Use outra coisa quando

  • As opções não são ordenadas. Um Choice é a forma honesta para categorias sem ordem.
  • Você não consegue descrever os níveis de forma distinta. Use quantos conseguir descrever e nada além — níveis sem descrição não dão ao modelo nada com que comparar.

Os outros dois

Faça um Score sobre o seu próprio texto

O playground manda para o Jev o que você colar e desenha cada resposta. Sem conta, sem chave.

Abrir o playground