Jev mot en språkmodell

De konkurrerer ikke om den samme jobben. En språkmodell skriver; Jev bestemmer. Den nyttige sammenligningen er ikke hvilken som er smartest, men hva koden din må gjøre med svaret — og den forskjellen er stor nok til å endre hvordan programmet rundt skrives.

Den samme beslutningen, skrevet på begge måter

Rut en supportsak til én av fire køer. Her er hva hver side faktisk koster deg i kode.

Med en språkmodell

const res = await llm.chat({
  messages: [{ role: "user", content:
    `Route this ticket. Reply with JSON: {"queue": "Billing"|"Technical"|"Account"|"Sales"}
     Ticket: ${ticket}` }],
  response_format: { type: "json_object" }
});

let queue;
try {
  queue = JSON.parse(res.content).queue;        // may not be JSON
} catch {
  return retry();                               // ...so there is a retry
}
if (!QUEUES.includes(queue)) return retry();    // may be a queue you never had
// and no idea how close the call was

Med Jev

const { answers } = await jev.systemOne({
  state: ticket,
  model: "jev-latest",
  questions: { queue: { type: "choice", instructions:
    "Which team should own this ticket?", criteria: QUEUES } }
});

const { choice, probabilities, confidence } = answers.queue;
// choice is one of QUEUES. It cannot be anything else.
if (confidence < 0.7) return humanReview(ticket, probabilities);
route(choice);

Gjentakelsesløkken er det avslørende. Den finnes i den første versjonen fordi svaret kommer som tekst som kanskje ikke lar seg tolke, eller tolkes til en kø som aldri sto på listen. I den andre har den ingen steder å bo: svaret er per konstruksjon ett av QUEUES. Det som erstatter den, er en helt annen gren — en som slår ut når modellen er usikker, heller enn når utdataene er ødelagte.

Hva den andre versjonen kan se

Den saken, kjørt gjennom Jev på ekte. Vinneren er lite overraskende; nummer to er den delen en naken etikett ville kastet bort.

“SSO-innloggingen vår har gitt 500 siden 4.2-utgivelsen i morges. Ingen på laget kommer inn. Det samme i Chrome og Safari, to ulike leietakere.”
Teknisk på 87 %, av 4 alternativer
87 % Teknisk

Teknisk vinner med 87 %, men Konto holder 13 % — og det er den riktige uenigheten å ha, for en SSO-feil ligger faktisk på grensen mellom de to. En naken etikett ville skjult det. Hvis rutingen din har en kostnad ved å bomme, er 13 % tallet du setter terskel på.

Side om side

Hva du sender
Jev

Én tilstand pluss et kart over typede spørsmål.

Språkmodell

En ledetekst, som regel med skjemaet og reglene som prosa.

Hva som kommer tilbake
Jev

Ett typet svar per spørsmål, med en sannsynlighet for hvert alternativ.

Språkmodell

Tekst. JSON om du spurte pent og modusen støttes.

Den neste kodelinjen din
Jev

En forgrening på en verdi som bare kan være en av dine.

Språkmodell

En tolkning, så en validering, så en gren for når en av dem feilet.

Hvordan den svikter
Jev

Den kan ta feil om teksten din. Den kan ikke returnere en form du ikke definerte.

Språkmodell

Den kan også ta feil om formen — et manglende felt, en etikett du aldri listet, prosa viklet rundt JSON-en.

Å spørre om ti ting
Jev

Ti spørsmål i én forespørsel, vurdert mot tilstanden parallelt.

Språkmodell

Én overfylt ledetekst, eller ti kall.

Usikkerhet
Jev

En fordeling og en tillitsverdi på hver Choice og Score.

Språkmodell

Hva teksten enn påstår om sin egen sikkerhet.

Tallene

TypeSafe publiserer dem; det er leverandørens egne tall, ikke våre målinger.

70–500 ms

svartid fra ende til ende, mot 3–329 s for frontmodeller

40–200×

raskere på spørringer av System One-form

0,042 $

per million inn-tokens, utdata gratis

Hva vi kan måle: over 14 kjøringer gjort via denne siden er mediantiden tur-retur 329 ms — og de fleste av disse forespørslene bar ni spørsmål, ikke ett.

Når språkmodellen er riktig verktøy

Mesteparten av tiden, hvis det du trenger er språk. Jev har ingen mening den kan forklare og ingenting å si.

  • Du trenger prosa — et svar, et sammendrag, en commit-melding, en forklaring av beslutningen heller enn beslutningen.
  • Du trenger kode skrevet, eller en plan, eller noe åpent der svarmengden ikke er kjent før kallet.
  • Mengden mulige svar er virkelig ubegrenset. Å hente ut et vilkårlig navn er ikke en Choice over 255 alternativer.
  • Du trenger en resonnementskjede du kan inspisere. Jev returnerer en dom, ikke trinnene bak den.
  • Volumet er lavt og formen løs. En gjentakelsesløkke du kjører to ganger om dagen er ikke verdt å konstruere bort.

De to utfyller hverandre bedre enn de konkurrerer. TypeSafes egen ramme er System One for den raske strukturerte dømmekraften og en vanlig modell som System Two bak — sil inndataene med en Noul, rut med en Choice, og lever det som overlever til modellen som faktisk kan skrive.

Les videre

Kjør sammenligningen selv

Lim inn en sak, et utkast, en ledetekst — hva som helst du ellers ville skrevet en tolkeløkke rundt — og se ni typede svar komme tilbake fra én forespørsel.

Åpne lekeplassen