Jev mot en språkmodell
De konkurrerer ikke om den samme jobben. En språkmodell skriver; Jev bestemmer. Den nyttige sammenligningen er ikke hvilken som er smartest, men hva koden din må gjøre med svaret — og den forskjellen er stor nok til å endre hvordan programmet rundt skrives.
Den samme beslutningen, skrevet på begge måter
Rut en supportsak til én av fire køer. Her er hva hver side faktisk koster deg i kode.
Med en språkmodell
const res = await llm.chat({
messages: [{ role: "user", content:
`Route this ticket. Reply with JSON: {"queue": "Billing"|"Technical"|"Account"|"Sales"}
Ticket: ${ticket}` }],
response_format: { type: "json_object" }
});
let queue;
try {
queue = JSON.parse(res.content).queue; // may not be JSON
} catch {
return retry(); // ...so there is a retry
}
if (!QUEUES.includes(queue)) return retry(); // may be a queue you never had
// and no idea how close the call wasMed Jev
const { answers } = await jev.systemOne({
state: ticket,
model: "jev-latest",
questions: { queue: { type: "choice", instructions:
"Which team should own this ticket?", criteria: QUEUES } }
});
const { choice, probabilities, confidence } = answers.queue;
// choice is one of QUEUES. It cannot be anything else.
if (confidence < 0.7) return humanReview(ticket, probabilities);
route(choice);Gjentakelsesløkken er det avslørende. Den finnes i den første versjonen fordi svaret kommer som tekst som kanskje ikke lar seg tolke, eller tolkes til en kø som aldri sto på listen. I den andre har den ingen steder å bo: svaret er per konstruksjon ett av QUEUES. Det som erstatter den, er en helt annen gren — en som slår ut når modellen er usikker, heller enn når utdataene er ødelagte.
Hva den andre versjonen kan se
Den saken, kjørt gjennom Jev på ekte. Vinneren er lite overraskende; nummer to er den delen en naken etikett ville kastet bort.
Teknisk vinner med 87 %, men Konto holder 13 % — og det er den riktige uenigheten å ha, for en SSO-feil ligger faktisk på grensen mellom de to. En naken etikett ville skjult det. Hvis rutingen din har en kostnad ved å bomme, er 13 % tallet du setter terskel på.
Side om side
- Hva du sender
- Jev
Én tilstand pluss et kart over typede spørsmål.
SpråkmodellEn ledetekst, som regel med skjemaet og reglene som prosa.
- Hva som kommer tilbake
- Jev
Ett typet svar per spørsmål, med en sannsynlighet for hvert alternativ.
SpråkmodellTekst. JSON om du spurte pent og modusen støttes.
- Den neste kodelinjen din
- Jev
En forgrening på en verdi som bare kan være en av dine.
SpråkmodellEn tolkning, så en validering, så en gren for når en av dem feilet.
- Hvordan den svikter
- Jev
Den kan ta feil om teksten din. Den kan ikke returnere en form du ikke definerte.
SpråkmodellDen kan også ta feil om formen — et manglende felt, en etikett du aldri listet, prosa viklet rundt JSON-en.
- Å spørre om ti ting
- Jev
Ti spørsmål i én forespørsel, vurdert mot tilstanden parallelt.
SpråkmodellÉn overfylt ledetekst, eller ti kall.
- Usikkerhet
- Jev
En fordeling og en tillitsverdi på hver Choice og Score.
SpråkmodellHva teksten enn påstår om sin egen sikkerhet.
Tallene
TypeSafe publiserer dem; det er leverandørens egne tall, ikke våre målinger.
svartid fra ende til ende, mot 3–329 s for frontmodeller
raskere på spørringer av System One-form
per million inn-tokens, utdata gratis
Hva vi kan måle: over 14 kjøringer gjort via denne siden er mediantiden tur-retur 329 ms — og de fleste av disse forespørslene bar ni spørsmål, ikke ett.
Når språkmodellen er riktig verktøy
Mesteparten av tiden, hvis det du trenger er språk. Jev har ingen mening den kan forklare og ingenting å si.
- Du trenger prosa — et svar, et sammendrag, en commit-melding, en forklaring av beslutningen heller enn beslutningen.
- Du trenger kode skrevet, eller en plan, eller noe åpent der svarmengden ikke er kjent før kallet.
- Mengden mulige svar er virkelig ubegrenset. Å hente ut et vilkårlig navn er ikke en Choice over 255 alternativer.
- Du trenger en resonnementskjede du kan inspisere. Jev returnerer en dom, ikke trinnene bak den.
- Volumet er lavt og formen løs. En gjentakelsesløkke du kjører to ganger om dagen er ikke verdt å konstruere bort.
De to utfyller hverandre bedre enn de konkurrerer. TypeSafes egen ramme er System One for den raske strukturerte dømmekraften og en vanlig modell som System Two bak — sil inndataene med en Noul, rut med en Choice, og lever det som overlever til modellen som faktisk kan skrive.
Les videre
Kjør sammenligningen selv
Lim inn en sak, et utkast, en ledetekst — hva som helst du ellers ville skrevet en tolkeløkke rundt — og se ni typede svar komme tilbake fra én forespørsel.
Åpne lekeplassen