Jev mod en sprogmodel
De konkurrerer ikke om det samme job. En sprogmodel skriver; Jev beslutter. Den nyttige sammenligning er ikke, hvilken der er klogest, men hvad din kode skal stille op med svaret — og den forskel er stor nok til at ændre, hvordan programmet omkring skrives.
Den samme beslutning, skrevet på begge måder
Dirigér en supportsag til én af fire køer. Her er, hvad hver side faktisk koster dig i kode.
Med en sprogmodel
const res = await llm.chat({
messages: [{ role: "user", content:
`Route this ticket. Reply with JSON: {"queue": "Billing"|"Technical"|"Account"|"Sales"}
Ticket: ${ticket}` }],
response_format: { type: "json_object" }
});
let queue;
try {
queue = JSON.parse(res.content).queue; // may not be JSON
} catch {
return retry(); // ...so there is a retry
}
if (!QUEUES.includes(queue)) return retry(); // may be a queue you never had
// and no idea how close the call wasMed Jev
const { answers } = await jev.systemOne({
state: ticket,
model: "jev-latest",
questions: { queue: { type: "choice", instructions:
"Which team should own this ticket?", criteria: QUEUES } }
});
const { choice, probabilities, confidence } = answers.queue;
// choice is one of QUEUES. It cannot be anything else.
if (confidence < 0.7) return humanReview(ticket, probabilities);
route(choice);Gentagelsesløkken er det afslørende. Den findes i den første udgave, fordi svaret ankommer som tekst, der måske ikke kan tolkes, eller kan tolkes til en kø, der aldrig stod på listen. I den anden har den ingen steder at bo: svaret er per konstruktion ét af QUEUES. Det, der erstatter den, er en helt anden gren — en, der udløses, når modellen er usikker, frem for når outputtet er ødelagt.
Hvad den anden udgave kan se
Den sag, kørt gennem Jev for alvor. Vinderen er ikke overraskende; nummer to er den del, en bar etiket ville have smidt væk.
Teknik vinder med 87 %, men Konto holder 13 % — og det er den rigtige uenighed at have, for en SSO-fejl ligger faktisk på grænsen mellem de to. En bar etiket ville have skjult det. Hvis din dirigering har en pris for at ramme forkert, er 13 % det tal, du sætter tærskel på.
Side om side
- Hvad du sender
- Jev
Én tilstand plus et kort over typede spørgsmål.
SprogmodelEn prompt, som regel med skemaet og reglerne som prosa.
- Hvad der kommer tilbage
- Jev
Ét typet svar pr. spørgsmål, med en sandsynlighed for hver mulighed.
SprogmodelTekst. JSON, hvis du spurgte pænt, og tilstanden understøttes.
- Din næste kodelinje
- Jev
En forgrening på en værdi, der kun kan være en af dine.
SprogmodelEn tolkning, så en validering, så en gren til, når en af dem fejlede.
- Hvordan den fejler
- Jev
Den kan tage fejl om din tekst. Den kan ikke returnere en form, du ikke definerede.
SprogmodelDen kan også tage fejl om formen — et manglende felt, en etiket du aldrig nævnte, prosa viklet om JSON’en.
- At spørge om ti ting
- Jev
Ti spørgsmål i én forespørgsel, vurderet mod tilstanden parallelt.
SprogmodelÉn overfyldt prompt, eller ti kald.
- Usikkerhed
- Jev
En fordeling og en tillidsværdi på hver Choice og Score.
SprogmodelHvad teksten end påstår om sin egen sikkerhed.
Tallene
TypeSafe udgiver dem; det er leverandørens egne tal, ikke vores målinger.
svartid fra ende til ende, mod 3–329 s for frontmodeller
hurtigere på forespørgsler af System One-form
pr. million inputtokens, output gratis
Hvad vi kan måle: over 14 kørsler foretaget via dette site er mediantiden tur-retur 329 ms — og de fleste af de forespørgsler bar ni spørgsmål, ikke ét.
Hvornår sprogmodellen er det rigtige værktøj
Det meste af tiden, hvis det, du har brug for, er sprog. Jev har ingen holdning, den kan forklare, og intet at sige.
- Du har brug for prosa — et svar, et resumé, en commit-besked, en forklaring af beslutningen frem for beslutningen.
- Du har brug for kode skrevet, eller en plan, eller noget åbent, hvor svarmængden ikke er kendt før kaldet.
- Mængden af mulige svar er reelt ubegrænset. At udtrække et vilkårligt navn er ikke en Choice over 255 muligheder.
- Du har brug for en tankekæde, du kan inspicere. Jev returnerer en dom, ikke trinnene bag den.
- Mængden er lille, og formen er løs. En gentagelsesløkke, du kører to gange om dagen, er ikke værd at designe væk.
De to spiller bedre sammen, end de konkurrerer. TypeSafes egen ramme er System One til den hurtige strukturerede dømmekraft og en almindelig model som System Two bagved — sigt inputtet med en Noul, dirigér med en Choice, og aflevér det, der overlever, til den model, der faktisk kan skrive.
Læs videre
Kør sammenligningen selv
Indsæt en sag, et udkast, en prompt — hvad som helst du ellers ville have skrevet en tolkningsløkke omkring — og se ni typede svar komme tilbage fra én forespørgsel.
Åbn legepladsen