Jev mot en språkmodell
De konkurrerar inte om samma jobb. En språkmodell skriver; Jev bestämmer. Den användbara jämförelsen är inte vilken som är smartast utan vad din kod måste göra med svaret — och den skillnaden är stor nog att ändra hur programmet runt omkring skrivs.
Samma beslut, skrivet på båda sätten
Dirigera ett supportärende till en av fyra köer. Så här mycket kostar var sida dig i kod.
Med en språkmodell
const res = await llm.chat({
messages: [{ role: "user", content:
`Route this ticket. Reply with JSON: {"queue": "Billing"|"Technical"|"Account"|"Sales"}
Ticket: ${ticket}` }],
response_format: { type: "json_object" }
});
let queue;
try {
queue = JSON.parse(res.content).queue; // may not be JSON
} catch {
return retry(); // ...so there is a retry
}
if (!QUEUES.includes(queue)) return retry(); // may be a queue you never had
// and no idea how close the call wasMed Jev
const { answers } = await jev.systemOne({
state: ticket,
model: "jev-latest",
questions: { queue: { type: "choice", instructions:
"Which team should own this ticket?", criteria: QUEUES } }
});
const { choice, probabilities, confidence } = answers.queue;
// choice is one of QUEUES. It cannot be anything else.
if (confidence < 0.7) return humanReview(ticket, probabilities);
route(choice);Omförsöksloopen är avslöjaren. Den finns i den första versionen eftersom svaret kommer som text som kanske inte går att tolka, eller tolkas till en kö som aldrig fanns på listan. I den andra har den ingenstans att bo: svaret är per konstruktion ett av QUEUES. Det som ersätter den är en helt annan gren — en som utlöses när modellen är osäker snarare än när utdata är trasig.
Vad den andra versionen kan se
Det ärendet, verkligen kört genom Jev. Vinnaren är föga överraskande; tvåan är den del en naken etikett hade slängt bort.
Teknik vinner på 87 %, men Konto håller 13 % — och det är rätt oenighet att ha, eftersom ett SSO-fel faktiskt ligger på gränsen mellan de två. En naken etikett hade dolt det. Om din dirigering har en kostnad för att gå fel är 13 % talet att sätta tröskel på.
Sida vid sida
- Vad du skickar
- Jev
Ett tillstånd plus en karta av typade frågor.
SpråkmodellEn prompt, som oftast bär schemat och reglerna som prosa.
- Vad som kommer tillbaka
- Jev
Ett typat svar per fråga, med en sannolikhet för varje alternativ.
SpråkmodellText. JSON om du bad snällt och läget stöds.
- Din nästa kodrad
- Jev
En växling på ett värde som bara kan vara ett av dina.
SpråkmodellEn tolkning, sedan en validering, sedan en gren för när något av dem misslyckades.
- Hur den fallerar
- Jev
Den kan ha fel om din text. Den kan inte returnera en form du inte definierat.
SpråkmodellDen kan också ha fel om formen — ett saknat fält, en etikett du aldrig listade, prosa lindad runt JSON:en.
- Att fråga tio saker
- Jev
Tio frågor i en förfrågan, utvärderade mot tillståndet parallellt.
SpråkmodellEn överfull prompt, eller tio anrop.
- Osäkerhet
- Jev
En fördelning och ett tillförsiktsvärde, på varje Choice och Score.
SpråkmodellVad texten än påstår om sin egen säkerhet.
Siffrorna
TypeSafe publicerar dem; det är leverantörens egna tal, inte våra mätningar.
svarstid ände till ände, mot 3–329 s för frontlinjemodeller
snabbare på frågor av System One-form
per miljon indata-tokens, utdata gratis
Vad vi kan mäta: över 14 körningar gjorda via den här sajten är mediantiden tur och retur 329 ms — och de flesta av dessa förfrågningar bar nio frågor, inte en.
När språkmodellen är rätt verktyg
För det mesta, om det du behöver är språk. Jev har ingen åsikt den kan förklara och inget att säga.
- Du behöver prosa — ett svar, en sammanfattning, ett commit-meddelande, en förklaring av beslutet snarare än beslutet.
- Du behöver kod skriven, eller en plan, eller något öppet där svarsmängden inte är känd före anropet.
- Mängden möjliga svar är verkligen obegränsad. Att extrahera ett godtyckligt namn är inte en Choice över 255 alternativ.
- Du behöver en resonemangskedja du kan granska. Jev returnerar en bedömning, inte stegen bakom den.
- Volymen är låg och formen lös. En omförsöksloop du kör två gånger om dagen är inte värd att konstruera bort.
De två kompletterar varandra bättre än de konkurrerar. TypeSafes egen ram är System One för den snabba strukturerade bedömningen och en vanlig modell som System Two bakom den — sålla indata med en Noul, dirigera med en Choice och lämna över det som överlever till modellen som faktiskt kan skriva.
Läs vidare
Kör jämförelsen själv
Klistra in ett ärende, ett utkast, en prompt — vad som helst du annars hade skrivit en tolkningsloop runt — och se nio typade svar komma tillbaka från en förfrågan.
Öppna lekplatsen