Jev mot en språkmodell

De konkurrerar inte om samma jobb. En språkmodell skriver; Jev bestämmer. Den användbara jämförelsen är inte vilken som är smartast utan vad din kod måste göra med svaret — och den skillnaden är stor nog att ändra hur programmet runt omkring skrivs.

Samma beslut, skrivet på båda sätten

Dirigera ett supportärende till en av fyra köer. Så här mycket kostar var sida dig i kod.

Med en språkmodell

const res = await llm.chat({
  messages: [{ role: "user", content:
    `Route this ticket. Reply with JSON: {"queue": "Billing"|"Technical"|"Account"|"Sales"}
     Ticket: ${ticket}` }],
  response_format: { type: "json_object" }
});

let queue;
try {
  queue = JSON.parse(res.content).queue;        // may not be JSON
} catch {
  return retry();                               // ...so there is a retry
}
if (!QUEUES.includes(queue)) return retry();    // may be a queue you never had
// and no idea how close the call was

Med Jev

const { answers } = await jev.systemOne({
  state: ticket,
  model: "jev-latest",
  questions: { queue: { type: "choice", instructions:
    "Which team should own this ticket?", criteria: QUEUES } }
});

const { choice, probabilities, confidence } = answers.queue;
// choice is one of QUEUES. It cannot be anything else.
if (confidence < 0.7) return humanReview(ticket, probabilities);
route(choice);

Omförsöksloopen är avslöjaren. Den finns i den första versionen eftersom svaret kommer som text som kanske inte går att tolka, eller tolkas till en kö som aldrig fanns på listan. I den andra har den ingenstans att bo: svaret är per konstruktion ett av QUEUES. Det som ersätter den är en helt annan gren — en som utlöses när modellen är osäker snarare än när utdata är trasig.

Vad den andra versionen kan se

Det ärendet, verkligen kört genom Jev. Vinnaren är föga överraskande; tvåan är den del en naken etikett hade slängt bort.

“Vår SSO-inloggning har gett 500 sedan 4.2-släppet i morse. Ingen i teamet kommer in. Samma i Chrome och Safari, två olika tenanter.”
Teknik på 87 %, av 4 alternativ
87 % Teknik

Teknik vinner på 87 %, men Konto håller 13 % — och det är rätt oenighet att ha, eftersom ett SSO-fel faktiskt ligger på gränsen mellan de två. En naken etikett hade dolt det. Om din dirigering har en kostnad för att gå fel är 13 % talet att sätta tröskel på.

Sida vid sida

Vad du skickar
Jev

Ett tillstånd plus en karta av typade frågor.

Språkmodell

En prompt, som oftast bär schemat och reglerna som prosa.

Vad som kommer tillbaka
Jev

Ett typat svar per fråga, med en sannolikhet för varje alternativ.

Språkmodell

Text. JSON om du bad snällt och läget stöds.

Din nästa kodrad
Jev

En växling på ett värde som bara kan vara ett av dina.

Språkmodell

En tolkning, sedan en validering, sedan en gren för när något av dem misslyckades.

Hur den fallerar
Jev

Den kan ha fel om din text. Den kan inte returnera en form du inte definierat.

Språkmodell

Den kan också ha fel om formen — ett saknat fält, en etikett du aldrig listade, prosa lindad runt JSON:en.

Att fråga tio saker
Jev

Tio frågor i en förfrågan, utvärderade mot tillståndet parallellt.

Språkmodell

En överfull prompt, eller tio anrop.

Osäkerhet
Jev

En fördelning och ett tillförsiktsvärde, på varje Choice och Score.

Språkmodell

Vad texten än påstår om sin egen säkerhet.

Siffrorna

TypeSafe publicerar dem; det är leverantörens egna tal, inte våra mätningar.

70–500 ms

svarstid ände till ände, mot 3–329 s för frontlinjemodeller

40–200×

snabbare på frågor av System One-form

0,042 $

per miljon indata-tokens, utdata gratis

Vad vi kan mäta: över 14 körningar gjorda via den här sajten är mediantiden tur och retur 329 ms — och de flesta av dessa förfrågningar bar nio frågor, inte en.

När språkmodellen är rätt verktyg

För det mesta, om det du behöver är språk. Jev har ingen åsikt den kan förklara och inget att säga.

  • Du behöver prosa — ett svar, en sammanfattning, ett commit-meddelande, en förklaring av beslutet snarare än beslutet.
  • Du behöver kod skriven, eller en plan, eller något öppet där svarsmängden inte är känd före anropet.
  • Mängden möjliga svar är verkligen obegränsad. Att extrahera ett godtyckligt namn är inte en Choice över 255 alternativ.
  • Du behöver en resonemangskedja du kan granska. Jev returnerar en bedömning, inte stegen bakom den.
  • Volymen är låg och formen lös. En omförsöksloop du kör två gånger om dagen är inte värd att konstruera bort.

De två kompletterar varandra bättre än de konkurrerar. TypeSafes egen ram är System One för den snabba strukturerade bedömningen och en vanlig modell som System Two bakom den — sålla indata med en Noul, dirigera med en Choice och lämna över det som överlever till modellen som faktiskt kan skriva.

Läs vidare

Kör jämförelsen själv

Klistra in ett ärende, ett utkast, en prompt — vad som helst du annars hade skrivit en tolkningsloop runt — och se nio typade svar komma tillbaka från en förfrågan.

Öppna lekplatsen