Jev mod en sprogmodel

De konkurrerer ikke om det samme job. En sprogmodel skriver; Jev beslutter. Den nyttige sammenligning er ikke, hvilken der er klogest, men hvad din kode skal stille op med svaret — og den forskel er stor nok til at ændre, hvordan programmet omkring skrives.

Den samme beslutning, skrevet på begge måder

Dirigér en supportsag til én af fire køer. Her er, hvad hver side faktisk koster dig i kode.

Med en sprogmodel

const res = await llm.chat({
  messages: [{ role: "user", content:
    `Route this ticket. Reply with JSON: {"queue": "Billing"|"Technical"|"Account"|"Sales"}
     Ticket: ${ticket}` }],
  response_format: { type: "json_object" }
});

let queue;
try {
  queue = JSON.parse(res.content).queue;        // may not be JSON
} catch {
  return retry();                               // ...so there is a retry
}
if (!QUEUES.includes(queue)) return retry();    // may be a queue you never had
// and no idea how close the call was

Med Jev

const { answers } = await jev.systemOne({
  state: ticket,
  model: "jev-latest",
  questions: { queue: { type: "choice", instructions:
    "Which team should own this ticket?", criteria: QUEUES } }
});

const { choice, probabilities, confidence } = answers.queue;
// choice is one of QUEUES. It cannot be anything else.
if (confidence < 0.7) return humanReview(ticket, probabilities);
route(choice);

Gentagelsesløkken er det afslørende. Den findes i den første udgave, fordi svaret ankommer som tekst, der måske ikke kan tolkes, eller kan tolkes til en kø, der aldrig stod på listen. I den anden har den ingen steder at bo: svaret er per konstruktion ét af QUEUES. Det, der erstatter den, er en helt anden gren — en, der udløses, når modellen er usikker, frem for når outputtet er ødelagt.

Hvad den anden udgave kan se

Den sag, kørt gennem Jev for alvor. Vinderen er ikke overraskende; nummer to er den del, en bar etiket ville have smidt væk.

“Vores SSO-login har givet 500 siden 4.2-udgivelsen i morges. Ingen på holdet kan komme ind. Det samme i Chrome og Safari, to forskellige lejere.”
Teknik ved 87 %, ud af 4 muligheder
87 % Teknik

Teknik vinder med 87 %, men Konto holder 13 % — og det er den rigtige uenighed at have, for en SSO-fejl ligger faktisk på grænsen mellem de to. En bar etiket ville have skjult det. Hvis din dirigering har en pris for at ramme forkert, er 13 % det tal, du sætter tærskel på.

Side om side

Hvad du sender
Jev

Én tilstand plus et kort over typede spørgsmål.

Sprogmodel

En prompt, som regel med skemaet og reglerne som prosa.

Hvad der kommer tilbage
Jev

Ét typet svar pr. spørgsmål, med en sandsynlighed for hver mulighed.

Sprogmodel

Tekst. JSON, hvis du spurgte pænt, og tilstanden understøttes.

Din næste kodelinje
Jev

En forgrening på en værdi, der kun kan være en af dine.

Sprogmodel

En tolkning, så en validering, så en gren til, når en af dem fejlede.

Hvordan den fejler
Jev

Den kan tage fejl om din tekst. Den kan ikke returnere en form, du ikke definerede.

Sprogmodel

Den kan også tage fejl om formen — et manglende felt, en etiket du aldrig nævnte, prosa viklet om JSON’en.

At spørge om ti ting
Jev

Ti spørgsmål i én forespørgsel, vurderet mod tilstanden parallelt.

Sprogmodel

Én overfyldt prompt, eller ti kald.

Usikkerhed
Jev

En fordeling og en tillidsværdi på hver Choice og Score.

Sprogmodel

Hvad teksten end påstår om sin egen sikkerhed.

Tallene

TypeSafe udgiver dem; det er leverandørens egne tal, ikke vores målinger.

70–500 ms

svartid fra ende til ende, mod 3–329 s for frontmodeller

40–200×

hurtigere på forespørgsler af System One-form

0,042 $

pr. million inputtokens, output gratis

Hvad vi kan måle: over 14 kørsler foretaget via dette site er mediantiden tur-retur 329 ms — og de fleste af de forespørgsler bar ni spørgsmål, ikke ét.

Hvornår sprogmodellen er det rigtige værktøj

Det meste af tiden, hvis det, du har brug for, er sprog. Jev har ingen holdning, den kan forklare, og intet at sige.

  • Du har brug for prosa — et svar, et resumé, en commit-besked, en forklaring af beslutningen frem for beslutningen.
  • Du har brug for kode skrevet, eller en plan, eller noget åbent, hvor svarmængden ikke er kendt før kaldet.
  • Mængden af mulige svar er reelt ubegrænset. At udtrække et vilkårligt navn er ikke en Choice over 255 muligheder.
  • Du har brug for en tankekæde, du kan inspicere. Jev returnerer en dom, ikke trinnene bag den.
  • Mængden er lille, og formen er løs. En gentagelsesløkke, du kører to gange om dagen, er ikke værd at designe væk.

De to spiller bedre sammen, end de konkurrerer. TypeSafes egen ramme er System One til den hurtige strukturerede dømmekraft og en almindelig model som System Two bagved — sigt inputtet med en Noul, dirigér med en Choice, og aflevér det, der overlever, til den model, der faktisk kan skrive.

Læs videre

Kør sammenligningen selv

Indsæt en sag, et udkast, en prompt — hvad som helst du ellers ville have skrevet en tolkningsløkke omkring — og se ni typede svar komme tilbage fra én forespørgsel.

Åbn legepladsen