Jev față de un LLM

Nu se bat pe aceeași slujbă. Un LLM scrie; Jev decide. Comparația utilă nu e care e mai deștept, ci ce trebuie să facă codul tău cu răspunsul — iar diferența e destul de mare cât să schimbe felul în care e scris programul din jur.

Aceeași decizie, scrisă în ambele feluri

Rutează un tichet de suport spre una din patru cozi. Iată cât te costă efectiv fiecare variantă în cod.

Cu un model de limbaj

const res = await llm.chat({
  messages: [{ role: "user", content:
    `Route this ticket. Reply with JSON: {"queue": "Billing"|"Technical"|"Account"|"Sales"}
     Ticket: ${ticket}` }],
  response_format: { type: "json_object" }
});

let queue;
try {
  queue = JSON.parse(res.content).queue;        // may not be JSON
} catch {
  return retry();                               // ...so there is a retry
}
if (!QUEUES.includes(queue)) return retry();    // may be a queue you never had
// and no idea how close the call was

Cu Jev

const { answers } = await jev.systemOne({
  state: ticket,
  model: "jev-latest",
  questions: { queue: { type: "choice", instructions:
    "Which team should own this ticket?", criteria: QUEUES } }
});

const { choice, probabilities, confidence } = answers.queue;
// choice is one of QUEUES. It cannot be anything else.
if (confidence < 0.7) return humanReview(ticket, probabilities);
route(choice);

Bucla de reîncercare e semnul. Există în prima variantă fiindcă răspunsul sosește ca text care poate să nu se analizeze sau să se analizeze într-o coadă care n-a fost niciodată pe listă. În a doua nu are unde să stea: răspunsul este prin construcție unul din QUEUES. Ce îi ia locul e o ramură cu totul diferită — una care se declanșează când modelul e nesigur, nu când e stricat.

Ce poate vedea a doua variantă

Acel tichet, trecut cu adevărat prin Jev. Câștigătoarea nu surprinde; locul doi e partea pe care o etichetă seacă ar fi aruncat-o.

“Autentificarea noastră SSO dă 500 de la versiunea 4.2 lansată azi-dimineață. Nimeni din echipă nu poate intra. La fel în Chrome și Safari, pe doi chiriași diferiți.”
Tehnic la 87 %, din 4 opțiuni
87 % Tehnic

Tehnic câștigă cu 87%, dar Cont ține 13% — și exact acesta e dezacordul potrivit, fiindcă o defecțiune SSO chiar stă la granița dintre ele. O etichetă seacă ar fi ascuns-o. Dacă greșeala de rutare costă ceva, 13% e cifra pe care pui pragul.

Alături

Ce trimiți
Jev

Un state plus o hartă de întrebări tipizate.

LLM

Un prompt, care de obicei cară schema și regulile ca proză.

Ce se întoarce
Jev

Câte un răspuns tipizat pe întrebare, cu probabilitate pentru fiecare opțiune.

LLM

Text. JSON dacă ai cerut frumos și modul e suportat.

Următoarea ta linie de cod
Jev

Un switch pe o valoare care nu poate fi decât una dintre ale tale.

LLM

O analiză, apoi o validare, apoi o ramură pentru când una dintre ele a eșuat.

Cum greșește
Jev

Poate greși în privința textului tău. Nu poate returna o formă pe care n-ai definit-o.

LLM

Poate greși și forma — un câmp lipsă, o etichetă pe care n-ai enumerat-o, proză înfășurată în jurul JSON-ului.

Zece întrebări
Jev

Zece întrebări într-o cerere, evaluate față de state în paralel.

LLM

Un prompt aglomerat sau zece apeluri.

Incertitudine
Jev

O distribuție și o valoare de încredere, la fiecare Choice și Score.

LLM

Orice pretinde textul despre propria siguranță.

Cifrele

Le publică TypeSafe; sunt cifrele furnizorului, nu măsurători de-ale noastre.

70–500 ms

răspuns cap-coadă, față de 3–329 s pentru modelele de vârf

40–200×

mai rapid la interogări de forma Sistemului Unu

0,042 $

per milion de tokenuri de intrare, ieșirea gratuită

Ce putem măsura noi: pe 14 rulări făcute prin acest site, mediana dus-întors este 329 ms — iar majoritatea acelor cereri purtau nouă întrebări, nu una.

Când LLM-ul este unealta potrivită

Aproape întotdeauna, dacă ai nevoie de limbaj. Jev n-are o opinie pe care s-o explice și n-are nimic de spus.

  • Ai nevoie de proză — un răspuns, un rezumat, un mesaj de commit, o explicație a deciziei în loc de decizie.
  • Ai nevoie de cod scris, de un plan sau de orice deschis, unde mulțimea răspunsurilor nu se cunoaște înainte de apel.
  • Mulțimea răspunsurilor posibile este cu adevărat nemărginită. A extrage un nume oarecare nu e un Choice peste 255 de opțiuni.
  • Ai nevoie de un lanț de raționament pe care să-l poți inspecta. Jev returnează o judecată, nu pașii din spatele ei.
  • Volumul e mic, iar forma e lejeră. O buclă de reîncercare care rulează de două ori pe zi nu merită proiectată afară.

Cele două se compun mai bine decât concurează. Însăși formularea TypeSafe este Sistemul Unu pentru judecata structurată rapidă și un model obișnuit ca Sistemul Doi în spate — cerne intrarea cu un Noul, rutează cu un Choice și dă ce supraviețuiește modelului care chiar știe să scrie.

Citește mai departe

Fă singur comparația

Lipește un tichet, o ciornă, un prompt — orice în jurul căruia altfel ai fi scris o buclă de analiză — și urmărește cum se întorc nouă răspunsuri tipizate dintr-o singură cerere.

Deschide terenul de joacă