Jev față de un LLM
Nu se bat pe aceeași slujbă. Un LLM scrie; Jev decide. Comparația utilă nu e care e mai deștept, ci ce trebuie să facă codul tău cu răspunsul — iar diferența e destul de mare cât să schimbe felul în care e scris programul din jur.
Aceeași decizie, scrisă în ambele feluri
Rutează un tichet de suport spre una din patru cozi. Iată cât te costă efectiv fiecare variantă în cod.
Cu un model de limbaj
const res = await llm.chat({
messages: [{ role: "user", content:
`Route this ticket. Reply with JSON: {"queue": "Billing"|"Technical"|"Account"|"Sales"}
Ticket: ${ticket}` }],
response_format: { type: "json_object" }
});
let queue;
try {
queue = JSON.parse(res.content).queue; // may not be JSON
} catch {
return retry(); // ...so there is a retry
}
if (!QUEUES.includes(queue)) return retry(); // may be a queue you never had
// and no idea how close the call wasCu Jev
const { answers } = await jev.systemOne({
state: ticket,
model: "jev-latest",
questions: { queue: { type: "choice", instructions:
"Which team should own this ticket?", criteria: QUEUES } }
});
const { choice, probabilities, confidence } = answers.queue;
// choice is one of QUEUES. It cannot be anything else.
if (confidence < 0.7) return humanReview(ticket, probabilities);
route(choice);Bucla de reîncercare e semnul. Există în prima variantă fiindcă răspunsul sosește ca text care poate să nu se analizeze sau să se analizeze într-o coadă care n-a fost niciodată pe listă. În a doua nu are unde să stea: răspunsul este prin construcție unul din QUEUES. Ce îi ia locul e o ramură cu totul diferită — una care se declanșează când modelul e nesigur, nu când e stricat.
Ce poate vedea a doua variantă
Acel tichet, trecut cu adevărat prin Jev. Câștigătoarea nu surprinde; locul doi e partea pe care o etichetă seacă ar fi aruncat-o.
Tehnic câștigă cu 87%, dar Cont ține 13% — și exact acesta e dezacordul potrivit, fiindcă o defecțiune SSO chiar stă la granița dintre ele. O etichetă seacă ar fi ascuns-o. Dacă greșeala de rutare costă ceva, 13% e cifra pe care pui pragul.
Alături
- Ce trimiți
- Jev
Un state plus o hartă de întrebări tipizate.
LLMUn prompt, care de obicei cară schema și regulile ca proză.
- Ce se întoarce
- Jev
Câte un răspuns tipizat pe întrebare, cu probabilitate pentru fiecare opțiune.
LLMText. JSON dacă ai cerut frumos și modul e suportat.
- Următoarea ta linie de cod
- Jev
Un switch pe o valoare care nu poate fi decât una dintre ale tale.
LLMO analiză, apoi o validare, apoi o ramură pentru când una dintre ele a eșuat.
- Cum greșește
- Jev
Poate greși în privința textului tău. Nu poate returna o formă pe care n-ai definit-o.
LLMPoate greși și forma — un câmp lipsă, o etichetă pe care n-ai enumerat-o, proză înfășurată în jurul JSON-ului.
- Zece întrebări
- Jev
Zece întrebări într-o cerere, evaluate față de state în paralel.
LLMUn prompt aglomerat sau zece apeluri.
- Incertitudine
- Jev
O distribuție și o valoare de încredere, la fiecare Choice și Score.
LLMOrice pretinde textul despre propria siguranță.
Cifrele
Le publică TypeSafe; sunt cifrele furnizorului, nu măsurători de-ale noastre.
răspuns cap-coadă, față de 3–329 s pentru modelele de vârf
mai rapid la interogări de forma Sistemului Unu
per milion de tokenuri de intrare, ieșirea gratuită
Ce putem măsura noi: pe 14 rulări făcute prin acest site, mediana dus-întors este 329 ms — iar majoritatea acelor cereri purtau nouă întrebări, nu una.
Când LLM-ul este unealta potrivită
Aproape întotdeauna, dacă ai nevoie de limbaj. Jev n-are o opinie pe care s-o explice și n-are nimic de spus.
- Ai nevoie de proză — un răspuns, un rezumat, un mesaj de commit, o explicație a deciziei în loc de decizie.
- Ai nevoie de cod scris, de un plan sau de orice deschis, unde mulțimea răspunsurilor nu se cunoaște înainte de apel.
- Mulțimea răspunsurilor posibile este cu adevărat nemărginită. A extrage un nume oarecare nu e un Choice peste 255 de opțiuni.
- Ai nevoie de un lanț de raționament pe care să-l poți inspecta. Jev returnează o judecată, nu pașii din spatele ei.
- Volumul e mic, iar forma e lejeră. O buclă de reîncercare care rulează de două ori pe zi nu merită proiectată afară.
Cele două se compun mai bine decât concurează. Însăși formularea TypeSafe este Sistemul Unu pentru judecata structurată rapidă și un model obișnuit ca Sistemul Doi în spate — cerne intrarea cu un Noul, rutează cu un Choice și dă ce supraviețuiește modelului care chiar știe să scrie.
Citește mai departe
Fă singur comparația
Lipește un tichet, o ciornă, un prompt — orice în jurul căruia altfel ai fi scris o buclă de analiză — și urmărește cum se întorc nouă răspunsuri tipizate dintr-o singură cerere.
Deschide terenul de joacă