Jev versus LLM
Nesoupeří o stejnou práci. LLM píše; Jev rozhoduje. Užitečné srovnání není, kdo je chytřejší, ale co musí váš kód s odpovědí udělat — a ten rozdíl je dost velký na to, aby změnil, jak je napsaný program okolo.
Totéž rozhodnutí, napsané oběma způsoby
Nasměrovat tiket podpory do jedné ze čtyř front. Tady je, co vás každá strana skutečně stojí v kódu.
S jazykovým modelem
const res = await llm.chat({
messages: [{ role: "user", content:
`Route this ticket. Reply with JSON: {"queue": "Billing"|"Technical"|"Account"|"Sales"}
Ticket: ${ticket}` }],
response_format: { type: "json_object" }
});
let queue;
try {
queue = JSON.parse(res.content).queue; // may not be JSON
} catch {
return retry(); // ...so there is a retry
}
if (!QUEUES.includes(queue)) return retry(); // may be a queue you never had
// and no idea how close the call wasS Jevem
const { answers } = await jev.systemOne({
state: ticket,
model: "jev-latest",
questions: { queue: { type: "choice", instructions:
"Which team should own this ticket?", criteria: QUEUES } }
});
const { choice, probabilities, confidence } = answers.queue;
// choice is one of QUEUES. It cannot be anything else.
if (confidence < 0.7) return humanReview(ticket, probabilities);
route(choice);Smyčka opakování je ta zrada. V první verzi existuje proto, že odpověď přichází jako text, který se nemusí naparsovat nebo se naparsuje do fronty, která nikdy nebyla na seznamu. Ve druhé nemá kde bydlet: odpověď je z konstrukce jedna z QUEUES. Místo ní nastoupí úplně jiná větev — ta, která se spustí, když si model není jistý, ne když je výstup rozbitý.
Co vidí druhá verze
Ten tiket, doopravdy protažený Jevem. Vítěz nepřekvapí; druhé místo je ta část, kterou by holý štítek zahodil.
Technický vyhrává s 87 %, ale Účet drží 13 % — a to je přesně ta správná neshoda, protože výpadek SSO opravdu leží na hranici mezi nimi. Holý štítek by to skryl. Pokud špatné směrování něco stojí, práh patří právě na těch 13 %.
Vedle sebe
- Co posíláte
- Jev
Jeden state plus mapu typovaných otázek.
LLMPrompt, který obvykle nese schéma a pravidla jako prózu.
- Co se vrací
- Jev
Po jedné typované odpovědi na otázku, s pravděpodobností pro každou možnost.
LLMText. JSON, pokud jste hezky poprosili a režim je podporovaný.
- Váš další řádek kódu
- Jev
Přepnutí podle hodnoty, která může být jen jedna z vašich.
LLMParsování, pak validace, pak větev pro případ, že jedno z toho selhalo.
- Jak selhává
- Jev
Může se mýlit ohledně vašeho textu. Nemůže vrátit tvar, který jste nedefinovali.
LLMMůže se mýlit i v tvaru — chybějící pole, štítek, který jste nikdy neuvedli, próza omotaná kolem JSON.
- Zeptat se na deset věcí
- Jev
Deset otázek v jednom požadavku, vyhodnocených proti state souběžně.
LLMJeden přeplácaný prompt, nebo deset volání.
- Nejistota
- Jev
Rozdělení a hodnota jistoty u každého Choice a Score.
LLMCokoli text tvrdí o vlastní jistotě.
Čísla
Zveřejňuje je TypeSafe; jsou to čísla dodavatele, ne naše měření.
odezva od konce ke konci, proti 3–329 s u špičkových modelů
rychleji u dotazů tvaru Systému 1
za milion vstupních tokenů, výstup zdarma
Co změřit umíme: napříč 14 běhy provedenými přes tento web je medián doby odezvy 329 ms — a většina těch požadavků nesla devět otázek, ne jednu.
Kdy je LLM ten správný nástroj
Většinou, pokud potřebujete jazyk. Jev nemá názor, který by dokázal vysvětlit, a nemá co říct.
- Potřebujete prózu — odpověď, shrnutí, zprávu ke commitu, vysvětlení rozhodnutí místo rozhodnutí samotného.
- Potřebujete napsat kód nebo plán, nebo cokoli otevřeného, kde množina odpovědí není před voláním známá.
- Množina možných odpovědí je opravdu neomezená. Vytáhnout libovolné jméno není Choice přes 255 možností.
- Potřebujete řetěz úvah, do kterého se dá nahlédnout. Jev vrací úsudek, ne kroky za ním.
- Objem je malý a tvar volný. Smyčku opakování, která běží dvakrát denně, nemá cenu vyprojektovat pryč.
Ti dva se skládají líp, než soupeří. Vlastní rámování TypeSafe je Systém 1 pro rychlý strukturovaný úsudek a běžný model jako Systém 2 za ním — proseťte vstup Noulem, nasměrujte Choicem a předejte to, co přežije, modelu, který opravdu umí psát.
Číst dál
Udělejte si to srovnání sami
Vložte tiket, koncept, prompt — cokoli, kolem čeho byste jinak napsali parsovací smyčku — a sledujte, jak se z jediného požadavku vrátí devět typovaných odpovědí.
Otevřít hřiště