Jev kontra LLM

Nem ugyanarra a munkára pályáznak. Az LLM ír; a Jev dönt. A hasznos összehasonlítás nem az, melyik okosabb, hanem az, mit kell a kódodnak kezdenie a válasszal — és ez a különbség elég nagy ahhoz, hogy megváltoztassa a köré írt program felépítését.

Ugyanaz a döntés, mindkét módon megírva

Irányíts egy ügyfélszolgálati jegyet négy sor egyikébe. Íme, mibe kerül ez kódban mindkét oldalon.

Nyelvi modellel

const res = await llm.chat({
  messages: [{ role: "user", content:
    `Route this ticket. Reply with JSON: {"queue": "Billing"|"Technical"|"Account"|"Sales"}
     Ticket: ${ticket}` }],
  response_format: { type: "json_object" }
});

let queue;
try {
  queue = JSON.parse(res.content).queue;        // may not be JSON
} catch {
  return retry();                               // ...so there is a retry
}
if (!QUEUES.includes(queue)) return retry();    // may be a queue you never had
// and no idea how close the call was

Jevvel

const { answers } = await jev.systemOne({
  state: ticket,
  model: "jev-latest",
  questions: { queue: { type: "choice", instructions:
    "Which team should own this ticket?", criteria: QUEUES } }
});

const { choice, probabilities, confidence } = answers.queue;
// choice is one of QUEUES. It cannot be anything else.
if (confidence < 0.7) return humanReview(ticket, probabilities);
route(choice);

Az újrapróbálkozó ciklus az árulkodó jel. Az első változatban azért van, mert a válasz szövegként érkezik, ami vagy elemezhető, vagy olyan sorba elemződik, ami sosem volt a listán. A másodikban nincs hol léteznie: a válasz szerkezeténél fogva a QUEUES egyike. Ami a helyére lép, az egy egészen más ág — olyan, amely akkor sül el, ha a modell bizonytalan, nem akkor, ha a kimenet hibás.

Mit lát a második változat

Ugyanaz a jegy, valóban átfuttatva a Jeven. A győztes nem meglepő; a második helyezett az a rész, amit egy puszta címke eldobott volna.

“Az SSO-bejelentkezésünk ma reggel a 4.2-es kiadás óta 500-as hibát dob. A csapatból senki nem tud belépni. Chrome-on és Safarin ugyanaz, két különböző bérlőnél.”
Műszaki 87% értéken, 4 lehetőségből
87% Műszaki

A Műszaki nyer 87%-kal, de a Fiók 13%-ot tart — és ez a helyes nézeteltérés, mert egy SSO-hiba tényleg a kettő határán van. Egy puszta címke ezt elrejtette volna. Ha az irányításnak ára van, amikor téved, akkor a 13% az a szám, amire küszöböt kell tenni.

Egymás mellett

Amit elküldesz
Jev

Egy állapot és tipizált kérdések térképe.

LLM

Egy prompt, benne általában a séma és a szabályok prózában.

Ami visszajön
Jev

Kérdésenként egy tipizált válasz, minden lehetőséghez valószínűséggel.

LLM

Szöveg. JSON, ha szépen kérted, és a mód támogatott.

A következő kódsorod
Jev

Elágazás egy értéken, ami csak a tieid egyike lehet.

LLM

Elemzés, majd validálás, majd egy ág arra az esetre, ha bármelyik elbukott.

Hogyan hibázik
Jev

Tévedhet a szövegeddel kapcsolatban. Olyan alakot nem adhat vissza, amit nem adtál meg.

LLM

Az alakot is elronthatja — hiányzó mező, sosem listázott címke, próza a JSON köré tekerve.

Tíz dolgot kérdezni
Jev

Tíz kérdés egy kérésben, párhuzamosan kiértékelve az állapotra.

LLM

Egy zsúfolt prompt, vagy tíz hívás.

Bizonytalanság
Jev

Eloszlás és bizonyossági érték, minden Choice-on és Score-on.

LLM

Amit a szöveg állít a saját biztosságáról.

A számok

Ezeket a TypeSafe teszi közzé; a gyártó saját adatai, nem a mi méréseink.

70–500 ms

végponttól végpontig, szemben a határmodellek 3–329 másodpercével

40–200×

gyorsabb a System One alakú kérdéseken

0,042 $

millió bemeneti tokenenként, a kimenet ingyenes

Amit mi mérni tudunk: az ezen az oldalon készült 14 futtatáson a medián oda-vissza idő 329 ms — és ezeknek a kéréseknek a többsége kilenc kérdést vitt, nem egyet.

Mikor az LLM a helyes eszköz

Legtöbbször akkor, ha nyelvre van szükséged. A Jevnek nincs véleménye, amit ki tudna fejteni, és nincs mondanivalója.

  • Prózára van szükséged — válaszra, összefoglalóra, commit-üzenetre, a döntés magyarázatára a döntés helyett.
  • Kódot kell írni, vagy tervet, vagy bármi nyitott végűt, ahol a válaszhalmaz a hívás előtt nem ismert.
  • A lehetséges válaszok halmaza valóban korlátlan. Egy tetszőleges név kinyerése nem 255 lehetőség közüli Choice.
  • Átvizsgálható gondolatmenetre van szükséged. A Jev ítéletet ad vissza, nem a mögötte lévő lépéseket.
  • A mennyiség kicsi és az alak laza. Egy naponta kétszer lefutó újrapróbálkozó ciklust nem éri meg megtervezni.

A kettő jobban egészíti ki egymást, mint ahogy versengene. A TypeSafe megfogalmazásában a System One a gyors, strukturált ítélet, mögötte egy hagyományos modell System Two-ként — szűrd a bemenetet egy Noullal, irányíts egy Choice-szal, és add át azt, ami átjutott, annak a modellnek, amely tényleg tud írni.

Olvass tovább

Futtasd le magad az összehasonlítást

Illessz be egy jegyet, egy piszkozatot, egy promptot — bármit, ami köré egyébként elemző ciklust írnál —, és nézd, ahogy kilenc tipizált válasz visszaér egyetlen kérésből.

Játszótér megnyitása