Jev kontra LLM
Nem ugyanarra a munkára pályáznak. Az LLM ír; a Jev dönt. A hasznos összehasonlítás nem az, melyik okosabb, hanem az, mit kell a kódodnak kezdenie a válasszal — és ez a különbség elég nagy ahhoz, hogy megváltoztassa a köré írt program felépítését.
Ugyanaz a döntés, mindkét módon megírva
Irányíts egy ügyfélszolgálati jegyet négy sor egyikébe. Íme, mibe kerül ez kódban mindkét oldalon.
Nyelvi modellel
const res = await llm.chat({
messages: [{ role: "user", content:
`Route this ticket. Reply with JSON: {"queue": "Billing"|"Technical"|"Account"|"Sales"}
Ticket: ${ticket}` }],
response_format: { type: "json_object" }
});
let queue;
try {
queue = JSON.parse(res.content).queue; // may not be JSON
} catch {
return retry(); // ...so there is a retry
}
if (!QUEUES.includes(queue)) return retry(); // may be a queue you never had
// and no idea how close the call wasJevvel
const { answers } = await jev.systemOne({
state: ticket,
model: "jev-latest",
questions: { queue: { type: "choice", instructions:
"Which team should own this ticket?", criteria: QUEUES } }
});
const { choice, probabilities, confidence } = answers.queue;
// choice is one of QUEUES. It cannot be anything else.
if (confidence < 0.7) return humanReview(ticket, probabilities);
route(choice);Az újrapróbálkozó ciklus az árulkodó jel. Az első változatban azért van, mert a válasz szövegként érkezik, ami vagy elemezhető, vagy olyan sorba elemződik, ami sosem volt a listán. A másodikban nincs hol léteznie: a válasz szerkezeténél fogva a QUEUES egyike. Ami a helyére lép, az egy egészen más ág — olyan, amely akkor sül el, ha a modell bizonytalan, nem akkor, ha a kimenet hibás.
Mit lát a második változat
Ugyanaz a jegy, valóban átfuttatva a Jeven. A győztes nem meglepő; a második helyezett az a rész, amit egy puszta címke eldobott volna.
A Műszaki nyer 87%-kal, de a Fiók 13%-ot tart — és ez a helyes nézeteltérés, mert egy SSO-hiba tényleg a kettő határán van. Egy puszta címke ezt elrejtette volna. Ha az irányításnak ára van, amikor téved, akkor a 13% az a szám, amire küszöböt kell tenni.
Egymás mellett
- Amit elküldesz
- Jev
Egy állapot és tipizált kérdések térképe.
LLMEgy prompt, benne általában a séma és a szabályok prózában.
- Ami visszajön
- Jev
Kérdésenként egy tipizált válasz, minden lehetőséghez valószínűséggel.
LLMSzöveg. JSON, ha szépen kérted, és a mód támogatott.
- A következő kódsorod
- Jev
Elágazás egy értéken, ami csak a tieid egyike lehet.
LLMElemzés, majd validálás, majd egy ág arra az esetre, ha bármelyik elbukott.
- Hogyan hibázik
- Jev
Tévedhet a szövegeddel kapcsolatban. Olyan alakot nem adhat vissza, amit nem adtál meg.
LLMAz alakot is elronthatja — hiányzó mező, sosem listázott címke, próza a JSON köré tekerve.
- Tíz dolgot kérdezni
- Jev
Tíz kérdés egy kérésben, párhuzamosan kiértékelve az állapotra.
LLMEgy zsúfolt prompt, vagy tíz hívás.
- Bizonytalanság
- Jev
Eloszlás és bizonyossági érték, minden Choice-on és Score-on.
LLMAmit a szöveg állít a saját biztosságáról.
A számok
Ezeket a TypeSafe teszi közzé; a gyártó saját adatai, nem a mi méréseink.
végponttól végpontig, szemben a határmodellek 3–329 másodpercével
gyorsabb a System One alakú kérdéseken
millió bemeneti tokenenként, a kimenet ingyenes
Amit mi mérni tudunk: az ezen az oldalon készült 14 futtatáson a medián oda-vissza idő 329 ms — és ezeknek a kéréseknek a többsége kilenc kérdést vitt, nem egyet.
Mikor az LLM a helyes eszköz
Legtöbbször akkor, ha nyelvre van szükséged. A Jevnek nincs véleménye, amit ki tudna fejteni, és nincs mondanivalója.
- Prózára van szükséged — válaszra, összefoglalóra, commit-üzenetre, a döntés magyarázatára a döntés helyett.
- Kódot kell írni, vagy tervet, vagy bármi nyitott végűt, ahol a válaszhalmaz a hívás előtt nem ismert.
- A lehetséges válaszok halmaza valóban korlátlan. Egy tetszőleges név kinyerése nem 255 lehetőség közüli Choice.
- Átvizsgálható gondolatmenetre van szükséged. A Jev ítéletet ad vissza, nem a mögötte lévő lépéseket.
- A mennyiség kicsi és az alak laza. Egy naponta kétszer lefutó újrapróbálkozó ciklust nem éri meg megtervezni.
A kettő jobban egészíti ki egymást, mint ahogy versengene. A TypeSafe megfogalmazásában a System One a gyors, strukturált ítélet, mögötte egy hagyományos modell System Two-ként — szűrd a bemenetet egy Noullal, irányíts egy Choice-szal, és add át azt, ami átjutott, annak a modellnek, amely tényleg tud írni.
Olvass tovább
Futtasd le magad az összehasonlítást
Illessz be egy jegyet, egy piszkozatot, egy promptot — bármit, ami köré egyébként elemző ciklust írnál —, és nézd, ahogy kilenc tipizált válasz visszaér egyetlen kérésből.
Játszótér megnyitása