Jev срещу голям езиков модел

Те не се борят за една и съща работа. Езиковият модел пише; Jev решава. Полезното сравнение не е кой е по-умен, а какво трябва да прави кодът ти с отговора — и тази разлика е достатъчно голяма, за да промени как е написана програмата наоколо.

Едно и също решение, написано по двата начина

Насочи заявка към поддръжката към една от четири опашки. Ето какво ти струва всяка страна в код.

С езиков модел

const res = await llm.chat({
  messages: [{ role: "user", content:
    `Route this ticket. Reply with JSON: {"queue": "Billing"|"Technical"|"Account"|"Sales"}
     Ticket: ${ticket}` }],
  response_format: { type: "json_object" }
});

let queue;
try {
  queue = JSON.parse(res.content).queue;        // may not be JSON
} catch {
  return retry();                               // ...so there is a retry
}
if (!QUEUES.includes(queue)) return retry();    // may be a queue you never had
// and no idea how close the call was

С Jev

const { answers } = await jev.systemOne({
  state: ticket,
  model: "jev-latest",
  questions: { queue: { type: "choice", instructions:
    "Which team should own this ticket?", criteria: QUEUES } }
});

const { choice, probabilities, confidence } = answers.queue;
// choice is one of QUEUES. It cannot be anything else.
if (confidence < 0.7) return humanReview(ticket, probabilities);
route(choice);

Цикълът за повторни опити е издайническият знак. В първата версия съществува, защото отговорът пристига като текст, който може да не се разбере или да се разбере като опашка, която никога не е била в списъка. Във втората няма къде да живее: отговорът по построение е един от QUEUES. Онова, което го замества, е съвсем друг клон — такъв, който се задейства, когато моделът е несигурен, а не когато изходът е развален.

Какво може да види втората версия

Същата заявка, прекарана през Jev наистина. Победителят не изненадва; вторият по ред е частта, която гол етикет би изхвърлил.

“Влизането ни през SSO връща 500 от издаването на 4.2 тази сутрин. Никой от екипа не може да влезе. Същото в Chrome и Safari, при двама различни наематели.”
Техническо при 87%, от 4 опции
87% Техническо

Техническо печели с 87%, но Акаунт държи 13% — и това е правилното несъгласие, защото отказ на SSO наистина стои на границата между двете. Гол етикет би го скрил. Ако маршрутизирането ти има цена при грешка, 13% е числото, на което да сложиш праг.

Едно до друго

Какво изпращаш
Jev

Едно състояние плюс карта от типизирани въпроси.

Езиков модел

Промпт, обикновено носещ схемата и правилата като проза.

Какво се връща
Jev

По един типизиран отговор на въпрос, с вероятност за всяка опция.

Езиков модел

Текст. JSON, ако си помолил любезно и режимът се поддържа.

Следващият ти ред код
Jev

Разклонение по стойност, която може да е само една от твоите.

Езиков модел

Разбор, после валидация, после клон за случая, в който някое от двете се е провалило.

Как се проваля
Jev

Може да сгреши за текста ти. Не може да върне форма, която не си определил.

Езиков модел

Може да сгреши и за формата — липсващо поле, етикет, който никога не си изброявал, проза, обвита около JSON-а.

Да питаш десет неща
Jev

Десет въпроса в една заявка, оценени спрямо състоянието паралелно.

Езиков модел

Един претъпкан промпт или десет повиквания.

Несигурност
Jev

Разпределение и стойност на увереност, при всеки Choice и Score.

Езиков модел

Каквото текстът твърди за собствената си сигурност.

Числата

TypeSafe ги публикува; това са данните на доставчика, не наши измервания.

70–500 ms

отговор от край до край, срещу 3–329 s за челните модели

40–200×

по-бързо при заявки с форма System One

$0,042

на милион входни токена, изходът е безплатен

Какво можем да измерим: през 14 изпълнения, направени през този сайт, медианното време за отиване и връщане е 329 мсек — и повечето от тези заявки носеха девет въпроса, не един.

Кога големият езиков модел е правилният инструмент

През повечето време, ако това, от което имаш нужда, е език. Jev няма мнение, което да обясни, и няма какво да каже.

  • Нуждаеш се от проза — отговор, резюме, съобщение към комит, обяснение на решението вместо самото решение.
  • Нуждаеш се от написан код, от план или от нещо отворено, където наборът от отговори не е известен преди повикването.
  • Наборът от възможни отговори наистина е неограничен. Извличането на произволно име не е Choice над 255 опции.
  • Нуждаеш се от верига разсъждения, която можеш да прегледаш. Jev връща преценка, не стъпките зад нея.
  • Обемът е малък, а формата — свободна. Цикъл за повторни опити, който пускаш два пъти дневно, не си струва да бъде проектиран настрани.

Двата се съчетават по-добре, отколкото се съревновават. Формулировката на TypeSafe е System One за бързата структурирана преценка и обикновен модел като System Two зад него — пресей входа с Noul, маршрутизирай с Choice и подай оцелялото на модела, който наистина може да пише.

Продължи да четеш

Направи сравнението сам

Постави заявка, чернова, промпт — каквото и да е, около което иначе би написал цикъл за разбор — и виж как девет типизирани отговора се връщат от една заявка.

Отвори площадката