Jev срещу голям езиков модел
Те не се борят за една и съща работа. Езиковият модел пише; Jev решава. Полезното сравнение не е кой е по-умен, а какво трябва да прави кодът ти с отговора — и тази разлика е достатъчно голяма, за да промени как е написана програмата наоколо.
Едно и също решение, написано по двата начина
Насочи заявка към поддръжката към една от четири опашки. Ето какво ти струва всяка страна в код.
С езиков модел
const res = await llm.chat({
messages: [{ role: "user", content:
`Route this ticket. Reply with JSON: {"queue": "Billing"|"Technical"|"Account"|"Sales"}
Ticket: ${ticket}` }],
response_format: { type: "json_object" }
});
let queue;
try {
queue = JSON.parse(res.content).queue; // may not be JSON
} catch {
return retry(); // ...so there is a retry
}
if (!QUEUES.includes(queue)) return retry(); // may be a queue you never had
// and no idea how close the call wasС Jev
const { answers } = await jev.systemOne({
state: ticket,
model: "jev-latest",
questions: { queue: { type: "choice", instructions:
"Which team should own this ticket?", criteria: QUEUES } }
});
const { choice, probabilities, confidence } = answers.queue;
// choice is one of QUEUES. It cannot be anything else.
if (confidence < 0.7) return humanReview(ticket, probabilities);
route(choice);Цикълът за повторни опити е издайническият знак. В първата версия съществува, защото отговорът пристига като текст, който може да не се разбере или да се разбере като опашка, която никога не е била в списъка. Във втората няма къде да живее: отговорът по построение е един от QUEUES. Онова, което го замества, е съвсем друг клон — такъв, който се задейства, когато моделът е несигурен, а не когато изходът е развален.
Какво може да види втората версия
Същата заявка, прекарана през Jev наистина. Победителят не изненадва; вторият по ред е частта, която гол етикет би изхвърлил.
Техническо печели с 87%, но Акаунт държи 13% — и това е правилното несъгласие, защото отказ на SSO наистина стои на границата между двете. Гол етикет би го скрил. Ако маршрутизирането ти има цена при грешка, 13% е числото, на което да сложиш праг.
Едно до друго
- Какво изпращаш
- Jev
Едно състояние плюс карта от типизирани въпроси.
Езиков моделПромпт, обикновено носещ схемата и правилата като проза.
- Какво се връща
- Jev
По един типизиран отговор на въпрос, с вероятност за всяка опция.
Езиков моделТекст. JSON, ако си помолил любезно и режимът се поддържа.
- Следващият ти ред код
- Jev
Разклонение по стойност, която може да е само една от твоите.
Езиков моделРазбор, после валидация, после клон за случая, в който някое от двете се е провалило.
- Как се проваля
- Jev
Може да сгреши за текста ти. Не може да върне форма, която не си определил.
Езиков моделМоже да сгреши и за формата — липсващо поле, етикет, който никога не си изброявал, проза, обвита около JSON-а.
- Да питаш десет неща
- Jev
Десет въпроса в една заявка, оценени спрямо състоянието паралелно.
Езиков моделЕдин претъпкан промпт или десет повиквания.
- Несигурност
- Jev
Разпределение и стойност на увереност, при всеки Choice и Score.
Езиков моделКаквото текстът твърди за собствената си сигурност.
Числата
TypeSafe ги публикува; това са данните на доставчика, не наши измервания.
отговор от край до край, срещу 3–329 s за челните модели
по-бързо при заявки с форма System One
на милион входни токена, изходът е безплатен
Какво можем да измерим: през 14 изпълнения, направени през този сайт, медианното време за отиване и връщане е 329 мсек — и повечето от тези заявки носеха девет въпроса, не един.
Кога големият езиков модел е правилният инструмент
През повечето време, ако това, от което имаш нужда, е език. Jev няма мнение, което да обясни, и няма какво да каже.
- Нуждаеш се от проза — отговор, резюме, съобщение към комит, обяснение на решението вместо самото решение.
- Нуждаеш се от написан код, от план или от нещо отворено, където наборът от отговори не е известен преди повикването.
- Наборът от възможни отговори наистина е неограничен. Извличането на произволно име не е Choice над 255 опции.
- Нуждаеш се от верига разсъждения, която можеш да прегледаш. Jev връща преценка, не стъпките зад нея.
- Обемът е малък, а формата — свободна. Цикъл за повторни опити, който пускаш два пъти дневно, не си струва да бъде проектиран настрани.
Двата се съчетават по-добре, отколкото се съревновават. Формулировката на TypeSafe е System One за бързата структурирана преценка и обикновен модел като System Two зад него — пресей входа с Noul, маршрутизирай с Choice и подай оцелялото на модела, който наистина може да пише.
Продължи да четеш
Направи сравнението сам
Постави заявка, чернова, промпт — каквото и да е, около което иначе би написал цикъл за разбор — и виж как девет типизирани отговора се връщат от една заявка.
Отвори площадката