Jev ile dil modeli

Aynı iş için yarışmıyorlar. Dil modeli yazar; Jev karar verir. Yararlı karşılaştırma hangisinin daha akıllı olduğu değil, kodunun yanıtla ne yapmak zorunda kalacağıdır — ve bu fark, çevresindeki programın nasıl yazıldığını değiştirecek kadar büyüktür.

Aynı karar, iki biçimde de yazılmış

Bir destek talebini dört kuyruktan birine yönlendir. Her bir yolun kodda sana neye mal olduğu şöyle.

Bir dil modeliyle

const res = await llm.chat({
  messages: [{ role: "user", content:
    `Route this ticket. Reply with JSON: {"queue": "Billing"|"Technical"|"Account"|"Sales"}
     Ticket: ${ticket}` }],
  response_format: { type: "json_object" }
});

let queue;
try {
  queue = JSON.parse(res.content).queue;        // may not be JSON
} catch {
  return retry();                               // ...so there is a retry
}
if (!QUEUES.includes(queue)) return retry();    // may be a queue you never had
// and no idea how close the call was

Jev ile

const { answers } = await jev.systemOne({
  state: ticket,
  model: "jev-latest",
  questions: { queue: { type: "choice", instructions:
    "Which team should own this ticket?", criteria: QUEUES } }
});

const { choice, probabilities, confidence } = answers.queue;
// choice is one of QUEUES. It cannot be anything else.
if (confidence < 0.7) return humanReview(ticket, probabilities);
route(choice);

Ele veren şey yeniden deneme döngüsüdür. İlk sürümde var, çünkü yanıt ayrıştırılamayabilecek ya da listede hiç olmayan bir kuyruğa ayrıştırılabilecek bir metin olarak gelir. İkincide yaşayacak yeri yoktur: yanıt yapısı gereği QUEUES içinden biridir. Onun yerini alan şey tümüyle başka bir daldır — bozuk çıktıda değil, model kararsız olduğunda tetiklenen bir dal.

İkinci sürümün görebildiği

O talep, gerçekten Jev’den geçirilmiş hâli. Kazanan şaşırtıcı değil; ikinci sıradaki, çıplak bir etiketin atacağı kısım.

“SSO girişimiz bu sabahki 4.2 sürümünden beri 500 döndürüyor. Ekipten kimse giremiyor. Chrome ve Safari’de aynı, iki farklı kiracıda.”
4 seçenek arasından %87 ile Teknik
%87 Teknik

Teknik %87 ile kazanıyor ama Hesap %13 tutuyor — ve bu doğru anlaşmazlıktır, çünkü bir SSO arızası gerçekten ikisinin sınırında durur. Çıplak bir etiket bunu gizlerdi. Yönlendirmenin yanlış olmasının bir bedeli varsa, eşik koyulacak sayı %13’tür.

Yan yana

Ne gönderirsin
Jev

Bir durum artı tipli soruların bir eşlemesi.

Dil modeli

Bir istem; şemayı ve kuralları genellikle düzyazı olarak taşır.

Ne geri gelir
Jev

Soru başına bir tipli yanıt, her seçenek için bir olasılıkla.

Dil modeli

Metin. Kibarca istediysen ve kip destekleniyorsa JSON.

Sonraki kod satırın
Jev

Yalnızca senin değerlerinden biri olabilecek bir değer üzerinde bir switch.

Dil modeli

Bir ayrıştırma, sonra bir doğrulama, sonra ikisinden biri başarısız olursa diye bir dal.

Nasıl başarısız olur
Jev

Metnin hakkında yanılabilir. Tanımlamadığın bir biçimi döndüremez.

Dil modeli

Biçim konusunda da yanılabilir — eksik alan, hiç listelemediğin bir etiket, JSON’un çevresine sarılmış düzyazı.

On şey sormak
Jev

Tek istekte on soru, duruma karşı paralel değerlendirilir.

Dil modeli

Tek kalabalık bir istem ya da on çağrı.

Belirsizlik
Jev

Her Choice ve Score’da bir dağılım ve bir güven değeri.

Dil modeli

Metnin kendi kesinliği hakkında iddia ettiği ne ise o.

Sayılar

Bunları TypeSafe yayımlıyor; satıcının kendi rakamları, bizim ölçümlerimiz değil.

70–500 ms

uçtan uca yanıt, öncü modellerdeki 3–329 s’ye karşı

40–200×

System One biçimli sorgularda daha hızlı

0,042 $

milyon girdi jetonu başına, çıktı ücretsiz

Bizim ölçebildiğimiz: bu site üzerinden yapılan 14 çalıştırmada ortanca gidiş dönüş süresi 329 msn — ve bu isteklerin çoğu bir değil dokuz soru taşıyordu.

Dil modelinin doğru araç olduğu durumlar

İhtiyacın dilse çoğu zaman. Jev’in açıklayabileceği bir görüşü ve söyleyecek bir sözü yoktur.

  • Düzyazıya ihtiyacın var — bir yanıt, bir özet, bir işleme iletisi, kararın kendisi yerine kararın açıklaması.
  • Yazılacak koda, bir plana ya da yanıt kümesinin çağrıdan önce bilinmediği açık uçlu bir şeye ihtiyacın var.
  • Olası yanıtlar kümesi gerçekten sınırsız. Rastgele bir adı çıkarmak, 255 seçenek üzerinde bir Choice değildir.
  • İnceleyebileceğin bir akıl yürütme zincirine ihtiyacın var. Jev bir yargı döndürür, ardındaki adımları değil.
  • Hacim düşük ve biçim gevşek. Günde iki kez çalıştırdığın bir yeniden deneme döngüsünü tasarımla ortadan kaldırmaya değmez.

İkisi yarışmaktan çok birbirini tamamlar. TypeSafe’in kendi çerçevelemesi, hızlı yapılandırılmış yargı için System One ve arkasında System Two olarak sıradan bir model — girdiyi bir Noul ile ele, bir Choice ile yönlendir ve ayakta kalanı gerçekten yazabilen modele devret.

Okumaya devam et

Karşılaştırmayı kendin çalıştır

Bir talep, bir taslak, bir istem yapıştır — başka türlü çevresine ayrıştırma döngüsü yazacağın her ne varsa — ve tek istekten dokuz tipli yanıtın geri gelişini izle.

Deneme alanını aç