Jev ile dil modeli
Aynı iş için yarışmıyorlar. Dil modeli yazar; Jev karar verir. Yararlı karşılaştırma hangisinin daha akıllı olduğu değil, kodunun yanıtla ne yapmak zorunda kalacağıdır — ve bu fark, çevresindeki programın nasıl yazıldığını değiştirecek kadar büyüktür.
Aynı karar, iki biçimde de yazılmış
Bir destek talebini dört kuyruktan birine yönlendir. Her bir yolun kodda sana neye mal olduğu şöyle.
Bir dil modeliyle
const res = await llm.chat({
messages: [{ role: "user", content:
`Route this ticket. Reply with JSON: {"queue": "Billing"|"Technical"|"Account"|"Sales"}
Ticket: ${ticket}` }],
response_format: { type: "json_object" }
});
let queue;
try {
queue = JSON.parse(res.content).queue; // may not be JSON
} catch {
return retry(); // ...so there is a retry
}
if (!QUEUES.includes(queue)) return retry(); // may be a queue you never had
// and no idea how close the call wasJev ile
const { answers } = await jev.systemOne({
state: ticket,
model: "jev-latest",
questions: { queue: { type: "choice", instructions:
"Which team should own this ticket?", criteria: QUEUES } }
});
const { choice, probabilities, confidence } = answers.queue;
// choice is one of QUEUES. It cannot be anything else.
if (confidence < 0.7) return humanReview(ticket, probabilities);
route(choice);Ele veren şey yeniden deneme döngüsüdür. İlk sürümde var, çünkü yanıt ayrıştırılamayabilecek ya da listede hiç olmayan bir kuyruğa ayrıştırılabilecek bir metin olarak gelir. İkincide yaşayacak yeri yoktur: yanıt yapısı gereği QUEUES içinden biridir. Onun yerini alan şey tümüyle başka bir daldır — bozuk çıktıda değil, model kararsız olduğunda tetiklenen bir dal.
İkinci sürümün görebildiği
O talep, gerçekten Jev’den geçirilmiş hâli. Kazanan şaşırtıcı değil; ikinci sıradaki, çıplak bir etiketin atacağı kısım.
Teknik %87 ile kazanıyor ama Hesap %13 tutuyor — ve bu doğru anlaşmazlıktır, çünkü bir SSO arızası gerçekten ikisinin sınırında durur. Çıplak bir etiket bunu gizlerdi. Yönlendirmenin yanlış olmasının bir bedeli varsa, eşik koyulacak sayı %13’tür.
Yan yana
- Ne gönderirsin
- Jev
Bir durum artı tipli soruların bir eşlemesi.
Dil modeliBir istem; şemayı ve kuralları genellikle düzyazı olarak taşır.
- Ne geri gelir
- Jev
Soru başına bir tipli yanıt, her seçenek için bir olasılıkla.
Dil modeliMetin. Kibarca istediysen ve kip destekleniyorsa JSON.
- Sonraki kod satırın
- Jev
Yalnızca senin değerlerinden biri olabilecek bir değer üzerinde bir switch.
Dil modeliBir ayrıştırma, sonra bir doğrulama, sonra ikisinden biri başarısız olursa diye bir dal.
- Nasıl başarısız olur
- Jev
Metnin hakkında yanılabilir. Tanımlamadığın bir biçimi döndüremez.
Dil modeliBiçim konusunda da yanılabilir — eksik alan, hiç listelemediğin bir etiket, JSON’un çevresine sarılmış düzyazı.
- On şey sormak
- Jev
Tek istekte on soru, duruma karşı paralel değerlendirilir.
Dil modeliTek kalabalık bir istem ya da on çağrı.
- Belirsizlik
- Jev
Her Choice ve Score’da bir dağılım ve bir güven değeri.
Dil modeliMetnin kendi kesinliği hakkında iddia ettiği ne ise o.
Sayılar
Bunları TypeSafe yayımlıyor; satıcının kendi rakamları, bizim ölçümlerimiz değil.
uçtan uca yanıt, öncü modellerdeki 3–329 s’ye karşı
System One biçimli sorgularda daha hızlı
milyon girdi jetonu başına, çıktı ücretsiz
Bizim ölçebildiğimiz: bu site üzerinden yapılan 14 çalıştırmada ortanca gidiş dönüş süresi 329 msn — ve bu isteklerin çoğu bir değil dokuz soru taşıyordu.
Dil modelinin doğru araç olduğu durumlar
İhtiyacın dilse çoğu zaman. Jev’in açıklayabileceği bir görüşü ve söyleyecek bir sözü yoktur.
- Düzyazıya ihtiyacın var — bir yanıt, bir özet, bir işleme iletisi, kararın kendisi yerine kararın açıklaması.
- Yazılacak koda, bir plana ya da yanıt kümesinin çağrıdan önce bilinmediği açık uçlu bir şeye ihtiyacın var.
- Olası yanıtlar kümesi gerçekten sınırsız. Rastgele bir adı çıkarmak, 255 seçenek üzerinde bir Choice değildir.
- İnceleyebileceğin bir akıl yürütme zincirine ihtiyacın var. Jev bir yargı döndürür, ardındaki adımları değil.
- Hacim düşük ve biçim gevşek. Günde iki kez çalıştırdığın bir yeniden deneme döngüsünü tasarımla ortadan kaldırmaya değmez.
İkisi yarışmaktan çok birbirini tamamlar. TypeSafe’in kendi çerçevelemesi, hızlı yapılandırılmış yargı için System One ve arkasında System Two olarak sıradan bir model — girdiyi bir Noul ile ele, bir Choice ile yönlendir ve ayakta kalanı gerçekten yazabilen modele devret.
Okumaya devam et
Karşılaştırmayı kendin çalıştır
Bir talep, bir taslak, bir istem yapıştır — başka türlü çevresine ayrıştırma döngüsü yazacağın her ne varsa — ve tek istekten dokuz tipli yanıtın geri gelişini izle.
Deneme alanını aç