Jev lawan model bahasa
Kedua-duanya tidak berebut kerja yang sama. Model bahasa menulis; Jev memutuskan. Perbandingan yang berguna bukan mana yang lebih pintar tetapi apa yang perlu dilakukan kod anda dengan jawapannya — dan beza itu cukup besar untuk mengubah cara program di sekelilingnya ditulis.
Keputusan yang sama, ditulis dengan kedua-dua cara
Halakan satu tiket sokongan ke salah satu daripada empat baris gilir. Inilah kos sebenar setiap belah dalam bentuk kod.
Dengan model bahasa
const res = await llm.chat({
messages: [{ role: "user", content:
`Route this ticket. Reply with JSON: {"queue": "Billing"|"Technical"|"Account"|"Sales"}
Ticket: ${ticket}` }],
response_format: { type: "json_object" }
});
let queue;
try {
queue = JSON.parse(res.content).queue; // may not be JSON
} catch {
return retry(); // ...so there is a retry
}
if (!QUEUES.includes(queue)) return retry(); // may be a queue you never had
// and no idea how close the call wasDengan Jev
const { answers } = await jev.systemOne({
state: ticket,
model: "jev-latest",
questions: { queue: { type: "choice", instructions:
"Which team should own this ticket?", criteria: QUEUES } }
});
const { choice, probabilities, confidence } = answers.queue;
// choice is one of QUEUES. It cannot be anything else.
if (confidence < 0.7) return humanReview(ticket, probabilities);
route(choice);Gelung cubaan semula itulah petunjuknya. Ia wujud dalam versi pertama kerana jawapannya tiba sebagai teks yang mungkin gagal dihurai, atau terhurai menjadi baris gilir yang tidak pernah ada dalam senarai. Dalam versi kedua ia tiada tempat untuk hidup: jawapannya secara binaan ialah salah satu daripada QUEUES. Yang menggantikannya ialah cabang yang berlainan sama sekali — cabang yang menyala apabila model tidak pasti, bukan apabila keluarannya rosak.
Apa yang boleh dilihat versi kedua
Tiket itu, benar-benar dijalankan melalui Jev. Pemenangnya tidak mengejutkan; tempat keduanya ialah bahagian yang akan dibuang oleh label kosong.
Teknikal menang pada 87%, tetapi Akaun memegang 13% — dan itu percanggahan yang betul, kerana kegagalan SSO memang duduk di sempadan antara kedua-duanya. Label kosong akan menyembunyikannya. Jika penghalaan anda ada kos apabila tersilap, 13% ialah nombor untuk diberi ambang.
Bersebelahan
- Apa yang anda hantar
- Jev
Satu keadaan serta peta soalan bertaip.
Model bahasaSatu gesaan, biasanya membawa skema dan peraturannya sebagai prosa.
- Apa yang kembali
- Jev
Satu jawapan bertaip bagi setiap soalan, dengan kebarangkalian bagi setiap pilihan.
Model bahasaTeks. JSON jika anda minta elok-elok dan modnya disokong.
- Baris kod anda yang seterusnya
- Jev
Satu suis pada nilai yang hanya boleh menjadi milik anda.
Model bahasaSatu penghuraian, kemudian pengesahan, kemudian cabang untuk ketika salah satunya gagal.
- Cara ia gagal
- Jev
Ia boleh tersilap tentang teks anda. Ia tidak boleh memulangkan bentuk yang anda tidak tentukan.
Model bahasaIa juga boleh tersilap tentang bentuknya — medan yang hilang, label yang tidak pernah anda senaraikan, prosa yang membalut JSON itu.
- Bertanya sepuluh perkara
- Jev
Sepuluh soalan dalam satu permintaan, dinilai terhadap keadaan secara selari.
Model bahasaSatu gesaan yang sesak, atau sepuluh panggilan.
- Ketidakpastian
- Jev
Satu taburan dan satu nilai keyakinan, pada setiap Choice dan Score.
Model bahasaApa sahaja yang didakwa teks itu tentang kepastiannya sendiri.
Angkanya
TypeSafe menerbitkannya; itu angka vendor sendiri, bukan ukuran kami.
respons hujung ke hujung, berbanding 3–329 s bagi model barisan hadapan
lebih pantas bagi pertanyaan berbentuk System One
setiap juta token masukan, keluaran percuma
Apa yang boleh kami ukur: merentas 14 larian yang dibuat melalui laman ini, masa pergi balik median ialah 329 ms — dan kebanyakan permintaan itu membawa sembilan soalan, bukan satu.
Bila model bahasa ialah alat yang betul
Kebanyakan masa, jika yang anda perlukan ialah bahasa. Jev tiada pendapat yang boleh ia jelaskan dan tiada apa-apa untuk dikatakan.
- Anda perlukan prosa — satu balasan, ringkasan, mesej commit, penjelasan tentang keputusan dan bukan keputusannya.
- Anda perlukan kod ditulis, atau satu pelan, atau apa-apa yang terbuka di mana set jawapannya tidak diketahui sebelum panggilan.
- Set jawapan yang mungkin benar-benar tidak terbatas. Mengeluarkan nama sembarangan bukanlah Choice atas 255 pilihan.
- Anda perlukan rantaian penaakulan yang boleh diperiksa. Jev memulangkan pertimbangan, bukan langkah di sebaliknya.
- Jumlahnya rendah dan bentuknya longgar. Gelung cubaan semula yang anda jalankan dua kali sehari tidak berbaloi direka bentuk supaya hilang.
Kedua-duanya lebih baik digabungkan daripada dilagakan. Rangka TypeSafe sendiri ialah System One untuk pertimbangan berstruktur yang pantas dan model biasa sebagai System Two di belakangnya — tapis input dengan Noul, halakan dengan Choice, dan serahkan yang terselamat kepada model yang memang boleh menulis.
Terus membaca
Jalankan perbandingan itu sendiri
Tampal satu tiket, satu draf, satu gesaan — apa sahaja yang selainnya akan anda kelilingi dengan gelung penghuraian — dan lihat sembilan jawapan bertaip kembali daripada satu permintaan.
Buka taman permainan