Jev lawan model bahasa

Kedua-duanya tidak berebut kerja yang sama. Model bahasa menulis; Jev memutuskan. Perbandingan yang berguna bukan mana yang lebih pintar tetapi apa yang perlu dilakukan kod anda dengan jawapannya — dan beza itu cukup besar untuk mengubah cara program di sekelilingnya ditulis.

Keputusan yang sama, ditulis dengan kedua-dua cara

Halakan satu tiket sokongan ke salah satu daripada empat baris gilir. Inilah kos sebenar setiap belah dalam bentuk kod.

Dengan model bahasa

const res = await llm.chat({
  messages: [{ role: "user", content:
    `Route this ticket. Reply with JSON: {"queue": "Billing"|"Technical"|"Account"|"Sales"}
     Ticket: ${ticket}` }],
  response_format: { type: "json_object" }
});

let queue;
try {
  queue = JSON.parse(res.content).queue;        // may not be JSON
} catch {
  return retry();                               // ...so there is a retry
}
if (!QUEUES.includes(queue)) return retry();    // may be a queue you never had
// and no idea how close the call was

Dengan Jev

const { answers } = await jev.systemOne({
  state: ticket,
  model: "jev-latest",
  questions: { queue: { type: "choice", instructions:
    "Which team should own this ticket?", criteria: QUEUES } }
});

const { choice, probabilities, confidence } = answers.queue;
// choice is one of QUEUES. It cannot be anything else.
if (confidence < 0.7) return humanReview(ticket, probabilities);
route(choice);

Gelung cubaan semula itulah petunjuknya. Ia wujud dalam versi pertama kerana jawapannya tiba sebagai teks yang mungkin gagal dihurai, atau terhurai menjadi baris gilir yang tidak pernah ada dalam senarai. Dalam versi kedua ia tiada tempat untuk hidup: jawapannya secara binaan ialah salah satu daripada QUEUES. Yang menggantikannya ialah cabang yang berlainan sama sekali — cabang yang menyala apabila model tidak pasti, bukan apabila keluarannya rosak.

Apa yang boleh dilihat versi kedua

Tiket itu, benar-benar dijalankan melalui Jev. Pemenangnya tidak mengejutkan; tempat keduanya ialah bahagian yang akan dibuang oleh label kosong.

“Log masuk SSO kami mengeluarkan 500 sejak keluaran 4.2 pagi ini. Tiada sesiapa dalam pasukan boleh masuk. Sama pada Chrome dan Safari, dua penyewa berbeza.”
Teknikal pada 87%, daripada 4 pilihan
87% Teknikal

Teknikal menang pada 87%, tetapi Akaun memegang 13% — dan itu percanggahan yang betul, kerana kegagalan SSO memang duduk di sempadan antara kedua-duanya. Label kosong akan menyembunyikannya. Jika penghalaan anda ada kos apabila tersilap, 13% ialah nombor untuk diberi ambang.

Bersebelahan

Apa yang anda hantar
Jev

Satu keadaan serta peta soalan bertaip.

Model bahasa

Satu gesaan, biasanya membawa skema dan peraturannya sebagai prosa.

Apa yang kembali
Jev

Satu jawapan bertaip bagi setiap soalan, dengan kebarangkalian bagi setiap pilihan.

Model bahasa

Teks. JSON jika anda minta elok-elok dan modnya disokong.

Baris kod anda yang seterusnya
Jev

Satu suis pada nilai yang hanya boleh menjadi milik anda.

Model bahasa

Satu penghuraian, kemudian pengesahan, kemudian cabang untuk ketika salah satunya gagal.

Cara ia gagal
Jev

Ia boleh tersilap tentang teks anda. Ia tidak boleh memulangkan bentuk yang anda tidak tentukan.

Model bahasa

Ia juga boleh tersilap tentang bentuknya — medan yang hilang, label yang tidak pernah anda senaraikan, prosa yang membalut JSON itu.

Bertanya sepuluh perkara
Jev

Sepuluh soalan dalam satu permintaan, dinilai terhadap keadaan secara selari.

Model bahasa

Satu gesaan yang sesak, atau sepuluh panggilan.

Ketidakpastian
Jev

Satu taburan dan satu nilai keyakinan, pada setiap Choice dan Score.

Model bahasa

Apa sahaja yang didakwa teks itu tentang kepastiannya sendiri.

Angkanya

TypeSafe menerbitkannya; itu angka vendor sendiri, bukan ukuran kami.

70–500 ms

respons hujung ke hujung, berbanding 3–329 s bagi model barisan hadapan

40–200×

lebih pantas bagi pertanyaan berbentuk System One

$0.042

setiap juta token masukan, keluaran percuma

Apa yang boleh kami ukur: merentas 14 larian yang dibuat melalui laman ini, masa pergi balik median ialah 329 ms — dan kebanyakan permintaan itu membawa sembilan soalan, bukan satu.

Bila model bahasa ialah alat yang betul

Kebanyakan masa, jika yang anda perlukan ialah bahasa. Jev tiada pendapat yang boleh ia jelaskan dan tiada apa-apa untuk dikatakan.

  • Anda perlukan prosa — satu balasan, ringkasan, mesej commit, penjelasan tentang keputusan dan bukan keputusannya.
  • Anda perlukan kod ditulis, atau satu pelan, atau apa-apa yang terbuka di mana set jawapannya tidak diketahui sebelum panggilan.
  • Set jawapan yang mungkin benar-benar tidak terbatas. Mengeluarkan nama sembarangan bukanlah Choice atas 255 pilihan.
  • Anda perlukan rantaian penaakulan yang boleh diperiksa. Jev memulangkan pertimbangan, bukan langkah di sebaliknya.
  • Jumlahnya rendah dan bentuknya longgar. Gelung cubaan semula yang anda jalankan dua kali sehari tidak berbaloi direka bentuk supaya hilang.

Kedua-duanya lebih baik digabungkan daripada dilagakan. Rangka TypeSafe sendiri ialah System One untuk pertimbangan berstruktur yang pantas dan model biasa sebagai System Two di belakangnya — tapis input dengan Noul, halakan dengan Choice, dan serahkan yang terselamat kepada model yang memang boleh menulis.

Terus membaca

Jalankan perbandingan itu sendiri

Tampal satu tiket, satu draf, satu gesaan — apa sahaja yang selainnya akan anda kelilingi dengan gelung penghuraian — dan lihat sembilan jawapan bertaip kembali daripada satu permintaan.

Buka taman permainan