Jev έναντι γλωσσικού μοντέλου

Δεν διεκδικούν την ίδια δουλειά. Το γλωσσικό μοντέλο γράφει· το Jev αποφασίζει. Η χρήσιμη σύγκριση δεν είναι ποιο είναι εξυπνότερο αλλά τι πρέπει να κάνει ο κώδικάς σου με την απάντηση — και αυτή η διαφορά είναι αρκετά μεγάλη ώστε να αλλάξει πώς γράφεται το γύρω πρόγραμμα.

Η ίδια απόφαση, γραμμένη και με τους δύο τρόπους

Δρομολόγησε ένα αίτημα υποστήριξης σε μία από τέσσερις ουρές. Να τι σου κοστίζει στην πράξη κάθε πλευρά σε κώδικα.

Με γλωσσικό μοντέλο

const res = await llm.chat({
  messages: [{ role: "user", content:
    `Route this ticket. Reply with JSON: {"queue": "Billing"|"Technical"|"Account"|"Sales"}
     Ticket: ${ticket}` }],
  response_format: { type: "json_object" }
});

let queue;
try {
  queue = JSON.parse(res.content).queue;        // may not be JSON
} catch {
  return retry();                               // ...so there is a retry
}
if (!QUEUES.includes(queue)) return retry();    // may be a queue you never had
// and no idea how close the call was

Με το Jev

const { answers } = await jev.systemOne({
  state: ticket,
  model: "jev-latest",
  questions: { queue: { type: "choice", instructions:
    "Which team should own this ticket?", criteria: QUEUES } }
});

const { choice, probabilities, confidence } = answers.queue;
// choice is one of QUEUES. It cannot be anything else.
if (confidence < 0.7) return humanReview(ticket, probabilities);
route(choice);

Ο βρόχος επανάληψης είναι το αποκαλυπτικό σημείο. Υπάρχει στην πρώτη εκδοχή επειδή η απάντηση φτάνει ως κείμενο που μπορεί να μην αναλυθεί ή να αναλυθεί σε ουρά που δεν ήταν ποτέ στη λίστα. Στη δεύτερη δεν έχει πού να ζήσει: η απάντηση είναι εξ ορισμού μία από τις QUEUES. Αυτό που τον αντικαθιστά είναι ένας εντελώς διαφορετικός κλάδος — ένας που ενεργοποιείται όταν το μοντέλο είναι αβέβαιο και όχι όταν η έξοδος είναι κακοσχηματισμένη.

Τι μπορεί να δει η δεύτερη εκδοχή

Το ίδιο αίτημα, περασμένο πραγματικά από το Jev. Ο νικητής δεν εκπλήσσει· ο δεύτερος είναι το κομμάτι που μια σκέτη ετικέτα θα είχε πετάξει.

“Η σύνδεση SSO βγάζει 500 από την κυκλοφορία της 4.2 σήμερα το πρωί. Κανείς στην ομάδα δεν μπορεί να μπει. Το ίδιο σε Chrome και Safari, σε δύο διαφορετικούς μισθωτές.”
Τεχνικό στο 87%, από 4 επιλογές
87% Τεχνικό

Το Τεχνικό κερδίζει με 87%, αλλά ο Λογαριασμός κρατά 13% — και αυτή είναι η σωστή διαφωνία, γιατί μια αποτυχία SSO πράγματι κάθεται στη γραμμή ανάμεσά τους. Μια σκέτη ετικέτα θα το είχε κρύψει. Αν η δρομολόγησή σου έχει κόστος όταν αστοχεί, το 13% είναι ο αριθμός πάνω στον οποίο βάζεις κατώφλι.

Δίπλα δίπλα

Τι στέλνεις
Jev

Μία κατάσταση συν έναν χάρτη τυποποιημένων ερωτήσεων.

Γλωσσικό μοντέλο

Μια προτροπή, που συνήθως κουβαλά το σχήμα και τους κανόνες ως πρόζα.

Τι επιστρέφει
Jev

Μία τυποποιημένη απάντηση ανά ερώτηση, με πιθανότητα για κάθε επιλογή.

Γλωσσικό μοντέλο

Κείμενο. JSON αν το ζήτησες ευγενικά και υποστηρίζεται η λειτουργία.

Η επόμενη γραμμή κώδικά σου
Jev

Μια διακλάδωση πάνω σε τιμή που μπορεί να είναι μόνο μία από τις δικές σου.

Γλωσσικό μοντέλο

Μια ανάλυση, μετά μια επικύρωση, μετά ένας κλάδος για όταν αποτύχει κάποια από τις δύο.

Πώς αποτυγχάνει
Jev

Μπορεί να σφάλλει ως προς το κείμενό σου. Δεν μπορεί να επιστρέψει μορφή που δεν όρισες.

Γλωσσικό μοντέλο

Μπορεί να σφάλλει και ως προς τη μορφή — πεδίο που λείπει, ετικέτα που δεν κατέγραψες ποτέ, πρόζα τυλιγμένη γύρω από το JSON.

Να ρωτήσεις δέκα πράγματα
Jev

Δέκα ερωτήσεις σε ένα αίτημα, αξιολογημένες πάνω στην κατάσταση παράλληλα.

Γλωσσικό μοντέλο

Μία παραφορτωμένη προτροπή ή δέκα κλήσεις.

Αβεβαιότητα
Jev

Μια κατανομή και μια τιμή βεβαιότητας, σε κάθε Choice και Score.

Γλωσσικό μοντέλο

Ό,τι ισχυρίζεται το κείμενο για τη δική του βεβαιότητα.

Οι αριθμοί

Η TypeSafe τους δημοσιεύει· είναι τα δικά της νούμερα, όχι δικές μας μετρήσεις.

70–500 ms

απόκριση από άκρο σε άκρο, έναντι 3–329 s για τα μοντέλα αιχμής

40–200×

ταχύτερο σε ερωτήματα μορφής System One

0,042 $

ανά εκατομμύριο εισερχόμενα token, η έξοδος δωρεάν

Τι μπορούμε να μετρήσουμε: σε 14 εκτελέσεις μέσα από αυτόν τον ιστότοπο, ο διάμεσος χρόνος πλήρους διαδρομής είναι 329 ms — και τα περισσότερα από αυτά τα αιτήματα κουβαλούσαν εννέα ερωτήσεις, όχι μία.

Πότε το γλωσσικό μοντέλο είναι το σωστό εργαλείο

Τις περισσότερες φορές, αν αυτό που χρειάζεσαι είναι γλώσσα. Το Jev δεν έχει άποψη που να μπορεί να εξηγήσει, ούτε κάτι να πει.

  • Χρειάζεσαι πρόζα — μια απάντηση, μια περίληψη, ένα μήνυμα commit, μια εξήγηση της απόφασης αντί για την ίδια την απόφαση.
  • Χρειάζεσαι κώδικα γραμμένο, ή ένα σχέδιο, ή οτιδήποτε ανοιχτό όπου το σύνολο των απαντήσεων δεν είναι γνωστό πριν την κλήση.
  • Το σύνολο των πιθανών απαντήσεων είναι πραγματικά απεριόριστο. Η εξαγωγή ενός αυθαίρετου ονόματος δεν είναι Choice πάνω σε 255 επιλογές.
  • Χρειάζεσαι μια αλυσίδα συλλογισμού που μπορείς να επιθεωρήσεις. Το Jev επιστρέφει κρίση, όχι τα βήματα πίσω από αυτήν.
  • Ο όγκος είναι μικρός και η μορφή χαλαρή. Ένας βρόχος επανάληψης που τρέχεις δύο φορές τη μέρα δεν αξίζει να σχεδιαστεί εκτός.

Τα δύο συνδυάζονται καλύτερα από όσο ανταγωνίζονται. Η ίδια η TypeSafe το θέτει ως System One για τη γρήγορη δομημένη κρίση και ένα συνηθισμένο μοντέλο ως System Two πίσω του — φιλτράρισε την είσοδο με ένα Noul, δρομολόγησε με ένα Choice, και παράδωσε ό,τι επιβίωσε στο μοντέλο που μπορεί πραγματικά να γράψει.

Συνέχισε να διαβάζεις

Τρέξε τη σύγκριση μόνος σου

Επικόλλησε ένα αίτημα, ένα προσχέδιο, μια προτροπή — οτιδήποτε γύρω από το οποίο αλλιώς θα έγραφες βρόχο ανάλυσης — και δες εννέα τυποποιημένες απαντήσεις να επιστρέφουν από ένα αίτημα.

Άνοιξε το πεδίο δοκιμών