Jev έναντι γλωσσικού μοντέλου
Δεν διεκδικούν την ίδια δουλειά. Το γλωσσικό μοντέλο γράφει· το Jev αποφασίζει. Η χρήσιμη σύγκριση δεν είναι ποιο είναι εξυπνότερο αλλά τι πρέπει να κάνει ο κώδικάς σου με την απάντηση — και αυτή η διαφορά είναι αρκετά μεγάλη ώστε να αλλάξει πώς γράφεται το γύρω πρόγραμμα.
Η ίδια απόφαση, γραμμένη και με τους δύο τρόπους
Δρομολόγησε ένα αίτημα υποστήριξης σε μία από τέσσερις ουρές. Να τι σου κοστίζει στην πράξη κάθε πλευρά σε κώδικα.
Με γλωσσικό μοντέλο
const res = await llm.chat({
messages: [{ role: "user", content:
`Route this ticket. Reply with JSON: {"queue": "Billing"|"Technical"|"Account"|"Sales"}
Ticket: ${ticket}` }],
response_format: { type: "json_object" }
});
let queue;
try {
queue = JSON.parse(res.content).queue; // may not be JSON
} catch {
return retry(); // ...so there is a retry
}
if (!QUEUES.includes(queue)) return retry(); // may be a queue you never had
// and no idea how close the call wasΜε το Jev
const { answers } = await jev.systemOne({
state: ticket,
model: "jev-latest",
questions: { queue: { type: "choice", instructions:
"Which team should own this ticket?", criteria: QUEUES } }
});
const { choice, probabilities, confidence } = answers.queue;
// choice is one of QUEUES. It cannot be anything else.
if (confidence < 0.7) return humanReview(ticket, probabilities);
route(choice);Ο βρόχος επανάληψης είναι το αποκαλυπτικό σημείο. Υπάρχει στην πρώτη εκδοχή επειδή η απάντηση φτάνει ως κείμενο που μπορεί να μην αναλυθεί ή να αναλυθεί σε ουρά που δεν ήταν ποτέ στη λίστα. Στη δεύτερη δεν έχει πού να ζήσει: η απάντηση είναι εξ ορισμού μία από τις QUEUES. Αυτό που τον αντικαθιστά είναι ένας εντελώς διαφορετικός κλάδος — ένας που ενεργοποιείται όταν το μοντέλο είναι αβέβαιο και όχι όταν η έξοδος είναι κακοσχηματισμένη.
Τι μπορεί να δει η δεύτερη εκδοχή
Το ίδιο αίτημα, περασμένο πραγματικά από το Jev. Ο νικητής δεν εκπλήσσει· ο δεύτερος είναι το κομμάτι που μια σκέτη ετικέτα θα είχε πετάξει.
Το Τεχνικό κερδίζει με 87%, αλλά ο Λογαριασμός κρατά 13% — και αυτή είναι η σωστή διαφωνία, γιατί μια αποτυχία SSO πράγματι κάθεται στη γραμμή ανάμεσά τους. Μια σκέτη ετικέτα θα το είχε κρύψει. Αν η δρομολόγησή σου έχει κόστος όταν αστοχεί, το 13% είναι ο αριθμός πάνω στον οποίο βάζεις κατώφλι.
Δίπλα δίπλα
- Τι στέλνεις
- Jev
Μία κατάσταση συν έναν χάρτη τυποποιημένων ερωτήσεων.
Γλωσσικό μοντέλοΜια προτροπή, που συνήθως κουβαλά το σχήμα και τους κανόνες ως πρόζα.
- Τι επιστρέφει
- Jev
Μία τυποποιημένη απάντηση ανά ερώτηση, με πιθανότητα για κάθε επιλογή.
Γλωσσικό μοντέλοΚείμενο. JSON αν το ζήτησες ευγενικά και υποστηρίζεται η λειτουργία.
- Η επόμενη γραμμή κώδικά σου
- Jev
Μια διακλάδωση πάνω σε τιμή που μπορεί να είναι μόνο μία από τις δικές σου.
Γλωσσικό μοντέλοΜια ανάλυση, μετά μια επικύρωση, μετά ένας κλάδος για όταν αποτύχει κάποια από τις δύο.
- Πώς αποτυγχάνει
- Jev
Μπορεί να σφάλλει ως προς το κείμενό σου. Δεν μπορεί να επιστρέψει μορφή που δεν όρισες.
Γλωσσικό μοντέλοΜπορεί να σφάλλει και ως προς τη μορφή — πεδίο που λείπει, ετικέτα που δεν κατέγραψες ποτέ, πρόζα τυλιγμένη γύρω από το JSON.
- Να ρωτήσεις δέκα πράγματα
- Jev
Δέκα ερωτήσεις σε ένα αίτημα, αξιολογημένες πάνω στην κατάσταση παράλληλα.
Γλωσσικό μοντέλοΜία παραφορτωμένη προτροπή ή δέκα κλήσεις.
- Αβεβαιότητα
- Jev
Μια κατανομή και μια τιμή βεβαιότητας, σε κάθε Choice και Score.
Γλωσσικό μοντέλοΌ,τι ισχυρίζεται το κείμενο για τη δική του βεβαιότητα.
Οι αριθμοί
Η TypeSafe τους δημοσιεύει· είναι τα δικά της νούμερα, όχι δικές μας μετρήσεις.
απόκριση από άκρο σε άκρο, έναντι 3–329 s για τα μοντέλα αιχμής
ταχύτερο σε ερωτήματα μορφής System One
ανά εκατομμύριο εισερχόμενα token, η έξοδος δωρεάν
Τι μπορούμε να μετρήσουμε: σε 14 εκτελέσεις μέσα από αυτόν τον ιστότοπο, ο διάμεσος χρόνος πλήρους διαδρομής είναι 329 ms — και τα περισσότερα από αυτά τα αιτήματα κουβαλούσαν εννέα ερωτήσεις, όχι μία.
Πότε το γλωσσικό μοντέλο είναι το σωστό εργαλείο
Τις περισσότερες φορές, αν αυτό που χρειάζεσαι είναι γλώσσα. Το Jev δεν έχει άποψη που να μπορεί να εξηγήσει, ούτε κάτι να πει.
- Χρειάζεσαι πρόζα — μια απάντηση, μια περίληψη, ένα μήνυμα commit, μια εξήγηση της απόφασης αντί για την ίδια την απόφαση.
- Χρειάζεσαι κώδικα γραμμένο, ή ένα σχέδιο, ή οτιδήποτε ανοιχτό όπου το σύνολο των απαντήσεων δεν είναι γνωστό πριν την κλήση.
- Το σύνολο των πιθανών απαντήσεων είναι πραγματικά απεριόριστο. Η εξαγωγή ενός αυθαίρετου ονόματος δεν είναι Choice πάνω σε 255 επιλογές.
- Χρειάζεσαι μια αλυσίδα συλλογισμού που μπορείς να επιθεωρήσεις. Το Jev επιστρέφει κρίση, όχι τα βήματα πίσω από αυτήν.
- Ο όγκος είναι μικρός και η μορφή χαλαρή. Ένας βρόχος επανάληψης που τρέχεις δύο φορές τη μέρα δεν αξίζει να σχεδιαστεί εκτός.
Τα δύο συνδυάζονται καλύτερα από όσο ανταγωνίζονται. Η ίδια η TypeSafe το θέτει ως System One για τη γρήγορη δομημένη κρίση και ένα συνηθισμένο μοντέλο ως System Two πίσω του — φιλτράρισε την είσοδο με ένα Noul, δρομολόγησε με ένα Choice, και παράδωσε ό,τι επιβίωσε στο μοντέλο που μπορεί πραγματικά να γράψει.
Συνέχισε να διαβάζεις
Τρέξε τη σύγκριση μόνος σου
Επικόλλησε ένα αίτημα, ένα προσχέδιο, μια προτροπή — οτιδήποτε γύρω από το οποίο αλλιώς θα έγραφες βρόχο ανάλυσης — και δες εννέα τυποποιημένες απαντήσεις να επιστρέφουν από ένα αίτημα.
Άνοιξε το πεδίο δοκιμών