Στις 22 Σεπτεμβρίου, η OpenAI ανακοίνωσε υποδιπλασιασμό των τιμών για τα Sol και Luna, τα μοντέλα καθημερινής εργασίας της. Το ποσοστό υπολογίζεται σε προωθητικές τιμές, και το κόστος ενός φακέλου που επεξεργάζεται μένει να μετρηθεί.
Να διαβάζουμε τα ποσά πριν από το ποσοστό
Ανά εκατομμύριο tokens, το Sol πέφτει από 4 σε 2 δολάρια στην είσοδο και από 20 σε 10 δολάρια στην έξοδο. Το Luna πέφτει από 0,20 σε 0,10 δολάρια στην είσοδο και από 1,20 σε 0,50 δολάρια στην έξοδο. Η OpenAI ανακοινώνει «50 % φθηνότερα» και για τα δύο. Ο υπολογισμός είναι σωστός για το Sol και για την είσοδο του Luna, όμως η έξοδος του Luna πέφτει περίπου 58 %.
Οι τιμές εκκίνησης είναι αυτές των προωθητικών προσφορών του GPT-5.6, όχι οι τιμές καταλόγου του, όπως διευκρινίζει η OpenAI στο δικό της κείμενο. Η εταιρεία αποδίδει τη μείωση σε βελτιώσεις στην προσωρινή αποθήκευση και στην εξαγωγή συμπερασμάτων, με έκπτωση 90 % στην ανάγνωση εισόδων που έχουν ήδη αποθηκευτεί στη μνήμη.
Από την κυκλοφορία, η σελίδα φέρει ενημέρωση της 29ης Σεπτεμβρίου που παραπέμπει σε νεότερο μοντέλο, το GPT-6.1 Sol. Η ανακοίνωση δεν λέει τίποτε περισσότερο στο κείμενο που διάβασα: θα πρέπει επομένως να ελεγχθεί αν οι τιμές και οι συγκρίσεις αυτού του άρθρου ισχύουν ακόμη για το νέο μοντέλο.
Το κόστος μιας εργασίας, όπως το μετρά ο πάροχος
Η OpenAI προτιμά να μιλά για κόστος ανά εργασία. Στο AutomationBench, ένα τεστ επιχειρησιακών ροών εργασίας, το Sol στη ρύθμιση «xhigh» συγκεντρώνει 33,2 % με 0,27 δολάρια ανά εργασία, έναντι 26,9 % για το Claude Opus 5 στο μέγιστο, με κόστος που η εταιρεία υπολογίζει σε περισσότερο από έντεκα φορές εκείνο του Sol. Στο τεστ DeepSWE, αφιερωμένο στη μηχανική λογισμικού, το Sol παρουσιάζεται με 68,8 %, λίγο πάνω από μία μονάδα από την καλύτερη βαθμολογία του Claude Fable 5.
Οι αριθμοί αυτοί προέρχονται από την OpenAI, η οποία επέλεξε τις δοκιμασίες και τις ρυθμίσεις που συγκρίθηκαν. Αναφέρει ότι παίρνει τις βαθμολογίες των ανταγωνιστών από δημόσιες εκθέσεις και ότι χρησιμοποίησε εκείνες του Claude Fable 5 όταν εκείνες της έκδοσης 5.1 δεν ήταν διαθέσιμες. Οι βαθμολογίες της οικογένειας σε αυτό το επιχειρησιακό τεστ παραμένουν άλλωστε μέτριες σε απόλυτη τιμή.
Ένα επίπεδο για κάθε εργασία, να δοκιμάζεται αντί να υποτίθεται
Όσα ακολουθούν είναι ανάγνωση του συγγραφέα. Μια εργασία διαλογής, όπως η εντόπιση ενός ελλιπούς φακέλου, δεν απαιτεί την ίδια δαπάνη με μια ανάλυση προέλευσης ή ένα κείμενο που δεσμεύει τον Οίκο. Μπορεί λοιπόν να φανταστεί κανείς ένα οικονομικό μοντέλο για την πρώτη και ένα πιο απαιτητικό για τις υπόλοιπες. Το όνομα του μοντέλου δεν αποδεικνύει ότι ταιριάζει στην εργασία.
Μια ομάδα θα έκανε καλά να ορίσει τι περιέχει ένα αποδεκτό αποτέλεσμα πριν επιλέξει: τις απαραίτητες πληροφορίες, τα ανεκτά λάθη, τις περιπτώσεις που ανεβαίνουν σε έναν άνθρωπο. Η παράδοση της σκυτάλης μετρά όσο και η τιμολόγηση. Μια φθηνή πρώτη επεξεργασία που σβήνει τις πηγές της ή κρύβει τις αμφιβολίες της μεταβιβάζει ένα πρόβλημα που το επόμενο στάδιο δεν θα δει.
Η μονάδα που μετρά
Η τιμή του token είναι μια εισροή, και η κατανάλωση μιας εργασίας εξαρτάται από το επίπεδο προσπάθειας που επιλέγεται. Για να αποφασίσει κανείς, δέκα πραγματικοί φάκελοι που θα περνούσαν από τρία επίπεδα μοντέλων, με ένα πλέγμα των λαθών που μετρούν, θα έδιναν τον χρήσιμο αριθμό: το κόστος ανά φάκελο που ένας άνθρωπος αποδέχεται χωρίς να τον ξαναφτιάξει. Καμία σελίδα λανσαρίσματος δεν μπορεί να τον δώσει.
Cette publication est également disponible en :
