Am 22. September hat OpenAI halbierte Preise für Sol und Luna angekündigt, seine Modelle für die laufende Arbeit. Die Prozentzahl wird auf Aktionspreisen berechnet, und die Kosten eines bearbeiteten Vorgangs müssen noch gemessen werden.
Die Beträge vor dem Prozentsatz lesen
Pro Million Token sinkt Sol beim Input von 4 auf 2 Dollar und beim Output von 20 auf 10 Dollar. Luna sinkt beim Input von 0,20 auf 0,10 Dollar und beim Output von 1,20 auf 0,50 Dollar. OpenAI kündigt für beide «50 % günstiger» an. Die Rechnung stimmt für Sol und für den Input von Luna, doch der Output von Luna sinkt um rund 58 %.
Die Ausgangspreise sind die der Aktionsangebote von GPT-5.6, nicht seine Listenpreise, was OpenAI in seinem eigenen Text präzisiert. Das Unternehmen führt die Senkung auf Verbesserungen beim Caching und bei der Inferenz zurück, mit einem Rabatt von 90 % auf das Lesen bereits zwischengespeicherter Eingaben.
Seit dem Start trägt die Seite ein Update vom 29. September, das auf ein neueres Modell verweist, GPT-6.1 Sol. Die Ankündigung sagt in dem Text, den ich gelesen habe, nichts weiter dazu: Es wird also zu prüfen sein, ob die Preise und Vergleiche dieses Artikels auch für das neue Modell noch gelten.
Die Kosten einer Aufgabe, gemessen vom Anbieter
OpenAI spricht lieber von Kosten pro Aufgabe. Auf AutomationBench, einem Benchmark für Unternehmens-Workflows, erreicht Sol in der Einstellung «xhigh» 33,2 % bei 0,27 Dollar pro Aufgabe, gegenüber 26,9 % für Claude Opus 5 im Maximum, zu Kosten, die das Unternehmen auf mehr als das Elffache von Sol beziffert. Auf dem Benchmark DeepSWE, der dem Software-Engineering gewidmet ist, wird Sol mit 68,8 % angegeben, gut einen Punkt unter dem besten Wert von Claude Fable 5.
Diese Zahlen stammen von OpenAI, das die verglichenen Tests und Einstellungen ausgewählt hat. Es gibt an, die Werte der Konkurrenz aus öffentlichen Berichten zu übernehmen und die von Claude Fable 5 zu verwenden, wenn die der Version 5.1 nicht verfügbar waren. Die Werte der Familie auf diesem Unternehmens-Benchmark bleiben im Übrigen in absoluten Zahlen bescheiden.
Eine Stufe für jede Aufgabe, zu testen statt anzunehmen
Was folgt, ist eine Lesart des Autors. Eine Sortierarbeit, etwa das Erkennen eines unvollständigen Vorgangs, erfordert nicht denselben Aufwand wie eine Herkunftsanalyse oder ein Text, der das Haus bindet. Man kann sich also ein wirtschaftliches Modell für Ersteres und ein anspruchsvolleres Modell für die übrigen vorstellen. Der Name des Modells beweist nicht, dass es zur Aufgabe passt.
Ein Team täte gut daran, vor der Wahl festzulegen, was ein annehmbares Ergebnis enthält: die unverzichtbaren Informationen, die tolerierbaren Fehler, die Fälle, die an eine Person gehen. Die Übergabe zählt ebenso wie die Preisgestaltung. Eine günstige Erstbearbeitung, die ihre Quellen löscht oder ihre Zweifel verbirgt, gibt ein Problem weiter, das die nächste Stufe nicht sehen wird.
Die Einheit, die zählt
Der Tokenpreis ist ein Input, und der Verbrauch einer Aufgabe hängt von der gewählten Anstrengungsstufe ab. Um abzuwägen, würden zehn echte Vorgänge, durch drei Modellstufen geschickt, mit einem Raster der Fehler, die zählen, die nützliche Zahl liefern: die Kosten pro Vorgang, den eine Person akzeptiert, ohne ihn neu zu machen. Keine Startseite kann sie liefern.
Cette publication est également disponible en :
