9月22日、OpenAIは日常業務向けモデルであるSolとLunaの料金を半額にすると発表した。この割合はプロモーション価格を基に計算されており、処理した案件1件あたりのコストは、まだ測定されていない。
割合より先に金額を読む
100万トークンあたり、Solは入力が4ドルから2ドル、出力が20ドルから10ドルになる。Lunaは入力が0.20ドルから0.10ドル、出力が1.20ドルから0.50ドルになる。OpenAIは両モデルとも「50%安い」と発表している。この計算はSolとLunaの入力については正しいが、Lunaの出力の下げ幅は約58%である。
出発点の価格はGPT-5.6のプロモーション価格であり、定価ではない。OpenAI自身の文面でもその旨が示されている。同社は値下げの理由を、キャッシュと推論の改善に帰しており、すでにメモリに保持された入力の読み取りには90%の割引が適用される。
公開以来、このページには9月29日付の更新が付されており、より新しいモデルGPT-6.1 Solに言及している。私が読んだ文面では、発表はそれ以上のことを述べていない。したがって、本記事の料金と比較が新モデルにも当てはまるかどうかは、確認が必要である。
プロバイダーが測定するタスクのコスト
OpenAIはタスクあたりのコストで語ることを好む。企業ワークフローのベンチマークであるAutomationBenchでは、「xhigh」設定のSolが1タスク0.27ドルで33.2%を記録し、最大設定のClaude Opus 5は26.9%だった。同社は後者のコストをSolの11倍以上と見積もっている。ソフトウェア工学向けのDeepSWEベンチマークでは、Solは68.8%とされ、Claude Fable 5の最高スコアとは1ポイント強の差である。
これらの数字はOpenAIによるもので、比較する試験と設定も同社が選んだ。競合のスコアは公開レポートから引いており、バージョン5.1のスコアが得られない場合はClaude Fable 5のスコアを使ったと説明している。なお、この企業向けベンチマークでのファミリーのスコアは、絶対値としては控えめなままである。
タスクごとの階層は、想定するのではなく試すべきもの
以下は筆者の見方である。不完全な案件を見つけるような仕分けの作業は、出所の分析やメゾンを拘束する文章と同じ支出を必要としない。したがって、前者には経済的なモデルを、後者には要求の高いモデルを想定できる。モデルの名前は、それがタスクに適していることを証明しない。
チームは選ぶ前に、受け入れ可能な結果に何が含まれるかを定めておくとよい。欠かせない情報、許容できる誤り、人に上げるべきケースである。引き継ぎは料金設定と同じくらい重要だ。出典を消したり疑念を隠したりする安価な一次処理は、次の段階では見えない問題を引き渡すことになる。
重要な単位
トークン単価は投入要素であり、タスクの消費量は選ばれた努力水準に左右される。判断するには、実際の案件10件を3つのモデル階層に通し、重要な誤りの評価表を添えることで、有用な数字が得られるだろう。人がやり直さずに受け入れる、案件あたりのコストである。どんなローンチページもそれを提供できない。
Cette publication est également disponible en :
