9月22日,OpenAI宣布其日常工作模型Sol与Luna的价格减半。该百分比是按促销价计算的,处理一个案卷的成本仍有待衡量。
先看金额,再看百分比
按每百万token计,Sol的输入价从4美元降至2美元,输出价从20美元降至10美元。Luna的输入价从0.20美元降至0.10美元,输出价从1.20美元降至0.50美元。OpenAI宣称两者都“便宜50%”。这一计算对Sol和Luna的输入价成立,但Luna的输出价降幅约为58%。
起始价格是GPT-5.6促销方案的价格,而非其标价,OpenAI在自己的文本中对此作了说明。该公司将降价归因于缓存与推理方面的改进,对读取已存入内存的输入给予90%的折扣。
自发布以来,该页面附有一则9月29日的更新,指向一个更新的模型GPT-6.1 Sol。就我读到的文本而言,公告对此没有更多说明:因此需要核实本文中的价格与比较是否仍适用于这一新模型。
任务成本,由供应商衡量
OpenAI更愿意谈论每项任务的成本。在企业工作流基准AutomationBench上,“xhigh”设置下的Sol得分33.2%,每项任务成本0.27美元,而Claude Opus 5在最高设置下为26.9%,该公司估算其成本为Sol的十一倍以上。在专注软件工程的DeepSWE基准上,Sol的得分为68.8%,与Claude Fable 5的最佳成绩相差略多于一个百分点。
这些数字来自OpenAI,比较的测试与设置由其选定。它表示竞争对手的得分取自公开报告,并在5.1版本得分不可得时采用了Claude Fable 5的得分。此外,该系列在这一企业基准上的得分,就绝对值而言仍属有限。
每项任务一个层级,需要测试而非假设
以下是作者的解读。分拣类工作,例如发现一份不完整的案卷,所需的花费与来源分析或一份对品牌有约束力的文本并不相同。因此可以设想前者用经济型模型,其余用要求更高的模型。模型的名称并不能证明它适合这项任务。
团队在选择之前,最好先确定可接受的结果应包含什么:必不可少的信息、可容忍的错误、需要上报给人的情形。交接环节与定价同样重要。一次廉价的初步处理如果抹去了来源或掩盖了疑点,就会把一个下一环节看不到的问题传递下去。
真正重要的单位
token价格是一项投入,而一项任务的消耗取决于所选的投入程度。要做权衡,可以让十份真实案卷通过三个层级的模型,并配以一份记录重要错误的清单,由此得出有用的数字:一个人无需重做便接受的每案卷成本。任何发布页面都无法提供这个数字。
Cette publication est également disponible en :
