斜杠中年斜杠中年AI × 沟通 × 商业 × 人生
AI 与商业杠杆

AI 价格崩塌:GPT-6 Sol、Claude Opus 5.5,为什么「每件任务的成本」比排行榜更重要

2026 年 9 月 22 日,OpenAI 把 GPT-6 Sol 与 Luna 的 API 价格砍半,Anthropic 同日发布运行成本低 40% 的 Claude Opus 5.5。前沿智能的价钱一夜之间几乎对折——真正决定你技术选型的指标,已经从「跑分排名」变成「每完成一件任务的成本」。本文用一手来源的数字说清楚发生了什么,以及一个人怎么给自己的活儿做模型分层。

2026-09-24更新: 2026-09-249 分钟阅读Wesley Chong
#GPT-6 Sol#Claude Opus 5.5#AI 价格#每任务成本#模型路由#Qwen 4#AI 新闻
AI 价格崩塌:GPT-6 Sol、Claude Opus 5.5,为什么「每件任务的成本」比排行榜更重要|AI 与商业杠杆 封面图

摘要

OpenAI 把 GPT-6 Sol 与 Luna 的 API 价格下调 50%,Anthropic 同日发布运行成本低 40% 的 Claude Opus 5.5。前沿 AI 一夜之间接近对折,真正该看的数字是「每完成一件任务的成本」。本文整理两家官方发布的真实数据、一个真实 agent 任务的算账过程,以及便宜/中档/旗舰三层模型怎么在同一个工作流里分工。

一句话答案

本周二(2026 年 9 月 22 日),OpenAI 把 GPT-6 Sol 与 Luna 的 API 价格砍半,Anthropic 在几个小时内发布了运行成本低 40% 的 Claude Opus 5.5——前沿级智能的价钱几乎一夜对折,而从这天起决定你技术选型的指标是「每完成一件任务的成本」,不是谁坐在排行榜第一。

这种星期会安静地改变地基。我先看了一期把当天发布全讲一遍的 AI 新闻视频(链接放在文末),然后回到一手来源——OpenAI 与 Anthropic 自己的发布页——把每个头条数字逐行核对了一遍。

问题:为什么「用最强模型就对了」不再成立

2026 年大半年的时间里,建议都很简单:挑你能负担的最聪明的模型。现在有两件事把它推翻了:

  • 最强的那个每周都在换。 GPT-6 Astra、Claude Fable 5.1、Mythos 5.1、Opus 5、Grok 4.7 轮着坐庄,比你的习惯更新得还快。
  • Agent 类工作会把每一分钱放大。 单次对话花多少就是多少;但一个会规划、调工具、读文件、反思再改的 agent,可能把同一段 10 万 tokens 的上下文重放十几次。你的账不是那段提示词,而是提示词乘以步数。

两家的动作都印证了这一点:这周的两个发布,都不是「更聪明」,而是「每完成一件活儿更便宜」。

实际发布了什么

1. GPT-6 Sol 与 GPT-6 Luna(OpenAI)

GPT-6 Astra 本月初刚作为旗舰发布。Sol 与 Luna 把那一代的训练方法搬到了价格曲线的下半段:

  • GPT-6 Sol: 每百万 tokens 输入 2 美元、输出 10 美元(原为 4 / 20 美元),双向便宜 50%。
  • GPT-6 Luna: 输入 0.10 美元、输出 0.50 美元(原为 0.20 / 1.20 美元),相比 Claude Sonnet 5 的 2 / 10 美元相当于打了 95% 的折。

OpenAI 对媒体确认这是永久定价,不是限时促销。注意 Sol 落在哪里:正好压在 Claude Sonnet 5 的价格上,是 Opus 5.5 的一半。

性能叙述这次用的是「每任务成本」,不是跑分排名:

  • AutomationBench(覆盖 47 个工具的业务流程测试)上,GPT-6 Sol 在 xhigh 档得 33.2%,每件任务 0.27 美元,以 1/11 的成本击败在 max 档的 Claude Opus 5。
  • Agents' Last Exam 上 Sol 最高档得 56.4%,高于 Claude Opus 5 的最佳成绩,每任务成本低 60%。
  • DeepSWE v1.1(真实代码库工程任务)上 Sol max 得 68.8%,只比 Claude Fable 5 的最佳成绩 69.9% 低 1.1 个百分点,而每任务成本低约 80%。Luna max 得 66.6%,每任务比 Opus 5 便宜 93%。
  • OSWorld 2.0 offline(电脑操作)上 Sol xhigh 以 60.5% 追平 Opus 5 medium 的 60.3%,成本低约 80%。

有两个细节比图表更实用。第一,OpenAI 同时改进了 GPT-6 的 prompt 缓存:缓存命中的输入 tokens 打一折,而且中途调整推理档位或开关工具都不再让缓存失效。第二,上线是分批的:付费方案的 ChatGPT Work 与 Codex 当天可用,免费与 Go 用户可在桌面端用 Luna,API 里已可用 gpt-6-solgpt-6-luna——但还没进 Chat。

2. Claude Opus 5.5(Anthropic)

同一天,Anthropic 发布了新 Claude 5.5 家族的第一个模型:

  • 每百万 tokens 输入 4 美元、输出 20 美元。 缓存读取从 0.50 降到 0.20 美元,比 Opus 5 便宜 60%
  • Anthropic 称在默认档位上,它比 Opus 5 在典型工作量上便宜 40%:不只是单价更低,而是完成同一件事用的 tokens 更少。输出速度比 Opus 5 快 30% 以上。
  • 跑分:Terminal-Bench 4.0 得 66.4%(Fable 5.1 为 55.8%、GPT-6 Astra 为 57.9%),FrontierCode v1.1 Main 得 54.4%,GDPval-AA v2.1 得 1846 Elo——后者覆盖 44 个职业的真实工作。
  • 在 FrontierCode 默认档位上,它击败 GPT-6 Astra 的最高分,而每任务成本只要对手的约 20%;在 CursorBench 上比 GPT-5.6 Sol 高 11 分,成本约为其三分之一。
  • Anthropic 同时确认 Claude Sonnet 5.5 与 Haiku 5.5 会在未来几周内跟进,并提高了订阅制的用量上限,还把一次「重置额度」做成可以存起来、想用再用的形式。

3. 同一周的另外三个信号

  • 阿里在云栖大会预告了 Qwen 4 家族:Qwen 4 Max、Plus、Flash,以及一个 Qwen 4 27B——最后这个最值得注意,因为 27B 正是你可以在本地跑起来的规格。模型仍在训练中。
  • 腾讯 Hy Image 3.5 preview 上线,国际 API 约 每张图 0.024 美元(国内 2K 为 0.15 元),参考图和失败生成不计费——图像生成也在走同一条成本曲线。
  • 命名的角力。 9 月 22 日特朗普在联合国讲话时,指示美国政府文件以后用「super intelligence(超级智能,SI)」而不是「artificial intelligence」,理由是「人工」这个词让人以为技术是假的。这是语言层面的事,但如果你在这个行业写作或销售,词汇表将会跟着动。

真正该算的账:不是每 token 价格,而是每任务成本

单价最容易比较,也最容易误导。拿一个真实的 agent 活儿举例:一次长代码审阅,上下文 20 万 tokens(其中 18 万命中缓存),输出 1.5 万 tokens。

  • GPT-6 Sol: 这活儿约 0.23 美元
  • Claude Opus 5.5:0.42 美元,约为 Sol 的 1.8 倍,能力剖面相近。
  • GPT-6 Astra(假设同样一折的缓存折扣):约 1.13 美元,是 Sol 的 5 倍。
  • GPT-6 Luna(便宜层):约 0.01 美元

一个月跑 100 件这样的任务,范围是从 1 美元到 113 美元——做的是同一批能合并的活儿。决定你要不要自动化一段流程的,是这道差距,而不是跑分上那两分。

如果你是一个人公司,这改变什么

你不需要一堆模型,你需要三条路由规则:

  1. 便宜层做量。 Luna 级价位(0.10 / 0.50)用来抽取、分类、摘要、打标签、写初稿,以及任何你反正会看一遍的东西。每件一分钱,比你决定「要不要跑」所花的时间还便宜。
  2. 中档层做日常交付。 Sol、Sonnet 5、Opus 5.5 用来做真正要出货的活:功能代码、代码审阅、文档起草、研究整料。你大部分工时应该落在这里,因为每任务是几分钱而不是几美元。
  3. 旗舰层做一次性难题。 Astra 与 Fable 5.1 仍然赢在「答错很贵」的地方:架构决策、深度调试、长迁移,以及任何你难以验收的东西。为了那 5% 的任务付 5 倍价钱,是划算的。

两个习惯让分层真正省钱。第一,让提示词对缓存友好:前缀稳定,一折的缓存输入价在 agent 循环里就是真金白银;两家最近都允许你在不破坏缓存的前提下切换推理档位或工具。第二,追踪「每完成一件任务的成本」,而不是每 token 价格:把每件活儿的实际花费记下来,让日志替你选模型——因为那个「便宜但要多重试一次」的模型,其实并不便宜。

战略上的读法很简单:前沿模型现在不再是卖智能,而是卖经济性。如果你的竞争对手这个月还没给自己的流程重新定价,你现在就多了一套他们没有的成本结构。

重点整理

  • OpenAI 的 GPT-6 Sol(2 / 10 美元)与 Luna(0.10 / 0.50 美元)比 GPT-5.6 一代便宜 50%,且被确认为永久定价。
  • Anthropic 的 Claude Opus 5.5 是 4 / 20 美元,缓存读取便宜 60%,典型工作量运行成本比 Opus 5 低 40%;Sonnet 5.5 与 Haiku 5.5 几周内到。
  • 「每完成一件任务的成本」= 单价 × 实际消耗 tokens × 调用次数,这是两家现在竞争的指标,也是你该追踪的指标。
  • 同一周还有:Qwen 4(含 27B 本地模型)、约两分钱一张的 Hy Image 3.5,以及美国政府把 AI 改称「超级智能」。
  • 对独立经营者来说,赢法不是选一个冠军,而是三层路由 + 让提示词可缓存 + 记录每件完成任务的成本。

想补背景,可以看OpenAI GPT-5.6 发布时那套三档定价意味着什么,以及按厂商逐一对比的2026 年 LLM API 价格深度分析

本文依据的当日新闻汇总视频:GPT-6 Sol 与 Luna、Opus 5.5、Qwen 4、Hy Image 3.5 全解析。一手来源:OpenAI:Introducing GPT-6 Sol and LunaAnthropic:Introducing Claude Opus 5.5

常见问题

GPT-6 Sol 和 Luna 比起上一代便宜多少?

Sol 双向便宜 50%:每百万 tokens 输入从 4 美元降到 2 美元,输出从 20 美元降到 10 美元。Luna 输入从 0.20 降到 0.10 美元、输出从 1.20 降到 0.50 美元,输入便宜 50%、输出便宜约 58%。OpenAI 向媒体确认这是永久定价,不是促销价。

Claude Opus 5.5 比 GPT-6 Sol 便宜吗?

不便宜。Opus 5.5 是每百万 tokens 输入 4 美元、输出 20 美元,所以 GPT-6 Sol 在两个未缓存价格上都比它便宜 50%。Anthropic 自己的说法是:因为每件任务消耗的 tokens 更少,Opus 5.5 在典型工作量上的运行成本比 Opus 5 低 40%。

「每任务成本」是什么?为什么比跑分更重要?

每任务成本 = 单价 × 一件任务实际消耗的 tokens × 调用次数。Agent 类工作每一步都要重放长上下文,所以单价只有一半、步骤还更少的模型,每件完成的任务可能便宜一个数量级。对一人公司来说,这个倍数直接决定哪些流程你根本养不起、哪些可以放心自动化。

该不该用这些便宜模型取代 GPT-6 Astra 或 Claude Fable 5.1?

该分层,而不是取代。把便宜层(GPT-6 Luna 级)用于抽取、分类、初稿;中档层(GPT-6 Sol、Claude Sonnet 5、Opus 5.5)用于每天真正要交付的代码、审阅、文档与研究;旗舰层(GPT-6 Astra、Claude Fable 5.1)留给架构决策、深度调试、长迁移这类答错代价很高的一次性问题。

分享这篇文章 / Share Article
Wesley Chong

作者

Wesley Chong

来自马来西亚居銮的软件开发者、数字顾问、Toastmasters 讲员。

专注帮助普通人用 AI 升级沟通、表达、商业与人生。

相关阅读

打造马来西亚首个主权 AI 生态:杨忠礼电力(YTL Power)柔佛绿能算力翻倍与 ILMUchat 的双轮驱动布局|AI 与商业杠杆 封面图
AI 与商业杠杆YTL PowerYes 5G

打造马来西亚首个主权 AI 生态:杨忠礼电力(YTL Power)柔佛绿能算力翻倍与 ILMUchat 的双轮驱动布局

杨忠礼集团(YTL)正在以惊人的速度重塑马来西亚的 AI 版图。本文深度解析 YTL Power 柔佛绿能数据中心的翻倍扩张计划,以及 YTL AI Labs 联合 Yes 5G 推出的马来西亚首个主权大模型 ILMUchat,探讨其如何通过超本地化语言理解与算力自主,为大马企业与政府机构奠定数据主权基础。

2026-06-268 分钟阅读