一句话答案
LLM API 价格已经从 "按功能付费" 变成了 "按场景选型"——没有"最便宜"的模型,只有"最适合你"的模型。对于生产环境,GPT-5.4 ($2.50/$15) 和 Claude Sonnet 4.6 ($3/$15) 是当前最佳性价比选择。
问题:LLM API 的成本为什么让人头大?
2026年的AI API价格表就像看超市价签——不是东西贵了,而是选择太多了。
| 模型 | 输入/百万Tokens | 输出/百万Tokens | 差距 | |------|----------------|----------------|------| | GPT-4.1 Nano | $0.10 | $0.40 | 入门级 | | Claude Haiku 4.5 | $1.00 | $5.00 | 预算级 | | GPT-5.4 | $2.50 | $15.00 | 主力级 | | Claude Opus 4.7 | $5.00 | $25.00 | 旗舰级 | | GPT-5.4 Pro | $30.00 | $180.00 | 企业级 |
同一个公司内,输入价格最高相差 300 倍。 选错模型,每个月账单可能差出 10 倍以上。
我用 Hermes Agent 做开发和内容创作,日常调用多个模型的 API。以下是我基于实际使用经验整理的深度分析。
Part 1: 三大厂商旗舰对比
旗舰模型价格大战
这是目前市场上三个顶级模型的对决——它们在代码生成和推理能力上最为接近,但价格差异显著:
| 模型 | 提供商 | 输入/MTok | 输出/MTok | 上下文窗口 | SWE-bench Verified | |------|--------|----------|----------|-----------|-------------------| | GPT-5.5 | OpenAI | $5.00 | $30.00 | 1M | 88.7% | | Claude Opus 4.7 | Anthropic | $5.00 | $25.00 | 1M | 88.6% | | Gemini 3.1 Pro | Google | $2.00 | $12.00 | 1M | 80.6% |
关键洞察:
- Claude Opus 4.7 胜出——能力和 GPT-5.5 几乎持平(差距不到 0.2%),但输出便宜 17%($25 vs $30 per MTok)。
- Gemini 3.1 Pro 性价比之王——输入只要 $2,输出只要 $12,比两大旗舰便宜 60%+。虽然 SWE-bench 低几个百分点,但对大多数应用来说差距可接受。
- OpenAI 定价激进——GPT-5.5 在 2026 年 3 月大幅降价(从 $10/MTok 降到 $5),说明 OpenAI 感受到了竞争压力。
实际场景成本计算
假设一个 AI 编程助手,每次请求平均输入 2K tokens + 输出 500 tokens:
| 每日请求量 | GPT-5.4 ($2.50/$15) | Claude Sonnet ($3/$15) | Gemini 2.5 Pro ($1.25/$10) | |-----------|--------------------|----------------------|--------------------------| | 100 | $0.80 | $0.93 | $0.56 | | 1,000 | $8.00 | $9.38 | $5.63 | | 10,000 | $80.00 | $93.75 | $56.25 | | 100,000 | $800 | $938 | $563 |
结论: 在高吞吐场景下,选择一个便宜的模型一个月能省下几百美元。
Part 2: 各层级的最佳选择
LLM 市场已经分化为五个清晰的层级,每个层级有明确的"冠军模型"。
🥇 旗舰级(最贵,最强能力)
| 模型 | 输入/MTok | 输出/MTok | 适合场景 | |------|----------|----------|---------| | Claude Opus 4.7 ($5/$25) | ✅ 推荐 | — | 复杂代码评审、长上下文推理、Agent 工具使用 | | GPT-5.5 ($5/$30) | — | — | OpenAI 生态集成、GPT-5.6 预览版用户 | | GPT-5.4 Pro ($30/$180) | 💰 贵 | — | 仅企业 mission-critical 场景 |
Claude Opus 4.7 是当前旗舰的首选——它比 GPT-5.5 便宜,能力相当。GPT-5.4 Pro 虽然贵 6 倍,但只在高难度推理任务上有微弱优势。
🥈 主力级(性价比最优,适合生产环境)
| 模型 | 输入/MTok | 输出/MTok | 适合场景 | |------|----------|----------|---------| | GPT-5.4 ($2.50/$15) | ✅ 推荐 | ✅ | 通用 API、工具调用强、生态系统完善 | | Claude Sonnet 4.6 ($3/$15) | — | ✅ | 编码、结构化输出、多步推理 | | Gemini 2.5 Pro ($1.25/$10) | ✅ 推荐 | ✅ | 1M 上下文 + 低成本 + Google 集成 |
这个层级的三个模型实际能力差距最小,都是"够用且强大"的选择。我的建议:
- 需要最强工具调用/函数执行 → GPT-5.4
- 需要结构化输出/JSON 解析 → Claude Sonnet
- 需要长文档处理 + 低成本 → Gemini 2.5 Pro
🥉 预算级(高吞吐,简单任务)
| 模型 | 输入/MTok | 输出/MTok | 适合场景 | |------|----------|----------|---------| | GPT-4.1 Nano ($0.10/$0.40) | ✅ 推荐 | — | 分类、提取、轻量过滤 | | Gemini 2.5 Flash ($0.30/$2.50) | — | — | Google 生态、多模态 | | Claude Haiku 4.5 ($1/$5) | — | — | 中等复杂度任务 |
GPT-4.1 Nano 是最便宜的自有 API 模型——每百万输入 tokens 只要 10 美分。适合:
- 文本分类(垃圾邮件检测、情感分析)
- 信息提取(从 JSON 字段中提取特定数据)
- 内容过滤和分级
🧠 推理级(Thinking Tokens 特殊模式)
| 模型 | 推理成本 | 典型扩展倍数 | 有效成本 | |------|---------|-------------|---------| | GPT-5 (reasoning) | 包含在输出价格 | 2-5x 输出 tokens | 3-6x 基础输出成本 | | DeepSeek R1 | $2.19/MTok | 3-8x 输出 tokens | 4-9x 基础输出成本 | | Claude extended thinking | $15/MTok | 1-3x 输出 tokens | 2-4x 基础输出成本 |
Thinking tokens 是一个常被忽略的成本陷阱。当使用 GPT-5 的 reasoning 模式时,模型先"思考"再回答——这些思考 tokens 按输出价格计费,通常是正常输出的 3-6 倍。
🌏 中国模型(价格屠夫)
| 模型 | 输入/MTok | 输出/MTok | 相对 Claude Sonnet | |------|----------|----------|------------------| | DeepSeek V4 Flash | $0.14 | $0.28 | 便宜 ~15x | | DeepSeek V3 | $0.27 | $1.10 | 便宜 ~10x | | MiniMax M3 | $0.60 | $2.40 | 便宜 ~5x | | GLM-5.2 (Z.AI) | $1.40 | $4.40 | 便宜 ~2x |
DeepSeek 是目前最便宜的选项之一——但便宜是有代价的。在 SWE-bench Verified 等基准测试上,DeepSeek 的得分远低于 Claude Opus 或 GPT-5.5。它在简单任务上性价比极高,但在复杂推理上仍有差距。
Part 3: 隐藏成本的五大陷阱
陷阱 1: Thinking Tokens 不收费?
很多开发者不知道 thinking tokens 是按输出价格计费的。
# GPT-5 标准模式
input: 1000 tokens × $2.50/MTok = $0.0025
output: 200 tokens × $15.00/MTok = $0.0030
# 总成本: $0.0055
# GPT-5 Reasoning 模式
input: 1000 tokens × $2.50/MTok = $0.0025
thinking: 500 tokens × $15.00/MTok = $0.0075 ← 额外成本!
output: 200 tokens × $15.00/MTok = $0.0030
# 总成本: $0.0130 (2.4 倍!)
建议: 简单任务用非 reasoning 模式;只在需要深度推理时才开启。
陷阱 2: 超长上下文的隐藏加价
大多数模型标价是"标准上下文"价格,超过一定长度会加价:
| Provider | 模型 | 标准价格 | 超长价格 | 阈值 | |----------|------|---------|---------|------| | Google | Gemini 2.5 Pro | $1.25/$10 | $2.50/$15 | >200K tokens | | Anthropic | Sonnet 4.6 (beta) | $3/$15 | $3/$15 | 无加价(1M 统一价格)|
建议: 如果上下文接近 200K tokens,考虑分割长文档或使用摘要前置。
陷阱 3: Token 估算不准
1 个 token ≠ 1 个词。不同模型的 tokenizer 效率差异很大:
- Anthropic Opus 4.7+: 新 tokenizer,同样的文本可能多产生 35% 的 tokens
- GPT-5.x: 高效的 sentencepiece tokenizer
- 中文场景: 1 个汉字 ≈ 2-3 tokens
如果你的应用主要处理中文内容,实际成本会比看起来高 2-3 倍。
陷阱 4: Rate Limits = 隐性排队成本
即使你付了钱,高频率调用也会遇到限流:
| Provider | 免费/基础 | 标准 | 企业 | |----------|---------|------|------| | OpenAI | 500 RPM | 5,000-10,000 RPM | 定制 | | Anthropic | 50 RPM | 2,000-4,000 RPM | 定制 | | Google | 15 RPM | 1,000-2,000 RPM | 定制 |
建议: 如果你需要在短时间内大量请求,提前申请更高的 rate limit,或者使用 batch API。
陷阱 5: 过时模型仍在计费
有些 API 端点仍然支持 GPT-4 Turbo ($10/$30) 甚至旧版 GPT-4 ($30/$60),但这些模型已标记为即将弃用。迁移到新模型既能降低成本,又能获得更好的性能。
Part 4: 我的省钱策略
基于过去半年的实际使用经验,以下是我从 Hermes Agent 工作流中总结出的省钱方法:
1. Multi-Model Routing(多级模型路由)
不要对所有任务使用同一个模型:
| 任务类型 | 推荐模型 | 每百万 tokens 成本 | |---------|---------|------------------| | 内容摘要 / 翻译 | GPT-4.1 Nano | $0.10 / $0.40 | | 代码生成 / 调试 | Claude Sonnet 4.6 | $3.00 / $15.00 | | 深度推理 / 架构设计 | Claude Opus 4.7 | $5.00 / $25.00 | | 批量数据处理 | DeepSeek V4 Flash | $0.14 / $0.28 |
效果: 将简单任务从 $15/MTok 降到 $0.40/MTok,成本降低 97%。
2. Prompt Caching(上下文缓存)
如果你的应用每次都发送相同的 system prompt(比如角色设定、API 文档),使用缓存可以省下 90% 的输入成本:
| Provider | 缓存写入 | 缓存读取 | 最大节省 | |----------|---------|---------|---------| | Anthropic | +25% 溢价 | 10% 标准价 | 90% | | Google | 免费 | 25% 标准价 | 75% | | OpenAI | 同标准价 | 50% 标准价 | 50% |
3. Batch API(批处理 API)
对于不需要即时响应的任务(文档分类、批量生成描述),batch API 通常打折 50%:
# 实时 API: $2.50/$15 per MTok
# Batch API: $1.25/$7.50 per MTok (50% off)
# 延迟: Up to 24 hours
4. 用本地模型处理可离线任务
一些任务根本不需要调用云端 API:
- 文件分类可以用 Llama 3.3 70B via Together AI ($0.88/$0.88) 自己跑
- 数据预处理可以在本地用 Whisper 做音频转写
- 小批量检索增强用 本地嵌入模型(免费)
Part 5: 结论与建议
快速决策树
你的任务是什么?
├── 简单分类/提取 → GPT-4.1 Nano ($0.10/$0.40)
├── 代码生成/调试 → Claude Sonnet 4.6 ($3/$15)
├── 长文档分析 → Gemini 2.5 Pro ($1.25/$10, 1M context)
├── 复杂推理 → Claude Opus 4.7 ($5/$25) 或 GPT-5.5 ($5/$30)
├── 批量处理 → Batch API (50% off any model)
└── 极致低价/简单任务 → DeepSeek V4 Flash ($0.14/$0.28)
核心数字
| 指标 | 数字 | |------|------| | 最便宜的生产模型 | GPT-4.1 Nano @ $0.10/$0.40 per MTok | | 最佳性价比(主力) | GPT-5.4 @ $2.50/$15 or Claude Sonnet 4.6 @ $3/$15 | | 最强性价比(旗舰) | Claude Opus 4.7 @ $5/$25 (vs GPT-5.5 at $5/$30) | | 最长上下文 | Gemini 2.5 Pro @ 1M tokens | | 最大价格差异 | 300x(Nano vs Pro) |
最后的话
LLM API 市场正在经历一场残酷的价格战。2026年,同样的能力(SWE-bench 80-89%)可以买到从 $0.60/MTok 到 $30/MTok 的 50 倍价格差。
最佳策略不是找一个"最便宜"的模型,而是建立一个"多模型路由系统"——根据你的任务复杂度、延迟要求和预算,自动选择最合适的模型。
我在用 Hermes Agent 的 Skills 系统时就用了这种策略:简单任务走 Nano,编程走 Sonnet,深度推理走 Opus。每个月省下的钱比订阅费还多。
延伸阅读
- OpenAI API Pricing
- Anthropic API Pricing
- Google Gemini Pricing
- wesleychong.com — 我的个人品牌网站
- bnext.my — BNext Solutions 为企业提供 AI 驱动的软件解决方案




