你在对比各家 API 单价时,榜单很可能每周都在变——DeepSeek V3.2 仍占超低价榜首,Gemini Flash-Lite 靠生态默认进前三,但 Agent 多轮调用会让「最便宜」变成「账单最贵」。本文用 2026 年 8 月官方价 + 混合 token 成本口径给出可复用的排名框架,并说明我们每月如何更新。
先定口径:我们怎么排「最便宜」
你在搜「2026 最便宜 AI API」时,看到的榜单往往 只比输入价,或者混进了 OpenRouter 上周用量(那是「谁被打得多」,不是「谁最便宜」)。本站主榜用三个固定前提,方便你每月回来对照:
| 前提 | 说明 |
|---|---|
| 混合成本 | 按 输入 60% + 输出 40% 估算百万 token 账单(USD),贴近一般对话型产品 |
| 官方标价 | 以各厂商 2026 年 8 月公开 API 价为准;Batch / 缓存折扣在正文单独标注 |
| 可持续可用 | 免费试用、限时活动 不进主榜;只列能长期开票的付费档 |
一句话: 超低价档 DeepSeek 仍领先;生态默认 Gemini Flash 系列进前三;旗舰任务别硬压到低价模型——Agent 多轮会把价差放大 10–50 倍,详见 Agent 时代账单拆解。
2026 年 8 月主榜:通用对话 API($/百万 token,混合成本)
下表「混合价」= 输入价×0.6 + 输出价×0.4。数据来自 OpenAI、Anthropic、Google AI、DeepSeek、Mistral 2026 年 8 月页面。
| 排名 | 模型 | 输入 $/1M | 输出 $/1M | 混合价 | 适合场景 |
|---|---|---|---|---|---|
| 1 | DeepSeek V3.2 | 0.14 | 0.28 | ~0.20 | 高流量、多语言、成本敏感 |
| 2 | Gemini 2.0 Flash-Lite | 0.075 | 0.30 | ~0.17 | 短回复、分类、Google 生态默认 |
| 3 | GPT-4.1 Nano | 0.10 | 0.40 | ~0.22 | 标签/抽取/轻量 Agent |
| 4 | Mistral Small 3.1 | 0.10 | 0.30 | ~0.18 | 欧洲节点、GDPR 友好 |
| 5 | Qwen3 32B(多路由) | ~0.15 | ~0.60 | ~0.33 | 中文优化、开源权重可自托管 |
| 6 | Claude Haiku 4.5 | 1.00 | 5.00 | ~2.60 | 低延迟客服、轻量工具调用 |
| 7 | GPT-4.1 Mini | 0.40 | 1.60 | ~0.88 | 通用对话、中等复杂度 |
| 8 | Gemini 2.5 Flash | 0.30 | 2.50 | ~1.18 | 多模态、长上下文性价比 |
| 9 | Claude Sonnet 4 | 3.00 | 15.00 | ~7.80 | 难推理、代码、长文档 |
| 10 | GPT-5.4 / Opus 级 | 5.00+ | 25.00+ | ~13+ | 最高质量、低量核心任务 |
读榜提示:
- 排名 1–4 差距很小(混合价 $0.17–0.22),选型应看 延迟、合规区域、工具调用稳定性,而非再抠 $0.02。
- Haiku 起跳明显变贵——把它留给 需要稳定 tool schema 的链路,简单问答用 Nano / Flash-Lite 即可。
- 同一产品内建议 三层路由:L1 超低价处理 70% 请求 → L2 中档兜底 → L3 旗舰只处理升级队列。
专项榜:Embedding 与批量任务
Embedding($/百万 token)
| 排名 | 模型 | 价格 | 备注 |
|---|---|---|---|
| 1 | Gemini Embedding | ~0.025 | 多语言检索首选之一 |
| 2 | OpenAI text-embedding-3-small | 0.02 | 生态成熟、维度可选 |
| 3 | Voyage / Cohere 路由价 | 0.02–0.06 | 视 OpenRouter 节点 |
Embedding 通常 纯输入计费,混合公式不适用;RAG 产品里 embedding 占比 5–15%,别为省 embedding 去牺牲检索质量。
Batch / 异步(官方折扣档)
| 厂商 | 典型折扣 | 适用 |
|---|---|---|
| OpenAI Batch | ~50% off | 离线评测、日报生成 |
| Google Batch | 类似异步价 | 非实时流水线 |
| Anthropic Message Batches | 批量推理 | 大规模标注 |
Batch 能把榜单前几名再砍一半——但 延迟小时级,只适合非用户等待路径。
隐藏成本:榜单不会告诉你的四件事
1. 输出 token 比你想的多
用户 200 字提问 + 模型 800 字回答,输出往往占账单 60–75%。只比输入价会系统性低估 Sonnet / Opus 档。
2. Agent 乘数效应
一次用户动作 = 规划 + 多轮 tool call + 反思。10 步 Agent 链 ≈ 单次聊天的 8–20 倍 token。低价模型若幻觉多、重试多,总账可能反超中档模型。
3. 缓存与 Prompt 前缀
OpenAI / Anthropic / Google 均提供 Prompt 缓存(命中后输入价可降 50–90%)。固定 system prompt 的 SaaS 应优先测缓存命中率,再谈换模型。
4. 聚合路由溢价
OpenRouter 方便但非总是最低价;账单持续偏高时可对照 OmniRoute 迁移验收。自托管(Ollama / vLLM)则把 GPU 固定成本 换 token 变动成本——月 API 稳定超过 $2,000–3,000 再算 TCO。
按场景选型(比盯排名更实用)
| 你的产品形态 | 推荐起步组合 | 月 API 粗算(DAU 100) |
|---|---|---|
| 聊天 SaaS / 客服 | DeepSeek V3.2 或 Gemini Flash-Lite + Haiku 升级队列 | $15–80 |
| RAG 知识库 | Flash-Lite + Gemini Embedding + Sonnet 难问 | $80–350 |
| 编码 Agent | Sonnet / Kimi K 编码向 + Nano 做 lint | $150–600+ |
| 批量内容工厂 | Batch API + Nano / DeepSeek | $30–200 |
粗算公式(与 零基础 AI 产品成本 一致):
月 token ≈ DAU × 人均日请求 × 单次 token × 30
月费用 ≈ 月 token × 混合单价 / 1,000,000
持续更新机制
本文标题里的「持续更新」不是营销话术,执行规则如下:
- 每月第一个工作日:复查上表 10 个模型的官方价;脚注更新
dateModified。 - 重大调价(>15%):72 小时内修订表格与排名说明。
- 新模型进榜:需满足公开 API + 稳定 slug 30 天以上(避免把 preview 价写进「最便宜」)。
- 用量榜交叉验证:对照 OpenRouter Top10——若某模型「很便宜但没人用」,正文会标注风险。
2026-08-04 变更摘要: DeepSeek V3.2 维持超低价首位;Gemini 2.0 Flash-Lite 因输入价下调进入混合成本前三;GPT-4.1 Nano 仍是 Western 生态最便宜的官方 Nano 档。
省钱清单(今天就能做)
- 默认小模型,升级队列走 Sonnet——别让用户手动选 Opus。
- 打开 Prompt 缓存,固定 system prompt 与工具定义。
- 流式截断:
max_tokens硬上限 + 重复检测,防止 Agent 跑飞。 - Embedding 与生成模型分离——检索用专用 embedding,别用聊天模型硬嵌。
- 账单告警:日环比 +50% 自动 Slack/邮件(Gemini 费用细节见 Gemini API 多少钱)。
- 双供应商 fallback:主路由 DeepSeek / Gemini,备路由 OpenAI——避免单点涨价。
常见误区
- 误区 1:「榜单第一 = 我该全量切换。」→ 先灰度 5% 流量,对比 任务成功率 与 P95 延迟。
- 误区 2:「OpenRouter 排名 = 最便宜。」→ 那是用量榜,不是价格榜。
- 误区 3:「自托管一定更便宜。」→ 低流量阶段 GPU 空置比 API 贵得多。
- 误区 4:「年付 Cursor / Copilot 等于 API 便宜。」→ 订阅是 开发工具费,与产品 API 分开记账(对照 Cursor vs Copilot 年费)。
免责声明:价格为撰稿时厂商公开信息,不构成采购承诺;实际账单以控制台为准。转载请注明出处并核对日期。
分层路由 API,执行环境也要算进 TCO
便宜模型 + 本地 Agent / CI 若跑在不稳定 VPS 上,省下的 token 费会被重试和宕机吃掉。
Nuvcloud 提供独享 M4 Mac mini,适合 Xcode、OpenClaw 与长时 Agent 任务。