2026 年最佳 LLM API 供应商:四种类型及各自成本
同样的 token 有四种买法。Claude Opus 5 在其中三种上都是 $5/$25,gpt-oss-120B 只要 $0.15/M,充值手续费高达 5.5%,区域端点加价 10%。
摘要: 2026 年买 LLM token 有四种方式,它们不是在同一个维度上竞争。原生 API 卖的是官方标价和第零日功能。开放权重托管商卖的是廉价 token,Together 上的 gpt-oss-20B 低至 $0.05/M。路由器卖的是跨多家供应商的一把密钥,通常按标价收费,成本被挪到了付款手续费上,OpenRouter 的银行卡充值收 5.5%。云平台卖的是采购流程,并为此收费:合作云的区域端点比全球端点贵 10%,Vertex 的优先档是标准档的 1.8x。同样一次 Claude Opus 5 调用,在四种里的三种上都花 $5/$25 每 1M token。真正不同的是围绕 token 的一切。
摘要:你该从哪种类型购买?
| 你的情况 | 从哪买 | 为什么 |
|---|---|---|
| 你需要一个刚发布那周的模型 | 原生 API | 合作云和路由器在新 SKU 和新功能上都会滞后 |
| 你的账单被某一个开放权重模型主导 | 开放权重托管商 | 先按 token 用无服务器,等把 GPU 跑满后再上专属 GPU |
| 你调用四家供应商但想要一张发票 | 路由器 | 一把密钥、一个余额,需要的话还能统一一种线路格式 |
| 财务已经批准了一份云承诺额度 | 云平台 | 支出落到一张已经存在的发票上,这往往就是全部理由 |
| 你需要小模型上的亚秒级首 token | 开放权重托管商 | Groq 公布其 llama-3.1-8b-instant 达 560 tok/s、openai/gpt-oss-20b 达 1000 tok/s,按其自家价格 |
| 你想要一条无需第二份合同的备用路由 | 路由器 | 故障转移就是产品本身,不是你要自己搭的功能 |
| 你的数据必须留在同一个法律辖区 | 云平台或原生数据驻留 | 两者都提供,两者都为此收约 10% |
| 你还在决定用哪个模型 | 路由器 | 换一个模型 ID 比换一套集成便宜 |
有两种情况可以到这里就停止阅读。如果你每月在 token 上花不到约 $200,就直接从做出你喜欢的模型的那家实验室购买,等数字变得有意思时再回来看;下面的每一项优化,都不值得你花上一个下午去折腾。如果你已经把生产流量跑在两家以上供应商上,直接跳到隐藏成本表格,因为你的钱实际上就花在那里。

四种类型,逐一对照
有用的区分不是品牌。而是谁在跑 GPU、谁在定价、谁在开发票。
| 原生 API | 开放权重托管商 | 路由器 / 聚合器 | 云平台 | |
|---|---|---|---|---|
| 举例 | OpenAI、Anthropic、Google、DeepSeek | Together、Fireworks、Groq | OpenRouter、ofox | Bedrock、Vertex AI、Microsoft Foundry |
| 是否跑推理 | 是 | 是 | 否 | 是,或转售实验室 |
| 模型目录 | 一家实验室的模型 | 仅开放权重 | 多家实验室,100+ 个 ID | 云平台的合作方清单 |
| 是否定价 | 是,这就是标价 | 是,具竞争性 | 大体照抄标价 | 标价加平台附加费 |
| 新模型第零日可用 | 是 | 对开放权重,是 | 通常几天内 | 常常要几周 |
| 认证 | Bearer token | Bearer token | Bearer token | IAM 角色、SigV4、服务账户 |
| 计费 | 银行卡或发票,按实验室 | 银行卡,按托管商 | 一个预付余额 | 你现有的云账单 |
| 跨供应商故障转移 | 你自己搭 | 你自己搭 | 内置 | 在同一云的目录内 |
| 最擅长 | 最新功能、最高上限 | 每 token 成本 | 广度与切换成本 | 采购与合规 |
下面的全部内容,就是把这张表展开来讲,附上我能核实到的数字。
类型一:原生 API
从训练出该模型的那家实验室购买是默认选项,而且对大多数团队来说,它保持正确答案的时间比网上说的要长。
你能拿到三样其他地方无法可靠提供的东西。发布当天就有新模型。只有第一方才有的功能,比如 Anthropic 的 fast mode,其定价文档写明该功能仅在 Claude API 上提供,合作方运营的平台上没有。以及最高的公布速率上限,因为其他每一条路由的产能都是从你原本会去买产能的同一个地方买来的。
以下是三大实验室的实际收费,每 1M token,核查于 2026-08-02。
| 模型 | 输入 | 缓存输入 | 输出 |
|---|---|---|---|
| Claude Fable 5 | $10 | $1 | $50 |
| Claude Opus 5 | $5 | $0.50 | $25 |
| Claude Sonnet 5 | $2(到 Aug 31 为止,之后 $3) | $0.20 | $10(之后 $15) |
| Claude Haiku 4.5 | $1 | $0.10 | $5 |
| gpt-5.6-sol | $5 | $0.50 | $30 |
| gpt-5.6-terra | $2 | $0.20 | $12 |
| gpt-5.6-luna | $0.20 | $0.02 | $1.20 |
| gpt-5.5 | $5 | $0.50 | $30 |
| Gemini 3.6 Flash | $1.50 | $0.15 | $7.50 |
| Gemini 3.5 Flash-Lite | $0.30 | $0.03 | $2.50 |
在使用这些数字前有两点说明。OpenAI 分别公布短上下文和长上下文两列,上面的数字是短上下文档。长上下文不是一个统一的倍数:gpt-5.6-luna 从 $0.20/$1.20 变成 $0.40/$1.80,也就是输入翻倍、输出上涨一半。Gemini 那些数字是 Vertex 的 Global 档,该系列中有几个模型对非全球端点定价高 10%,Gemini 3.5 Flash 为 $1.65/$9.90 对比 $1.50/$9.00。
那张表里有两样东西比头条价格更值钱。这些实验室每一家都对批处理工作在输入和输出上各打 50% 折扣,只要你的工作负载有任何部分可以等,这就是可用的最大杠杆。而且缓存输入在这三家上都按新鲜输入的十分之一计费,所以一个拥有稳定系统提示词的智能体,实际支付的只是标价所暗示金额的一小部分。我们在 Anthropic 与 OpenAI 提示词缓存对比 中详细算过这笔账。
走原生路线的代价是行政上的,而且它会悄悄累积。四家实验室意味着四把密钥、四个仪表盘、四段计费关系,以及四套毫无共通词汇的速率限制规则手册。我们在 LLM API 速率限制对比 中把其中五套规则手册并排比较过,它们几乎在所有事情上都不一致,包括「请求」到底是什么。
如果你已经标准化在某一家实验室上、需要发布当天的访问权,或者你的量大到想跟某个人直接谈商务,那就走原生路线。当你还在评估模型、想在某家实验室出问题的那个下午有个地方故障转移过去,或者你手上攥着四把密钥、财务团队开始过问它们时,它就不再舒服了。
类型二:开放权重推理托管商
这个类别之所以存在,是因为有些模型权重是公开的,这意味着价格由 GPU 经济学决定,而不是由拥有模型的那个人决定。这里的竞争是真实的,价格也体现了这一点。
| 模型 | 托管商 | 输入 /1M | 输出 /1M |
|---|---|---|---|
| gpt-oss-20B | Together | $0.05 | $0.20 |
| gpt-oss-20B | Groq(openai/gpt-oss-20b) | $0.075 | $0.30 |
| LFM2.5-8B-A1B | Together | $0.03 | $0.12 |
| gpt-oss-120B | Together | $0.15 | $0.60 |
| gpt-oss-120B | Groq(openai/gpt-oss-120b) | $0.15 | $0.60 |
| Qwen3.5-397B-A17B | Together | $0.60 | $3.60 |
| Llama 3.3 70B | Together | $1.04 | $1.04 |
| Llama 3.3 70B | Groq(llama-3.3-70b-versatile) | $0.59 | $0.79 |
| DeepSeek V4 Flash | DeepSeek(原生) | $0.14 | $0.28 |
价格取自各供应商的定价页面公布内容,核查于 2026-08-02。
按行成对来读这张表,因为重复的模型名正是重点所在。同样的公布权重,你付多少取决于它们跑在谁的集群上。gpt-oss-20B 上 Together 更便宜,$0.05/$0.20 对 $0.075/$0.30。Llama 3.3 70B 上 Groq 更便宜,$0.59/$0.79 对统一的 $1.04/$1.04。在 gpt-oss-120B 上打平。没有谁赢下整个类别,这正是一个产品已商品化、差异化在于调度的市场里应有的样子。这也意味着吞吐量和价格不会同行:Groq 的 1000 tok/s 属于 Groq 按 Groq 价格提供的 gpt-oss-20B,而不属于 Together 对同样权重更便宜的那份标价。
有两点结构性的东西把这个类别和其余分开。
第一是你可以从按 token 计价毕业。Together 公布专属 H100 实例按需为 $5.49/小时,GPU 集群为每 GPU 小时 $3.99,预留后降到 $3.19。Fireworks 列出按需 GPU:H100 或 H200 为 $7.00/小时,B200 为 $10.00,B300 为 $12.00。这给了你一个可以计算的盈亏平衡点:一块 H100 按 $5.49/小时算约合每月 $4,000,所以一旦你在 20B-class 模型上的无服务器账单超过这个数、而且流量是稳定而非尖峰的,专属就开始占优。尖峰流量会让你比算术所暗示的更久地待在无服务器上,因为空闲的小时你也要付钱。
第二是一个值得点名的陷阱。这些托管商上的模型可用性不是承诺。Groq 的模型文档把目录分成生产和预览两类,而预览的措辞异常直接:那些模型「intended for evaluation purposes only and should not be used in production environments as they may be discontinued at short notice.」在 2026-08-02 的核查中,那份清单里包括了 qwen/qwen3.6-27b。如果你在生产里钉死一个预览模型 ID,你就接受了一项供应商已经书面告诉你不要接受的依赖。
这个类别在面对公开权重的大用量、延迟关键的小模型工作,以及任何你最终可能想拉回内部并用同样输出自托管的东西上,配得上它的位置。如果你需要一个前沿闭源模型,或者需要某个特定模型 ID 在下个季度还存在,那这里就是错的地方。
类型三:路由器与聚合器
路由器不跑推理。它接收你的请求,决定哪个上游拿到它,转发过去,再把归一化后的响应交回给你。你买的是集成工作的缺席:一把密钥、一个余额、一种线路格式,以及一条你不用自己搭的备用路径。
大家对这个类别常问的定价问题是有没有加价,而对于两家最大的,答案比是或否更有意思。
OpenRouter 明确表示它不对推理加价:「We pass through the pricing of the underlying providers; there is no markup on inference pricing (however we do charge a fee when purchasing credits).」收入被挪到了付款环节。其 FAQ 把银行卡手续费定为「a 5.5% ($0.80 minimum) fee when you purchase credits」,加密货币为 5%,自带密钥路由则在你一个月内超过头 1M 次 BYOK 请求后收「5% of what the same model and provider would normally cost on OpenRouter」。按每月 $600 的 token 支出算,银行卡手续费约为 $33。按 $10,000 算是 $550。我们在 OpenRouter 定价:那笔隐藏的 5.5% 手续费 中逐项列出了每一笔费用,并在 OpenRouter 可靠吗? 中单独考察了生产可靠性。
既然 ofox 也在这个类别里,公平的做法就是用同样的方式核查我们自己的价格表。以下是我在 2026-08-02 拉取的每个模型页面,对照供应商公布的标价:
| 模型 ID | ofox 标价 | 供应商标价 | 是否一致 |
|---|---|---|---|
anthropic/claude-opus-5 | $5 / $25 | $5 / $25 | 是 |
anthropic/claude-sonnet-5 | $2 / $10 | $2 / $10 | 是 |
openai/gpt-5.5 | $5 / $30 | $5 / $30 | 是 |
google/gemini-3.6-flash | $1.50 / $7.50 | $1.50 / $7.50 | 是 |
deepseek/deepseek-v4-flash | $0.14 / $0.28 | $0.14 / $0.28 | 是 |
openai/gpt-5.6-luna | $1 / $6 | $0.20 / $1.20 | 否,高出 5x |
六个里五个与标价一致,一个明显高于标价。Luna 那一行不是四舍五入误差:OpenAI 在 2026-07-30 把该模型的标价下调了 80%,而三天后该条目仍显示降价前的档位。这个教训适用于每一个路由器,包括这一个。网关价格表是一张快照,而供应商标价说变就变,所以在你打算调用某个精确模型 ID 的那天,去核查它的模型页面,而不是从任何人「便宜」的名声去外推。我们在 DeepSeek V4 Flash 与 Gemini 3.6 Flash 对比 中得出的正是同一个发现。
在挑选路由器前另一件要核查的事是它说哪几种线路格式,因为你的工具链没有投票权。Claude Code 要 Anthropic Messages 格式。Codex CLI 要 OpenAI 的。一个只暴露其中一种的路由器会在你的路径里插进一层翻译。ofox 记录了三个 base URL,每种协议一个:OpenAI Chat Completions 用 https://api.ofox.io/v1,Messages 用 https://api.ofox.io/anthropic,Gemini 用 https://api.ofox.io/gemini。我在 2026-08-02 调用它的 /v1/models 时,返回了跨 12 个供应商前缀的 122 个模型 ID。
当你还在选模型、当你调用超过两家供应商、当你想要一条不用自己搭的故障转移路径,或者当一个预付余额比四段绑卡关系更好交代时,路由器就值回票价。如果你需要在第零日就用上一个全新 SKU、需要一个仅第一方才有的功能,或者你已经直接和某家实验室谈妥了用量折扣,那它就是错误的层。在最后那种情况下,走任何别人都严格更差。
这个类别里不止两个产品。我们在 7 个最佳 OpenRouter 替代品 中给其中七个排了名,并附上迁移说明,而通用的选型框架在 LLM API 网关指南 里。
类型四:云平台
Amazon Bedrock、Google Vertex AI 和 Microsoft Foundry 卖的产品和上面所有人都不同,假装不是这样正是团队最终对它们失望的原因。它们卖的是采购流程。模型是你公司已经在付的一张发票上的一个条目,在你安全团队已经审查过的一个账户里,按一份你可能已经签过的承诺额度计费。对一个足够大的组织来说,这值真金白银,而 token 价格几乎无关紧要。
这些附加费是真实的,而且都有文档记录。
| 附加费 | 出现在哪 | 金额 |
|---|---|---|
| 区域或多区域端点 | Bedrock、Google Cloud | 比全球端点高 10%。Anthropic 的文档把这个范围界定为 Claude Sonnet 4.5、Haiku 4.5、Opus 4.5「and all future models」,所以 Opus 5 和 Sonnet 5 都包含在内 |
| 优先服务档 | Vertex AI | 标准的 1.8x。Google 没有印出这个倍数,但每一行 Gemini 都能除出它来:3.6 Flash 从 $1.50/$7.50 变成 $2.70/$13.50 |
| 仅美国推理地理位置 | Claude API、AWS 上的 Claude Platform、Foundry | 所有 token 类别上加 1.1x,Claude 4.6 及之后 |
| 预配置吞吐量 | Bedrock | 每模型单位每小时,有无承诺、1 个月和 6 个月三档费率。在 Cohere 部分的预配置吞吐量表里,Cohere Command 分别为 $49.50、$39.60 和 $23.77 |
| 批处理 / Flex 档 | Bedrock、Vertex AI | 折扣,不是附加费:标准价打 50% |
计费机制也不同,其差别对负责核对发票的人很重要。AWS 上的 Claude Platform 和 Microsoft Foundry 里的 Claude 都以 Claude Consumption Units 计费,固定为每 CCU $0.01,按小时计量、按月开票。Anthropic 的文档把这描述为「Arrears only (postpaid); no prepaid credits」,你的云账单会显示一个 CCU 条目,而不是按模型的细分。如果你的成本归因依赖于看到哪个模型花了多少钱,那份核对是在供应商控制台里完成的,不在 Cost Explorer 里。
Bedrock 还按区域定价,为 US East、Frankfurt、Sydney 等分别列表,并把推理拆成 Standard、Flex、Priority 和 Reserved 四档。预配置吞吐量按每模型单位每小时报价而非按 token,而对 Anthropic 模型,该页面根本不公布费率:它让你联系你的客户团队,这倒是对整个类别的一个恰当概括。Vertex 对缓存输入按标准的 10% 计费,和第一方是同样的比例。
当你有已承诺的支出要消耗、当采购把一家新供应商当成一个跨季度的项目来对待,或者当流量一留在你已拥有的账户里合规就变简单时,就在这里买。当你想要最新模型、最低价格,或者想要一把 API 密钥而不是一个 IAM 角色时,去别处买。这个类别里的认证是真活儿:用 SigV4 签名或服务账户凭据而不是一个 bearer token,第一次要花一天工程时间,之后每次有新服务需要访问都再多花一点。
定价算术:同一个工作负载的四种买法
标价回答不了大家真正在问的问题,也就是发票上写多少。以下是我反复见到的三个工作负载,按上面核实过的费率来算。
工作负载 A:前沿模型上的面向客户助手。 每月在 Claude Opus 5 上用 20M 输入和 5M 输出 token。
| 路由 | 算式 | 每月 |
|---|---|---|
| Anthropic 直连,全球端点 | 20 × $5 + 5 × $25 | $225 |
| 按标价的路由器 | 同样费率 | $225 |
| 合作云,区域端点 | $225 × 1.10 | $247.50 |
| Anthropic Batch API,如果工作能等 | 20 × $2.50 + 5 × $12.50 | $112.50 |
你从哪种类型购买,会让这张账单移动 10%。工作能否批处理,会让它移动 50%。这个次序对大多数团队都成立,这就是为什么「哪家供应商最便宜」是个错误的首要问题。
工作负载 B:上量的智能体后端。 每月 200M 输入和 50M 输出 token,便宜档。
| 路由 | 算式 | 每月 |
|---|---|---|
| DeepSeek V4 Flash,原生费率 | 200 × $0.14 + 50 × $0.28 | $42 |
| Together 上的 gpt-oss-120B | 200 × $0.15 + 50 × $0.60 | $60 |
| gpt-5.6-luna,OpenAI 标价 | 200 × $0.20 + 50 × $1.20 | $100 |
| gpt-5.6-luna,经由一个仍停在降价前档位的条目 | 200 × $1 + 50 × $6 | $500 |
| Gemini 3.6 Flash | 200 × $1.50 + 50 × $7.50 | $675 |
在同一个质量档内部,差价达到 16x,其中有一行不过是一张过时的价格表。这就是核查具体模型页面能在一个下午里赚回自己的地方。
工作负载 C:离线分类。 每月在 Claude Haiku 4.5 上用 500M 输入和 20M 输出 token。
| 路由 | 算式 | 每月 |
|---|---|---|
| Claude Haiku 4.5,Batch API 打 50% 折 | 500 × $0.50 + 20 × $2.50 | $300 |
| Claude Haiku 4.5,标准费率 | 500 × $1 + 20 × $5 | $600 |
| Vertex 上的 Gemini 3.6 Flash,标准档 | 500 × $1.50 + 20 × $7.50 | $900 |
| Vertex 上的 Gemini 3.6 Flash,优先档 | 500 × $2.70 + 20 × $13.50 | $1,620 |
前两行是对同一个模型的同一个请求,相差两倍,唯一的区别是你是否愿意等。再加上模型和档位的选择,一个平平无奇的工作负载上的差价从 $300 一直跑到 $1,620。几乎没有一个本可以用批处理模式跑工作负载 C 的人真的在这么做。
那些不会出现在价格页上的成本
每个类别都有一个条目,在它到来之前都是看不见的。
| 类型 | 看不见的成本 | 它长什么样 |
|---|---|---|
| 原生 | 集成工作量乘以供应商数量 | 四套 SDK、四套重试策略、四套毫无共通词汇的速率限制规则手册 |
| 原生 | 分词器变化 | Anthropic 的文档指出 Claude 4.7 及之后使用一种分词器,对同样文本产生约多 30% 的 token,所以一次价格相同的模型升级仍可能推高你的账单 |
| 开放权重托管商 | 空闲 GPU 小时 | 专属产能把波谷和波峰一起计费;尖峰流量会烧掉盈亏平衡 |
| 开放权重托管商 | 目录变动 | 按供应商自己的警告,一个预览模型 ID 可能在短时间内被撤下 |
| 路由器 | 付款手续费 | OpenRouter 银行卡充值 5.5%,外加 BYOK 超过每月 1M 请求后的 5% |
| 路由器 | 价格表滞后 | 上面的 Luna 那一行:供应商降价后有三天高出标价 5x |
| 云 | 认证工程 | 用 IAM 角色和请求签名代替一个 bearer token,每个服务一次 |
| 云 | 附加费叠加 | 区域 1.10 × 优先 1.8 在你注意到之前就已经复合了 |
| 全部四种 | 不做批处理 | 在每一个本可以等上一小时的工作负载上都白扔了 50% |
分词器那一行是没人会预先规划的。一次每 token 价格完全相同的模型升级,如果新分词器更密,仍可能推高你的发票,而没有任何价格对比表会给你看到这一点。
什么时候你需要两种类型,什么时候一种就够
当你的流量跑在一两个模型上、一小时的宕机是烦恼而非事故,并且你的每月支出小到 10% 的差别不值得做一次集成时,一种类型就够了。这描述的是大多数团队,而且比它们预期的更久。
一旦下面三件事之一成真,你就想要第二种类型。一次模型宕机给你造成的损失超过搭建备用所需的成本,这种情况下路由器是最便宜的第二条路由,因为它卖的就是故障转移。你的财务流程再也吸收不了一家新供应商,这种情况下云平台解决的问题是任何价格优化都解决不了的。或者你在某个特定模型上的量大到专属部署胜过按 token 计价,这会让你无论还跑别的什么都得上一个开放权重托管商。
出现得最多的搭配是原生密钥加一个路由器。原生密钥承载主流量,给你发布当天的模型和最高的速率上限。路由器是逃生口,已经集成好、留着一个小余额,离接管只差一个模型 ID 字符串。
你不该做的是买同一类型的第二家供应商然后管它叫冗余。两个指向同一个上游供应商的路由器会一起失败。
不重写客户端就切换类型
类型选择是可逆的,因为四个类别里有三个都说 OpenAI Chat Completions 格式。原生 OpenAI、大多数开放权重托管商和大多数路由器都接受同样的请求体,所以要改的只有 base URL 和模型字符串。
Python
import os
from openai import OpenAI
ROUTES = [
("https://api.openai.com/v1", "gpt-5.6-luna"),
("https://api.ofox.io/v1", "deepseek/deepseek-v4-flash"),
("https://api.ofox.io/v1", "anthropic/claude-opus-5"),
]
for base_url, model in ROUTES:
client = OpenAI(base_url=base_url, api_key=os.environ["API_KEY"])
r = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": "Summarize this in one line."}],
)
print(model, r.usage.total_tokens, r.choices[0].message.content[:80])
Node
import OpenAI from "openai";
const routes = [
["https://api.openai.com/v1", "gpt-5.6-luna"],
["https://api.ofox.io/v1", "deepseek/deepseek-v4-flash"],
["https://api.ofox.io/v1", "anthropic/claude-opus-5"],
];
for (const [baseURL, model] of routes) {
const client = new OpenAI({ baseURL, apiKey: process.env.API_KEY });
const r = await client.chat.completions.create({
model,
messages: [{ role: "user", content: "Summarize this in one line." }],
});
console.log(model, r.usage.total_tokens, r.choices[0].message.content.slice(0, 80));
}
在决定某种类型之前,用你自己的提示词跑一遍那个循环。token 数量在不同模型间的差异比价格更大,一个每 token 便宜 3x 但花掉 4x 输出 token 的模型并不更便宜。如果你想要今天的数字而不是本文的数字,ofox 模型目录 里有当前的每模型费率。
云平台是唯一不符合这个模式的类别,这也是它们更费工夫的诚实原因。Bedrock 和 Vertex 要签名请求和平台 SDK,所以迁移到或迁移出它们是一次迁移,而不是编辑两个字符串。
本次刷新核查的来源
- Anthropic 模型定价、批处理、缓存、合作云及 CCU 计费:platform.claude.com/docs/en/about-claude/pricing(核查于 2026-08-02)
- OpenAI GPT-5.x 标价及批处理折扣:developers.openai.com/api/docs/pricing(核查于 2026-08-02)
- Vertex AI Gemini 定价、标准与优先档表格、全球对非全球费率、批处理折扣:cloud.google.com/vertex-ai/generative-ai/pricing,现已重定向到 Agent Platform 定价页(核查于 2026-08-02)
- Amazon Bedrock 定价档位、批处理折扣、预配置吞吐量承诺、按区域表格:aws.amazon.com/bedrock/pricing(核查于 2026-08-02)
- OpenRouter 费用结构,全部引文:
openrouter.ai/docs/faq(核查于 2026-08-02) - Together 无服务器、专属和集群定价:
together.ai/pricing(核查于 2026-08-02) - Fireworks 按需 GPU 定价:
fireworks.ai/pricing(核查于 2026-08-02) - Groq 生产对预览模型策略、每 token 价格和吞吐量数字:
console.groq.com/docs/models(核查于 2026-08-02) - ofox 每模型定价和目录规模:
ofox.ai/zh/models/下的模型页面,加上一次实时的GET /v1/models调用;协议 base URL 取自ofox.io/llms-full.txt(核查于 2026-08-02)
常见问题
- 最佳的 LLM API 供应商是哪家?
- 没有唯一的最佳答案,因为这四种类型卖的东西根本不同。原生 API(OpenAI、Anthropic、Google)卖的是官方标价和新功能的第零日访问权。开放权重托管商(Together、Fireworks、Groq)卖的是无人独占的模型上的廉价 token。路由器卖的是跨多家供应商的一把密钥和一张账单。云平台(Bedrock、Vertex、Microsoft Foundry)卖的是采购流程,让你的 LLM 支出落到财务团队已经批准过的账单上。先选类型,再选类型里的供应商。大多数运行满一年的团队最终会落在两种类型上,而不是一种。
- OpenRouter 比直连更便宜吗?
- 在推理上并不便宜。OpenRouter 自己的 FAQ 写道「there is no markup on inference pricing (however we do charge a fee when purchasing credits)」,而且你「pay the same rate as you would directly with the provider」。成本出现在你充值的时候:「5.5% ($0.80 minimum) fee when you purchase credits」,加密货币充值收 5%。按每月 $600 的支出算,这大约是 $33。自带密钥(BYOK)路由在你每月超过 1M 次 BYOK 请求后另收 5% 费用。所以 token 那一行是一样的,付款那一行不一样。
- 2026 年最便宜的 LLM API 是哪个?
- 对于文本类工作,是开放权重那一档。按 2026-08-02 的核查,DeepSeek V4 Flash 标价为每 1M token 输入 $0.14 / 输出 $0.28,Together 上的 gpt-oss-120B 为 $0.15 / $0.60,gpt-oss-20B 为 $0.05 / $0.20。前沿模型要贵 20x 到 100x:Claude Opus 5 是 $5 / $25,GPT-5.5 是 $5 / $30。标价最便宜的不一定是账单最便宜的,因为啰嗦的推理模型在同一任务上会花掉更多输出 token。
- 我该用 Amazon Bedrock 还是直接用 Anthropic API?
- 当决定因素是采购流程时用 Bedrock:你有已承诺的 AWS 支出要消耗、你需要把费用记到现有账单上,或者当流量始终不离开你已拥有的账户时安全审查会更容易。当你想要最低价格和最先拿到新功能时,直接用 Anthropic API。Anthropic 的定价文档指出,合作云上的区域和多区域端点比全球端点贵 10%,而且部分第一方功能(其中包括 fast mode)在合作方运营的平台上完全不可用。
- LLM API 网关会加价吗?
- 有的会有的不会,诚实的答案是你必须核查具体模型,而不是相信笼统的说法。在 2026-08-02 抽查六个模型页面时,ofox 有五个与供应商标价完全一致(Claude Opus 5 为 $5/$25,Claude Sonnet 5 为 $2/$10,GPT-5.5 为 $5/$30,Gemini 3.6 Flash 为 $1.50/$7.50,DeepSeek V4 Flash 为 $0.14/$0.28),第六个高于标价:GPT-5.6 Luna 显示为 $1/$6,而 OpenAI 降价后为 $0.20/$1.20。网关价格表是快照,中途的供应商降价需要时间才能传导过去。
- LLM API 网关和推理供应商有什么区别?
- 推理供应商拥有或租用 GPU 并运行模型权重。Together、Fireworks、Groq 以及原生实验室都是推理供应商。网关根本不做推理;它接收你的请求,挑选一家供应商,转发过去,再对响应做归一化处理。这就是为什么一个网关能列出 100+ 个它并不托管的模型,也是为什么网关宕机与模型宕机是不同的故障模式。有些产品两件事都做,所以要看模型页面,而不是营销页面。
- 我能用一把 API 密钥调用 OpenAI、Claude 和 Gemini 吗?
- 可以,这正是路由器卖的核心产品。三种线路格式各不相同,所以有意思的问题是某个路由器支持哪几种。ofox 为每种协议记录了一个 base URL:OpenAI Chat Completions 格式用 https://api.ofox.io/v1,Messages API 格式用 https://api.ofox.io/anthropic,Gemini 格式用 https://api.ofox.io/gemini。这一点很重要,因为像 Claude Code 和 Codex CLI 这类工具各自只说一种格式,而且不会协商。
- 我需要不止一家 LLM API 供应商吗?
- 一旦一次模型宕机给你造成的损失超过做集成的工作量,你就需要第二条路由。在这条线以下,一家供应商加一套重试策略就够了。在这条线以上,最便宜的第二条路由通常是不同的类型,而不是同一类型的第二家供应商,因为你要买保险来防范的正是相关性故障。原生密钥加一个路由器是常见搭配:原生密钥给你最新功能和最高的速率上限,路由器给你一个无需新合同就能故障转移过去的去处。


