如何选择 AI Infrastructure:模型 API 服务商(Token Provider)实用指南

Vendor 造模型,Token Provider 提供推理 API。用本决策框架,结合 AI Hippo 上的多源 USD/1M 实价,在官方直连、聚合器与云平台之间做可复现的选型。

第 0 步:Vendor ≠ Token Provider

口语里的「模型供应商」其实叠了两件事。在 AI Hippo:Vendor(开发商)是训练并发布权重的品牌——Anthropic、OpenAI、Meta、DeepSeek;Token Provider(API 宿主 / 服务商)是对外提供推理 HTTP 端点的平台——OpenRouter、Azure OpenAI、AWS Bedrock、Groq,或厂商自己的直连 API。

你可以选 Claude(vendor=anthropic),但仍要在 anthropic-direct、aws-bedrock、openrouter 等宿主之间再选一次。把「选哪个模型」和「走哪条 API」混成一个问题,是最容易买贵或踩坑的做法。

术语见词汇表:开发商(Vendor)与服务商(API 主机)。模型侧入口 /model/vendor/;宿主索引 /token/provider/。

宿主版图:AI Hippo 当前跟踪哪些 Token Provider

本快照按四类索引 17 个 Token Provider:

直连 Direct(7):anthropic-direct、openai-direct、deepseek-direct、moonshot-direct、minimax-direct、z-ai-direct、ai21-direct——来自厂商定价页爬取的可验证标价。

云 Cloud(5):aws-bedrock、azure-openai、google-vertex、together、fireworks——企业合同或 Serverless 云,自有 SKU 与结算。

聚合 Aggregator(4):openrouter、groq、siliconflow、deepinfra——一把 API Key,多路上游模型。

其他 Other(1):self-hosted——自托管权重(无共享标价行)。

覆盖刻意不均:OpenRouter 有 334 条主 listing(is_primary_listing=1)供跨模型排名;非 OpenRouter 的已验证行覆盖 151 个不同模型。排行榜默认用 OpenRouter 保证可比;Token 矩阵才是按同一 core_model_id 审计「宿主 vs 宿主」USD/1M 的地方。

六个决策维度(别只看单价)

签约前,按六个轴给候选宿主打分:

1)标价:每百万 token 的 prompt/completion(以及 batch/cached 档)。优先 model_bound_verified;model_bound_snapshot 视为暂定,直到厂商爬取稳定。

2)价格可信度与偏离:相对已验证 OpenRouter 报价偏离 ≥20% 的非官方行会被抑制,避免矩阵默默采纳离群值。

3)模型覆盖:该宿主是否真的上架你的 SKU?旗舰官方价常跨 direct/cloud/OR 持平(例:Claude Sonnet 4 在 anthropic-direct、aws-bedrock、openrouter 均为 $3/$15)。开源与中档 SKU 的宿主间价差可以非常大。

4)延迟与吞吐档位:Groq 类宿主常用更高标价换速度;最便宜的 DeepInfra 行可能赢在 $/token 但输在 p95。有 latency 列就看列,没有就自己压测。

5)区域、数据驻留与合规:Azure OpenAI、Bedrock、Vertex 解决的是企业 IAM、私网与驻留条款——纯聚合器发票替代不了。

6)运维面:一把 OpenRouter Key vs N 把厂商 Key、故障切换、账单合并,以及是否需要矩阵里的 domestic_pay / badge_cheapest 信号。

若两家 verified 价持平,用 4–6 轴决胜,而不是看宣传页。

路径 A — 官方直连:何时厂商 API 胜出

在需要这些条件时选 anthropic-direct、openai-direct、deepseek-direct(及同类):首日上新 SKU;batch / cached input / 组织消费上限等聚合器常滞后的能力;或单一商务关系(支持与 DPA)。

本快照硬数字:DeepSeek V4 Pro 在 deepseek-direct 与 OpenRouter 主 listing 均为每百万 $0.435/$0.870;DeepInfra 标 $1.30/$2.60,SiliconFlow 约 $1.50/$3.14,Fireworks/Together 为 $1.74/$3.48——同一 model id 在部分聚合器上可贵 3–4 倍。若 V4 Pro 是生产主力,直连(或与直连同价的 OR)才是成本理性默认。

反例:Claude Sonnet 4 在 anthropic-direct、aws-bedrock、openrouter 均为 $3/$15——此时价格不是差异点,合同、区域与 IAM 才是。

代价:N 把厂商 Key、账单碎片化,且该厂商以外的模型仍要第二宿主。

路径 B — 聚合器:一把 Key、多模型,但盯紧价差

OpenRouter、Groq、SiliconFlow、DeepInfra 适合:跨厂商原型、需要故障切换路由、或模型短名单仍在变时想一张发票。OpenRouter 的 334 条主 listing 也是 AI Hippo 排行榜的默认可比通道。

但「聚合」≠「最便宜」。本快照 Llama 3.3 70B Instruct:DeepInfra $0.10/$0.32(verified)、OpenRouter 主价 $0.13/$0.40、Groq $0.59/$0.79(snapshot)、Fireworks $0.90/$0.90、Together $1.04/$1.04。同一开源 id 的输入标价从最便宜到最贵约 10 倍。

DeepSeek V4 Flash 更紧:DeepInfra $0.09/$0.18、OpenRouter 约 $0.094/$0.188、SiliconFlow $0.13/$0.28、deepseek-direct 与 Fireworks $0.14/$0.28——这里聚合器可以低于直连。

法则:每个生产 SKU 都打开 Token 矩阵按 verified USD/1M 排序——别假设上季度胜出的宿主这季度仍胜。

路径 C — 云平台:合规与账号体系往往重于标价

在这些条件下选 aws-bedrock、azure-openai 或 google-vertex:采购已锁定某一云;需要 VPC/Private Link;区域驻留;承诺用量折扣;或与其余栈统一的 IAM。Together 与 Fireworks 属于「云/Serverless 推理」带:适合开源舰队与云式运维,但不必是完整超大规模账号。

价格现实:本快照 GPT-4o 在 openai-direct、azure-openai、openrouter 均为 $2.50/$10.00——宿主选择关乎 token 跑在哪、谁签 DPA,而不是公开标价里的秘密折扣。

gpt-oss-120b 是另一模式:OpenRouter 主价 $0.037/$0.170,SiliconFlow $0.05/$0.45,而 aws-bedrock / Fireworks / Groq / Together 聚在约 $0.15/$0.60。若必须留在 AWS 体系内,付 Bedrock 行仍可能优于再开一套厂商关系——即使纸面上 OR 更便宜。

切勿在未读 verified 行与合同附件前,把云一律当成「总更贵」或「总更安全」。

成本实测:同一模型、五个宿主、两种负载

以 Llama 3.3 70B Instruct 为例(标价见上)。成本 = 输入 tokens×输入价 + 输出 tokens×输出价。

场景 1——agent 编码一轮(10 万输入 + 2 万输出):DeepInfra ≈ $0.0164;OpenRouter ≈ $0.021;Groq ≈ $0.075;Fireworks ≈ $0.108;Together ≈ $0.125。最便宜 verified 宿主比 Together 便宜约 7.6 倍。

场景 2——RAG 批处理(50 万输入 + 5 千输出):DeepInfra ≈ $0.0516;OpenRouter ≈ $0.067;Groq ≈ $0.299;Fireworks ≈ $0.455;Together ≈ $0.525。

第二例——DeepSeek V4 Pro 生产对话(10 万入 + 2 万出):deepseek-direct / OpenRouter ≈ $0.061;DeepInfra ≈ $0.182;Fireworks/Together ≈ $0.244。图「方便」走聚合器却不看矩阵,单轮就可贵 3–4 倍。

以上为站内快照的规格与标价对比,非能力基准测试,也非企业谈判价。

决策清单:先选路径,再回 AI Hippo 核验

1)用排行榜与 /compare/ 冻结模型短名单(能力 / 上下文 / 工具)——这是 Vendor 问题。

2)对每个入围的 core_model_id,打开 /token/ 读齐宿主行:verified vs snapshot、相对 OpenRouter 的 Δ%、最便宜/最快/国内支付等徽章。

3)若需要一把 Key 与快速实验 → 先走路径 B(常是 OpenRouter),再把胜出者晋升为直连或云。

4)若单一 SKU 主导花费且直连 verified 价 ≤ 聚合器 → 路径 A。

5)若法务/安全要求具名云账号 → 路径 C,再确认云行是价格持平还是你可接受的溢价。

6)每次定价同步后复查(管道约 6h)。提交 price-correction 前先读「如何读定价矩阵」同伴文。

7)仅当利用率、运维能力与许可条款,在你的量级下打得过最便宜 verified API 行时才自托管——分叉见 /compare/llama-vs-api-hosted/。

不要跳过第 2 步。矩阵存在的意义,就是让「AI 基础设施」选型可审计,而不是凭传闻。

来源

证据与行动建议

证据: 搜「AI 基础设施 / 选哪个模型供应商」的团队常把模型厂商与 API 宿主混为一谈;需要一份锚定定价快照的选型框架,否则易多花钱或踩合规红线。

  • 时间窗口: pricing snapshot
  • 观测数量: 17
  • 来源类型: editorial_manual
  • 在 /zh/token/ 按模型展开多宿主 USD/1M 矩阵。
  • 打开 /zh/token/provider/ 浏览 Direct / Cloud / Aggregator。
  • 读 /zh/insights/token-cost-comparison-guide/ 弄清 verified 与主价口径,必要时查 /zh/glossary/。

洞察