Como escolher infraestrutura de IA: guia prático de hosts de API

O Vendor cria o modelo; um Token Provider hospeda a API. Use este quadro e preços USD/1M multi-host na AI Hippo para escolher direto, agregador ou cloud sem chute.

Passo 0: Vendor não é o Token Provider

“Fornecedor de modelos” mistura dois papéis. Na AI Hippo, Vendor treina e publica os pesos (Anthropic, OpenAI, Meta, DeepSeek). Token Provider serve o endpoint HTTP de inferência (OpenRouter, Azure OpenAI, AWS Bedrock, Groq ou a API direta do vendor).

Você pode escolher Claude (vendor=anthropic) e ainda escolher entre anthropic-direct, aws-bedrock e openrouter. Misturar “qual modelo” com “qual host” é o caminho mais rápido para uma compra ruim.

Glossário: Vendor vs Service provider. Catálogo em /model/vendor/; hosts em /token/provider/.

Mapa de hosts que a AI Hippo rastreia

Este snapshot indexa 17 Token Providers em quatro tipos:

Direct (7): anthropic-direct, openai-direct, deepseek-direct, moonshot-direct, minimax-direct, z-ai-direct, ai21-direct—preços de página vendor verificáveis.

Cloud (5): aws-bedrock, azure-openai, google-vertex, together, fireworks—nuvem enterprise ou serverless.

Aggregator (4): openrouter, groq, siliconflow, deepinfra—uma API key, muitos upstream.

Other (1): self-hosted—pesos próprios (sem linha de list price compartilhada).

A cobertura é desigual de propósito: OpenRouter tem 334 listings primários (is_primary_listing=1) para ranking; linhas verificadas não-OR cobrem 151 modelos. Rankings usam OpenRouter por comparabilidade; a matriz Token audita USD/1M host-vs-host do mesmo core_model_id.

Seis dimensões de decisão (não só o preço unitário)

Pontue cada host em seis eixos antes do contrato:

1) Preço lista USD/1M (e batch/cached se houver). Prefira model_bound_verified; snapshot é provisório.

2) Confiança e divergência: linhas não oficiais com ≥20% vs OpenRouter verificado são suprimidas.

3) Cobertura de modelo: lista seu SKU? Flagships costumam empatar em direct/cloud/OR (Claude Sonnet 4 a $3/$15 em anthropic-direct, aws-bedrock e openrouter). Open-weight varia muito.

4) Latência e throughput: hosts tipo Groq trocam preço por velocidade; DeepInfra barato pode ganhar $/token e perder p95.

5) Região, residência e compliance: Azure, Bedrock e Vertex cobrem IAM, rede privada e cláusulas que um agregador não substitui.

6) Superfície ops: uma chave OpenRouter vs N chaves, failover, fatura única, sinais domestic_pay / badge_cheapest.

Se empatam no preço verificado, decida nos eixos 4–6.

Rota A — Direto oficial: quando a API do vendor vence

Escolha anthropic-direct, openai-direct, deepseek-direct quando precisar: SKUs no dia 1, flags (batch, cached, tetos de org) que agregadores atrasam, ou uma só relação comercial/DPA.

Números: DeepSeek V4 Pro está a $0.435/$0.870 no deepseek-direct e no listing primário do OpenRouter; DeepInfra $1.30/$2.60; SiliconFlow ~$1.50/$3.14; Fireworks/Together $1.74/$3.48—até 3–4×. Se V4 Pro é o cavalo de produção, direct (ou OR espelho) é o default racional.

Claude Sonnet 4 está a $3/$15 em anthropic-direct, aws-bedrock e openrouter: preço não diferencia; contrato, região e IAM sim.

Custo: N chaves, faturas fragmentadas, e um segundo host para modelos fora do vendor.

Rota B — Agregadores: uma chave, muitos modelos, olhe o spread

OpenRouter, Groq, SiliconFlow e DeepInfra vencem ao prototipar entre vendors, precisar de failover ou uma fatura só com shortlist fluida. Os 334 listings primários do OpenRouter são a faixa de comparabilidade padrão nos rankings AI Hippo.

Mas agregador ≠ mais barato. Llama 3.3 70B Instruct: DeepInfra $0.10/$0.32 (verified), OpenRouter $0.13/$0.40, Groq $0.59/$0.79 (snapshot), Fireworks $0.90/$0.90, Together $1.04/$1.04—cerca de 10× de spread no input.

DeepSeek V4 Flash fica mais apertado: DeepInfra $0.09/$0.18, OpenRouter ~$0.094/$0.188, SiliconFlow $0.13/$0.28, deepseek-direct e Fireworks $0.14/$0.28—aqui um agregador pode bater o direto.

Regra: para cada SKU de produção, ordene a matriz Token por USD/1M verificado.

Rota C — Cloud: compliance e contas vencem o preço lista

Escolha aws-bedrock, azure-openai ou google-vertex quando procurement já padronizou uma nuvem, você precisa de VPC/private link, residência regional, descontos committed-use ou IAM unificado. Together e Fireworks são faixa cloud/serverless para frotas open-weight.

Realidade de preço: GPT-4o está a $2.50/$10.00 em openai-direct, azure-openai e openrouter—a escolha é onde os tokens rodam e quem assina o DPA.

gpt-oss-120b: OpenRouter $0.037/$0.170, SiliconFlow $0.05/$0.45, enquanto aws-bedrock / Fireworks / Groq / Together ficam perto de $0.15/$0.60. Se precisa ficar na AWS, a linha Bedrock pode vencer mesmo com OR mais barato no papel.

Não trate cloud como “sempre mais cara” ou “sempre mais segura” sem ler a linha verified e o contrato.

Custo na prática: mesmo modelo, cinco hosts, duas cargas

Exemplo com Llama 3.3 70B Instruct. Custo = tokens_in×preço_in + tokens_out×preço_out.

Cenário 1 — turno agente (100K in + 20K out): DeepInfra ≈ $0.0164; OpenRouter ≈ $0.021; Groq ≈ $0.075; Fireworks ≈ $0.108; Together ≈ $0.125. O host verified mais barato é ~7.6× mais barato que Together.

Cenário 2 — lote RAG (500K in + 5K out): DeepInfra ≈ $0.0516; OpenRouter ≈ $0.067; Groq ≈ $0.299; Fireworks ≈ $0.455; Together ≈ $0.525.

Segundo exemplo — DeepSeek V4 Pro (100K+20K): direct/OR ≈ $0.061; DeepInfra ≈ $0.182; Fireworks/Together ≈ $0.244. A “comodidade” do agregador sem olhar a matriz pode multiplicar um turno ×3–4.

Comparação de specs e list price do snapshot—não benchmark de capacidade nem tarifas enterprise negociadas.

Checklist: escolha a rota e verifique na AI Hippo

1) Congele o shortlist de modelos com rankings e /compare/—pergunta de Vendor.

2) Para cada core_model_id, abra /token/ e leia cada linha de host: verified vs snapshot, Δ% vs OpenRouter, badges.

3) Uma chave e experimentação rápida → Rota B (muitas vezes OpenRouter), depois promova vencedores a direct/cloud.

4) Um SKU domina o gasto e direct ≤ agregador verified → Rota A.

5) Jurídico/segurança exige conta cloud nomeada → Rota C; confira paridade ou prêmio aceitável.

6) Revise após cada sync de preços (~6h). Leia o guia irmão da matriz antes de price-correction.

7) Self-host só se utilização, ops e licença vencem a linha API verified mais barata—ver /compare/llama-vs-api-hosted/.

Não pule o passo 2. A matriz torna auditável a escolha de infraestrutura.

Fontes

Evidence and actions

Evidência: Quem busca “infraestrutura de IA” costuma misturar vendors e hosts de API; sem um quadro ancorado no pricing snapshot paga a mais ou falha em compliance.

  • Janela de tempo: pricing snapshot
  • Tamanho da amostra: 17
  • Tipo de fonte: editorial_manual
  • Abra /pt/token/ para a matriz USD/1M multi-host.
  • Percorra Direct / Cloud / Aggregator em /pt/token/provider/.
  • Leia /pt/insights/token-cost-comparison-guide/ e o glossário em /pt/glossary/.

Insights