Cómo elegir infraestructura de IA: guía práctica de hosts de API

El Vendor crea el modelo; un Token Provider hospeda la API. Usa este marco y precios USD/1M multi-host en AI Hippo para elegir directo, agregador o cloud sin adivinar.

Paso 0: Vendor no es el Token Provider

“Proveedor de modelos” mezcla dos roles. En AI Hippo, Vendor es quien entrena y publica los pesos (Anthropic, OpenAI, Meta, DeepSeek). Token Provider es quien sirve el endpoint HTTP de inferencia (OpenRouter, Azure OpenAI, AWS Bedrock, Groq o la API directa del vendor).

Puedes elegir Claude (vendor=anthropic) y aún así elegir entre anthropic-direct, aws-bedrock y openrouter. Mezclar “qué modelo” con “qué host” es la vía rápida a una mala compra.

Glosario: Vendor vs Service provider. Catálogo en /model/vendor/; hosts en /token/provider/.

Mapa de hosts que rastrea AI Hippo

Este snapshot indexa 17 Token Providers en cuatro tipos:

Direct (7): anthropic-direct, openai-direct, deepseek-direct, moonshot-direct, minimax-direct, z-ai-direct, ai21-direct—precios de página vendor verificables.

Cloud (5): aws-bedrock, azure-openai, google-vertex, together, fireworks—nube enterprise o serverless.

Aggregator (4): openrouter, groq, siliconflow, deepinfra—una API key, muchos upstream.

Other (1): self-hosted—pesos propios (sin fila de list price compartida).

La cobertura es desigual a propósito: OpenRouter tiene 334 listings primarios (is_primary_listing=1) para ranking; filas verificadas no-OR cubren 151 modelos. Los rankings usan OpenRouter por comparabilidad; la matriz Token audita USD/1M host-vs-host del mismo core_model_id.

Seis dimensiones de decisión (no solo el precio unitario)

Puntúa cada host en seis ejes antes del contrato:

1) Precio lista USD/1M (y batch/cached si existe). Prefiere model_bound_verified; snapshot es provisional.

2) Confianza y divergencia: filas no oficiales con ≥20% vs OpenRouter verificado se suprimen.

3) Cobertura de modelo: ¿lista tu SKU? Los flagship suelen empatar en direct/cloud/OR (Claude Sonnet 4 a $3/$15 en anthropic-direct, aws-bedrock y openrouter). Los open-weight varían mucho.

4) Latencia y throughput: hosts tipo Groq cambian precio por velocidad; DeepInfra barato puede ganar $/token y perder p95.

5) Región, residencia y compliance: Azure, Bedrock y Vertex cubren IAM, red privada y cláusulas que un agregador no reemplaza.

6) Superficie ops: una clave OpenRouter vs N claves, failover, factura única, señales domestic_pay / badge_cheapest.

Si empatan en precio verificado, decide en los ejes 4–6.

Ruta A — Directo oficial: cuándo gana la API del vendor

Elige anthropic-direct, openai-direct, deepseek-direct cuando necesites: SKUs el día 1, flags (batch, cached, límites de org) que los agregadores retrasan, o una sola relación comercial/DPA.

Números: DeepSeek V4 Pro está a $0.435/$0.870 en deepseek-direct y el listing primario de OpenRouter; DeepInfra $1.30/$2.60; SiliconFlow ~$1.50/$3.14; Fireworks/Together $1.74/$3.48—hasta 3–4× más. Si V4 Pro es tu caballo de producción, direct (u OR espejo) es el default racional.

Claude Sonnet 4 está a $3/$15 en anthropic-direct, aws-bedrock y openrouter: el precio no diferencia; sí el contrato, la región y el IAM.

Coste: N claves, facturas rotas, y un segundo host para modelos fuera del vendor.

Ruta B — Agregadores: una clave, muchos modelos, vigila el spread

OpenRouter, Groq, SiliconFlow y DeepInfra ganan al prototipar entre vendors, necesitar failover o una sola factura con shortlist fluida. Los 334 listings primarios de OpenRouter son el carril de comparabilidad por defecto en rankings AI Hippo.

Pero agregador ≠ más barato. Llama 3.3 70B Instruct: DeepInfra $0.10/$0.32 (verified), OpenRouter $0.13/$0.40, Groq $0.59/$0.79 (snapshot), Fireworks $0.90/$0.90, Together $1.04/$1.04—unos 10× de spread en input.

DeepSeek V4 Flash está más apretado: DeepInfra $0.09/$0.18, OpenRouter ~$0.094/$0.188, SiliconFlow $0.13/$0.28, deepseek-direct y Fireworks $0.14/$0.28—aquí un agregador puede batir al directo.

Regla: por cada SKU de producción, ordena la matriz Token por USD/1M verificado.

Ruta C — Cloud: compliance y cuentas ganan al precio lista

Elige aws-bedrock, azure-openai o google-vertex cuando procurement ya estandarizó una nube, necesitas VPC/private link, residencia regional, descuentos committed-use o IAM unificado. Together y Fireworks son banda cloud/serverless para flotas open-weight.

Realidad de precio: GPT-4o está a $2.50/$10.00 en openai-direct, azure-openai y openrouter—la elección es dónde corren los tokens y quién firma el DPA.

gpt-oss-120b: OpenRouter $0.037/$0.170, SiliconFlow $0.05/$0.45, mientras aws-bedrock / Fireworks / Groq / Together rondan $0.15/$0.60. Si debes quedarte en AWS, la fila Bedrock puede ganar aunque OR sea más barato en papel.

No trates la cloud como “siempre más cara” o “siempre más segura” sin leer la fila verified y el contrato.

Coste en la práctica: mismo modelo, cinco hosts, dos cargas

Ejemplo con Llama 3.3 70B Instruct. Coste = tokens_in×precio_in + tokens_out×precio_out.

Escenario 1 — turno agente (100K in + 20K out): DeepInfra ≈ $0.0164; OpenRouter ≈ $0.021; Groq ≈ $0.075; Fireworks ≈ $0.108; Together ≈ $0.125. El host verified más barato es ~7.6× más barato que Together.

Escenario 2 — lote RAG (500K in + 5K out): DeepInfra ≈ $0.0516; OpenRouter ≈ $0.067; Groq ≈ $0.299; Fireworks ≈ $0.455; Together ≈ $0.525.

Segundo ejemplo — DeepSeek V4 Pro (100K+20K): direct/OR ≈ $0.061; DeepInfra ≈ $0.182; Fireworks/Together ≈ $0.244. La “comodidad” del agregador sin mirar la matriz puede multiplicar un turno ×3–4.

Comparación de specs y list price del snapshot—no benchmark de capacidad ni tarifas enterprise negociadas.

Lista de decisión: elige ruta y verifica en AI Hippo

1) Congela el shortlist de modelos con rankings y /compare/—pregunta de Vendor.

2) Por cada core_model_id, abre /token/ y lee cada fila de host: verified vs snapshot, Δ% vs OpenRouter, badges.

3) Una clave y experimentación rápida → Ruta B (a menudo OpenRouter), luego promociona ganadores a direct/cloud.

4) Un SKU domina el gasto y direct ≤ agregador verified → Ruta A.

5) Legal/seguridad exige cuenta cloud nombrada → Ruta C; comprueba paridad o prima aceptable.

6) Revisa tras cada sync de precios (~6h). Lee la guía hermana de la matriz antes de price-correction.

7) Self-host solo si utilización, ops y licencia vencen la fila API verified más barata—ver /compare/llama-vs-api-hosted/.

No saltes el paso 2. La matriz hace auditable la elección de infraestructura.

Fuentes

Evidence and actions

Evidencia: Quien busca “infraestructura IA” suele mezclar vendors y hosts de API; sin un marco anclado al pricing snapshot se paga de más o se incumple compliance.

  • Ventana temporal: pricing snapshot
  • Tamaño de muestra: 17
  • Tipo de fuente: editorial_manual
  • Abre /es/token/ para la matriz USD/1M multi-host.
  • Recorre Direct / Cloud / Aggregator en /es/token/provider/.
  • Lee /es/insights/token-cost-comparison-guide/ y el glosario en /es/glossary/.

Insights