Cómo elegir infraestructura de IA: guía práctica de hosts de API
El Vendor crea el modelo; un Token Provider hospeda la API. Usa este marco y precios USD/1M multi-host en AI Hippo para elegir directo, agregador o cloud sin adivinar.
Paso 0: Vendor no es el Token Provider
“Proveedor de modelos” mezcla dos roles. En AI Hippo, Vendor es quien entrena y publica los pesos (Anthropic, OpenAI, Meta, DeepSeek). Token Provider es quien sirve el endpoint HTTP de inferencia (OpenRouter, Azure OpenAI, AWS Bedrock, Groq o la API directa del vendor).
Puedes elegir Claude (vendor=anthropic) y aún así elegir entre anthropic-direct, aws-bedrock y openrouter. Mezclar “qué modelo” con “qué host” es la vía rápida a una mala compra.
Glosario: Vendor vs Service provider. Catálogo en /model/vendor/; hosts en /token/provider/.
Mapa de hosts que rastrea AI Hippo
Este snapshot indexa 17 Token Providers en cuatro tipos:
Direct (7): anthropic-direct, openai-direct, deepseek-direct, moonshot-direct, minimax-direct, z-ai-direct, ai21-direct—precios de página vendor verificables.
Cloud (5): aws-bedrock, azure-openai, google-vertex, together, fireworks—nube enterprise o serverless.
Aggregator (4): openrouter, groq, siliconflow, deepinfra—una API key, muchos upstream.
Other (1): self-hosted—pesos propios (sin fila de list price compartida).
La cobertura es desigual a propósito: OpenRouter tiene 334 listings primarios (is_primary_listing=1) para ranking; filas verificadas no-OR cubren 151 modelos. Los rankings usan OpenRouter por comparabilidad; la matriz Token audita USD/1M host-vs-host del mismo core_model_id.
Seis dimensiones de decisión (no solo el precio unitario)
Puntúa cada host en seis ejes antes del contrato:
1) Precio lista USD/1M (y batch/cached si existe). Prefiere model_bound_verified; snapshot es provisional.
2) Confianza y divergencia: filas no oficiales con ≥20% vs OpenRouter verificado se suprimen.
3) Cobertura de modelo: ¿lista tu SKU? Los flagship suelen empatar en direct/cloud/OR (Claude Sonnet 4 a $3/$15 en anthropic-direct, aws-bedrock y openrouter). Los open-weight varían mucho.
4) Latencia y throughput: hosts tipo Groq cambian precio por velocidad; DeepInfra barato puede ganar $/token y perder p95.
5) Región, residencia y compliance: Azure, Bedrock y Vertex cubren IAM, red privada y cláusulas que un agregador no reemplaza.
6) Superficie ops: una clave OpenRouter vs N claves, failover, factura única, señales domestic_pay / badge_cheapest.
Si empatan en precio verificado, decide en los ejes 4–6.
Ruta A — Directo oficial: cuándo gana la API del vendor
Elige anthropic-direct, openai-direct, deepseek-direct cuando necesites: SKUs el día 1, flags (batch, cached, límites de org) que los agregadores retrasan, o una sola relación comercial/DPA.
Números: DeepSeek V4 Pro está a $0.435/$0.870 en deepseek-direct y el listing primario de OpenRouter; DeepInfra $1.30/$2.60; SiliconFlow ~$1.50/$3.14; Fireworks/Together $1.74/$3.48—hasta 3–4× más. Si V4 Pro es tu caballo de producción, direct (u OR espejo) es el default racional.
Claude Sonnet 4 está a $3/$15 en anthropic-direct, aws-bedrock y openrouter: el precio no diferencia; sí el contrato, la región y el IAM.
Coste: N claves, facturas rotas, y un segundo host para modelos fuera del vendor.
Ruta B — Agregadores: una clave, muchos modelos, vigila el spread
OpenRouter, Groq, SiliconFlow y DeepInfra ganan al prototipar entre vendors, necesitar failover o una sola factura con shortlist fluida. Los 334 listings primarios de OpenRouter son el carril de comparabilidad por defecto en rankings AI Hippo.
Pero agregador ≠ más barato. Llama 3.3 70B Instruct: DeepInfra $0.10/$0.32 (verified), OpenRouter $0.13/$0.40, Groq $0.59/$0.79 (snapshot), Fireworks $0.90/$0.90, Together $1.04/$1.04—unos 10× de spread en input.
DeepSeek V4 Flash está más apretado: DeepInfra $0.09/$0.18, OpenRouter ~$0.094/$0.188, SiliconFlow $0.13/$0.28, deepseek-direct y Fireworks $0.14/$0.28—aquí un agregador puede batir al directo.
Regla: por cada SKU de producción, ordena la matriz Token por USD/1M verificado.
Ruta C — Cloud: compliance y cuentas ganan al precio lista
Elige aws-bedrock, azure-openai o google-vertex cuando procurement ya estandarizó una nube, necesitas VPC/private link, residencia regional, descuentos committed-use o IAM unificado. Together y Fireworks son banda cloud/serverless para flotas open-weight.
Realidad de precio: GPT-4o está a $2.50/$10.00 en openai-direct, azure-openai y openrouter—la elección es dónde corren los tokens y quién firma el DPA.
gpt-oss-120b: OpenRouter $0.037/$0.170, SiliconFlow $0.05/$0.45, mientras aws-bedrock / Fireworks / Groq / Together rondan $0.15/$0.60. Si debes quedarte en AWS, la fila Bedrock puede ganar aunque OR sea más barato en papel.
No trates la cloud como “siempre más cara” o “siempre más segura” sin leer la fila verified y el contrato.
Coste en la práctica: mismo modelo, cinco hosts, dos cargas
Ejemplo con Llama 3.3 70B Instruct. Coste = tokens_in×precio_in + tokens_out×precio_out.
Escenario 1 — turno agente (100K in + 20K out): DeepInfra ≈ $0.0164; OpenRouter ≈ $0.021; Groq ≈ $0.075; Fireworks ≈ $0.108; Together ≈ $0.125. El host verified más barato es ~7.6× más barato que Together.
Escenario 2 — lote RAG (500K in + 5K out): DeepInfra ≈ $0.0516; OpenRouter ≈ $0.067; Groq ≈ $0.299; Fireworks ≈ $0.455; Together ≈ $0.525.
Segundo ejemplo — DeepSeek V4 Pro (100K+20K): direct/OR ≈ $0.061; DeepInfra ≈ $0.182; Fireworks/Together ≈ $0.244. La “comodidad” del agregador sin mirar la matriz puede multiplicar un turno ×3–4.
Comparación de specs y list price del snapshot—no benchmark de capacidad ni tarifas enterprise negociadas.
Lista de decisión: elige ruta y verifica en AI Hippo
1) Congela el shortlist de modelos con rankings y /compare/—pregunta de Vendor.
2) Por cada core_model_id, abre /token/ y lee cada fila de host: verified vs snapshot, Δ% vs OpenRouter, badges.
3) Una clave y experimentación rápida → Ruta B (a menudo OpenRouter), luego promociona ganadores a direct/cloud.
4) Un SKU domina el gasto y direct ≤ agregador verified → Ruta A.
5) Legal/seguridad exige cuenta cloud nombrada → Ruta C; comprueba paridad o prima aceptable.
6) Revisa tras cada sync de precios (~6h). Lee la guía hermana de la matriz antes de price-correction.
7) Self-host solo si utilización, ops y licencia vencen la fila API verified más barata—ver /compare/llama-vs-api-hosted/.
No saltes el paso 2. La matriz hace auditable la elección de infraestructura.
Fuentes
Evidence and actions
Evidencia: Quien busca “infraestructura IA” suele mezclar vendors y hosts de API; sin un marco anclado al pricing snapshot se paga de más o se incumple compliance.
- Ventana temporal: pricing snapshot
- Tamaño de muestra: 17
- Tipo de fuente: editorial_manual
- Abre /es/token/ para la matriz USD/1M multi-host.
- Recorre Direct / Cloud / Aggregator en /es/token/provider/.
- Lee /es/insights/token-cost-comparison-guide/ y el glosario en /es/glossary/.