Choisir son infrastructure IA : guide pratique des hôtes d’API
Le Vendor crée le modèle ; un Token Provider héberge l’API. Cadre de décision + prix USD/1M multi-hôtes sur AI Hippo pour trancher direct, agrégateur ou cloud.
Étape 0 : Vendor ≠ Token Provider
« Fournisseur de modèles » mélange deux rôles. Sur AI Hippo, le Vendor entraîne et publie les poids (Anthropic, OpenAI, Meta, DeepSeek). Le Token Provider sert l’endpoint HTTP d’inférence (OpenRouter, Azure OpenAI, AWS Bedrock, Groq ou l’API directe).
Vous pouvez choisir Claude (vendor=anthropic) et encore trancher entre anthropic-direct, aws-bedrock et openrouter. Mélanger « quel modèle » et « quel hôte » mène vite à un mauvais achat.
Glossaire : Vendor vs Service provider. Catalogue /model/vendor/ ; hôtes /token/provider/.
Carte des hôtes suivis par AI Hippo
Ce snapshot indexe 17 Token Providers en quatre kinds :
Direct (7) : anthropic-direct, openai-direct, deepseek-direct, moonshot-direct, minimax-direct, z-ai-direct, ai21-direct — prix de page vendor vérifiables.
Cloud (5) : aws-bedrock, azure-openai, google-vertex, together, fireworks — cloud enterprise ou serverless.
Aggregator (4) : openrouter, groq, siliconflow, deepinfra — une clé API, plusieurs upstream.
Other (1) : self-hosted — poids auto-hébergés (pas de list price partagé).
Couverture volontairement inégale : OpenRouter porte 334 listings primaires (is_primary_listing=1) pour le ranking ; les lignes vérifiées hors OR couvrent 151 modèles. Les classements utilisent OpenRouter pour la comparabilité ; la matrice Token audite le USD/1M hôte-contre-hôte pour un même core_model_id.
Six dimensions de décision (pas seulement le prix unitaire)
Notez chaque hôte sur six axes avant le contrat :
1) Prix liste USD/1M (et batch/cached si présent). Préférez model_bound_verified ; snapshot = provisoire.
2) Confiance et divergence : lignes non officielles ≥20 % vs OpenRouter vérifié sont supprimées.
3) Couverture modèle : votre SKU est-il listé ? Les flagships s’alignent souvent (Claude Sonnet 4 à $3/$15 sur anthropic-direct, aws-bedrock, openrouter). Les open-weight varient fort.
4) Latence et débit : hôtes type Groq échangent prix contre vitesse ; DeepInfra bon marché peut gagner en $/token et perdre en p95.
5) Région, résidence, compliance : Azure, Bedrock, Vertex couvrent IAM, réseau privé et clauses qu’un agrégateur ne remplace pas.
6) Surface ops : une clé OpenRouter vs N clés, failover, facture unique, signaux domestic_pay / badge_cheapest.
À prix vérifié égal, tranchez sur les axes 4–6.
Voie A — Direct officiel : quand l’API vendor gagne
Choisissez anthropic-direct, openai-direct, deepseek-direct quand il vous faut : SKUs dès le jour 1, flags (batch, cached, plafonds org) que les agrégateurs retardent, ou une relation commerciale/DPA unique.
Chiffres : DeepSeek V4 Pro à $0.435/$0.870 sur deepseek-direct et le listing primaire OpenRouter ; DeepInfra $1.30/$2.60 ; SiliconFlow ~$1.50/$3.14 ; Fireworks/Together $1.74/$3.48 — jusqu’à 3–4×. Si V4 Pro est votre cheval de prod, le direct (ou OR miroir) est le défaut rationnel.
Claude Sonnet 4 est à $3/$15 sur anthropic-direct, aws-bedrock et openrouter : le prix n’est pas le différenciateur ; contrat, région et IAM le sont.
Contrepartie : N clés, factures éclatées, et un second hôte hors vendor.
Voie B — Agrégateurs : une clé, beaucoup de modèles, surveillez le spread
OpenRouter, Groq, SiliconFlow et DeepInfra gagnent pour prototyper multi-vendors, le failover, ou une facture unique tant que la shortlist bouge. Les 334 listings primaires OpenRouter sont la voie de comparabilité par défaut des rankings AI Hippo.
Mais agrégateur ≠ moins cher. Llama 3.3 70B Instruct : DeepInfra $0.10/$0.32 (verified), OpenRouter $0.13/$0.40, Groq $0.59/$0.79 (snapshot), Fireworks $0.90/$0.90, Together $1.04/$1.04 — ~10× d’écart en entrée.
DeepSeek V4 Flash est plus serré : DeepInfra $0.09/$0.18, OpenRouter ~$0.094/$0.188, SiliconFlow $0.13/$0.28, deepseek-direct et Fireworks $0.14/$0.28 — ici un agrégateur peut battre le direct.
Règle : pour chaque SKU de prod, triez la matrice Token par USD/1M vérifié.
Voie C — Cloud : compliance et comptes battent le prix liste
Choisissez aws-bedrock, azure-openai ou google-vertex quand le procurement a standardisé un cloud, qu’il faut VPC/private link, résidence régionale, remises committed-use ou IAM unifié. Together et Fireworks sont la bande cloud/serverless pour flottes open-weight.
Réalité prix : GPT-4o à $2.50/$10.00 sur openai-direct, azure-openai et openrouter — l’enjeu est où tournent les tokens et qui signe le DPA.
gpt-oss-120b : OpenRouter $0.037/$0.170, SiliconFlow $0.05/$0.45, aws-bedrock / Fireworks / Groq / Together ~$0.15/$0.60. Rester dans AWS peut rendre la ligne Bedrock rationnelle même si OR est moins cher sur le papier.
Ne traitez pas le cloud comme « toujours plus cher » ou « toujours plus sûr » sans lire la ligne verified et le contrat.
Coût en pratique : même modèle, cinq hôtes, deux charges
Exemple sur Llama 3.3 70B Instruct. Coût = tokens_in×prix_in + tokens_out×prix_out.
Scénario 1 — tour agent (100K in + 20K out) : DeepInfra ≈ $0.0164 ; OpenRouter ≈ $0.021 ; Groq ≈ $0.075 ; Fireworks ≈ $0.108 ; Together ≈ $0.125. Le host verified le moins cher est ~7,6× moins cher que Together.
Scénario 2 — lot RAG (500K in + 5K out) : DeepInfra ≈ $0.0516 ; OpenRouter ≈ $0.067 ; Groq ≈ $0.299 ; Fireworks ≈ $0.455 ; Together ≈ $0.525.
Second exemple — DeepSeek V4 Pro (100K+20K) : direct/OR ≈ $0.061 ; DeepInfra ≈ $0.182 ; Fireworks/Together ≈ $0.244. La « commodité » agrégateur sans matrice peut ×3–4 un tour.
Comparaison specs/list price du snapshot — pas un benchmark de capacité ni des tarifs enterprise négociés.
Checklist : choisissez la voie, puis vérifiez sur AI Hippo
1) Gelez la shortlist modèles via rankings et /compare/ — question Vendor.
2) Pour chaque core_model_id, ouvrez /token/ et lisez chaque ligne d’hôte : verified vs snapshot, Δ% vs OpenRouter, badges.
3) Une clé et expérimentation rapide → Voie B (souvent OpenRouter), puis promotez les gagnants en direct/cloud.
4) Un SKU domine la dépense et direct ≤ agrégateur verified → Voie A.
5) Juridique/sécu exige un compte cloud nommé → Voie C ; vérifiez parité ou prime acceptable.
6) Revérifiez après chaque sync prix (~6h). Lisez le guide sœur de la matrice avant price-correction.
7) Self-host seulement si utilisation, ops et licence battent la ligne API verified la moins chère — /compare/llama-vs-api-hosted/.
Ne sautez pas l’étape 2. La matrice rend le choix d’infrastructure auditable.
Sources
Evidence and actions
Preuve: Les recherches « infrastructure IA » confondent vendors et hôtes d’API ; sans cadre ancré au pricing snapshot, surcoût ou échec compliance.
- Fenêtre temporelle: pricing snapshot
- Taille de l’échantillon: 17
- Type de source: editorial_manual
- Ouvrez /fr/token/ pour la matrice USD/1M multi-hôtes.
- Parcourez Direct / Cloud / Aggregator sur /fr/token/provider/.
- Lisez /fr/insights/token-cost-comparison-guide/ et le glossaire /fr/glossary/.