KI-Infrastruktur wählen: Praxisleitfaden zu API-Hosts

Der Vendor baut das Modell; ein Token Provider hostet die API. Entscheidungsrahmen plus Live-USD/1M-Preise auf AI Hippo für Direkt, Aggregator oder Cloud.

Schritt 0: Vendor ist nicht der Token Provider

„Modellanbieter“ vermischt zwei Rollen. Bei AI Hippo trainiert und veröffentlicht der Vendor die Weights (Anthropic, OpenAI, Meta, DeepSeek). Der Token Provider liefert den Inference-HTTP-Endpunkt (OpenRouter, Azure OpenAI, AWS Bedrock, Groq oder die Direkt-API).

Sie können Claude (vendor=anthropic) wählen und trotzdem zwischen anthropic-direct, aws-bedrock und openrouter entscheiden. „Welches Modell?“ mit „welcher Host?“ zu vermischen ist der schnellste Weg zum Fehlkauf.

Glossar: Vendor vs Service provider. Katalog unter /model/vendor/; Hosts unter /token/provider/.

Host-Landkarte: was AI Hippo trackt

Dieser Snapshot indexiert 17 Token Provider in vier Arten:

Direct (7): anthropic-direct, openai-direct, deepseek-direct, moonshot-direct, minimax-direct, z-ai-direct, ai21-direct—prüfbare Vendor-Seitenpreise.

Cloud (5): aws-bedrock, azure-openai, google-vertex, together, fireworks—Enterprise- oder Serverless-Cloud.

Aggregator (4): openrouter, groq, siliconflow, deepinfra—ein API-Key, viele Upstreams.

Other (1): self-hosted—eigene Weights (keine gemeinsame List-Price-Zeile).

Abdeckung bewusst ungleich: OpenRouter hat 334 Primary-Listings (is_primary_listing=1) für Rankings; verifizierte Non-OR-Zeilen decken 151 Modelle. Rankings nutzen OpenRouter für Vergleichbarkeit; die Token-Matrix prüft USD/1M Host-vs-Host für dieselbe core_model_id.

Sechs Entscheidungsachsen (nicht nur Stückpreis)

Bewerten Sie jeden Host vor dem Vertrag auf sechs Achsen:

1) Listenpreis USD/1M (plus Batch/Cached falls vorhanden). Preferieren Sie model_bound_verified; Snapshot ist vorläufig.

2) Konfidenz & Divergenz: Nicht-offizielle Zeilen mit ≥20 % Abweichung vom verifizierten OpenRouter werden unterdrückt.

3) Modellabdeckung: Ist Ihr SKU gelistet? Flagships liegen oft gleichauf (Claude Sonnet 4 zu $3/$15 auf anthropic-direct, aws-bedrock, openrouter). Open-Weight schwankt stark.

4) Latenz & Throughput: Groq-ähnliche Hosts tauschen Preis gegen Tempo; billiges DeepInfra kann bei $/Token gewinnen und bei p95 verlieren.

5) Region, Residenz, Compliance: Azure, Bedrock, Vertex decken IAM, Privatnetz und Klauseln ab, die ein Aggregator nicht ersetzt.

6) Ops-Fläche: ein OpenRouter-Key vs. N Keys, Failover, Rechnungskonsolidierung, domestic_pay / badge_cheapest.

Bei gleichem verifiziertem Preis entscheiden Achsen 4–6.

Pfad A — Offiziell direkt: wann die Vendor-API gewinnt

Wählen Sie anthropic-direct, openai-direct, deepseek-direct, wenn Sie brauchen: SKUs am Tag 1, Flags (Batch, Cached, Org-Limits), die Aggregatoren verzögern, oder eine einzige Commercial-/DPA-Beziehung.

Zahlen: DeepSeek V4 Pro kostet $0.435/$0.870 auf deepseek-direct und dem OpenRouter-Primary-Listing; DeepInfra $1.30/$2.60; SiliconFlow ~$1.50/$3.14; Fireworks/Together $1.74/$3.48—bis 3–4×. Ist V4 Pro Ihr Production-Workhorse, ist Direct (oder spiegelndes OR) das rationale Default.

Claude Sonnet 4 liegt bei $3/$15 auf anthropic-direct, aws-bedrock und openrouter: Preis differenziert nicht; Vertrag, Region und IAM schon.

Trade-off: N Keys, fragmentierte Rechnungen, zweiter Host für Modelle außerhalb des Vendors.

Pfad B — Aggregatoren: ein Key, viele Modelle, Spread beachten

OpenRouter, Groq, SiliconFlow und DeepInfra gewinnen beim Multi-Vendor-Prototyping, Failover oder einer Rechnung bei fluider Shortlist. 334 OpenRouter-Primary-Listings sind die Default-Vergleichsspur der AI-Hippo-Rankings.

Aber Aggregator ≠ billigste. Llama 3.3 70B Instruct: DeepInfra $0.10/$0.32 (verified), OpenRouter $0.13/$0.40, Groq $0.59/$0.79 (snapshot), Fireworks $0.90/$0.90, Together $1.04/$1.04—etwa 10× Spread auf Input.

DeepSeek V4 Flash ist enger: DeepInfra $0.09/$0.18, OpenRouter ~$0.094/$0.188, SiliconFlow $0.13/$0.28, deepseek-direct und Fireworks $0.14/$0.28—hier kann ein Aggregator Direct unterbieten.

Regel: Pro Production-SKU Token-Matrix nach verified USD/1M sortieren.

Pfad C — Cloud: Compliance und Konten schlagen Listenpreis

Wählen Sie aws-bedrock, azure-openai oder google-vertex, wenn Procurement eine Cloud standardisiert hat, VPC/Private Link, Residenz, Committed-Use-Rabatte oder einheitliches IAM nötig sind. Together und Fireworks sind Cloud/Serverless-Inference für Open-Weight-Flotten.

Preisrealität: GPT-4o liegt bei $2.50/$10.00 auf openai-direct, azure-openai und openrouter—es geht um Ausführungsort und DPA, nicht um Geheimrabatte.

gpt-oss-120b: OpenRouter $0.037/$0.170, SiliconFlow $0.05/$0.45, aws-bedrock / Fireworks / Groq / Together ~$0.15/$0.60. Wer in AWS bleiben muss, kann die Bedrock-Zeile wählen, auch wenn OR auf dem Papier günstiger ist.

Behandeln Sie Cloud nicht als „immer teurer“ oder „immer sicherer“, ohne verified-Zeile und Vertrag zu lesen.

Kosten in der Praxis: gleiches Modell, fünf Hosts, zwei Lasten

Rechenbeispiel Llama 3.3 70B Instruct. Kosten = input_tokens×in_price + output_tokens×out_price.

Szenario 1 — Agenten-Coding-Turn (100K in + 20K out): DeepInfra ≈ $0.0164; OpenRouter ≈ $0.021; Groq ≈ $0.075; Fireworks ≈ $0.108; Together ≈ $0.125. Günstigster verified Host ist ~7,6× günstiger als Together.

Szenario 2 — RAG-Batch (500K in + 5K out): DeepInfra ≈ $0.0516; OpenRouter ≈ $0.067; Groq ≈ $0.299; Fireworks ≈ $0.455; Together ≈ $0.525.

Zweites Beispiel — DeepSeek V4 Pro (100K+20K): direct/OR ≈ $0.061; DeepInfra ≈ $0.182; Fireworks/Together ≈ $0.244. Aggregator-„Bequemlichkeit“ ohne Matrix kann einen Turn ×3–4 machen.

Spec- und Listenpreis-Vergleich aus dem Snapshot—kein Fähigkeits-Benchmark und keine verhandelten Enterprise-Raten.

Checkliste: Pfad wählen, dann auf AI Hippo prüfen

1) Modell-Shortlist mit Rankings und /compare/ einfrieren—Vendor-Frage.

2) Pro core_model_id /token/ öffnen und jede Host-Zeile lesen: verified vs snapshot, Δ% vs OpenRouter, Badges.

3) Ein Key und schnelles Experimentieren → Pfad B (oft OpenRouter), Gewinner dann auf Direct/Cloud heben.

4) Ein SKU dominiert Spend und Direct ≤ Aggregator verified → Pfad A.

5) Legal/Security verlangt benanntes Cloud-Konto → Pfad C; Parität oder akzeptierte Prämie prüfen.

6) Nach jedem Pricing-Sync (~6h) erneut prüfen. Schwester-Guide zur Matrix vor price-correction lesen.

7) Self-Host nur, wenn Auslastung, Ops und Lizenz die günstigste verified-API-Zeile schlagen—siehe /compare/llama-vs-api-hosted/.

Schritt 2 nicht überspringen. Die Matrix macht Infra-Wahl auditierbar.

Quellen

Evidence and actions

Evidenz: Suchen nach „KI-Infrastruktur“ vermischen oft Vendors und API-Hosts; ohne Rahmen am Pricing-Snapshot drohen Überzahlung oder Compliance-Risiko.

  • Zeitfenster: pricing snapshot
  • Stichprobengröße: 17
  • Quellentyp: editorial_manual
  • /de/token/ für die Multi-Host-USD/1M-Matrix öffnen.
  • Direct / Cloud / Aggregator auf /de/token/provider/ durchsehen.
  • /de/insights/token-cost-comparison-guide/ und Glossar /de/glossary/ lesen.

Insights