Как выбрать AI-инфраструктуру: практический гид по API-хостам

Vendor создаёт модель; Token Provider хостит API. Рамка решений и живые USD/1M цены на AI Hippo — чтобы выбрать direct, агрегатор или облако без догадок.

Шаг 0: Vendor ≠ Token Provider

«Поставщик моделей» смешивает две роли. На AI Hippo Vendor обучает и публикует веса (Anthropic, OpenAI, Meta, DeepSeek). Token Provider отдаёт HTTP endpoint инференса (OpenRouter, Azure OpenAI, AWS Bedrock, Groq или прямой API вендора).

Можно выбрать Claude (vendor=anthropic) и всё равно выбирать между anthropic-direct, aws-bedrock и openrouter. Смешивать «какая модель» и «какой хост» — самый быстрый путь к плохой покупке.

Глоссарий: Vendor vs Service provider. Каталог /model/vendor/; хосты /token/provider/.

Карта хостов, которые отслеживает AI Hippo

Этот снимок индексирует 17 Token Provider в четырёх kinds:

Direct (7): anthropic-direct, openai-direct, deepseek-direct, moonshot-direct, minimax-direct, z-ai-direct, ai21-direct — проверяемые list price со страниц вендоров.

Cloud (5): aws-bedrock, azure-openai, google-vertex, together, fireworks — enterprise или serverless.

Aggregator (4): openrouter, groq, siliconflow, deepinfra — один API-ключ, много upstream.

Other (1): self-hosted — свои веса (без общей строки list price).

Покрытие намеренно неравномерно: у OpenRouter 334 primary listing (is_primary_listing=1) для рейтингов; verified-строки вне OR покрывают 151 модель. Рейтинги по умолчанию на OpenRouter ради сравнимости; матрица Token — место аудита USD/1M host-vs-host для одного core_model_id.

Шесть осей решения (не только цена за токен)

Оценивайте каждый хост по шести осям до контракта:

1) List price USD/1M (и batch/cached при наличии). Предпочитайте model_bound_verified; snapshot — временно.

2) Уверенность и расхождение: неофициальные строки с ≥20% vs verified OpenRouter подавляются.

3) Покрытие модели: есть ли ваш SKU? Флагманы часто совпадают (Claude Sonnet 4 по $3/$15 на anthropic-direct, aws-bedrock и openrouter). Open-weight сильно плывёт.

4) Задержка и throughput: хосты вроде Groq меняют цену на скорость; дешёвый DeepInfra может выиграть $/token и проиграть p95.

5) Регион, резидентность, compliance: Azure, Bedrock, Vertex закрывают IAM, private network и оговорки, которые агрегатор не заменит.

6) Ops-поверхность: один ключ OpenRouter vs N ключей, failover, единый счёт, сигналы domestic_pay / badge_cheapest.

При равной verified-цене решайте осями 4–6.

Путь A — Official direct: когда побеждает API вендора

Выбирайте anthropic-direct, openai-direct, deepseek-direct, когда нужны: SKU в день релиза, флаги (batch, cached, лимиты org), которые агрегаторы запаздывают, или один коммерческий/DPA-контур.

Цифры: DeepSeek V4 Pro — $0.435/$0.870 на deepseek-direct и primary listing OpenRouter; DeepInfra $1.30/$2.60; SiliconFlow ~$1.50/$3.14; Fireworks/Together $1.74/$3.48 — до 3–4×. Если V4 Pro — рабочая лошадка прода, direct (или зеркальный OR) — рациональный default.

Claude Sonnet 4 — $3/$15 на anthropic-direct, aws-bedrock и openrouter: цена не различает; контракт, регион и IAM — да.

Цена пути: N ключей, раздробленные счета и второй хост для моделей вне вендора.

Путь B — Агрегаторы: один ключ, много моделей, следите за спредом

OpenRouter, Groq, SiliconFlow и DeepInfra выигрывают при кросс-вендорном прототипе, failover или одном счёте при живом shortlist. 334 primary listing OpenRouter — полоса сравнимости рейтингов AI Hippo по умолчанию.

Но агрегатор ≠ самый дешёвый. Llama 3.3 70B Instruct: DeepInfra $0.10/$0.32 (verified), OpenRouter $0.13/$0.40, Groq $0.59/$0.79 (snapshot), Fireworks $0.90/$0.90, Together $1.04/$1.04 — спред входа ~10×.

DeepSeek V4 Flash уже: DeepInfra $0.09/$0.18, OpenRouter ~$0.094/$0.188, SiliconFlow $0.13/$0.28, deepseek-direct и Fireworks $0.14/$0.28 — здесь агрегатор может быть дешевле direct.

Правило: для каждого production SKU сортируйте матрицу Token по verified USD/1M.

Путь C — Облако: compliance и аккаунты важнее list price

Выбирайте aws-bedrock, azure-openai или google-vertex, когда procurement уже стандартизировал облако, нужны VPC/private link, региональная резидентность, committed-use скидки или единый IAM. Together и Fireworks — полоса cloud/serverless для open-weight флота.

Ценовая реальность: GPT-4o — $2.50/$10.00 на openai-direct, azure-openai и openrouter; выбор про то, где крутятся токены и кто подписывает DPA.

gpt-oss-120b: OpenRouter $0.037/$0.170, SiliconFlow $0.05/$0.45, а aws-bedrock / Fireworks / Groq / Together около $0.15/$0.60. Если нужно остаться в AWS, строка Bedrock может быть рациональнее даже при более дешёвом OR на бумаге.

Не считайте облако «всегда дороже» или «всегда безопаснее» без verified-строки и приложения к договору.

Стоимость на практике: одна модель, пять хостов, две нагрузки

Пример на Llama 3.3 70B Instruct. Стоимость = input_tokens×in_price + output_tokens×out_price.

Сценарий 1 — агентский ход (100K in + 20K out): DeepInfra ≈ $0.0164; OpenRouter ≈ $0.021; Groq ≈ $0.075; Fireworks ≈ $0.108; Together ≈ $0.125. Самый дешёвый verified хост ~в 7.6× дешевле Together.

Сценарий 2 — RAG batch (500K in + 5K out): DeepInfra ≈ $0.0516; OpenRouter ≈ $0.067; Groq ≈ $0.299; Fireworks ≈ $0.455; Together ≈ $0.525.

Второй пример — DeepSeek V4 Pro (100K+20K): direct/OR ≈ $0.061; DeepInfra ≈ $0.182; Fireworks/Together ≈ $0.244. «Удобство» агрегатора без матрицы может удорожить ход в 3–4 раза.

Это сравнение спеков и list price из снимка — не бенчмарк возможностей и не enterprise-тарифы.

Чеклист: выберите путь, затем проверьте на AI Hippo

1) Зафиксируйте shortlist моделей через рейтинги и /compare/ — вопрос Vendor.

2) Для каждого core_model_id откройте /token/ и прочитайте строки хостов: verified vs snapshot, Δ% vs OpenRouter, badges.

3) Один ключ и быстрый эксперимент → Путь B (часто OpenRouter), затем повышайте победителей в direct/cloud.

4) Один SKU доминирует в spend и direct ≤ агрегатор verified → Путь A.

5) Legal/security требует именной cloud-аккаунт → Путь C; проверьте паритет или приемлемую премию.

6) Перепроверяйте после каждого pricing sync (~6h). Перед price-correction читайте соседний гайд по матрице.

7) Self-host только если utilization, ops и лицензия бьют самый дешёвый verified API ряд — /compare/llama-vs-api-hosted/.

Не пропускайте шаг 2. Матрица делает выбор инфраструктуры аудируемым.

Источники

Evidence and actions

Доказательство: Запросы «AI-инфраструктура» путают вендоров и API-хосты; без рамки на pricing снапшот — переплата или провал compliance.

  • Период: pricing snapshot
  • Размер выборки: 17
  • Тип источника: editorial_manual
  • Откройте /ru/token/ для матрицы USD/1M multi-host.
  • Смотрите Direct / Cloud / Aggregator на /ru/token/provider/.
  • Читайте /ru/insights/token-cost-comparison-guide/ и глоссарий /ru/glossary/.

Инсайты