Tech-стек AI-стартапа 2026: от inference до billing
AI‑стартапы часто сжигают 40–50% выручки на COGS — из‑за решений, принятых «на ходу» в первые месяцы. Маржинальность оказывается ближе к облачному провайдеру, чем к продуктовой компании. Разбор пяти слоёв инфраструктуры показывает, где именно утекают деньги и как быстро это исправить. Inference: начинать с API — нормально, но при росте объёма токенов выгоднее self‑hosted. vLLM с PagedAttention стал де‑факто стандартом; TGI 3.0 от Hugging Face быстрее на длинных промптах. Нужна середина между «всё своё» и «всё через API» — смотрите Replicate/Modal. Vector DB: частая ошибка — брать Pinecone «как в туториале» и переплачивать. Если у вас уже есть Postgres и средние объёмы — начинайте с pgvector (ноль лишней инфраструктуры), а когда упрётесь — переходите на Qdrant. Инвесторы с первого звонка спросят, на чьей инфраструктуре всё крутится и что будет при смене условий. Prompt management и стоимость ответа: промпт должен быть конфигом с версиями, A/B и откатом (Langfuse/Helicone), иначе один неудачный релиз многократно поднимет чек. Prefix caching от Anthropic радикально снижает цену: общий системный промпт кэшируется и токены обходятся на порядок дешевле. Параллельно включайте usage metering: с OpenMeter считаете токены per‑user, видите маржу по клиентам и перестаёте субсидировать «тяжёлых» пользователей. Cost controls: маршрутизация моделей (простое — дешёвой, сложное — большой), semantic caching и fallback‑цепочки через Portkey/LiteLLM стабильно режут LLM‑расходы в разы и повышают устойчивость. Быстрый аудит на 20 минут — четыре вопроса к биллингу — обычно находит две самые дорогие «дыры». Напишите в комментариях, какой слой у вас сейчас болит сильнее всего — inference, vector DB, промпты, metering или cost controls. Таймкоды: 00:00 — Счёт за инференс 00:49 — Пять слоёв стека 01:20 — API vs self‑hosted 01:56 — vLLM и TGI 02:40 — Vector DB: выбор 03:41 — Prompt management 04:18 — Префикс‑кэширование 04:57 — Metering и OpenMeter 05:46 — Контроль стоимости LLM 06:31 — Аудит биллинга Источники: ICONIQ Growth, Spheron, VentureBeat, Anthropic, Habr, pgvector #aistartup #infrastructure #llm #vllm #pgvector #qdrant #pinecone #postgres #promptengineering #modelrouting #semanticcaching #mlops #юнитэкономика #costoptimization