14.08.2026
Облако vs on-prem: когда своё железо оправдано — расчёт
Облако против on-prem для LLM-инференса: FinOps-расчёт, когда своё железо окупается. Стоимость токена, нагрузка, 152-ФЗ — считаем, а не гадаем.
FinOps
on-prem
облако
LLM-инференс
Проблема
«Купим GPU» или «взять в облаке» — вопрос, который решают на интуиции. Между тем это чистый FinOps-расчёт: при какой нагрузке и какой цене токена своё железо начинает дешевле облака. Без расчёта легко переплатить в обе стороны.
Что входит в расчёт
- Нагрузка — сколько токенов в день/час, пиковый и средний batch.
- Стоимость токена в облаке — цена GPU-часа, делённая на реальный throughput (не маркетинговый).
- Стоимость своего железа — GPU + сервер + электричество + администрирование, распределённые на срок жизни.
- Утилизация — свой GPU часто простаивает. Облако масштабируется, своё — нет.
- Не-финансовые факторы — 152-ФЗ, air-gapped, данные не покидают контур. Это иногда решающий аргумент сам по себе.
Когда своё железо оправдано
- Стабильно высокая нагрузка — GPU загружен большую часть времени, утилизация высокая.
- Закрытый контур — 152-ФЗ / НУЦ / air-gapped: облако просто не вариант.
- Долгий горизонт — железо окупается за 2–3 года при постоянной нагрузке.
- Предсказуемая модель — одна-две модели, стабильный промпт, не нужен масштабирование.
Когда облако лучше
- Пиковая/непредсказуемая нагрузка — scale-to-zero, платить только за использование.
- Много разных моделей — гибкость выбора без закупки.
- Старт — пока объём мал, своё железо не окупится.
Вывод
Это расчёт, а не вера. Считайте стоимость токена при вашей реальной нагрузке и утилизации. Высокая стабильная нагрузка или закрытый контур → своё железо. Пики и старт → облако. И часто правильный ответ — гибрид: базовая нагрузка на своём, пики — в облаке.
Хотите так же?
Расскажите о задаче — ответим с планом и оценкой в течение 2 рабочих дней.
Обсудить задачу