Тренды

Open-weight модели on-prem в 2026: когда это разумнее API

Операционно-экономический триггер перехода: TCO под российские реалии, матрица процессов и чеклист готовности за 15 минут.

Open-weight модели on-prem в 2026: когда это разумнее API

Почему этот вопрос возникает именно сейчас

Если вы уже используете LLM API в процессах и у вас растёт счёт — вы в нужном месте. Вопрос выбора архитектуры с нуля закрыт в нашей статье «Корпоративный AI: облако, API и on-prem — риски для РФ». Здесь другое: вы уже в продакшне, API работает, но что-то начинает беспокоить — счёт, доступность, зависимость. Когда именно пора считать миграцию части нагрузки на on-prem open-weight модель?

Три независимых триггера, которые в 2026 году сошлись одновременно:

Триггер 1 — экономический. Стоимость frontier API снижается, но бюджетные API (DeepSeek-класс, ~$0.14/1M токенов) уже настолько дёшевы, что on-prem окупается против них только при очень высоком объёме. Зато против GPT-5-класса ($5–15/1M) порог окупаемости — около 250–300M токенов/мес при 65% утилизации GPU. Для компании с активным документооборотом или аналитикой это реальные цифры.

Триггер 2 — операционный. Западные API для российских компаний недоступны напрямую. Работа через прокси создаёт юридическую и операционную неопределённость. Прецеденты отключения уже есть. On-prem open-weight модель — это актив на балансе, а не подписка с риском отзыва в любой момент.

Триггер 3 — технологический. Качество open-weight моделей в 2026 году достигло уровня, при котором для большинства корпоративных задач (не требующих frontier reasoning) разрыв с закрытыми моделями незначителен. DeepSeek V3, Qwen3-235B, Llama 4 Scout — это не «почти как GPT-4», это реально конкурентный уровень для документооборота, классификации, суммаризации и RAG-пайплайнов.

Российский контекст: почему западные расчёты не работают напрямую

Западные источники считают TCO от цены H100 в $30–35K и DevOps-инженера в $6000/мес. В российских реалиях оба числа другие — и итог тоже.

GPU через параллельный импорт. H100 SXM в РФ в 2026 году стоит в диапазоне 4–6M ₽ ($45–70K по текущему курсу) с учётом логистики и наценки. A100 80GB — 2.5–3.5M ₽. Это 1.5–2× к западной цене. Дефицит реален: по данным Хабра и Коммерсанта, сроки поставки выросли, а спрос на локальные вычислительные мощности в 2024–2025 годах вырос на 40%+ (ITGLOBAL).

DevOps в РФ дешевле. Senior DevOps с опытом GPU-инфраструктуры в РФ — $1500–3000/мес (150–300K ₽). В США тот же специалист стоит $6000–8000/мес. Это меняет структуру TCO принципиально: капитальные затраты выше, операционные — ниже.

Альтернатива собственному железу — облачный GPU в РФ. Yandex Cloud и SberCloud предоставляют GPU-инстансы (A100, H100) без санкционных рисков. Это разумный промежуточный шаг: проверить объём и утилизацию без капитальных вложений, а потом считать on-prem.

Недоступность западных API как самостоятельный триггер. Это не только 152-ФЗ (подробнее о регуляторных ограничениях — в статье «152-ФЗ и генеративный ИИ: что учесть до запуска»). Это операционный риск: зависимость от Anthropic/OpenAI через посредников — это не enterprise-архитектура, это временное решение с неопределённым сроком жизни.

TCO-калькулятор под российские реалии

Упрощённая формула для первичной оценки. Все цифры — ориентировочные, для порядка величин.

Ежемесячные затраты on-prem (1× A100 80GB):

  • Амортизация GPU (3 года): 3M ₽ / 36 мес = 83K ₽/мес
  • DevOps 0.5 FTE: 75–150K ₽/мес
  • Электричество (400W × 24h × 30 дней × 8 ₽/кВт·ч): ~23K ₽/мес
  • Сервер, сеть, обслуживание: ~20K ₽/мес
  • Итого: ~200–280K ₽/мес

Break-even по токенам:

При стоимости frontier API $10/1M токенов (≈900 ₽/1M) break-even наступает при 220–310M токенов/мес.

При стоимости бюджетного API $0.14/1M токенов (≈13 ₽/1M) break-even — 15–22B токенов/мес. Это нереалистично для большинства компаний: против бюджетного API on-prem окупается только при промышленных объёмах.

Вывод: On-prem имеет смысл, если вы используете frontier-класс API (или планировали бы его использовать) и объём превышает 200–300M токенов/мес. Если вы на бюджетном API — считайте сначала облачный GPU РФ.

Важно: On-prem выгоден только при утилизации GPU 60–70%+. Простаивающий GPU — это убыток. Spiky-нагрузка (нерегулярные пики) делает on-prem невыгодным — там нужен облачный GPU с оплатой по факту.

Матрица: тип процесса × объём × команда → рекомендация

Тип процессаОбъём токеновЧувствительность данныхНаличие командыРекомендация
Документооборот, batch-обработка>200M/мес, стабильныйВысокая (ПДн, коммерческая тайна)DevOps естьOn-prem
Документооборот, batch-обработка>200M/мес, стабильныйСредняяDevOps естьOn-prem или облачный GPU РФ
Аналитика, нерегулярные пикиSpiky, непредсказуемыйЛюбаяЛюбаяОблачный GPU РФ (Yandex Cloud, SberCloud)
Аналитика, нерегулярные пики<50M/месНизкаяAPI (российский: GigaChat, YandexGPT)
Агенты в ERP/1С, latency-критично>100M/мес, стабильныйВысокаяDevOps + ML-доступOn-prem (TTFT <200ms критичен)
Агенты в ERP/1С, latency-критично<100M/месВысокаяDevOps нетОблачный GPU РФ
Классификация, суммаризация (рутина)ЛюбойЛюбаяЛюбаяЛокальная open-weight (гибрид)
Frontier reasoning, сложные задачиЛюбойНизкаяРоссийский API (GigaChat Pro, YandexGPT Pro)

Для RAG-пайплайнов latency особенно критична — подробнее о выборе архитектуры базы знаний см. в статье «Корпоративная база знаний vs RAG: когда что выбрать».

Топ-5 open-weight моделей для on-prem в РФ, 2026

МодельЛицензияМинимальное железоПодходящие задачиСтатус весов
DeepSeek V3 / R2MIT2× A100 80GB (FP8)Документооборот, RAG, аналитика, кодВеса открыты, доступны
Qwen3-235B-A22B (MoE)Apache 2.02× A100 80GBРассуждение, многоязычность, агентыВеса открыты, доступны
Qwen3-32BApache 2.01× A100 80GBСуммаризация, классификация, RAGВеса открыты, доступны
Llama 4 Scout (17B MoE)Llama 4 Community1× A100 40GBКлассификация, извлечение, диалогВеса открыты; ограничения на обучение конкурирующих моделей
Mistral Small 3.2 (24B)Apache 2.01× A100 40GBИнструкции, функции, edge-деплойВеса открыты, доступны

Важно по лицензиям: Qwen3.7-Max и Meta Muse Spark с 2026 года перешли в API-only — их веса закрыты, on-prem невозможен. Llama 4 в enterprise-контексте требует согласования с юридической службой, если планируется дообучение или дистилляция: лицензия запрещает использование выходов для обучения конкурирующих LLM.

Serving-стек 2026: что деплоить

TGI (Text Generation Inference) переведён в maintenance с декабря 2025. Не рекомендуем его для новых деплоев.

Актуальный стек:

  • vLLM — стандарт для batch-инференса и высокопропускных сценариев. Поддерживает PagedAttention, continuous batching, FP8. Первый выбор для документооборота и аналитики.
  • SGLang — оптимален для RAG-пайплайнов и multi-turn диалогов. Лучший TTFT (time-to-first-token) в агентных сценариях.
  • Ollama — только для dev-окружения и прототипирования. В продакшн не идёт.

Мониторинг в продакшне: отслеживайте TTFT (time-to-first-token) и ITL (inter-token latency) — для агентных сценариев деградация этих метрик видна раньше, чем пользователи начинают жаловаться.

Чеклист готовности к on-prem за 15 минут

Ответьте на 8 вопросов. Если больше трёх ответов «нет» — начните с облачного GPU РФ.

  • Объём токенов: Ваш текущий API-счёт превышает 200–280K ₽/мес? (Это примерный порог окупаемости on-prem против frontier API в российских ценах.)
  • Тип нагрузки: Нагрузка стабильная и предсказуемая, а не spiky? (Spiky → облачный GPU.)
  • Чувствительность данных: Данные содержат ПДн, коммерческую тайну или требуют локализации по 152-ФЗ?
  • Команда: Есть хотя бы 0.5 FTE DevOps с опытом Docker/Kubernetes?
  • Доступ к ML: Есть возможность привлечь ML-инженера на 10–15 ч/мес для обновления модели?
  • Бюджет на железо: Есть бюджет на GPU-сервер (от 3–5M ₽ на первый узел)?
  • Latency: Для ваших сценариев критичен TTFT <200ms? (Агенты в ERP/1С — да; batch-документооборот — нет.)
  • Лицензия: Вы проверили лицензию выбранной модели с юридической службой? (Особенно если планируете дообучение.)

Гибрид как норма, а не исключение

По данным F5 (2026), 78% западных enterprise уже запускают часть инференса самостоятельно. Среднее число моделей в портфеле — 7. Бинарного выбора больше нет.

Для российского B2B разумная схема гибридного роутинга:

  1. Локальная open-weight модель (DeepSeek V3 или Qwen3-32B on-prem) → рутинные задачи: классификация документов, извлечение данных, суммаризация, первичная обработка запросов.
  2. Российский API (GigaChat Pro, YandexGPT Pro) → сложные задачи: аналитические выводы, генерация с высокими требованиями к качеству, frontier reasoning.
  3. Роутер — простой классификатор сложности запроса (можно реализовать на той же локальной модели).

Западные данные показывают экономию 30–50% на API-счёте при такой схеме. В российском контексте эффект может быть выше за счёт того, что frontier API здесь дороже и менее стабильно доступен.

Когда on-prem точно не нужен

Честный список сценариев, где on-prem избыточен:

  • Объём токенов < 5K запросов/день — API дешевле с учётом ops-нагрузки.
  • Нагрузка нерегулярная, с пиками — облачный GPU РФ с оплатой по факту.
  • Нет DevOps в команде и нет бюджета на найм — ops-нагрузка on-prem (10–20 ч/мес инженера + обновление модели каждые 2–4 мес) съест экономию.
  • Задача требует frontier reasoning (сложный юридический анализ, стратегические выводы) — open-weight модели пока уступают, гибрид с российским API разумнее.
  • Стартап или MVP — не замораживайте капитал в железе до подтверждения объёма.

Если вы только выбираете архитектуру с нуля — начните с нашей статьи «Корпоративный AI: облако, API и on-prem — риски для РФ»: там decision matrix для CTO с учётом четырёх российских реалий. Если вопрос в регуляторных ограничениях на передачу данных в API — см. «152-ФЗ и генеративный ИИ: что учесть до запуска».

Ключевые факты

  • Break-even on-prem против frontier API (GPT-5-класс) — около 250–300M токенов/мес при 65% утилизации GPU; против бюджетного API (DeepSeek-класс, ~$0.14/1M) — порог значительно выше: 5–6B токенов/мес.
  • В РФ GPU через параллельный импорт стоит в 1.5–2× дороже западной цены, но DevOps-инженер обходится в 3–4× дешевле ($1500–3000/мес vs $6000 в US) — итоговый TCO смещается в пользу on-prem раньше, чем по западным расчётам.
  • TGI переведён в maintenance с декабря 2025. Стандарт serving-стека 2026 — vLLM (batch) + SGLang (RAG/multi-turn). Ollama — только для dev-окружения.
  • 78% западных enterprise уже запускают часть инференса самостоятельно (F5, 2026); среднее число моделей в портфеле — 7. Бинарного выбора 'API или on-prem' больше нет — норма это гибрид.
  • Vendor lock-in для российского B2B — не абстрактный риск: прецеденты отключения западных API уже есть. On-prem open-weight модель — актив на балансе, а не подписка с риском отзыва.

Частые вопросы

Что если у нас нет ML-инженера?
Минимальная команда для on-prem — 0.5–1 FTE DevOps с опытом Docker/Kubernetes и эпизодический доступ к ML-инженеру (10–15 ч/мес на обновление модели). Без этого лучше начать с облачного GPU в Yandex Cloud или SberCloud — там ops-нагрузка ниже, а стек тот же (vLLM).
Можно ли начать с облачного GPU в РФ и потом перейти на on-prem?
Да, и это разумная стратегия. Облачный GPU (Yandex Cloud, SberCloud) позволяет проверить объём токенов и утилизацию без капитальных затрат. Когда утилизация стабильно выше 60–65% три месяца подряд — считайте TCO на собственное железо.
Какой минимальный объём токенов оправдывает покупку сервера?
Против frontier API — от 250M токенов/мес. Против бюджетного API класса DeepSeek (~$0.14/1M) — от 5B токенов/мес. В рублях: при GPU ≈2.5–3M ₽ (параллельный импорт), DevOps 150K ₽/мес и электричестве 20–30K ₽/мес амортизация за 3 года даёт ~120–130K ₽/мес совокупных затрат. Если API-счёт превышает эту сумму — on-prem окупается.
Какие лицензионные риски у open-weight моделей?
DeepSeek V3/R2 (MIT) и Qwen3 (Apache 2.0) — коммерчески чистые, без ограничений на использование. Llama 4 запрещает использование выходов модели для обучения конкурирующих LLM — важно согласовать с юридической службой, если планируете дообучение или дистилляцию. Qwen3.7-Max и Meta Muse Spark с 2026 года доступны только через API, веса закрыты.
Hybrid routing — это сложно внедрить?
Базовая схема несложная: локальная open-weight модель обрабатывает рутинные задачи (классификация, извлечение, суммаризация), сложные запросы маршрутизируются в российский API (GigaChat, YandexGPT). Роутер — простой классификатор сложности запроса. Западные данные показывают экономию 30–50% на API-счёте при такой схеме.

Источники

О brezatech

brezatech — интегратор ИИ в данные и процессы российского B2B: разработка LLM-пайплайнов, BI, автоматизация и инфраструктура для инференса. ИИ-агент продаж 24/7 →

Ещё в журнале