Почему стандартный выбор «облако vs on-prem» не работает для РФ
Большинство западных фреймворков сравнивают облако и on-prem по шести-восьми параметрам: стоимость, масштабируемость, latency, контроль данных, compliance, гибкость. Это разумная рамка — но она не учитывает четыре российские реалии, которые кардинально меняют выводы.
Реалия 1: 152-ФЗ с зубами. С 30 мая 2025 года штрафы за нарушение локализации ПДн выросли до 1–18 млн руб. за первичное нарушение. Трансграничная передача без уведомления РКН и договора поручения — это не абстрактный риск, а операционная угроза.
Реалия 2: Санкционная нестабильность западных API. С сентября 2024 года западные IT-услуги официально недоступны для прямой оплаты из РФ. Доступ через шлюзы и VPN создаёт операционный риск: сервис может стать недоступен в любой момент без предупреждения. Это не учитывается в TCO-моделях западных аналитиков.
Реалия 3: GPU-дефицит. NVIDIA ввела KYC-процедуры для H100/H200 в конце 2024 года. Срок поставки в РФ — 3–4 месяца при наличии, стоимость выросла в 2–3 раза от официального прайса. On-prem на бумаге выглядит привлекательно, но физически реализовать его сложнее, чем кажется.
Реалия 4: Появление локальных моделей. GigaChat MAX, YandexGPT Pro, Saiga-3 на базе Llama, DeepSeek V3 в self-hosted варианте — это реальные альтернативы западным frontier-моделям для большинства корпоративных задач на русском языке.
Алгоритм выбора архитектуры: четыре шага
Не начинайте с выбора технологии. Начните с данных.
Шаг 1. Классифицируй данные по чувствительности. Какие данные будут проходить через LLM? Публичные тексты, внутренние документы, ПДн клиентов, медицинские данные, сведения, составляющие гостайну — это принципиально разные категории с разными допустимыми архитектурами.
Шаг 2. Оцени объём запросов. Сколько токенов в день реально потребует ваш сценарий? Важно: если вы планируете agentic AI (агенты, многошаговые цепочки), умножьте оценку на 10–50. Один агентный workflow делает 10–50 API-вызовов вместо 1–2 у чат-бота. Это меняет точку окупаемости и compliance-нагрузку.
Шаг 3. Оцени MLOps-зрелость команды. On-prem переносит ответственность за безопасность, обновления, мониторинг и доступность на вашу команду. Без выделенного MLOps-инженера (зарплата в РФ: 200–350 тыс. руб./мес.) on-prem превращается в операционный кошмар.
Шаг 4. Выбери архитектуру из матрицы ниже.
Decision matrix: данные × архитектура × 152-ФЗ
| Тип данных | Западный API | Российское облако | On-prem | Гибрид |
|---|---|---|---|---|
| Публичные данные | ✅ Допустимо, низкий риск | ✅ Допустимо | ✅ Допустимо | ✅ Оптимально для гибкости |
| Внутренние документы | ⚠️ Риск: нет договора поручения для РФ; нужно обезличивание | ✅ При наличии договора поручения в оферте | ✅ Рекомендуется | ✅ Роутинг по типу документа |
| ПДн (клиенты, сотрудники) | 🚫 Нарушение 152-ФЗ без ТГП + договора поручения; большинство западных провайдеров не предоставляют договор для РФ | ⚠️ Допустимо при локализации и договоре поручения | ✅ Оптимально, минимальные требования | ✅ ПДн → on-prem/RU-облако, остальное → любой API |
| Медданные (спецкатегории) | 🚫 Запрещено | 🚫 Требует отдельной аттестации; риск высокий | ✅ Единственный безопасный вариант | ⚠️ Только если медданные остаются в on-prem сегменте |
| Гостайна | 🚫 Запрещено | 🚫 Запрещено | ✅ Только сертифицированные решения ФСТЭК | 🚫 Не применимо |
Ключевой вывод из матрицы: западный API допустим только для публичных данных или внутренних документов с необратимым обезличиванием. Псевдонимизация (замена имени на user_123) не выводит данные из-под 152-ФЗ, если ключ восстановим — это распространённое заблуждение, которое уже привело к штрафам.
TCO в рублях: три сценария нагрузки
Горизонт расчёта — 36 месяцев. Сравнение за 12 месяцев всегда выигрывает облако — это методологическая ловушка.
| Сценарий | 5 тыс. запросов/день | 50 тыс. запросов/день | 500 тыс. запросов/день |
|---|---|---|---|
| Западный API (через шлюз) | ~180–300 тыс. руб./мес. | ~1,2–2 млн руб./мес. | ~12–20 млн руб./мес. + операционный риск отключения |
| Российское облако (GigaChat/YandexGPT API + GPU-аренда) | ~80–150 тыс. руб./мес. | ~400–700 тыс. руб./мес. | ~3–5 млн руб./мес. |
| On-prem (покупка сервера + колокация + MLOps) | Нецелесообразно: CAPEX от 4 млн руб., окупаемость >36 мес. | Окупаемость 18–24 мес.; суммарный TCO за 36 мес. сопоставим с облаком | Окупаемость 8–12 мес.; за 36 мес. выгоднее облака в 2–3 раза |
Скрытые затраты on-prem, которые не учитываются в первоначальных расчётах: зарплата MLOps-инженера (7–12 млн руб. за 36 мес.), колокация (300–600 тыс. руб./год), обновления модели и дообучение, compliance-аудит, стоимость простоев. Реальный TCO on-prem в 1,8–3,5 раза выше презентуемой цифры — это подтверждают и западные исследования.
Порог окупаемости on-prem в российских реалиях: при стабильной нагрузке >2–3 млн токенов/день и GPU utilization >60% on-prem становится экономически целесообразным. При utilization <40% стоимость инференса вырастает в 2–3 раза от теоретической.
Санкционный риск API: таймлайн и митигация
Западные API — это не просто технический выбор, это операционный риск с конкретной историей:
- Сентябрь 2024: официальный запрет IT-услуг западных провайдеров для РФ; прямая оплата стала невозможной.
- Конец 2024: NVIDIA вводит KYC-процедуры для H100/H200; поставки в РФ резко усложнились.
- 2025–2026: дефицит GPU H100/H200 в РФ; рыночная цена в 2–3 раза выше официального прайса; срок поставки 3–4 месяца.
- Текущий статус: доступ к OpenAI, Anthropic, Google AI через VPN/шлюзы работает, но нестабилен; в любой момент возможна блокировка на уровне IP-диапазонов.
Сценарии митигации:
- Российский LLM-шлюз с fallback на GigaChat/YandexGPT при недоступности западного API.
- Гибридный роутинг: публичные данные → любой доступный API, ПДн → только российское облако или on-prem.
- Локальные модели как основной инференс: DeepSeek V3 в self-hosted варианте показывает качество, сопоставимое с GPT-4o на задачах документооборота и аналитики на русском языке.
Компании, выбравшие западный API на пилоте без плана миграции, через 12–18 месяцев обнаруживают необходимость переархитектуры. Стоимость переезда — переобучение команды, рефакторинг промптов, смена векторной базы, повторное тестирование — не учитывается в первоначальном TCO, но реально составляет 2–6 месяцев работы команды.
Карта локальных моделей РФ 2026
| Модель | On-prem доступность | Качество на русском | Применимость | Стоимость API |
|---|---|---|---|---|
| GigaChat MAX | Да (enterprise-договор) | Высокое, 152-ФЗ out-of-box | Документооборот, RAG, диалоги | Договорная, есть тарифы |
| YandexGPT Pro | Через Yandex Cloud (частное облако) | Высокое, особенно поиск и суммаризация | Аналитика, поиск, классификация | ~1–3 руб./1000 токенов |
| Saiga-3 (Llama-RU) | Да, open-source, self-hosted | Среднее–высокое для задач RAG | RAG, классификация, извлечение данных | Бесплатно (self-hosted) |
| DeepSeek V3/R1 | Да, open-source, self-hosted | Высокое, особенно reasoning и код | Аналитика, код, сложные цепочки рассуждений | Бесплатно (self-hosted) |
Практическое замечание по DeepSeek: модель доступна для self-hosted развёртывания, что полностью решает вопрос 152-ФЗ — данные не покидают периметр. Для развёртывания полной версии V3 (685B параметров) требуется кластер из 8+ GPU; квантизованные версии работают на 2–4 GPU класса A100.
Архитектура гибридного развёртывания для РФ
Оптимальная архитектура для большинства российских enterprise выглядит так:
Данные → Классификатор чувствительности → Роутер → LLM Gateway с audit log
- Классификатор определяет тип данных в запросе (публичные / внутренние / ПДн / спецкатегории).
- Роутер направляет: ПДн и спецкатегории → on-prem или российское облако; публичные данные → любой доступный API с fallback.
- LLM Gateway ведёт полный audit log всех запросов и ответов — это требование compliance и инструмент для расследования инцидентов.
- Fallback-логика: при недоступности западного API автоматический переход на GigaChat или YandexGPT.
Такая архитектура решает три задачи одновременно: compliance по 152-ФЗ, операционную устойчивость при санкционных рисках, оптимизацию стоимости (дорогой frontier-API только там, где он реально нужен).
GPU-дефицит: реальные альтернативы
Планировать on-prem на H100/H200 в 2026 году — значит планировать на 3–4 месяца ожидания и цену в 2–3 раза выше официальной. Реальные альтернативы:
- Аренда GPU в российских облаках (Selectel, Yandex Cloud): A100 80GB — от 350–500 руб./час, H100-эквиваленты — от 600 руб./час. Это позволяет начать без CAPEX и оценить реальную нагрузку перед покупкой железа.
- Huawei Ascend 910B: производительность сопоставима с A100, поставки в РФ стабильнее. Требует адаптации MLOps-стека (не все фреймворки поддерживаются out-of-box).
- Delta Sprut и отечественные нейроускорители: пока ограниченная экосистема, но активно развиваются при господдержке.
- Потребительские GPU (RTX 4090, RTX 6000 Ada): для моделей до 13B параметров — вполне рабочий вариант для небольших нагрузок. Стоимость в 5–10 раз ниже серверных GPU.
Shadow AI: риск, который уже реализуется
Пока IT-директор выбирает архитектуру, сотрудники уже используют личный ChatGPT с корпоративными данными. По оценкам, в крупных российских компаниях 20–40% сотрудников, работающих с текстами, используют публичные LLM для рабочих задач.
Это нарушение 152-ФЗ: трансграничная передача ПДн без уведомления РКН и договора поручения. Ответственность несёт оператор ПДн — компания, а не сотрудник.
Минимальный набор мер:
- DLP-политики с детектированием обращений к AI-сервисам (ключевые слова, домены).
- Корпоративный LLM-шлюз как единственный авторизованный канал.
- Обучение персонала: что можно, что нельзя, почему.
- Политика допустимого использования AI, подписанная сотрудниками.
Чеклист compliance по 152-ФЗ для каждой архитектуры
Западный API:
- Уведомление РКН о трансграничной передаче ПДн (ТГП)
- Договор поручения на обработку ПДн с провайдером (большинство западных провайдеров не предоставляют для РФ)
- Необратимое обезличивание данных перед отправкой (не псевдонимизация)
- Оценка: высокий риск, рекомендуется только для публичных данных
Российское облако (GigaChat API, Yandex Cloud):
- Проверить наличие договора поручения в оферте провайдера
- Убедиться в локализации данных на серверах в РФ
- Настроить audit log запросов
- Оценка: допустимо для ПДн при выполнении условий
On-prem:
- RBAC: разграничение доступа к модели и данным
- Audit log всех запросов и ответов
- Шифрование весов модели и данных в покое
- Регулярные обновления модели (model lag: on-prem отстаёт от frontier на 2–4 квартала)
- Оценка: минимальные регуляторные требования, максимальный контроль, максимальная операционная нагрузка
Итог: алгоритм решения для российского ЛПР
Выбор архитектуры ИИ в РФ в 2026 году — это не технический, а стратегический вопрос с четырьмя измерениями: compliance, операционный риск, TCO и MLOps-зрелость.
Если вы начинаете: российское облако (GigaChat API или Yandex Cloud) + гибридный роутинг. Минимальный CAPEX, compliance по 152-ФЗ решаем, быстрый старт.
Если у вас >50 тыс. запросов/день и стабильная нагрузка: считайте TCO на 36 месяцев с on-prem. При GPU utilization >60% on-prem выгоднее облака начиная с 18–24 месяцев.
Если у вас ПДн или медданные в сценарии: on-prem или российское частное облако с договором поручения. Западный API — только для обезличенных данных.
Если вы используете западный API: немедленно оцените санкционный риск и заложите план миграции. Переезд через 12–18 месяцев обойдётся дороже, чем правильный выбор сейчас.
Главный anti-pattern — выбирать архитектуру «по тренду» вместо классификации данных и рабочих нагрузок. Матрица выше даёт структуру; данные вашей компании дают ответ.
Связанные материалы в блоге brezatech:
- 152-ФЗ и LLM: что нужно знать оператору ПДн
- RAG в продакшене: архитектура для корпоративной базы знаний
- BI и данные: как выстроить аналитическую инфраструктуру
brezatech — интегратор ИИ в данные и процессы российских B2B-компаний: разработка, BI, автоматизация и LLM в продакшене.
Ключевые факты
- Штрафы за нарушение 152-ФЗ с 30 мая 2025: от 1 до 18 млн руб. за хранение ПДн за рубежом без уведомления РКН.
- Западные API официально недоступны для прямой оплаты из РФ с сентября 2024; NVIDIA ввела KYC для H100/H200 в конце 2024.
- Порог окупаемости on-prem в РФ: при >50 тыс. запросов/день и горизонте 24–36 месяцев — выгоднее российского облака.
- Agentic AI-сценарии потребляют в 10–50 раз больше токенов, чем чат-бот — это меняет точку окупаемости и compliance-нагрузку.
- Shadow AI — сотрудники с личным ChatGPT и корпоративными данными — уже является нарушением 152-ФЗ (трансграничная передача без договора поручения).
Частые вопросы
- Можно ли использовать ChatGPT с данными клиентов?
- Нет, если данные содержат ПДн без необратимого обезличивания. Передача в OpenAI требует уведомления РКН о трансграничной передаче и договора поручения — которого OpenAI не предоставляет для российских операторов.
- Что будет, если сотрудники используют личный ChatGPT с рабочими данными?
- Это нарушение 152-ФЗ: трансграничная передача ПДн без договора поручения. Штраф для оператора — до 18 млн руб. Решение: DLP-политики, корпоративный LLM-шлюз, обучение персонала.
- Как DeepSeek соотносится с 152-ФЗ?
- DeepSeek — китайская модель, доступна для self-hosted развёртывания (open-source V3/R1). В этом случае данные не покидают периметр. Использование облачного API DeepSeek требует тех же процедур, что и любой зарубежный провайдер.
- Когда on-prem реально окупается в РФ?
- При стабильной нагрузке >50 тыс. запросов/день и горизонте расчёта 24–36 месяцев. При нагрузке <5 тыс. запросов/день российское облако выгоднее минимум в 3–4 раза.
- Что делать, если нет доступа к GPU H100/H200?
- Три альтернативы: аренда GPU в Selectel или Yandex Cloud (A100/H100-эквиваленты), китайские ускорители Huawei Ascend 910B, отечественные решения (Delta Sprut). Для моделей до 13B параметров достаточно потребительских GPU класса RTX 4090.
Источники
- Облако vs On-premise: цифры в рублях, TCO, RAG-архитектура — Промолитика
- 152-ФЗ и нейросети: штрафы 2025, обезличивание, регламент — AZONE-AI
- 152-ФЗ и нейросети: какие данные нельзя отдавать ChatGPT — Anti-Malware.ru
- Вычислительный тупик: российский ИИ без мощностей, NVIDIA KYC — ComNews
- Российский рынок GPU: 63 млрд руб., дефицит, санкции NVIDIA — TAdviser
- On-premise AI vs cloud AI: enterprise deployment guide 2026 — Lyzr
- AI on-premise vs cloud: decision framework, TCO, hidden costs — ALGORCOMP
- Complete Guide to On-Premise LLM for Regulated Enterprises — Allganize
- LLM и персональные данные: как избежать нарушений 152-ФЗ — vc.ru
- ИИ-трансформация в России 2025: стек, архитектуры, игроки — chu.st
- Cost-Benefit Analysis of On-Premise LLM Deployment: break-even math — arXiv
О brezatech
brezatech — интегратор ИИ в данные и процессы российских B2B-компаний: разработка, BI, автоматизация и LLM в продакшене. ИИ-агент продаж 24/7 →
