Тренды

Корпоративный AI: облако, API и on-prem — риски для РФ

Decision matrix для CTO и IT-директоров: как выбрать архитектуру ИИ с учётом 152-ФЗ, санкций и дефицита GPU в России.

Корпоративный AI: облако, API и on-prem — риски для РФ

Почему стандартный выбор «облако vs on-prem» не работает для РФ

Большинство западных фреймворков сравнивают облако и on-prem по шести-восьми параметрам: стоимость, масштабируемость, latency, контроль данных, compliance, гибкость. Это разумная рамка — но она не учитывает четыре российские реалии, которые кардинально меняют выводы.

Реалия 1: 152-ФЗ с зубами. С 30 мая 2025 года штрафы за нарушение локализации ПДн выросли до 1–18 млн руб. за первичное нарушение. Трансграничная передача без уведомления РКН и договора поручения — это не абстрактный риск, а операционная угроза.

Реалия 2: Санкционная нестабильность западных API. С сентября 2024 года западные IT-услуги официально недоступны для прямой оплаты из РФ. Доступ через шлюзы и VPN создаёт операционный риск: сервис может стать недоступен в любой момент без предупреждения. Это не учитывается в TCO-моделях западных аналитиков.

Реалия 3: GPU-дефицит. NVIDIA ввела KYC-процедуры для H100/H200 в конце 2024 года. Срок поставки в РФ — 3–4 месяца при наличии, стоимость выросла в 2–3 раза от официального прайса. On-prem на бумаге выглядит привлекательно, но физически реализовать его сложнее, чем кажется.

Реалия 4: Появление локальных моделей. GigaChat MAX, YandexGPT Pro, Saiga-3 на базе Llama, DeepSeek V3 в self-hosted варианте — это реальные альтернативы западным frontier-моделям для большинства корпоративных задач на русском языке.

Алгоритм выбора архитектуры: четыре шага

Не начинайте с выбора технологии. Начните с данных.

Шаг 1. Классифицируй данные по чувствительности. Какие данные будут проходить через LLM? Публичные тексты, внутренние документы, ПДн клиентов, медицинские данные, сведения, составляющие гостайну — это принципиально разные категории с разными допустимыми архитектурами.

Шаг 2. Оцени объём запросов. Сколько токенов в день реально потребует ваш сценарий? Важно: если вы планируете agentic AI (агенты, многошаговые цепочки), умножьте оценку на 10–50. Один агентный workflow делает 10–50 API-вызовов вместо 1–2 у чат-бота. Это меняет точку окупаемости и compliance-нагрузку.

Шаг 3. Оцени MLOps-зрелость команды. On-prem переносит ответственность за безопасность, обновления, мониторинг и доступность на вашу команду. Без выделенного MLOps-инженера (зарплата в РФ: 200–350 тыс. руб./мес.) on-prem превращается в операционный кошмар.

Шаг 4. Выбери архитектуру из матрицы ниже.

Decision matrix: данные × архитектура × 152-ФЗ

Тип данныхЗападный APIРоссийское облакоOn-premГибрид
Публичные данные✅ Допустимо, низкий риск✅ Допустимо✅ Допустимо✅ Оптимально для гибкости
Внутренние документы⚠️ Риск: нет договора поручения для РФ; нужно обезличивание✅ При наличии договора поручения в оферте✅ Рекомендуется✅ Роутинг по типу документа
ПДн (клиенты, сотрудники)🚫 Нарушение 152-ФЗ без ТГП + договора поручения; большинство западных провайдеров не предоставляют договор для РФ⚠️ Допустимо при локализации и договоре поручения✅ Оптимально, минимальные требования✅ ПДн → on-prem/RU-облако, остальное → любой API
Медданные (спецкатегории)🚫 Запрещено🚫 Требует отдельной аттестации; риск высокий✅ Единственный безопасный вариант⚠️ Только если медданные остаются в on-prem сегменте
Гостайна🚫 Запрещено🚫 Запрещено✅ Только сертифицированные решения ФСТЭК🚫 Не применимо

Ключевой вывод из матрицы: западный API допустим только для публичных данных или внутренних документов с необратимым обезличиванием. Псевдонимизация (замена имени на user_123) не выводит данные из-под 152-ФЗ, если ключ восстановим — это распространённое заблуждение, которое уже привело к штрафам.

TCO в рублях: три сценария нагрузки

Горизонт расчёта — 36 месяцев. Сравнение за 12 месяцев всегда выигрывает облако — это методологическая ловушка.

Сценарий5 тыс. запросов/день50 тыс. запросов/день500 тыс. запросов/день
Западный API (через шлюз)~180–300 тыс. руб./мес.~1,2–2 млн руб./мес.~12–20 млн руб./мес. + операционный риск отключения
Российское облако (GigaChat/YandexGPT API + GPU-аренда)~80–150 тыс. руб./мес.~400–700 тыс. руб./мес.~3–5 млн руб./мес.
On-prem (покупка сервера + колокация + MLOps)Нецелесообразно: CAPEX от 4 млн руб., окупаемость >36 мес.Окупаемость 18–24 мес.; суммарный TCO за 36 мес. сопоставим с облакомОкупаемость 8–12 мес.; за 36 мес. выгоднее облака в 2–3 раза

Скрытые затраты on-prem, которые не учитываются в первоначальных расчётах: зарплата MLOps-инженера (7–12 млн руб. за 36 мес.), колокация (300–600 тыс. руб./год), обновления модели и дообучение, compliance-аудит, стоимость простоев. Реальный TCO on-prem в 1,8–3,5 раза выше презентуемой цифры — это подтверждают и западные исследования.

Порог окупаемости on-prem в российских реалиях: при стабильной нагрузке >2–3 млн токенов/день и GPU utilization >60% on-prem становится экономически целесообразным. При utilization <40% стоимость инференса вырастает в 2–3 раза от теоретической.

Санкционный риск API: таймлайн и митигация

Западные API — это не просто технический выбор, это операционный риск с конкретной историей:

  • Сентябрь 2024: официальный запрет IT-услуг западных провайдеров для РФ; прямая оплата стала невозможной.
  • Конец 2024: NVIDIA вводит KYC-процедуры для H100/H200; поставки в РФ резко усложнились.
  • 2025–2026: дефицит GPU H100/H200 в РФ; рыночная цена в 2–3 раза выше официального прайса; срок поставки 3–4 месяца.
  • Текущий статус: доступ к OpenAI, Anthropic, Google AI через VPN/шлюзы работает, но нестабилен; в любой момент возможна блокировка на уровне IP-диапазонов.

Сценарии митигации:

  • Российский LLM-шлюз с fallback на GigaChat/YandexGPT при недоступности западного API.
  • Гибридный роутинг: публичные данные → любой доступный API, ПДн → только российское облако или on-prem.
  • Локальные модели как основной инференс: DeepSeek V3 в self-hosted варианте показывает качество, сопоставимое с GPT-4o на задачах документооборота и аналитики на русском языке.

Компании, выбравшие западный API на пилоте без плана миграции, через 12–18 месяцев обнаруживают необходимость переархитектуры. Стоимость переезда — переобучение команды, рефакторинг промптов, смена векторной базы, повторное тестирование — не учитывается в первоначальном TCO, но реально составляет 2–6 месяцев работы команды.

Карта локальных моделей РФ 2026

МодельOn-prem доступностьКачество на русскомПрименимостьСтоимость API
GigaChat MAXДа (enterprise-договор)Высокое, 152-ФЗ out-of-boxДокументооборот, RAG, диалогиДоговорная, есть тарифы
YandexGPT ProЧерез Yandex Cloud (частное облако)Высокое, особенно поиск и суммаризацияАналитика, поиск, классификация~1–3 руб./1000 токенов
Saiga-3 (Llama-RU)Да, open-source, self-hostedСреднее–высокое для задач RAGRAG, классификация, извлечение данныхБесплатно (self-hosted)
DeepSeek V3/R1Да, open-source, self-hostedВысокое, особенно reasoning и кодАналитика, код, сложные цепочки рассужденийБесплатно (self-hosted)

Практическое замечание по DeepSeek: модель доступна для self-hosted развёртывания, что полностью решает вопрос 152-ФЗ — данные не покидают периметр. Для развёртывания полной версии V3 (685B параметров) требуется кластер из 8+ GPU; квантизованные версии работают на 2–4 GPU класса A100.

Архитектура гибридного развёртывания для РФ

Оптимальная архитектура для большинства российских enterprise выглядит так:

Данные → Классификатор чувствительности → Роутер → LLM Gateway с audit log

  • Классификатор определяет тип данных в запросе (публичные / внутренние / ПДн / спецкатегории).
  • Роутер направляет: ПДн и спецкатегории → on-prem или российское облако; публичные данные → любой доступный API с fallback.
  • LLM Gateway ведёт полный audit log всех запросов и ответов — это требование compliance и инструмент для расследования инцидентов.
  • Fallback-логика: при недоступности западного API автоматический переход на GigaChat или YandexGPT.

Такая архитектура решает три задачи одновременно: compliance по 152-ФЗ, операционную устойчивость при санкционных рисках, оптимизацию стоимости (дорогой frontier-API только там, где он реально нужен).

GPU-дефицит: реальные альтернативы

Планировать on-prem на H100/H200 в 2026 году — значит планировать на 3–4 месяца ожидания и цену в 2–3 раза выше официальной. Реальные альтернативы:

  • Аренда GPU в российских облаках (Selectel, Yandex Cloud): A100 80GB — от 350–500 руб./час, H100-эквиваленты — от 600 руб./час. Это позволяет начать без CAPEX и оценить реальную нагрузку перед покупкой железа.
  • Huawei Ascend 910B: производительность сопоставима с A100, поставки в РФ стабильнее. Требует адаптации MLOps-стека (не все фреймворки поддерживаются out-of-box).
  • Delta Sprut и отечественные нейроускорители: пока ограниченная экосистема, но активно развиваются при господдержке.
  • Потребительские GPU (RTX 4090, RTX 6000 Ada): для моделей до 13B параметров — вполне рабочий вариант для небольших нагрузок. Стоимость в 5–10 раз ниже серверных GPU.

Shadow AI: риск, который уже реализуется

Пока IT-директор выбирает архитектуру, сотрудники уже используют личный ChatGPT с корпоративными данными. По оценкам, в крупных российских компаниях 20–40% сотрудников, работающих с текстами, используют публичные LLM для рабочих задач.

Это нарушение 152-ФЗ: трансграничная передача ПДн без уведомления РКН и договора поручения. Ответственность несёт оператор ПДн — компания, а не сотрудник.

Минимальный набор мер:

  • DLP-политики с детектированием обращений к AI-сервисам (ключевые слова, домены).
  • Корпоративный LLM-шлюз как единственный авторизованный канал.
  • Обучение персонала: что можно, что нельзя, почему.
  • Политика допустимого использования AI, подписанная сотрудниками.

Чеклист compliance по 152-ФЗ для каждой архитектуры

Западный API:

  • Уведомление РКН о трансграничной передаче ПДн (ТГП)
  • Договор поручения на обработку ПДн с провайдером (большинство западных провайдеров не предоставляют для РФ)
  • Необратимое обезличивание данных перед отправкой (не псевдонимизация)
  • Оценка: высокий риск, рекомендуется только для публичных данных

Российское облако (GigaChat API, Yandex Cloud):

  • Проверить наличие договора поручения в оферте провайдера
  • Убедиться в локализации данных на серверах в РФ
  • Настроить audit log запросов
  • Оценка: допустимо для ПДн при выполнении условий

On-prem:

  • RBAC: разграничение доступа к модели и данным
  • Audit log всех запросов и ответов
  • Шифрование весов модели и данных в покое
  • Регулярные обновления модели (model lag: on-prem отстаёт от frontier на 2–4 квартала)
  • Оценка: минимальные регуляторные требования, максимальный контроль, максимальная операционная нагрузка

Итог: алгоритм решения для российского ЛПР

Выбор архитектуры ИИ в РФ в 2026 году — это не технический, а стратегический вопрос с четырьмя измерениями: compliance, операционный риск, TCO и MLOps-зрелость.

Если вы начинаете: российское облако (GigaChat API или Yandex Cloud) + гибридный роутинг. Минимальный CAPEX, compliance по 152-ФЗ решаем, быстрый старт.

Если у вас >50 тыс. запросов/день и стабильная нагрузка: считайте TCO на 36 месяцев с on-prem. При GPU utilization >60% on-prem выгоднее облака начиная с 18–24 месяцев.

Если у вас ПДн или медданные в сценарии: on-prem или российское частное облако с договором поручения. Западный API — только для обезличенных данных.

Если вы используете западный API: немедленно оцените санкционный риск и заложите план миграции. Переезд через 12–18 месяцев обойдётся дороже, чем правильный выбор сейчас.

Главный anti-pattern — выбирать архитектуру «по тренду» вместо классификации данных и рабочих нагрузок. Матрица выше даёт структуру; данные вашей компании дают ответ.

Связанные материалы в блоге brezatech:

brezatech — интегратор ИИ в данные и процессы российских B2B-компаний: разработка, BI, автоматизация и LLM в продакшене.

Ключевые факты

  • Штрафы за нарушение 152-ФЗ с 30 мая 2025: от 1 до 18 млн руб. за хранение ПДн за рубежом без уведомления РКН.
  • Западные API официально недоступны для прямой оплаты из РФ с сентября 2024; NVIDIA ввела KYC для H100/H200 в конце 2024.
  • Порог окупаемости on-prem в РФ: при >50 тыс. запросов/день и горизонте 24–36 месяцев — выгоднее российского облака.
  • Agentic AI-сценарии потребляют в 10–50 раз больше токенов, чем чат-бот — это меняет точку окупаемости и compliance-нагрузку.
  • Shadow AI — сотрудники с личным ChatGPT и корпоративными данными — уже является нарушением 152-ФЗ (трансграничная передача без договора поручения).

Частые вопросы

Можно ли использовать ChatGPT с данными клиентов?
Нет, если данные содержат ПДн без необратимого обезличивания. Передача в OpenAI требует уведомления РКН о трансграничной передаче и договора поручения — которого OpenAI не предоставляет для российских операторов.
Что будет, если сотрудники используют личный ChatGPT с рабочими данными?
Это нарушение 152-ФЗ: трансграничная передача ПДн без договора поручения. Штраф для оператора — до 18 млн руб. Решение: DLP-политики, корпоративный LLM-шлюз, обучение персонала.
Как DeepSeek соотносится с 152-ФЗ?
DeepSeek — китайская модель, доступна для self-hosted развёртывания (open-source V3/R1). В этом случае данные не покидают периметр. Использование облачного API DeepSeek требует тех же процедур, что и любой зарубежный провайдер.
Когда on-prem реально окупается в РФ?
При стабильной нагрузке >50 тыс. запросов/день и горизонте расчёта 24–36 месяцев. При нагрузке <5 тыс. запросов/день российское облако выгоднее минимум в 3–4 раза.
Что делать, если нет доступа к GPU H100/H200?
Три альтернативы: аренда GPU в Selectel или Yandex Cloud (A100/H100-эквиваленты), китайские ускорители Huawei Ascend 910B, отечественные решения (Delta Sprut). Для моделей до 13B параметров достаточно потребительских GPU класса RTX 4090.

Источники

О brezatech

brezatech — интегратор ИИ в данные и процессы российских B2B-компаний: разработка, BI, автоматизация и LLM в продакшене. ИИ-агент продаж 24/7 →

Ещё в журнале