Почему генеративный ИИ — это новый фронт 152-ФЗ
Генеративный ИИ попадает под 152-ФЗ не потому что он «умный», а потому что является средством автоматизированной обработки данных. Как только в промпт попадает имя, телефон, email или любой другой идентификатор реального человека — начинается обработка ПДн. Если при этом запрос уходит в облачный API (OpenAI, GigaChat, Yandex GPT, Gemini) — это передача ПДн третьему лицу.
С 01.07.2025 (ФЗ-23 от 28.02.2025) хранение ПДн россиян на зарубежных серверах прямо запрещено. Большинство облачных LLM-провайдеров логируют промпты — минимум временно. Это означает, что даже «просто попробовать ChatGPT на реальных данных клиентов» уже создаёт нарушение.
Три ключевых изменения, которые изменили риск-профиль в 2024–2025 годах:
- Ст. 13.1 152-ФЗ (ФЗ-233 от 08.08.2024) — легализовала обезличивание как самостоятельный правовой инструмент. Надлежащим образом обезличенные данные выходят из-под режима ПДн.
- Новые штрафы — выросли на порядок: до 20 млн руб. за единичную утечку, до 500 млн руб. (оборотный) за повторную.
- Ст. 272.1 УК РФ (введена в декабре 2024) — уголовная ответственность за незаконный оборот ПДн. Это качественно меняет разговор с советом директоров.
Таблица: какие данные можно отправлять в LLM API
Это не абстрактная классификация — это операционный инструмент для DPO и разработчика.
| Категория ПДн | Статус по 152-ФЗ | В облачный API без согласия? | Что делать |
|---|---|---|---|
| ФИО | Общие ПДн | ❌ Нельзя | Заменить на токен: PERSON_001 |
| Телефон, email | Общие ПДн | ❌ Нельзя | Заменить на PHONE_001, EMAIL_001 |
| СНИЛС, ИНН | Общие ПДн (идентификаторы) | ❌ Нельзя | Удалить или заменить на ID_001 |
| Паспортные данные | Общие ПДн | ❌ Нельзя | Удалить, обрабатывать on-prem |
| Биометрия (лицо, отпечаток) | Специальная категория | ❌ Запрещено без письменного согласия | Только on-prem или письменное согласие + российский облачный провайдер |
| Голос (запись звонка) | Биометрия при идентификации | ❌ Запрещено без письменного согласия | Транскрибировать on-prem, анонимизировать текст |
| IP-адрес | ПДн при возможности идентификации | ⚠️ Зависит от контекста | Хэшировать или удалять перед отправкой |
| Медицинские данные | Специальная категория | ❌ Запрещено без явного согласия | Только on-prem или обезличивание по ст. 13.1 |
| История транзакций с привязкой к субъекту | Общие ПДн | ❌ Нельзя | Агрегировать, удалить идентификаторы |
| Агрегированная статистика без идентификаторов | Не ПДн | ✅ Можно | Проверить, что деанонимизация невозможна |
| Тексты договоров без ФИО | Не ПДн (после анонимизации) | ✅ Можно | Убедиться в полноте анонимизации |
Архитектурная матрица: on-prem vs российское облако vs зарубежное облако
Нет универсального ответа — есть компромиссы. Выбор зависит от чувствительности данных, бюджета и скорости запуска.
| Критерий | On-prem LLM (Llama, Mistral, GigaChat self-hosted) | Российское облако (Yandex Cloud, SberCloud, МТС Cloud) | Зарубежное облако + PII-proxy |
|---|---|---|---|
| Соответствие 152-ФЗ | ✅ Полное | ✅ При правильной конфигурации | ⚠️ Только при надлежащей анонимизации |
| Локализация данных | ✅ Данные не покидают контур | ✅ Серверы в РФ | ❌ Данные уходят за рубеж (даже анонимизированные — риск) |
| Стоимость запуска | 🔴 Высокая (GPU, инфраструктура) | 🟡 Средняя | 🟢 Низкая |
| Скорость запуска | 🔴 Месяцы | 🟡 Недели | 🟢 Дни |
| Качество модели | 🟡 Зависит от модели (7–70B) | 🟡 GigaChat, YandexGPT — растут | 🟢 GPT-4o, Claude — выше |
| Риск утечки | 🟢 Минимальный | 🟡 Низкий при аудите провайдера | 🟡 Средний (зависит от качества proxy) |
| Подходит для | Медицина, банки, госсектор, HR-ИИ | Большинство корпоративных сценариев | Обезличенные тексты, аналитика без ПДн |
Оптимальный гибридный паттерн: запросы, содержащие ПДн → on-prem LLM; обезличенные запросы (аналитика, суммаризация обезличенных документов) → облачный API. Это снижает нагрузку на собственную инфраструктуру и сохраняет соответствие закону.
Архитектура PII-proxy: как это работает
PII-proxy — это промежуточный слой между вашим приложением и LLM API. Он перехватывает запрос, заменяет ПДн на токены, отправляет обезличенный промпт в API, получает ответ и восстанавливает исходные значения.
Схема потока:
Исходный запрос → [Маскиратор] → Обезличенный промпт → LLM API
↓
Восстановленный ответ ← [Деанонимизатор] ← Ответ с токенамиПример замен в маскираторе:
Иванов Пётр Сергеевич→PERSON_001+7-999-123-45-67→PHONE_001ivanov@company.ru→EMAIL_0017712345678(ИНН) →INN_001г. Москва, ул. Ленина, д. 5→ADDRESS_001
Маскиратор хранит таблицу соответствий в памяти (не в логах) на время сессии. После получения ответа деанонимизатор восстанавливает значения в тексте ответа. Таблица соответствий уничтожается после завершения сессии.
Важно: PII-proxy реализует псевдонимизацию, а не обезличивание по ст. 13.1. Это значит, что данные по-прежнему считаются ПДн внутри вашего контура — но в API уходит уже не ПДн. Для полного соответствия закону ключ соответствия не должен передаваться провайдеру.
Ст. 13.1 152-ФЗ: обезличивание как легальный путь
Это норма, о которой почти не пишут, но которая открывает практический путь для большинства ИИ-сценариев. Надлежащим образом обезличенные данные перестают быть ПДн — и на них не распространяются требования закона.
Что считается надлежащим обезличиванием по требованиям РКН:
- Невозможность идентификации субъекта ни напрямую, ни в сочетании с другими доступными данными
- Необратимость: нет ключа для восстановления
- Документированный процесс обезличивания с оценкой остаточного риска
Чем отличается от псевдонимизации: псевдонимизация (токен-подмена с сохранением ключа) — это всё ещё ПДн. Обезличивание — это удаление или необратимое преобразование, после которого субъект не восстанавливается.
Практический вывод: для аналитических задач (суммаризация обращений, классификация тикетов, анализ тональности) часто достаточно удалить идентификаторы и агрегировать данные. Такой датасет можно отправлять в любой API без согласия субъектов.
Антипример: штраф 800 тыс. руб. за голосовую биометрию
Компания внедрила ИИ-анализ звонков колл-центра: записи разговоров загружались в облачный сервис транскрибации и анализа тональности. Голос клиента — биометрические ПДн при использовании для идентификации. Согласия на биометрическую обработку получено не было. РКН зафиксировал нарушение при плановой проверке. Штраф — 800 тыс. руб., предписание остановить обработку.
Как это можно было предотвратить технически:
- Транскрибация голоса → текст выполняется on-prem (голосовые данные не покидают контур)
- Текст транскрипции анонимизируется: имена, телефоны, адреса заменяются токенами
- Обезличенный текст отправляется в облачный API для анализа тональности и классификации
- Голосовые записи хранятся в зашифрованном виде в РФ с retention-политикой
Стоимость on-prem транскрибатора (Whisper на собственном сервере) — несопоставимо меньше штрафа и репутационных потерь.
Ст. 16 152-ФЗ: human-in-the-loop обязателен
Статья 16 запрещает принимать решения, порождающие юридические последствия или существенно затрагивающие права граждан, исключительно на основе автоматизированной обработки — без участия человека.
Сценарии, где это критично:
- HR-ИИ: автоматический отказ в найме на основе анализа резюме — нарушение
- Кредитный скоринг: отказ в кредите без участия сотрудника — нарушение
- Медицинская диагностика: автоматический диагноз без врача — нарушение
- Страховые решения: расчёт тарифа с автоматическим отказом — под вопросом
Что делать: внедрить human-in-the-loop на уровне процесса. ИИ готовит рекомендацию, человек принимает решение и фиксирует его. Это не просто юридическое требование — это и лучшая практика для снижения ошибок модели.
Карта штрафов 2025–2026
| Нарушение | Санкция |
|---|---|
| Процедурные нарушения (нет уведомления РКН, нет политики) | До 1,5 млн руб. |
| Утечка ПДн 1–10 тыс. субъектов | 3–5 млн руб. |
| Утечка ПДн 10–100 тыс. субъектов | 5–15 млн руб. |
| Утечка ПДн более 100 тыс. субъектов | 15–20 млн руб. |
| Повторная утечка | Оборотный штраф до 500 млн руб. |
| Хранение ПДн за рубежом (с 01.07.2025) | До 18 млн руб. |
| Незаконный оборот ПДн (ст. 272.1 УК РФ) | Уголовная ответственность, лишение свободы до 4 лет |
| Необеспечение уведомления РКН в 24 часа при утечке | До 3 млн руб. |
Чеклист «До запуска генеративного ИИ»
Используйте как операционный документ — не как формальность.
Регуляторная база
- Компания зарегистрирована как оператор ПДн в РКН (если ещё нет)
- Определены категории ПДн, которые будет обрабатывать ИИ-система
- Проведена оценка: попадают ли данные под специальные категории (биометрия, медицина)
- Проверено соответствие ст. 16: есть ли human-in-the-loop для решений, влияющих на права граждан
Инфраструктура и локализация
- База данных с ПДн локализована в РФ (требование с 01.07.2025 — обязательно)
- Выбрана архитектура: on-prem / российское облако / гибрид с PII-proxy
- Логи промптов и ответов LLM хранятся только в РФ
- Установлена retention-политика для логов (не дольше срока цели обработки, как правило 30 дней)
Анонимизация и технические меры
- Реализован PII-proxy или маскиратор для всех запросов к облачным LLM
- Проведено тестирование: ни один промпт не содержит ПДн в открытом виде
- Для биометрических данных (голос, лицо) — транскрибация/обработка только on-prem
- Документирован процесс обезличивания по ст. 13.1 с оценкой остаточного риска
Согласия и договоры
- Шаблон согласия субъекта ПДн обновлён: явно указано, что данные обрабатываются алгоритмом и могут передаваться LLM-сервису (с указанием провайдера)
- Для биометрии — получено письменное согласие (не электронное)
- Заключён договор с LLM-провайдером: пункт о запрете использования данных для обучения модели, обязательство уведомить об инциденте в 24 часа, право на уничтожение данных
- Проверено: провайдер российского облака подтверждает хранение данных только в РФ
Инциденты и мониторинг
- Определён ответственный за уведомление РКН при утечке (срок — 24 часа)
- Настроен мониторинг аномалий в запросах к LLM API
- Проведён внутренний аудит: кто имеет доступ к логам промптов
Шаблон пункта согласия субъекта ПДн для ИИ-сценариев
Стандартное согласие не покрывает ИИ-обработку. Добавьте в форму согласия явный пункт:
«Я даю согласие на обработку моих персональных данных с использованием систем искусственного интеллекта, включая автоматизированный анализ текстовых обращений, в целях [указать цель]. Обработка осуществляется [наименование оператора] с привлечением [наименование LLM-провайдера] в качестве обработчика. Данные не используются для обучения моделей третьих лиц. Решения, затрагивающие мои права, принимаются с участием уполномоченного сотрудника.»
Для биометрических данных (голос, изображение лица) согласие должно быть получено в письменной форме — электронная форма с галочкой недостаточна.
Что делать прямо сейчас
Если генеративный ИИ уже в проде или планируется в ближайшие месяцы, приоритеты такие:
- Аудит данных: пройдитесь по всем точкам, где ПДн могут попасть в промпт. Часто это не очевидно — например, контекст из CRM, который автоматически добавляется в запрос.
- Быстрая защита: внедрите PII-proxy или маскиратор на уровне API-клиента — это решается за дни и снимает основной риск.
- Договор с провайдером: проверьте, есть ли в соглашении с LLM-провайдером запрет на использование данных для обучения. У большинства крупных провайдеров это настраивается или уже включено в корпоративные тарифы.
- Retention логов: если промпты логируются — установите автоматическое удаление через 30 дней и ограничьте доступ.
- Human-in-the-loop: для любых решений, влияющих на права сотрудников или клиентов, добавьте шаг подтверждения человеком — это и юридическое требование, и страховка от галлюцинаций модели.
Регуляторный барьер реален, но он не означает «нельзя внедрять ИИ». Он означает «внедряй с правильной архитектурой». Компании, которые решат эту задачу сейчас, получат устойчивое конкурентное преимущество — пока остальные ждут «когда всё прояснится».
Материалы по теме в блоге brezatech: статья об архитектуре корпоративных баз знаний, обзор on-prem LLM для российского рынка, гайд по аудиту данных перед внедрением BI.
brezatech — интегратор, специализирующийся на внедрении ИИ в данные и бизнес-процессы: разработка, BI, автоматизация документооборота и базы знаний.
Ключевые факты
- С 01.07.2025 (ФЗ-23 от 28.02.2025) хранение ПДн россиян за рубежом запрещено — это напрямую касается облачных LLM, которые логируют промпты.
- Штрафы за утечку ПДн выросли до 20 млн руб. за единичный инцидент и до 500 млн руб. (оборотный) за повторный; с декабря 2024 введена уголовная ответственность по ст. 272.1 УК РФ.
- Ст. 13.1 152-ФЗ (введена ФЗ-233 от 08.08.2024) легализует обезличивание как способ работы с ПДн в ИИ без согласия субъекта — но только при соответствии требованиям РКН.
- Ст. 16 152-ФЗ запрещает принимать решения, влияющие на права граждан, исключительно на основе автоматизированной обработки — без участия человека. Критично для HR-ИИ, кредитного скоринга, медицинской диагностики.
- Гибридный паттерн (ПДн-запросы → on-prem LLM, обезличенные → облачный API) часто оптимальнее чистого on-prem по соотношению цена/риск/скорость запуска.
Частые вопросы
- Является ли промпт с именем клиента передачей ПДн третьему лицу?
- Да. Если промпт содержит ФИО, телефон, email или иные идентификаторы субъекта, отправка в облачный LLM API квалифицируется как передача ПДн оператором третьему лицу (провайдеру). Требуется либо поручение на обработку с соответствующим договором, либо анонимизация до отправки.
- Нужно ли согласие субъекта, если данные обезличены перед отправкой в LLM?
- Нет — при условии, что обезличивание соответствует требованиям РКН по ст. 13.1 152-ФЗ: данные не позволяют идентифицировать субъекта ни напрямую, ни в сочетании с другими. Псевдонимизация (замена имени на токен при сохранении ключа соответствия) не является обезличиванием.
- Как логировать запросы к LLM, не нарушая 152-ФЗ?
- Логируйте только обезличенные версии промптов и ответов. Если нужно хранить оригинал — шифруйте, ограничивайте доступ, устанавливайте retention не дольше срока цели обработки (как правило, 30 дней). Хранилище логов должно быть локализовано в РФ.
- Что писать в договоре с облачным LLM-провайдером?
- Обязательные пункты: запрет использования переданных данных для дообучения модели; обязательство хранить данные только в РФ (или подтверждение, что ПДн не передаются); порядок уведомления об инцидентах в течение 24 часов; право на аудит и уничтожение данных по запросу.
- Нужно ли уведомлять РКН при внедрении ИИ-системы?
- Уведомление об операторе ПДн подаётся при начале обработки ПДн — если компания ещё не зарегистрирована. При утечке уведомление РКН обязательно в течение 24 часов с момента обнаружения, независимо от масштаба инцидента.
Источники
- Динамическая анонимизация данных для LLM API
- 152-ФЗ и LLM: токен-подмена ПДн перед отправкой в Gemini API
- AI-сервисы и персональные данные: как обезопасить компанию
- ИИ и 152-ФЗ: кейс штраф 800 тыс. руб. за голосовую биометрию
- Закон о персональных данных 2025: штрафы, оборотные санкции, ст. 272.1 УК
- Защита конфиденциальных данных в облачных LLM: on-prem vs облако
- On-prem LLM для российского рынка: отраслевые требования
- Новые требования РКН май 2025: биометрия, письменное согласие
О brezatech
brezatech — интегратор, специализирующийся на внедрении ИИ в данные и бизнес-процессы: разработка, BI, автоматизация документооборота и базы знаний. ИИ-агент продаж 24/7 →
