Как обеспечить безопасность персональных данных в соответствии с ФЗ-152 при использовании ИИ

С приходом нейросетей и автоматизации в бизнес-процессы компании всё чаще сталкиваются с острым вопросом: как использовать ИИ-инструменты и при этом не нарушить российское законодательство о персональных данных? Федеральный закон № 152-ФЗ «О персональных данных» обязывает операторов обеспечивать защиту ПДн, а за нарушения грозят серьёзные штрафы и претензии со стороны Роскомнадзора.

Разбираем четыре ключевых подхода - от простых до комплексных.

1. Хранение данных на российских серверах

Статья 18.1 ФЗ-152 прямо требует: первичная запись, систематизация, накопление и хранение персональных данных граждан РФ должны осуществляться на серверах, расположенных на территории России.

Это означает, что если ваша система принимает имена, телефоны, адреса или любую другую информацию, позволяющую идентифицировать пользователя, - она должна оседать на российской инфраструктуре. Использование зарубежных облачных платформ (AWS, Google Cloud, Azure без локальных регионов) для хранения ПДн российских граждан нарушает этот принцип.

Практические шаги:

  1. Выбирайте облачных провайдеров с сертифицированными ЦОД в России: Yandex Cloud, VK Cloud, Selectel, облако МТС и другие.

  2. Зафиксируйте в политике обработки ПДн, на каком физическом оборудовании хранятся данные.

  3. При использовании гибридных архитектур убедитесь, что ПДн не реплицируются за рубеж.

2. Токенизация персональных данных перед отправкой в ИИ

Один из наиболее элегантных технических решений - токенизация ПДн перед их передачей в языковую модель. Суть метода: пользователь видит реальный результат, но сам ИИ никогда не обрабатывает настоящие персональные данные.

Как это работает на практике

[Входные данные: "Иван Иванов, +7999..."]
          ↓
[Узел JavaScript / Функция в n8n]
  — Заменяет ПДн на токены: "Иван" → "Пользователь_1"
  — Сохраняет карту соответствия в защищённую БД (Redis / PostgreSQL)
          ↓
[Запрос в LLM: "Пользователь_1 хочет узнать баланс..."]
          ↓
[Ответ от LLM: "У Пользователь_1 на счету 500 рублей"]
          ↓
[Узел JavaScript / Функция в n8n]
  — Обращается к БД, заменяет "Пользователь_1" обратно на "Иван"
          ↓
[Выходной результат: "Иван, у вас на счету 500 рублей"]

Преимущества подхода:

  • ИИ-модель в любой момент «видит» только обезличенные данные - токены, а не реальные ПДн.

  • Даже при утечке данных из модели злоумышленник получит лишь бессмысленный токен «Пользователь_1».

  • Метод совместим с любыми LLM, в том числе зарубежными, поскольку за рубеж уходят только обезличенные данные.

  • Карта соответствия хранится на вашем сервере в России и полностью под вашим контролем.

Такой пайплайн удобно реализовывать через платформы автоматизации (n8n, Airflow, собственные микросервисы) с хранением маппинга в зашифрованной базе данных.

3. Использование российских ИИ-моделей

Если задача требует передачи в модель реальных данных (например, для анализа медицинских документов или юридических текстов), логичным решением становится переход на отечественные ИИ-сервисы.

Российские поставщики обрабатывают данные в рамках российской юрисдикции, соблюдают требования ФЗ-152 и, как правило, готовы заключить соглашение об обработке данных в соответствии с российским законодательством.

Среди актуальных вариантов:

  • YandexGPT (Yandex Cloud) - API с обработкой внутри инфраструктуры Яндекса в России.

  • GigaChat (Сбер) - языковая модель с возможностью использования в закрытом контуре.

  • Другие модели от отечественных разработчиков на сертифицированных российских платформах.

При выборе провайдера важно убедиться, что в договоре прямо прописано: данные не передаются третьим лицам и не покидают российскую территорию.

4. Локальное развёртывание ИИ-модели на российском сервере

Самый дорогостоящий, но и наиболее защищённый вариант - self-hosted развёртывание открытой языковой модели на собственной или арендованной инфраструктуре в России.

В чём суть

Вы разворачиваете модель (например, Llama, Mistral, Qwen или отечественный аналог) на GPU-сервере в сертифицированном российском ЦОД. Все запросы и данные обрабатываются исключительно внутри вашего контура - никакие данные не покидают ваш периметр.

Когда это оправдано

  • Обработка медицинских, финансовых или юридических ПДн высокой степени конфиденциальности.

  • Корпоративные системы, где утечка данных несёт репутационные и правовые риски.

  • Компании, работающие с государственными заказчиками и требованиями к защите информации по ФСТЭК/ФСБ.

Что потребуется

  • GPU-сервер (от нескольких десятков тысяч рублей в месяц аренды).

  • Специалист по MLOps для настройки и поддержки.

  • Выбор подходящей open-source модели и её тонкая настройка (fine-tuning) под ваши задачи.

Сравнительная таблица подходов

Подход

Стоимость

Сложность

Уровень защиты

Российские серверы

Низкая

Низкая

Базовый

Токенизация ПДн

Средняя

Средняя

Высокий

Российские ИИ-модели

Средняя

Низкая

Высокий

Локальное развёртывание

Высокая

Высокая

Максимальный

Соблюдение ФЗ-152 при работе с ИИ - это не барьер, а архитектурная задача. Большинство компаний выбирает комбинированный подход: хранят данные на российских серверах, используют токенизацию при обращении к внешним моделям, а для наиболее чувствительных данных рассматривают локальное развёртывание. Важно зафиксировать выбранный подход в политике обработки ПДн, провести оценку рисков и убедиться, что ваш провайдер готов документально подтвердить соответствие требованиям закона.

*При разработке архитектуры обработки ПДн рекомендуется проконсультироваться с юристом, специализирующимся на защите данных, и техническим специалистом по информационной безопасности.