Внедрение ИИ через публичные API (OpenAI, Anthropic, Google) создаёт риски утечки конфиденциальных данных. Разбираем методы защиты коммерческой тайны, варианты архитектуры и compliance-требования для безопасной работы с ИИ.

Ваш разработчик интегрирует GPT в корпоративный чат-бот. В промпты летят реальные запросы клиентов, имена сделок, ценовые условия. Неделю всё работает отлично – а потом юрист присылает вопрос: «Мы отправили API-запрос в OpenAI с персональными данными. Где теперь эти данные?» Пауза. Никто не знает.
Рынок AI в России достиг 110 млрд рублей, и каждая вторая компания экспериментирует с публичными моделями – ChatGPT API, Claude, Gemini. Но между «запустить на пилоте» и «масштабировать на всю компанию» лежит пропасть: вопросы compliance, риски утечек, штрафы за нарушение ФЗ-152. Дальше – как отличить реальные риски от паники, какие условия прописаны в лицензиях вендоров, и какие архитектурные решения защищают данные без отказа от ИИ.
Каждый API-запрос к OpenAI или Anthropic – это отправка текстового payload на чужие серверы. В промпте может оказаться всё, что разработчик считает «контекстом»: клиентские обращения, внутренние документы, коммерческие условия.
Вот что происходит с данными по факту. OpenAI до марта 2023 года использовала все запросы к API для дообучения моделей – если пользователь не отключил эту опцию явно. Сейчас OpenAI обещает хранить промпты 30 дней для мониторинга нарушений, но не использовать их для тренировки. Anthropic заявляет, что не обучает Claude на данных клиентов, но также хранит логи для «улучшения систем безопасности». Google AI прописывает в Enterprise-соглашениях, что данные клиентов не покидают облако Google Cloud – но только если вы используете enterprise-тарифы, а не публичный API через AI Studio.

Проблема в том, что большинство компаний начинают с бесплатных или базовых тарифов, где гарантий ноль. Вы отправили в ChatGPT финансовый прогноз с разбивкой по регионам – формально OpenAI имеет право хранить его месяц. Технически достаточно утечки логов или ошибки в access control, чтобы данные оказались в руках третьих лиц.
Российский контекст усугубляет риски. ФЗ-152 требует локализации персональных данных граждан РФ внутри страны. Отправка имён, email, номеров телефонов в API OpenAI или Anthropic – прямое нарушение закона, если нет согласия субъекта на трансграничную передачу. ФСТЭК и Роскомнадзор квалифицируют это как утечку. Штраф для юрлиц – до 500 тыс. рублей за первичное нарушение, повторное – блокировка сервиса.
В проекте для Uprise – платформы оценки ментального здоровья сотрудников – команда столкнулась с аналогичной задачей: обрабатывать медицинские данные в TypeScript-приложении на React, не роняя типовую безопасность и не нарушая стандарты обработки чувствительной информации. Архитектура строилась так, чтобы данные о тестах сотрудников не попадали в третьи системы без явного контроля. Решение – изолированные модули с раздельным доступом и валидация каждого запроса до отправки. Аналогичная логика применима к ИИ-интеграциям: фильтруйте данные на стороне приложения, прежде чем они улетят в API.
Вывод раздела: публичные API по умолчанию небезопасны для коммерческих данных. Не доверяйте маркетингу вендоров – читайте Terms of Service и настраивайте opt-out там, где это возможно.
Юрист смотрит на API-контракт через призму ответственности: кто платит за утечку, где хранятся данные, как долго. Технарь – через SLA и технические гарантии. Разрыв между этими двумя чтениями убивает проекты.
OpenAI API Terms: компания заявляет, что не использует API-запросы для обучения моделей, если клиент не дал согласия. Но есть нюанс – данные хранятся 30 дней для abuse monitoring. Если ваш запрос попадёт под автоматическую проверку на токсичность или fraud, логи могут анализироваться вручную. Где именно хранятся серверы? OpenAI использует облака Azure, которые физически разбросаны по США и Европе. Для РФ это означает трансграничную передачу данных.
Anthropic (Claude): политика строже. Anthropic обещает не обучаться на пользовательских данных и хранит промпты только для мониторинга безопасности. Срок хранения не раскрывается публично – указано «минимально необходимое время». Enterprise-клиенты могут запросить Data Processing Agreement (DPA), где прописывается удаление данных по первому требованию. Но базовый API-доступ такого контракта не даёт.
Google AI (Gemini API): самый гибкий вариант для корпораций. Если вы используете Vertex AI в Google Cloud, данные остаются внутри вашего облачного проекта. Google не имеет к ним доступа, не хранит логи за пределами вашего региона и не использует для тренировки. Но эта гарантия работает только в платном enterprise-контуре. Публичный Gemini API через AI Studio работает по тем же правилам, что OpenAI: данные хранятся для улучшения сервиса, срок не гарантируется.
Что проверить перед подключением API:
Практический совет: начинайте интеграцию не с кода, а с юридического аудита контракта. Если вендор не предоставляет DPA на русском языке и не локализует серверы – ищите российские альтернативы (GigaChat, YandexGPT) или разворачивайте self-hosted модели.
Полностью отказаться от публичных API нереально – self-hosted модели дороги и требуют GPU-кластер. Но можно построить архитектуру так, чтобы конфиденциальные данные не покидали периметр.

Перед отправкой промпта в API вырезайте всё, что идентифицирует субъекта: имена, номера, email, ID сделок. Реализуется через препроцессинг-слой – микросервис между вашим приложением и внешним API.
Пример: пользователь пишет в чат-бот «Когда придёт заказ #А12345 на имя Иван Петров?». Препроцессор заменяет: «Когда придёт заказ #ORDER_ID на имя USER_NAME?». LLM получает обезличенный запрос, генерирует ответ – а ваш backend подставляет реальные значения обратно.
Минус решения: модель теряет контекст. Если в промпте важна логическая связь между именем клиента и историей его заказов – замена на placeholder сломает рассуждения. Но для 70% корпоративных сценариев (FAQ, классификация обращений, саммаризация) это работает.
Если данные вообще нельзя отправлять наружу (медицина, финтех, гособоронзаказ) – используйте on-premise LLM или российские облачные модели с локализацией. GigaChat от Сбера, YandexGPT, ruGPT-3 развёрнуты на территории РФ и подпадают под российскую юрисдикцию.
Альтернатива – self-hosted прокси с кешированием. Вы настраиваете внутренний сервер, который принимает запросы от сотрудников, кеширует популярные ответы и отправляет в OpenAI только анонимизированные промпты. Кеш снижает количество внешних запросов на 40–60%, а анонимизация – риски утечки.
Инструменты для реализации:
В проекте Vnx-Sto – платформы токенизации европейских облигаций – перед командой стояла задача спроектировать архитектуру с учётом требований KYC, KYB и AML. Каждый запрос на верификацию пользователя проходил через многоуровневую систему с раздельными тирами доступа. Аналогичный подход применим к ИИ: разделите потоки данных по уровням чувствительности. Публичные FAQ обрабатываются через внешний API, персональные обращения – через внутреннюю модель.
Вывод: если нельзя убрать риск полностью – минимизируйте поверхность атаки. Анонимизация, прокси-слой и гибридная архитектура (внешний API для открытых данных + self-hosted для чувствительных) снижают вероятность утечки в разы.
Юридические риски при работе с ИИ не абстрактны – они конвертируются в штрафы и блокировки. Разберём ключевые режимы.
Федеральный закон №152-ФЗ требует, чтобы персональные данные граждан РФ обрабатывались и хранились на серверах внутри России. Отправка имён, email, номеров телефонов в OpenAI или Anthropic без согласия субъекта – нарушение. Штраф для юрлиц – до 500 тыс. рублей, для должностных лиц – до 20 тыс. рублей. Роскомнадзор может заблокировать доступ к вашему сервису, если выявит систематические нарушения.
Исключение: если пользователь дал явное согласие на трансграничную передачу (ст. 12 ФЗ-152). Но оформить это в UX корректно сложно – нужен отдельный чекбокс, текст согласия на юридическом языке, логирование факта согласия. Большинство компаний этого не делают.
