1. Главная
  2. Блог
  3. Право, безопасность и риски ИИ
  4. Обезличивание данных для ИИ: как это делается и где ломается

Обезличивание данных для ИИ: как это делается и где ломается

15 августа 2026
33

Обезличивание — замена персональных данных в тексте на условные обозначения перед отправкой во внешнюю модель, с обратной подстановкой в результате.

Приём практичный: он часто снимает необходимость разворачивать модель у себя и позволяет пользоваться внешними сервисами там, где иначе было бы нельзя.

И у него есть свойство, которое надо назвать сразу:

> Полностью надёжного автоматического обезличивания не существует. Оно снижает риск, но не устраняет его, и требует проверки качества.

Правовую оценку достаточности меры даёт юрист — я не юрист и описываю техническую сторону.

Как устроено

Три шага.

Шаг 1: найти и заменить. В тексте выявляются персональные данные и заменяются метками: «Иван Петров» → [ЛИЦО_1], «+7 999 123-45-67» → [ТЕЛЕФОН_1].

Шаг 2: отправить в модель. Модель работает с обезличенным текстом.

Шаг 3: подставить обратно. В ответе метки заменяются исходными значениями. Соответствие хранится у вас и наружу не уходит.

Важная деталь второго шага: метки должны быть последовательными. Если «Иван Петров» встречается трижды, все три раза это [ЛИЦО_1] — иначе модель не поймёт, что речь об одном человеке, и связность текста разрушится.

Что заменять

Категория Примеры Сложность выявления
Имена ФИО, обращения средняя: совпадают с обычными словами
Контакты телефоны, почта низкая: формат распознаётся
Адреса улица, дом, квартира средняя
Документы паспорт, СНИЛС, ИНН низкая: контрольные суммы
Номера счетов и карт низкая
Идентификаторы номера договоров, заказов, дел средняя
Даты рождения, конкретных событий высокая: не отличить от обычных дат
Названия организаций если идентифицируют лицо высокая

Строки с высокой сложностью — там, где автоматика ошибается. Их приходится либо обрабатывать грубее (заменять все даты), либо оставлять и учитывать в оценке риска.

Чем выявлять

Правилами. Регулярные выражения плюс проверки: контрольная сумма ИНН и СНИЛС, формат телефона, структура почты. Надёжно для форматных данных, бесполезно для имён.

Словарями. Списки имён, фамилий, названий населённых пунктов. Даёт полноту, порождает ложные срабатывания: «Роман» — имя или жанр, «Орёл» — город или птица.

Моделью. Отдельная небольшая модель для выделения сущностей в тексте. Лучше справляется с контекстом, но сама вероятностна и пропускает.

Комбинация — рабочий вариант. Правила для форматного, модель для имён и адресов, словари для проверки. Каждый способ закрывает то, где другой слаб.

Отдельная оговорка. Если для обезличивания используется внешняя модель, данные уходят наружу до обезличивания — то есть мера бессмысленна. Выделение сущностей должно работать в вашем контуре.

Где ломается

Косвенная идентификация. Главная проблема, и она не решается заменой полей.

«Клиент, наш единственный дистрибьютор в Магадане, недоволен сроками» — ФИО нет, идентификация есть. Совокупность деталей идентифицирует человека или организацию не хуже имени.

Автоматика такого не ловит принципиально: она работает с полями, а не со смыслом ситуации.

Опечатки и нестандартные написания. Телефон, записанный словами, имя с опечаткой, адрес в свободной форме.

Данные в структуре. Имя в подписи письма, в имени файла, в метаданных документа. Обезличивают тело, забывают остальное.

Разрушение смысла. Иногда обезличивание делает текст бесполезным: если задача — разобраться в конфликте между конкретными сотрудниками, замена имён на метки сохраняет структуру, но текст становится трудным для модели.

Обратная подстановка в ответ. Если модель в ответе переформулировала метку или склонила её, автоматическая подстановка промахивается. Метки надо выбирать так, чтобы они не склонялись и не переписывались.

Как проверять качество

Мера без проверки — иллюзия защиты.

Соберите набор реальных текстов с размеченными вручную персональными данными: 100–200 фрагментов.

Считайте два показателя отдельно:

  • сколько пропущено — данные остались в тексте. Каждый пропуск — реализованный риск;
  • сколько лишнего заменено — ложные срабатывания. Портят качество работы модели.

Первый показатель важнее: пропуск — это утечка, лишняя замена — только ухудшение результата.

Проверяйте на своих текстах. Обезличивание, отлаженное на обращениях клиентов, на резюме или медицинских записях будет работать иначе.

Перепроверяйте регулярно. Меняются форматы обращений, появляются новые виды идентификаторов.

Разбор: обезличивание, которое пропускало

Задача. Разбор обращений клиентов внешней моделью. Перед отправкой — обезличивание.

Как было сделано. Регулярные выражения для телефонов, почты, номеров договоров плюс словарь имён.

Что показала проверка на 150 размеченных обращениях.

Телефоны и почта — выявлялись почти полностью. Форматные данные автоматика берёт хорошо.

Имена — пропускалось около четверти. Причины: редкие имена не было в словаре, имена в косвенных падежах не совпадали со словарной формой, часть имён была написана с опечатками.

Адреса — пропускалось больше половины: они писались в свободной форме, шаблон не срабатывал.

Что нашли отдельно и что оказалось важнее. В значительной части обращений клиент подписывался в конце письма, а подпись при разборе не обрабатывалась — обезличивался только текст обращения, выделенный как «суть». Имя и контакты уходили в модель в составе служебной части запроса.

Формально обезличивание работало. Фактически данные передавались.

Что сделали.

Добавили модель выделения сущностей в своём контуре — она закрыла имена в падежах и адреса в свободной форме. Пропуски по именам сократились до единичных.

Расширили область обезличивания на весь текст запроса, а не только на выделенную часть. Это исправило основную проблему.

Ввели проверку остатка: после обезличивания текст ещё раз прогонялся правилами на характерные признаки. Найденное — сигнал, а не молчаливая отправка.

Стали считать долю пропусков ежемесячно на новой выборке.

Что осталось нерешённым сознательно. Косвенная идентификация. Для их потока обращений случаев, где человек опознаётся по совокупности деталей, было немного, и риск приняли осознанно, зафиксировав это решение. Полностью автоматически такое не закрывается.

Что стоит забрать. Обезличивание, которое никто не измерял, обычно работает хуже, чем предполагается. И самая частая ошибка — не качество выявления, а неполная область: обезличивают часть запроса, а данные едут в другой его части.

Частые вопросы

Что такое обезличивание данных для ИИ?

Замена персональных данных в тексте на условные метки перед отправкой во внешнюю модель, с обратной подстановкой значений в полученный ответ. Соответствие меток и значений остаётся у вас. Приём позволяет пользоваться внешними моделями там, где передача исходных данных нежелательна.

Полностью ли это защищает?

Нет. Автоматическое обезличивание пропускает: имена в необычных формах, адреса в свободной форме, данные в подписях и метаданных. Отдельно оно принципиально не закрывает косвенную идентификацию, когда человек опознаётся по совокупности деталей без прямого указания имени.

Чем лучше выявлять персональные данные?

Комбинацией: правилами и контрольными суммами для форматных данных вроде телефонов и ИНН, моделью выделения сущностей для имён и адресов, словарями для проверки. Важно, чтобы модель выделения работала в вашем контуре — иначе данные уходят наружу до обезличивания.

Как проверить, что обезличивание работает?

На наборе из 100–200 реальных текстов с вручную размеченными персональными данными. Считать отдельно долю пропусков и долю ложных срабатываний. Пропуск — это реализованный риск, ложное срабатывание — только ухудшение качества работы модели.

Не испортит ли обезличивание качество ответа?

Может, если меток слишком много или они непоследовательны. Ключевое требование — одно и то же значение всегда заменяется одной и той же меткой, иначе модель не поймёт, что речь об одном человеке. В части задач, где важны сами личности, обезличивание действительно разрушает смысл.

Достаточно ли обезличивания с точки зрения закона?

Это вопрос к юристу: достаточность меры оценивается применительно к вашим данным и целям обработки. С технической стороны я могу описать, что именно заменяется, какова измеренная доля пропусков и какие риски остаются, — с этим описанием юрист сможет дать ответ по существу.

Что дальше

Когда обезличивание нужно и какие есть альтернативы — «Можно ли передавать персональные данные в нейросеть». Вариант без передачи вообще — «Локальное развёртывание LLM». Прочие каналы утечки — «Утечка данных через нейросеть», включая журналы, где данные тоже надо обезличивать.

Проектирование и проверка обезличивания в конвейерах — часть работы по автоматизации процессов и внедрению ИИ.