Обезличивание — замена персональных данных в тексте на условные обозначения перед отправкой во внешнюю модель, с обратной подстановкой в результате.
Приём практичный: он часто снимает необходимость разворачивать модель у себя и позволяет пользоваться внешними сервисами там, где иначе было бы нельзя.
И у него есть свойство, которое надо назвать сразу:
> Полностью надёжного автоматического обезличивания не существует. Оно снижает риск, но не устраняет его, и требует проверки качества.
Правовую оценку достаточности меры даёт юрист — я не юрист и описываю техническую сторону.
Как устроено
Три шага.
Шаг 1: найти и заменить. В тексте выявляются персональные данные и заменяются метками: «Иван Петров» → [ЛИЦО_1], «+7 999 123-45-67» → [ТЕЛЕФОН_1].
Шаг 2: отправить в модель. Модель работает с обезличенным текстом.
Шаг 3: подставить обратно. В ответе метки заменяются исходными значениями. Соответствие хранится у вас и наружу не уходит.
Важная деталь второго шага: метки должны быть последовательными. Если «Иван Петров» встречается трижды, все три раза это [ЛИЦО_1] — иначе модель не поймёт, что речь об одном человеке, и связность текста разрушится.
Что заменять
| Категория | Примеры | Сложность выявления |
|---|---|---|
| Имена | ФИО, обращения | средняя: совпадают с обычными словами |
| Контакты | телефоны, почта | низкая: формат распознаётся |
| Адреса | улица, дом, квартира | средняя |
| Документы | паспорт, СНИЛС, ИНН | низкая: контрольные суммы |
| Номера счетов и карт | — | низкая |
| Идентификаторы | номера договоров, заказов, дел | средняя |
| Даты | рождения, конкретных событий | высокая: не отличить от обычных дат |
| Названия организаций | если идентифицируют лицо | высокая |
Строки с высокой сложностью — там, где автоматика ошибается. Их приходится либо обрабатывать грубее (заменять все даты), либо оставлять и учитывать в оценке риска.
Чем выявлять
Правилами. Регулярные выражения плюс проверки: контрольная сумма ИНН и СНИЛС, формат телефона, структура почты. Надёжно для форматных данных, бесполезно для имён.
Словарями. Списки имён, фамилий, названий населённых пунктов. Даёт полноту, порождает ложные срабатывания: «Роман» — имя или жанр, «Орёл» — город или птица.
Моделью. Отдельная небольшая модель для выделения сущностей в тексте. Лучше справляется с контекстом, но сама вероятностна и пропускает.
Комбинация — рабочий вариант. Правила для форматного, модель для имён и адресов, словари для проверки. Каждый способ закрывает то, где другой слаб.
Отдельная оговорка. Если для обезличивания используется внешняя модель, данные уходят наружу до обезличивания — то есть мера бессмысленна. Выделение сущностей должно работать в вашем контуре.
Где ломается
Косвенная идентификация. Главная проблема, и она не решается заменой полей.
«Клиент, наш единственный дистрибьютор в Магадане, недоволен сроками» — ФИО нет, идентификация есть. Совокупность деталей идентифицирует человека или организацию не хуже имени.
Автоматика такого не ловит принципиально: она работает с полями, а не со смыслом ситуации.
Опечатки и нестандартные написания. Телефон, записанный словами, имя с опечаткой, адрес в свободной форме.
Данные в структуре. Имя в подписи письма, в имени файла, в метаданных документа. Обезличивают тело, забывают остальное.
Разрушение смысла. Иногда обезличивание делает текст бесполезным: если задача — разобраться в конфликте между конкретными сотрудниками, замена имён на метки сохраняет структуру, но текст становится трудным для модели.
Обратная подстановка в ответ. Если модель в ответе переформулировала метку или склонила её, автоматическая подстановка промахивается. Метки надо выбирать так, чтобы они не склонялись и не переписывались.
Как проверять качество
Мера без проверки — иллюзия защиты.
Соберите набор реальных текстов с размеченными вручную персональными данными: 100–200 фрагментов.
Считайте два показателя отдельно:
- сколько пропущено — данные остались в тексте. Каждый пропуск — реализованный риск;
- сколько лишнего заменено — ложные срабатывания. Портят качество работы модели.
Первый показатель важнее: пропуск — это утечка, лишняя замена — только ухудшение результата.
Проверяйте на своих текстах. Обезличивание, отлаженное на обращениях клиентов, на резюме или медицинских записях будет работать иначе.
Перепроверяйте регулярно. Меняются форматы обращений, появляются новые виды идентификаторов.
Разбор: обезличивание, которое пропускало
Задача. Разбор обращений клиентов внешней моделью. Перед отправкой — обезличивание.
Как было сделано. Регулярные выражения для телефонов, почты, номеров договоров плюс словарь имён.
Что показала проверка на 150 размеченных обращениях.
Телефоны и почта — выявлялись почти полностью. Форматные данные автоматика берёт хорошо.
Имена — пропускалось около четверти. Причины: редкие имена не было в словаре, имена в косвенных падежах не совпадали со словарной формой, часть имён была написана с опечатками.
Адреса — пропускалось больше половины: они писались в свободной форме, шаблон не срабатывал.
Что нашли отдельно и что оказалось важнее. В значительной части обращений клиент подписывался в конце письма, а подпись при разборе не обрабатывалась — обезличивался только текст обращения, выделенный как «суть». Имя и контакты уходили в модель в составе служебной части запроса.
Формально обезличивание работало. Фактически данные передавались.
Что сделали.
Добавили модель выделения сущностей в своём контуре — она закрыла имена в падежах и адреса в свободной форме. Пропуски по именам сократились до единичных.
Расширили область обезличивания на весь текст запроса, а не только на выделенную часть. Это исправило основную проблему.
Ввели проверку остатка: после обезличивания текст ещё раз прогонялся правилами на характерные признаки. Найденное — сигнал, а не молчаливая отправка.
Стали считать долю пропусков ежемесячно на новой выборке.
Что осталось нерешённым сознательно. Косвенная идентификация. Для их потока обращений случаев, где человек опознаётся по совокупности деталей, было немного, и риск приняли осознанно, зафиксировав это решение. Полностью автоматически такое не закрывается.
Что стоит забрать. Обезличивание, которое никто не измерял, обычно работает хуже, чем предполагается. И самая частая ошибка — не качество выявления, а неполная область: обезличивают часть запроса, а данные едут в другой его части.
Частые вопросы
Что такое обезличивание данных для ИИ?
Замена персональных данных в тексте на условные метки перед отправкой во внешнюю модель, с обратной подстановкой значений в полученный ответ. Соответствие меток и значений остаётся у вас. Приём позволяет пользоваться внешними моделями там, где передача исходных данных нежелательна.
Полностью ли это защищает?
Нет. Автоматическое обезличивание пропускает: имена в необычных формах, адреса в свободной форме, данные в подписях и метаданных. Отдельно оно принципиально не закрывает косвенную идентификацию, когда человек опознаётся по совокупности деталей без прямого указания имени.
Чем лучше выявлять персональные данные?
Комбинацией: правилами и контрольными суммами для форматных данных вроде телефонов и ИНН, моделью выделения сущностей для имён и адресов, словарями для проверки. Важно, чтобы модель выделения работала в вашем контуре — иначе данные уходят наружу до обезличивания.
Как проверить, что обезличивание работает?
На наборе из 100–200 реальных текстов с вручную размеченными персональными данными. Считать отдельно долю пропусков и долю ложных срабатываний. Пропуск — это реализованный риск, ложное срабатывание — только ухудшение качества работы модели.
Не испортит ли обезличивание качество ответа?
Может, если меток слишком много или они непоследовательны. Ключевое требование — одно и то же значение всегда заменяется одной и той же меткой, иначе модель не поймёт, что речь об одном человеке. В части задач, где важны сами личности, обезличивание действительно разрушает смысл.
Достаточно ли обезличивания с точки зрения закона?
Это вопрос к юристу: достаточность меры оценивается применительно к вашим данным и целям обработки. С технической стороны я могу описать, что именно заменяется, какова измеренная доля пропусков и какие риски остаются, — с этим описанием юрист сможет дать ответ по существу.
Что дальше
Когда обезличивание нужно и какие есть альтернативы — «Можно ли передавать персональные данные в нейросеть». Вариант без передачи вообще — «Локальное развёртывание LLM». Прочие каналы утечки — «Утечка данных через нейросеть», включая журналы, где данные тоже надо обезличивать.
Проектирование и проверка обезличивания в конвейерах — часть работы по автоматизации процессов и внедрению ИИ.