Операция выполнена!
Закрыть
Хабы: Natural Language Processing, Информационная безопасность

Привет! Я Андрей Иванов, NLP-исследователь в R&D-лаборатории red_mad_robot.

Персональные данные попадают в языковые модели постоянно. Отдельные пользователи и компании отправляют модели рабочие тексты, и вместе с ними уходят имена, телефоны, номера документов и другие чувствительные данные. 

Чтобы избежать рисков утечек, компании разрабатывают целые системы маскировки персональных данных, которые передают модели уже обезличенные тексты. Но у такого процесса тоже есть свои минусы: защита данных ломает рабочие сценарии, ведь модель возвращает точно такие же обезличенные тексты.

Поэтому в последнее время запрос к системам маскировки изменился. Теперь они должны уметь не только скрывать данные, но и подставлять их обратно в ответы модели, которая работала с обезличенным текстом. В этой статье я расскажу, как мы строили такую систему и какими путями шли к ней — результаты работы лежат в репозитории. В конце покажу метрики на датасетах и сравню с другими открытыми решениями.

Читать далее
Читайте также
НОВОСТИ

ПИШИТЕ

Техническая поддержка проекта ВсеТут

info@vsetut.pro