Персональные данные не доходят до модели — и не уезжают за границу: обезличивание в два слоя
Первый слой маскирует номера — телефоны, ИНН, паспорта — прямо в браузере. Второй стоит на границе с зарубежными моделями и работает на морфологии русского языка. Сканы и голос при этом распознаются в России.
Юрист работает с чужими паспортами, адресами и номерами дел. Отправлять это в модель как есть нельзя, а не отправлять текст документа — значит не получить ответ. Мы развели эти две задачи по двум слоям.
Слой первый: браузер
До того как текст вопроса уходит на сервер, скрипт в браузере находит телефоны, почту, ИНН, паспорта, СНИЛС и номера карт и заменяет их метками вида [INN_1]. Таблица соответствий остаётся на компьютере юриста. Ответ приходит с метками, и браузер восстанавливает настоящие значения только у него на экране. Сервер настоящих номеров не видит. Имена, адреса и присланные документы до сервера доходят — ими занимается второй слой.
Слой второй: граница с моделью
Браузер работает только с номерами: имена, адреса, номера дел и текст документов он не трогает, да и не смог бы надёжно — ему не понять, что «Кузнецова» и «Кузнецовой» одно лицо. Поэтому на сервере, в единственной точке выхода к модели, стоит второй слой. Он включается для всех моделей, кроме GigaChat: запрос к нему уходит напрямую в Сбер и границу не пересекает.
- ФИО — распознаватель именованных сущностей Natasha плюс правила на отчества, «Фамилия И. О.» и «И. О. Фамилия».
- Номера — регулярные выражения с контрольными цифрами: ИНН, ОГРН, банковские карты по алгоритму Луна.
- Адреса, в том числе улицы в косвенных падежах, даты рождения по контексту, счета, паспорта, СНИЛС, телефоны, госномера, VIN, номера дел.
- Одно лицо во всех падежах получает одну метку [ЛИЦО_1]; род берётся из имени и отчества, поэтому супруги Кузнецов и Кузнецова — разные лица.
Метки второго слоя кириллические, первого — латинские, поэтому они не пересекаются. Восстановление идёт прямо в потоке ответа: хвост с открытой скобкой придерживается, пока метка не дочитана. В журнале запроса остаётся только число скрытых значений — не сами значения.
Ложная метка допустима: она просто вернётся в ответ. Пропуск — нет. Поэтому фильтр не ужесточается ценой фамилий-слов вроде «Мороз И. П.».
На 400 фрагментах правовой базы ложных срабатываний не оказалось, скорость — около 1,3 секунды на 65 тысяч знаков. Организации и города не маскируются: без них ответ теряет смысл, а персональными данными они не являются.
Сканы и голос — в России
Картинки и сканы раньше распознавала зарубежная мультимодальная модель, а звук — Whisper. Обезличить картинку до распознавания нельзя, поэтому теперь сканы читает Yandex Vision OCR, а речь — SpeechKit; с 26 сентября это работает на боевом сервере. За рубеж уходит только уже обезличенный текст. Это записано в политике конфиденциальности в редакции от 17 сентября 2026 года.
Хранение и удаление
- Документы хранятся в аккаунте и удаляются вместе с чатом — все файлы, а не только присланный DOCX.
- Учётную запись можно удалить из кабинета сразу: пароль и слово «удалить», без ожидания и переписки с поддержкой.
- Согласие с офертой и политикой фиксируется с датой, редакцией документов и адресом.
Что дальше
Режим «только российские модели» для организаций, которым нужен контур без зарубежных поставщиков, и собственная модель Лесто — о ней отдельная статья.
Материал подготовлен командой Лесто с использованием ИИ и не является юридической консультацией. Ссылки на нормы приведены по редакциям на дату публикации.