Коллеги, хочу провести небольшой практический опрос, потому что сейчас ковыряю довольно неприятную инженерную задачу: как безопасно готовить реальные рабочие документы перед тем, как отдавать их ChatGPT, Claude или другой облачной LLM.
Речь именно о документах, где могут быть персональные данные, названия компаний и информационных систем, внутренние адреса, логины, IP, контакты, коммерческая информация и другие чувствительные сведения, которые совсем не хочется случайно отправить наружу. Локальные модели и закрытые корпоративные AI-контуры сейчас не рассматриваем.
Интересует, что люди делают в реальной работе, а не что написано в очередной статье про безопасность AI.
Я сейчас разбираю старые DOCX, PDF и сканы и довольно быстро увидела, что красивые результаты автоматического распознавания ФИО, организаций и других чувствительных сущностей на тестах заканчиваются там, где начинается настоящий документ. Одно ФИО может распознаться кусками, падежные формы не всегда объединяются, OCR в сканах режет текст как ему нравится, а подписи, печати и другие графические элементы вообще нельзя надёжно закрыть только автоматикой.
В итоге вопрос «нашли ли мы чувствительные данные автоматически» и вопрос «можно ли этот файл уже отдавать внешней LLM» оказались совсем не одним и тем же вопросом.
Особенно интересно, что вы делаете со сканами, подписями, печатями и сложными документами, где одного поиска и замены явно недостаточно. И если используете автоматическое обезличивание, проверяете ли потом весь результат глазами?
Речь именно о документах, где могут быть персональные данные, названия компаний и информационных систем, внутренние адреса, логины, IP, контакты, коммерческая информация и другие чувствительные сведения, которые совсем не хочется случайно отправить наружу. Локальные модели и закрытые корпоративные AI-контуры сейчас не рассматриваем.
Интересует, что люди делают в реальной работе, а не что написано в очередной статье про безопасность AI.
Я сейчас разбираю старые DOCX, PDF и сканы и довольно быстро увидела, что красивые результаты автоматического распознавания ФИО, организаций и других чувствительных сущностей на тестах заканчиваются там, где начинается настоящий документ. Одно ФИО может распознаться кусками, падежные формы не всегда объединяются, OCR в сканах режет текст как ему нравится, а подписи, печати и другие графические элементы вообще нельзя надёжно закрыть только автоматикой.
В итоге вопрос «нашли ли мы чувствительные данные автоматически» и вопрос «можно ли этот файл уже отдавать внешней LLM» оказались совсем не одним и тем же вопросом.
Особенно интересно, что вы делаете со сканами, подписями, печатями и сложными документами, где одного поиска и замены явно недостаточно. И если используете автоматическое обезличивание, проверяете ли потом весь результат глазами?