Изучаем финальный вариант Европейского Кодекса практик по прозрачности синтетического контента (часть 1: поставщики)Друзья, возвращаюсь к вам после летнего перерыва. В июне был опубликован третий и финальный вариант текста
Кодекса практик по прозрачности контента, созданного с помощью ИИ. Разборы предыдущих вариантов текста можно найти
тут.
Структура прежняя: первый раздел о маркировке и детекции синтетического контента поставщиками (providers, ст. 50(2) и (5) Регламента ЕС по ИИ), второй о маркировке дипфейков и текстов эксплуатантами (deployers, ст. 50(4) и (5)). Оба поделены на обязательства и меры.
Финальный текст вводит градацию формулировок:
"will" – обязательные меры,
"encouraged" – добровольные, но рекомендуемые,
"may" – гибкие в реализации. Для комплаенса это очень важно: теперь нам понятен минимальный "пакет" требований. Финальная версия в целом лояльнее к бизнесу и предусматривает упрощённое соблюдение некоторых требований для малого и среднего бизнеса (SMEs и SMCs).
Правила маркировкиФормула простая: если есть технология, обеспечивающая эффективную, совместимую, устойчивую и надёжную маркировку по смыслу ст. 50(2), то достаточно одного уровня маркировки. Пока таких решений нет, применяется
многоуровневая маркировка (метаданные и незаметный водяной знак) для аудио, изображений, видео и "контейнеризированного" текста (PDF, DOCX, HTML). Для свободного текста, который физически не может нести метаданные, хватит водяного знака, а для систем ИИ, встроенных в физические товары с замкнутой средой – метаданных. Очень короткий свободный текст (менее 200 токенов) не маркируется.
Поставщикам также рекомендуется встроить в интерфейс своих систем функцию, которая позволит пользователю сразу нанести на полученный контент видимую метку по правилам Раздела 2. О самих значках подробно поговорим во второй части поста.
Больше внимания уделено цепочкам поставок: маркировка реализуется на уровне модели или системы. Если на уровне модели, для интеграторов (downstream providers) предусмотрен льготный режим документирования.
Подписанты обязуются приложить все усилия, чтобы по мере технической возможности сохранять имеющиеся метаданные маркировки на входящем контенте и закрепить это в пользовательском соглашении, а также не выводить на рынок и не продвигать инструменты для обхода маркировки.
Правила детекцииОбязательство 2 требует от поставщиков бесплатно предоставить пользователям (от конечных до госорганов) решение для детекции синтетического контента. Исключение одно: поставщики с аудиторией менее 1 млн пользователей в месяц, чьё решение несёт существенные операционные издержки, вправе взимать разумную плату при превышении порога запросов от одного пользователя. Для надзорных органов, правоохранителей, СМИ, фактчекеров, исследователей и организаций гражданского общества доступ всегда бесплатен и не ограничен по объёму.
Решение можно разработать самому или использовать чужое. По общему правилу оно публично, но при риске снижения качества детекции (например, для водяных знаков в свободном тексте) доступ ограничивается проверенными экспертами. Работа решения должна соответствовать требованиям ЕС о защите персональных данных и кибербезопасности.
Оставшиеся обязательства касаются качества и контроля. Четыре требования ст. 50(2) оцениваются по совокупности всех методик, а не по каждой отдельно, причём количественной метрики эффективности нет: достаточно, чтобы человек мог получить и понять результат детекции. Для интероперабельности решений установлен отдельный срок:
2 февраля 2027 года. Решения тестируются до вывода на рынок и регулярно после, а процессы документируются. Важно отметить, что пока в отрасли нет признанных бенчмарков, соответствие подтверждается внутренним тестированием, а интеграторы вправе опираться на документацию поставщика модели (ответственности с них это не снимает).