Ждем в ГОСТы: в России стандартизировали данные для обучения ИИ
▶️ В России появился предварительный нацстандарт, касающийся синтетических данных - искусственно генерируемых массивов информации, которая воспроизводит реальные данные без сведений о конкретных людях или объектах, что безопаснее для обучения ИИ-моделей.
Разработкой стандарта занимались Ассоциация больших данных («Яндекс», VK, Сбер, Т-банк, МТС и др.) совместно с АНО «Национальный технологический центр цифровой криптографии». Документ пока носит временный характер - он рассчитан на трёхлетнюю апробацию, по итогам которой может стать полноценным ГОСТом.
Что именно стандартизируют.
Разработанный стандарт впервые в России вводит единые требования как к процессам синтеза, так и к качеству получаемых данных. По словам представителей Ассоциации, российская разработка объединила в себе три передовых направления:
⏺️ современные нейросетевые методы синтеза данных
⏺️ продвинутые техники управления приватностью
⏺️ и метрики оценки качества данных.
На стыке этих компонентов получился один из самых прогрессивных стандартов в мире - прикладной и обеспеченный строгой математической базой, в то время как международная стандартизация в этой сфере продвигается медленно и фрагментарно.
Зачем всё это нужно.
🔽 Доля синтетики в обучении ИИ будет расти - создание реального датасета требует значительно больше времени и средств. Но полная замена опасна: рекурсивное обучение на сгенерированном материале может накапливать ошибки и искажения. Наиболее вероятен гибридный подход, где синтетика служит масштабируемым дополнением.
В то же время стандартизация может привести к консолидации рынка: мелкие игроки, не готовые нести дополнительные издержки на сертификацию и верификацию, вероятно, уступят место более крупным. Но это сделает отрасль зрелее и откроет доступ к ИИ-инструментам для технологически консервативных секторов.
™️ МашТех в Telegram | в MAX
▶️ В России появился предварительный нацстандарт, касающийся синтетических данных - искусственно генерируемых массивов информации, которая воспроизводит реальные данные без сведений о конкретных людях или объектах, что безопаснее для обучения ИИ-моделей.
Разработкой стандарта занимались Ассоциация больших данных («Яндекс», VK, Сбер, Т-банк, МТС и др.) совместно с АНО «Национальный технологический центр цифровой криптографии». Документ пока носит временный характер - он рассчитан на трёхлетнюю апробацию, по итогам которой может стать полноценным ГОСТом.
Что именно стандартизируют.
Разработанный стандарт впервые в России вводит единые требования как к процессам синтеза, так и к качеству получаемых данных. По словам представителей Ассоциации, российская разработка объединила в себе три передовых направления:
⏺️ современные нейросетевые методы синтеза данных
⏺️ продвинутые техники управления приватностью
⏺️ и метрики оценки качества данных.
На стыке этих компонентов получился один из самых прогрессивных стандартов в мире - прикладной и обеспеченный строгой математической базой, в то время как международная стандартизация в этой сфере продвигается медленно и фрагментарно.
Зачем всё это нужно.
🔽 Доля синтетики в обучении ИИ будет расти - создание реального датасета требует значительно больше времени и средств. Но полная замена опасна: рекурсивное обучение на сгенерированном материале может накапливать ошибки и искажения. Наиболее вероятен гибридный подход, где синтетика служит масштабируемым дополнением.
В то же время стандартизация может привести к консолидации рынка: мелкие игроки, не готовые нести дополнительные издержки на сертификацию и верификацию, вероятно, уступят место более крупным. Но это сделает отрасль зрелее и откроет доступ к ИИ-инструментам для технологически консервативных секторов.
™️ МашТех в Telegram | в MAX