РЕЦЕНЗЕНТ №2: СИНТЕТИКА — НЕ ПАЦИЕНТ
Я люблю синтетические данные.
Правда.
Когда данных мало отлично.
Редкий класс прекрасно.
Нужно проверить крайний сценарий пожалуйста.
Нужно быстро понять, работает ли идея вообще, прежде чем месяцами собирать датасет, вообще вопросов нет.
FDA, к слову, тоже исследует синтетические данные именно как способ дополнять медицинские датасеты при разработке и оценке AI-моделей.
Проблемы начинаются примерно здесь:
«А зачем нам реальные данные? У нас синтетика очень реалистичная».
И вот тут в комнату входит Рецензент №2.
Потому что если вы сами создали данные, сами задали их распределение, сами определили патологию, сами внесли шум, а потом ваша модель прекрасно научилась всё это распознавать
поздравляю.
Вы доказали, что модель хорошо понимает мир, который вы сами ей придумали.
Пациент пока в исследовании участия не принимал.
И есть ещё одна маленькая неприятность.
Медицинское изделие регистрируют не за красивый ROC-AUC и не за то, что loss наконец перестал выглядеть как кардиограмма.
Нужно подтверждать качество, эффективность и безопасность продукта; система регистрации отдельно предусматривает клинические испытания там, где они необходимы для подтверждения эффективности. Для ПО с ИИ сейчас существуют ещё и специальные требования к регистрационному досье и последующему мониторингу его работы.
Поэтому сам факт обучения на синтетике не приговор.
А вот попытка заменить синтетикой реальную клиническую проверку уже совсем другой разговор.
Синтетические данные могут помочь вам построить модель.
Они могут увеличить выборку.
Помочь с редкими случаями.
Дать контролируемый эксперимент.
Позволить проверить гипотезу.
Но они не превращаются в пациента от того, что вы добавили побольше шума.
Синтетика — это инструмент, а не замена реальных пациентов.
Рецензент №2: major revision.
#эмэль@MathModeller
#моделируеммодели@MathModeller
Я люблю синтетические данные.
Правда.
Когда данных мало отлично.
Редкий класс прекрасно.
Нужно проверить крайний сценарий пожалуйста.
Нужно быстро понять, работает ли идея вообще, прежде чем месяцами собирать датасет, вообще вопросов нет.
FDA, к слову, тоже исследует синтетические данные именно как способ дополнять медицинские датасеты при разработке и оценке AI-моделей.
Проблемы начинаются примерно здесь:
«А зачем нам реальные данные? У нас синтетика очень реалистичная».
И вот тут в комнату входит Рецензент №2.
Потому что если вы сами создали данные, сами задали их распределение, сами определили патологию, сами внесли шум, а потом ваша модель прекрасно научилась всё это распознавать
поздравляю.
Вы доказали, что модель хорошо понимает мир, который вы сами ей придумали.
Пациент пока в исследовании участия не принимал.
И есть ещё одна маленькая неприятность.
Медицинское изделие регистрируют не за красивый ROC-AUC и не за то, что loss наконец перестал выглядеть как кардиограмма.
Нужно подтверждать качество, эффективность и безопасность продукта; система регистрации отдельно предусматривает клинические испытания там, где они необходимы для подтверждения эффективности. Для ПО с ИИ сейчас существуют ещё и специальные требования к регистрационному досье и последующему мониторингу его работы.
Поэтому сам факт обучения на синтетике не приговор.
А вот попытка заменить синтетикой реальную клиническую проверку уже совсем другой разговор.
Синтетические данные могут помочь вам построить модель.
Они могут увеличить выборку.
Помочь с редкими случаями.
Дать контролируемый эксперимент.
Позволить проверить гипотезу.
Но они не превращаются в пациента от того, что вы добавили побольше шума.
Синтетика — это инструмент, а не замена реальных пациентов.
Рецензент №2: major revision.
#эмэль@MathModeller
#моделируеммодели@MathModeller