👁 Агент. Медицинский агент
Привет! Я Алина, врач-психиатр. Сегодня рассказываю, по свежему обзору на arXiv, какие ИИ агенты уже есть в медицине
💥 Чем агент отличается от модели
Foundation model ≠ агент. Агент — это оркестрация: вокруг одной клинической задачи. Всего авторы выделяют семь таких способностей: держать цель, планировать шаги, помнить контекст, вызывать инструменты, искать во внешних базах, переделывать по результату и работать в связке с другими агентами
💥 Четыре архитектуры, которые уже используются
— Один агент + инструменты. Одна модель-контроллёр вызывает внешние ресурсы. Например, MedRAX подключает инструменты детекции и локализации для рентгена грудной клетки
— Мультиагентные системы. Например, MedAgents имитирует мультидисциплинарный консилиум
— Агенты с внешним знанием. Например, MALADE ищет побочные реакции на препараты по лейблам и литературе для фармаконадзора
— Мультимодальные агенты. MMedAgent держит набор моделей для работы со снимками и сам выбирает нужную под задачу (обвести границы находки, отнести её к типу, третья отвечает на вопрос по картинке)
💥 Где это применяется
🔶 Диагностика и дифференциальный диагноз
🔶 Анализ электронных карт —собрать группу пациентов по критериям, вытащить нужные показатели, посмотреть, как они менялись во времени
🔶 Лекарственная безопасность — фармаконадзор и проверка назначений
🔶 Клинические испытания — разложение trial-данных на подвопросы, оценка эффективности, безопасности и исходов
🔶 Радиология и генерация заключений — интерпретация снимков, локализация находок, черновики отчётов
💥 Reality check: что не так
— Почти вся доказательная база — бенчмарки, симуляции и ретроспективные датасеты. Проспективных испытаний в реальном клиническом воркфлоу практически нет
— Мультиагентность не равна качество: бенчмарки не показывают стабильного преимущества над сильной одиночной моделью, а путей для ошибок становится больше
— Радиология — самая передовая в применении. Внутри самой радиологии всё почти одинаковое: доказательства сконцентрированы на рентгене грудной клетки. CT, MRI, PET, патология и лонгитюдные снимки представлены слабо — авторы прямо называют это гэпом
➡️ Что это значит, если вы строите медицинский ИИ-продукт
Ценность не в модели, а в оркестрации. Правильный intake (структурированный сбор жалоб по протоколу), инструменты (внешние функции, которые агент вызывает вместо ответа по памяти: калькулятор дозы, шкала риска), актуальные гайдлайны, эскалация к врачу (прописанный safety контур)
Аудит всей цепочки вместо оценки ответа
Мультиагентность — не дефолт. Начинать стоит с одного агента и хороших инструментов, добавлять второго, кроме случаев когда это невозможно (например, нужны разные уровни доступа к данным, или под разные модальности и тд)
Путь к клинике ступенчатый: ретроспективные данные ➡️ внешняя валидация ➡️ проспективное «тихое» развёртывание в реальном воркфлоу (система работает на живом потоке в реальном времени, но выводы пишутся в лог и врачам не показываются) ➡️ показ врачу, на узком scope и с человеком в контуре
@FemtechForce — о технологиях для здоровья женщин
Текст подготовила #АлинаАкбашева
Привет! Я Алина, врач-психиатр. Сегодня рассказываю, по свежему обзору на arXiv, какие ИИ агенты уже есть в медицине
💥 Чем агент отличается от модели
Foundation model ≠ агент. Агент — это оркестрация: вокруг одной клинической задачи. Всего авторы выделяют семь таких способностей: держать цель, планировать шаги, помнить контекст, вызывать инструменты, искать во внешних базах, переделывать по результату и работать в связке с другими агентами
💥 Четыре архитектуры, которые уже используются
— Один агент + инструменты. Одна модель-контроллёр вызывает внешние ресурсы. Например, MedRAX подключает инструменты детекции и локализации для рентгена грудной клетки
— Мультиагентные системы. Например, MedAgents имитирует мультидисциплинарный консилиум
— Агенты с внешним знанием. Например, MALADE ищет побочные реакции на препараты по лейблам и литературе для фармаконадзора
— Мультимодальные агенты. MMedAgent держит набор моделей для работы со снимками и сам выбирает нужную под задачу (обвести границы находки, отнести её к типу, третья отвечает на вопрос по картинке)
💥 Где это применяется
🔶 Диагностика и дифференциальный диагноз
🔶 Анализ электронных карт —собрать группу пациентов по критериям, вытащить нужные показатели, посмотреть, как они менялись во времени
🔶 Лекарственная безопасность — фармаконадзор и проверка назначений
🔶 Клинические испытания — разложение trial-данных на подвопросы, оценка эффективности, безопасности и исходов
🔶 Радиология и генерация заключений — интерпретация снимков, локализация находок, черновики отчётов
💥 Reality check: что не так
— Почти вся доказательная база — бенчмарки, симуляции и ретроспективные датасеты. Проспективных испытаний в реальном клиническом воркфлоу практически нет
— Мультиагентность не равна качество: бенчмарки не показывают стабильного преимущества над сильной одиночной моделью, а путей для ошибок становится больше
— Радиология — самая передовая в применении. Внутри самой радиологии всё почти одинаковое: доказательства сконцентрированы на рентгене грудной клетки. CT, MRI, PET, патология и лонгитюдные снимки представлены слабо — авторы прямо называют это гэпом
Главная системная проблема — распространение ошибки по цепочке. Формула авторов: точность ≠ полезность, способность ≠ доказательство, автоматизация ≠ готовность к внедрению
➡️ Что это значит, если вы строите медицинский ИИ-продукт
Ценность не в модели, а в оркестрации. Правильный intake (структурированный сбор жалоб по протоколу), инструменты (внешние функции, которые агент вызывает вместо ответа по памяти: калькулятор дозы, шкала риска), актуальные гайдлайны, эскалация к врачу (прописанный safety контур)
Аудит всей цепочки вместо оценки ответа
Мультиагентность — не дефолт. Начинать стоит с одного агента и хороших инструментов, добавлять второго, кроме случаев когда это невозможно (например, нужны разные уровни доступа к данным, или под разные модальности и тд)
Путь к клинике ступенчатый: ретроспективные данные ➡️ внешняя валидация ➡️ проспективное «тихое» развёртывание в реальном воркфлоу (система работает на живом потоке в реальном времени, но выводы пишутся в лог и врачам не показываются) ➡️ показ врачу, на узком scope и с человеком в контуре
@FemtechForce — о технологиях для здоровья женщин
Текст подготовила #АлинаАкбашева