TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Regional compilations Thematic compilations Платные каналы Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
  • Promotion
    Advertising through Yandex Business Advertising in channels through TGStat Agency Advertising on TGStat.ru website
ВСЕВЕДА🕊

7 Sep, 10:38

Open in Telegram Share Report

31 августа вышел интересный препринт, который показал, что ИИ для медицинских записей (AI scribe) ошибается в более чем 30% случаев. Его широко рекламируют как инструмент, избавляющий врачей от бюрократии, но на практике он часто доставляет проблемы, выбрасывая существенные детали или додумывая недостающие.

В одном из таких случаев пациентка из Великобритании была потрясена, когда узнала, что у нее демиелинизация нервов, встречающаяся при тяжелых заболеваниях ЦНС. Она запросила данные МРТ, и тогда выяснилось, что ИИ просто выбросил слово “no” из описания. Больница исправила ошибку, указав, что “демиелинизация отсутствует”. В другом случае модель перепутала схожие названия препаратов, указав в назначениях неправильный. В третьем - самостоятельно “назначила” пациенту аспирин и т.д.

Сотрудники лондонской компании Composo, занимающейся AI scribe, решили выяснить уровень ошибок (правда, на чужих продуктах). Они прогнали 142 реальных и выдуманных разговора через 3 коммерческих AI scribe и получили 565 записей. Далее Claude Opus 5 искал все подозрительное (пропуски, галлюцинации, ошибки в препаратах и т.д.) и нашел их в изобилии - 13 678 потенциальных ошибок, из которых после первичной фильтрации осталось 5 898. Затем Claude и GPT-5.5 дали противоположную задачу: они должны были аргументированно доказать, что это не ошибка, если это было возможно. В результате осталось 618 подтвержденных ошибок, которые были обнаружены в 177 записях из 565 (31,3%).

В чем заключались эти ошибки? 
❇️ Самая большая категория (111) - пропуск информации об аллергии и препаратах, которые принимает пациент, несмотря на то, что они обсуждались на приеме. 
❇️ В 93 случаях ИИ додумывал данные пациента: если фамилия или имя были написаны неразборчиво или отсутствовали, AI scribe дописывал их сам. У одного человека так оказалось название препарата для химиотерапии вместо имени. 
❇️ В 53 записях был выброшен диагноз, хотя ИИ оставил на месте рекомендации по лечению. 
❇️ ИИ также был склонен представлять консультацию по телефону как физический осмотр (42 записи). Например, если врач говорил пациенту с сыпью, что осмотрел бы его, но такой возможности нет, AI scribe все равно создавал раздел “осмотр” с описанием сыпи. 
❇️ В 32 случаях планируемое исследование превращалось в выполненное: если врач говорил, что нужно договориться о проведении ЭКГ, ИИ писал, что “ЭКГ выполнена сегодня в клинике”. 
❇️ ИИ также менял описание симптомов (28): например, указывал, что они влияют на сон, хотя в разговоре не было ничего подобного. В другом случае пациент жаловался на отек и воспаление коленей, врач также фиксировал отечность и покраснение, но в записи эти симптомы отрицались. 
❇️ Заодно ИИ приписывал пациентам болезни их родственников, оставлял в силе предыдущий вариант лечения, если врач передумал, и т.д.

Но ключевой вопрос, который поставили авторы, заключался не в опасениях за судьбу пациентов, а в том, насколько можно доверять сообщениям о многочисленных ошибках, если неизвестен метод, которым их измеряли? При установлении строгих критериев LLM подтверждалось 9,3% потенциальных ошибок, при более мягких - 79% (что давало 96,5% записей с как минимум одной ошибкой). Но на практике ни пациенту, чьи симптомы или личные данные перепутали, ни врачу, назначения которого не записали, нет дела до методологических споров. Решение проблемы лежит в другой плоскости - создание AI scribe с множественными механизмами самопроверки на основе продвинутых LLM-моделей. Это усложнит жизнь разработчикам, но, по крайней мере, позволит отлавливать ошибки, когда вместо имени пациента написано название препарата.

Заодно эти случаи показывают, насколько декоративным на самом деле может быть контроль записей со стороны врача. Пациентке, которой “диагностировали” демиелинизацию, повезло - она сама работала в NHS и догадалась запросить оригинальные данные. Но многие на ее месте и не подозревают, что записи, под которыми стоит подпись врача, ошибочны.

6k 0 150 12
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot