TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Regional compilations Thematic compilations Платные каналы Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
  • Promotion
    Advertising through Yandex Business Advertising in channels through TGStat Agency Advertising on TGStat.ru website
Femtech Force — новости, вакансии, подкаст

1 Oct, 10:50

Open in Telegram Share Report

👁 Бенчмарк OpenAI для ментального здоровья: почему живые психологи в нём проиграли моделям

Привет! Меня зовут Ольга Титова, я AI Product Manager, выступаю за безопасный и этичный подход к ИИ, и регулярно делюсь с подписчиками Femtech Force новостями из мира ИИ и здоровья.

Сегодня разберём новый бенчмарк оценки моделей от OpenAI для ментального здоровья, и попробуем посмотреть на него чуть шире, чем пресс-релиз.

🔶 Что это такое?

23 сентября OpenAI представила MentalHealthBench. Это открытый набор из 1 215 диалогов, по которому оценивают, как языковые модели отвечают людям в разговорах о ментальном здоровье. Главное отличие от предыдущих бенчмарков в том, что он покрывает не только кризисы вроде суицидальных мыслей или психоза. В нём есть и повседневные ситуации: отношения, стресс, выгорание, забота о близком, и такие разговоры составляют чуть больше половины набора. Критерии оценки составляли 80+ лицензированных психиатров и психологов из 22 стран. 

💥 Что показали результаты?

Лучший результат у GPT-6 Astra (57,3%). За ней идут GPT-6 Sol (53,9%) и Claude Opus 5.5 (52,4%). У Gemini 3.1 Pro и GPT-4o по 32,1%. Даже лучшая модель набирает чуть больше половины возможных баллов. Слабее всего у моделей получается уточнять контекст и правильно оценивать срочность ситуации.

💥 На что стоит обратить внимание?

Разработчик моделей оценивает сам себя. Ответы всех моделей, включая конкурентов, проверяет GPT-5.6 Sol, модель самой OpenAI, а первые два места заняли модели OpenAI. 
Диалоги синтетические. Их сгенерировали LLM-симуляторы пользователей на основе обезличенных паттернов из ChatGPT.
 
Клиницисты проиграли моделям. Ответы, которые написали сами эксперты, набрали 38,5%, ниже большинства моделей. Авторы объясняют это стилем: психологи отвечают коротко, как в живом разговоре, часто одним вопросом. Длинные ответы моделей просто успевают закрыть больше пунктов рубрики. Получается, что высокий балл измеряет покрытие чек-листа, а не доказанную пользу для человека.

Пользователи хотят другого. OpenAI отдельно попросила 44 человек, которые используют ИИ для эмоциональной поддержки, написать собственные критерии. С экспертными они совпали лишь на 25,7%. Пользователи больше ценят практические шаги и тон, эксперты — осторожность и сбор контекста.

➡️ Что я думаю?

Мне кажется, несмтря на аффилиацию с OpenAI, работа получилась достаточно прозрачной: данные открыты, промпт грейдера опубликован, а раздел об ограничениях написан честно. Сам сдвиг фокуса с «не навредить в кризисе» на более спокойные разговоры тоже давно назрел: по опросу APA, 77% психологов говорят, что их пациенты упоминают использование ИИ.

При этом важно: бенчмарк хорошо измеряет, совпадает ли ответ с представлением экспертов о хорошем ответе, но стало ли человеку лучше. Это скорее инструмент для разработчиков, чем рейтинг «какому ИИ доверить свои переживания», и авторы, к их чести, сами так и пишут. Независимая проверка, в идеале на живых людях и с оценщиком не от разработчика, ещё впереди.

@FemtechForce — о технологиях для здоровья женщин

Текст подготовила #ОльгаТитова

806 0 12 14
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot