TGStat
TGStat
Qidiruv uchun matnni kiriting
Ilg‘or kanal qidiruvi
  • flag Uzbek
    Sayt tili
    flag Russian flag English flag Uzbek
  • Saytga kirish
  • Katalog
    Kanal va guruhlar katalogi Hududiy to‘plamlar Tematik to‘plamlar Платные каналы Kanallar qidiruvi
    Kanal/guruh qo‘shish
  • Reytinglar
    Kanallar reytingi Guruhlar reytingi Postlar reytingi
    Brendlar va shaxslar reytingi
  • Analitika
  • Postlarda qidiruv
  • Telegram'ni kuzatish
  • Targ‘ibot
    Yandex Business orqali reklama TGStat Agency orqali kanallarda reklama TGStat.ru saytida reklama
Femtech Force — новости, вакансии, подкаст

1 Oct, 10:50

Telegram'da ochish Ulashish Shikoyat qilish

👁 Бенчмарк OpenAI для ментального здоровья: почему живые психологи в нём проиграли моделям

Привет! Меня зовут Ольга Титова, я AI Product Manager, выступаю за безопасный и этичный подход к ИИ, и регулярно делюсь с подписчиками Femtech Force новостями из мира ИИ и здоровья.

Сегодня разберём новый бенчмарк оценки моделей от OpenAI для ментального здоровья, и попробуем посмотреть на него чуть шире, чем пресс-релиз.

🔶 Что это такое?

23 сентября OpenAI представила MentalHealthBench. Это открытый набор из 1 215 диалогов, по которому оценивают, как языковые модели отвечают людям в разговорах о ментальном здоровье. Главное отличие от предыдущих бенчмарков в том, что он покрывает не только кризисы вроде суицидальных мыслей или психоза. В нём есть и повседневные ситуации: отношения, стресс, выгорание, забота о близком, и такие разговоры составляют чуть больше половины набора. Критерии оценки составляли 80+ лицензированных психиатров и психологов из 22 стран. 

💥 Что показали результаты?

Лучший результат у GPT-6 Astra (57,3%). За ней идут GPT-6 Sol (53,9%) и Claude Opus 5.5 (52,4%). У Gemini 3.1 Pro и GPT-4o по 32,1%. Даже лучшая модель набирает чуть больше половины возможных баллов. Слабее всего у моделей получается уточнять контекст и правильно оценивать срочность ситуации.

💥 На что стоит обратить внимание?

Разработчик моделей оценивает сам себя. Ответы всех моделей, включая конкурентов, проверяет GPT-5.6 Sol, модель самой OpenAI, а первые два места заняли модели OpenAI. 
Диалоги синтетические. Их сгенерировали LLM-симуляторы пользователей на основе обезличенных паттернов из ChatGPT.
 
Клиницисты проиграли моделям. Ответы, которые написали сами эксперты, набрали 38,5%, ниже большинства моделей. Авторы объясняют это стилем: психологи отвечают коротко, как в живом разговоре, часто одним вопросом. Длинные ответы моделей просто успевают закрыть больше пунктов рубрики. Получается, что высокий балл измеряет покрытие чек-листа, а не доказанную пользу для человека.

Пользователи хотят другого. OpenAI отдельно попросила 44 человек, которые используют ИИ для эмоциональной поддержки, написать собственные критерии. С экспертными они совпали лишь на 25,7%. Пользователи больше ценят практические шаги и тон, эксперты — осторожность и сбор контекста.

➡️ Что я думаю?

Мне кажется, несмтря на аффилиацию с OpenAI, работа получилась достаточно прозрачной: данные открыты, промпт грейдера опубликован, а раздел об ограничениях написан честно. Сам сдвиг фокуса с «не навредить в кризисе» на более спокойные разговоры тоже давно назрел: по опросу APA, 77% психологов говорят, что их пациенты упоминают использование ИИ.

При этом важно: бенчмарк хорошо измеряет, совпадает ли ответ с представлением экспертов о хорошем ответе, но стало ли человеку лучше. Это скорее инструмент для разработчиков, чем рейтинг «какому ИИ доверить свои переживания», и авторы, к их чести, сами так и пишут. Независимая проверка, в идеале на живых людях и с оценщиком не от разработчика, ещё впереди.

@FemtechForce — о технологиях для здоровья женщин

Текст подготовила #ОльгаТитова

931 0 12 15
Katalog
Kanal va guruhlar katalogi Kanallar to‘plamlari Kanallar qidiruvi Kanal/guruh qo‘shish
Reytinglar
Telegram-kanallar reytingi Telegram-guruhlar reytingi Postlar reytingi Brendlar va shaxslar reytingi
API
Statistika API'si Postlar qidiruvi API'si API Callback
Kanallarimiz
@TGStat @TGStat_Chat @telepulse @TGStatAPI
O‘qish
Академия TGStat Telegram tadqiqoti 2019 Telegram tadqiqoti 2021 Telegram tadqiqoti 2023
Kontaktlar
Справочный центр Qo‘llab-quvvatlash Email Vakansiyalar
Har xil narsalar
Foydalanuvchi shartnomasi Maxfiylik siyosati Ommaviy oferta
Botlarimiz
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot