TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Femtech Force — новости, вакансии, подкаст

1 Oct, 10:50

Открыть в Telegram Поделиться Пожаловаться

👁 Бенчмарк OpenAI для ментального здоровья: почему живые психологи в нём проиграли моделям

Привет! Меня зовут Ольга Титова, я AI Product Manager, выступаю за безопасный и этичный подход к ИИ, и регулярно делюсь с подписчиками Femtech Force новостями из мира ИИ и здоровья.

Сегодня разберём новый бенчмарк оценки моделей от OpenAI для ментального здоровья, и попробуем посмотреть на него чуть шире, чем пресс-релиз.

🔶 Что это такое?

23 сентября OpenAI представила MentalHealthBench. Это открытый набор из 1 215 диалогов, по которому оценивают, как языковые модели отвечают людям в разговорах о ментальном здоровье. Главное отличие от предыдущих бенчмарков в том, что он покрывает не только кризисы вроде суицидальных мыслей или психоза. В нём есть и повседневные ситуации: отношения, стресс, выгорание, забота о близком, и такие разговоры составляют чуть больше половины набора. Критерии оценки составляли 80+ лицензированных психиатров и психологов из 22 стран. 

💥 Что показали результаты?

Лучший результат у GPT-6 Astra (57,3%). За ней идут GPT-6 Sol (53,9%) и Claude Opus 5.5 (52,4%). У Gemini 3.1 Pro и GPT-4o по 32,1%. Даже лучшая модель набирает чуть больше половины возможных баллов. Слабее всего у моделей получается уточнять контекст и правильно оценивать срочность ситуации.

💥 На что стоит обратить внимание?

Разработчик моделей оценивает сам себя. Ответы всех моделей, включая конкурентов, проверяет GPT-5.6 Sol, модель самой OpenAI, а первые два места заняли модели OpenAI. 
Диалоги синтетические. Их сгенерировали LLM-симуляторы пользователей на основе обезличенных паттернов из ChatGPT.
 
Клиницисты проиграли моделям. Ответы, которые написали сами эксперты, набрали 38,5%, ниже большинства моделей. Авторы объясняют это стилем: психологи отвечают коротко, как в живом разговоре, часто одним вопросом. Длинные ответы моделей просто успевают закрыть больше пунктов рубрики. Получается, что высокий балл измеряет покрытие чек-листа, а не доказанную пользу для человека.

Пользователи хотят другого. OpenAI отдельно попросила 44 человек, которые используют ИИ для эмоциональной поддержки, написать собственные критерии. С экспертными они совпали лишь на 25,7%. Пользователи больше ценят практические шаги и тон, эксперты — осторожность и сбор контекста.

➡️ Что я думаю?

Мне кажется, несмтря на аффилиацию с OpenAI, работа получилась достаточно прозрачной: данные открыты, промпт грейдера опубликован, а раздел об ограничениях написан честно. Сам сдвиг фокуса с «не навредить в кризисе» на более спокойные разговоры тоже давно назрел: по опросу APA, 77% психологов говорят, что их пациенты упоминают использование ИИ.

При этом важно: бенчмарк хорошо измеряет, совпадает ли ответ с представлением экспертов о хорошем ответе, но стало ли человеку лучше. Это скорее инструмент для разработчиков, чем рейтинг «какому ИИ доверить свои переживания», и авторы, к их чести, сами так и пишут. Независимая проверка, в идеале на живых людях и с оценщиком не от разработчика, ещё впереди.

@FemtechForce — о технологиях для здоровья женщин

Текст подготовила #ОльгаТитова

1k 0 12 17
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot