TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
beyond research

22 Jul, 21:21

Открыть в Telegram Поделиться Пожаловаться

Синтетические респонденты как мера доксы

Индустрия разделилась, в который раз — ну, хоть не так бесплодно и потешно, как в годы активной qual/quant дискуссии, она же «куку-дискуссия». Одни ратуют за «синтетических респондентов» (кто-то их продаёт, кто-то использует) — нейросетевые сущности, призванные репрезентировать сегменты аудитории или их отдельных представителей, и многие из энтузиастов инструмента предвещают закат исследований с участием людей. Реализованы «синтетики» могут быть по-разному — хоть в виде агентов, хоть в виде т. н. промпт-персон, хоть через статистическую аугментацию, не столь важно как. Другим такой инструмент претит — методологически ли, эстетически ли, и они, как правило, озвучивают доводы в том духе, что у LLM нет жизненного опыта и вместо человека та воспроизводит стереотипы, третьи офигевают и пребывают в свирепой задумчивости. Сейчас не стану вдаваться в то, в чём правы и в чём, на мой взгляд, заблуждаются первые. Главное, что у вторых есть своя правда (сам я, будучи по специализации и индоктринации качественником, впрочем, совершенно спокойно отношусь к тому, что «синтетики» являют собой дериваты от дериватов). Не правы они, имхо, в выводе, к которому — в большинстве своём — приходят: стереотипы вовсе не брак «синтетиков» как продукта. Неа. Это собственно продукт, и парадоксальным образом весьма ценный, по крайней мере для качественных исследований.

Что такое языковая модель? Упрощённо — скомпрессированный публичный дискурс. Попросите её ответить от лица «34-летней женщины с детьми из города-миллионника» про доставку здорового питания, и получите не эту женщину (её не существует), а взвешенное среднее всех текстов о таких женщинах и такой доставке: то, как принято об этом говорить, то, что о них известно. Модель, простите за тавтологию, моделирует не человека — текстовые/знаковые следы, которые оставляют люди определённого типа: то, как у них принято отвечать, мотивировать, оправдываться. Бурдьё называл это доксой — совокупностью само собой разумеющегося. И большая языковая модель даёт нам суперпозицию той доксы, что попала в обучающие датасеты. Впервые у нас в руках оказался прибор, способный ужасающе детализированно зафиксировать то, что носится в воздухе, причём отдельно от людей. Эдакий демон Шеннона.

И вот ведь забавность: это ровно то, чего исследованию чаще всего не хватает: нулевая отметка. Мы говорим клиенту, что поле дало инсайты, однако подчас затрудняемся при необходимости показать, насколько далеко инсайт отстоит от условного здравого смысла и common knowledge (или по-новому его раскрывает), и точки отсчёта для измерения «прироста смысла» не было. Теперь есть.

Как говорил один литературный персонаж, «и что для нас это значит в практическом смысле?». Самое простое — прогнать гайд на синтетических респондентах до поля, зафиксировать корпус ожидаемых ответов (ту самую доксу), пойти в поле, собрать эмпирический материал — и наконец, при анализе размечать его относительно той самой нулевой отметки. То, что живые люди говорят так же, как продемонстрировала LLM, с высокой вероятностью может быть отнесено на счёт воспроизводства публичного дискурса. То, что расходится с нейросетевой доксой, суть кандидаты в инсайты, причём слово «инсайт» обретает тут новое операциональное определение: то, чего нет в «скомпрессированном здравом смысле». И мы, как исследователи, начинаем видеть во всех деталях планку, которую должны взять. Если двадцать четыре наших интервью почти неотличимы от выдачи модели, значит, либо гайд собирает клише, либо исследователь не сдюжил, либо нужен другой метод — в общем, много разных диагностических «либо».

(Окончание в комментарии к посту.)

477 0 11 4 42
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot