TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Sberloga in Data

22 Apr, 14:11

Открыть в Telegram Поделиться Пожаловаться

Leonid
Репост из: .ml
Блайндбоксы в мире ML: как мы разработали и внедрили микросервис Labubu, который автоматизирует разметку коммуникаций

Допустим, Точка Нетворк решили нарастить комьюнити. Как мы можем по предыдущим коммуникациям с компаниями понять, кто из них будет заинтересован в нетворкинге?

📌 Как микросервис Labubu решил проблему с коммуникациями
Labubu — это микросервис, который помогает нам анализировать сотни тысяч коммуникаций. Чтобы не заставлять менеджера анализировать их тысячами, микросервис делает это за него по схеме:


1) Менеджер связывается с компанией. ASR-модель превращает разговор в текст, а Labubu получает расшифровку.
2) Labubu отправляет текст в маскиратор. Она скрывает персональные данные и чувствительную информацию, а после возвращает обратно.
3) Labubu отправляет зашифрованный текст в LLM. Она проводит анализ и возвращает в микросервис.
4) Labubu отправляет результаты разметки обратно в систему пользователя — она заполняет контекст по коммуникации.

Разберём схему подробнее. Чтобы понять, кому из предпринимателей будет ценностью комьюнити, коммуникацию нужно проанализировать. На слух это долго, поэтому использовали ASR-модели, которые превращали аудио в текст.

Проблема: ASR-модель работала нестабильно. Её WER был 21%, то есть искажено каждое пятое слово. А если во время разговора работала кофемолка, вместо текста мы получали пустой лист.


Решение: текст, который выдавала ASR, отправляли в модель разметки для анализа. Она понимала контекст коммуникации и выдавала его описание с потребностями предпринимателя.

Ещё одна проблема: в коммуникациях могут быть чувствительные данные. Если они попадут третьим лицам, мы нарушим закон.


Решение: команда Точка Банка разработала маскиратор. Он шифрует персональные данные перед отправкой информации в модель. При этом доступ к данным не имеет даже соседняя команда разработки.

Как работает маскиратор. Пользователь отправляет в маскиратор текст и получает ID маскирации. Проходит время — пользователь снова пингует маскиратор, чтобы тот выдал замаскированный текст.

Проблема: в маскиратор пользователи ходят ассинхронно, а так же нет колбэков/ESB. В сервис поступает много запросов, которые его заспамливают. Но при этом без спама не получается — коммуникаций много.


Решение: решения, к сожалению, не нашли. Приняли это как риск, чтобы не жертвовать скоростью получения данных, и записали в технический долг.

📌 Как Labubu размечает коммуникации
Так как диалогов с предпринимателями много, нужно отобрать конкретные. Чтобы помочь тимлиду-пользователю собрать данные, промпт-инженер написал запрос в нейросеть. Дальше тимлиду нужно заполнить форму для реализации его запроса:

• Валидация. Тимлид указывает описание целевого диалога и ключевые слова. На основе этих данных модель определяет, будет ли предпринимателю польза от нетворкинга.
• Отсечение. Тимлид указывает условия исключения. Промпт в модели отсекает коммуникации, где интерес есть, но продукт не подходит.

Как выглядит итоговый пайплайн коммуникаций в Labubu:

1) Проводим префильтеринг по нужным темам диалога.
2) Заполняем критерии отбора.
3) Отправляем отобранные данные в модель разметки.

Что такое префильтеринг и почему он важен

Анализ 100 000 коммуникаций занимает целую видеокарту. Чтобы сэкономить ресурсы, важно сократить количество запросов до самых нужных. Для этого разработчики Labubu каждые 10 тысяч размеченных коммуникаций дообучают небольшой классификатор, который дёшево инферить на CPU. Это позволяет экономить до 60% обращений к основной модели.

В итоге микросервис поднимает конверсию в успешное вовлечение предпринимателя до 10%. Но не всё так гладко.

В следующем посте разберём, как сервис едва не занял все ресурсы под инференс компании и как чуть не положил все остальные сервисы.

💜 Этот пост написал Макс Умутаев, бэкенд-разработчик в Точка Банк
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot