Как понять, что РЕАЛЬНО цепляет аудиторию на YouTube 🔍Все привыкли смотреть на просмотры и лайки, но они вообще не отвечают на главный вопрос:
какая конкретно мысль зацепила людей. Читать 5 000 комментов руками - ад, а классический анализ тональности («в среднем комментарии позитивные») - это просто бесполезная каша. Я решил достать из видео настоящие смыслы.
💡 Какие инсайды мы получаем на выходе:▪️
Реально горячие темы. Плотность реакций ≠ просмотры. Иногда нишевый вброс генерит больше дискуссий, чем хайповая тема.
▪️
Связка «тейк ➡️ реакция». Какой конкретно тезис автора вызвал спор, а с чем все согласились (в цифрах).
▪️
Привязка к секундам. Кликаешь на момент в видео - видишь шквал комментов, который породила именно эта фраза.
▪️
Граф дискуссий. Кто кому отвечает, где сформировались главные ветки споров и какие мысли дублируются.
▪️
Разрывы спроса. Темы, которые люди бурно обсуждают, но контента по ним мало = готовые идеи для новых роликов.
⚙️
Как это работает под капотом (стек)Здесь пришлось серьезно заморочиться, особенно на этапе парсинга.
1. Сбор данных. YouTube сейчас жестко банит за парсинг сабов (кидает 429-ю ошибку). Обошли это через yt-dlp + реверс блокировки: генерим PO-токены через self-hosted bgutil-провайдер на Node.js и пускаем всё через residential-прокси с ротацией по портам и странам. Комменты тянем с полной пагинацией (со всеми лайками, ветками ответов и сердечками от автора). На крайний случай есть фоллбэк - реверс бесплатного transcript-API.
2. Масштаб. Чтобы не ждать часами, я раскатал сбор на бесплатных serverless-контейнерах в Modal. Сделал fan-out (.map()) по десяткам инстансов и аккаунтов. Итог:
1 844 видео и 67 000 комментов выкачиваются за пару минут. Трафик выводим через свои прокси.
3. Привязка смыслов (контент ↔️ реакция). Режем транскрипт видео на куски. Комменты линкуем к ним двумя путями: - По прямым таймкодам в тексте (типа «на 7:13 он не прав»). - По смыслу через эмбеддинги (sentence-transformers, multilingual MiniLM, cosine similarity). Работает гибридно: эмбеддинги выдают топ-кандидатов, а LLM принимает финальное решение (добились точности привязки ~89%).
4. Аналитика. DeepSeek размечает реакции, а дальше KMeans кластеризует их по мета-темам (через те же эмбеддинги). Граф ответов строим на базе networkx.
5. Визуализация. Всё это собирается в интерактивный граф на vis-network (видео → тезисы → комменты), где связи показывают «ответы» и «семантическую похожесть». Добавляем таймлайн моментов с возможностью провалиться в детали (drill-down) и пакуем в удобную ссылку.
🎯
Итог: Запускаешь одну команду по любому видео - и вместо абстрактных «нравится/не нравится» получаешь готовую карту триггеров. Понимаешь не только
что зашло, но и
почему.
Пример того что на выходе можно посмотреть тут.
https://claude.ai/artifact/GvF1hTy6bauyMrDKCrpWSR