TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Tools 🛠

18 Aug, 19:38

Открыть в Telegram Поделиться Пожаловаться

Репост из: Точки над ИИ
Чем вытащить данные с любого сайта и как парсить с агентами

Часто звучит вопрос про парсинг. Нужно это чаще, чем кажется, собрать цены конкурентов, сложить статьи в свою базу знаний, скормить что-то агенту. В общем вот список, сохраняйте, пригодится.

Готовые сервисы, работают из коробки
Firecrawl
Превращает любую страницу, включая JS-сайты и PDF, в чистый markdown для модели.

Jina AI Reader
Добавляете r.jina.ai перед ссылкой и получаете чистый текст страницы, бесплатный тариф щедрый.

Apify
Маркетплейс из 28 тысяч готовых скраперов почти под любой популярный сайт.

Thunderbit
Расширение для Chrome, вытаскивает данные со страницы в два клика и отправляет их в Sheets или Notion.

RSS.app
Превращает сайты и соцсети в RSS-ленту с фильтрами и автопостингом в телеграм.


Открытые библиотеки, их ставит агент
Crawl4AI
Популярный открытый скрапер, отдает сайт сразу в markdown для модели.

Browser Use
Агент водит браузер как человек, логинится, кликает и забирает данные.

Crawlee
Фреймворк с ротацией прокси, ретраями и очередями, когда страниц реально много.

Scrapy
Промышленная классика на питоне для обхода миллионов страниц.

Scrapling
Сам подстраивается под изменения верстки, поэтому ломается заметно реже.

AutoScraper
Показываете пример нужных данных, он сам находит шаблон и вытаскивает остальное.

Defuddle
Чистит страницу от рекламы, меню и сайдбаров, это движок Obsidian Web Clipper.



Когда сайт сопротивляется
curl_cffi
Запросы с отпечатком настоящего браузера, самый простой способ не выглядеть ботом.

curl-impersonate
Тот же трюк на уровне curl, работает движком под curl_cffi.

CloakBrowser
Замена Playwright на патченом Chromium, проходит антибот и капчу.

invisible_playwright
То же самое, только на Firefox.



Что стоит добавить в список?

11 0 0
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot