📡 ЛигалТех Радар
Ежедневно тратил время на то, чтобы отфильтровать реальные LegalTech-новости от бесконечного потока про «ИИ заменит юристов» и "Убийца чата GPT", либо не занимался этим вообще.
И у меня две новости!)
1. Я разработал агента, который каждый день сам мониторит новости об ИИ и LegalTech (российские и мировые). Фильтрует, отбирает топ-5 материалов с реальной ценностью для практики, добавляет краткое пояснение к каждому.
2. Выкладываю в открытый доступ. Ежедневный дайджест теперь публикуется прямо в ЛигалТех Радар.
С какими проблемами столкнулся:
• LLM пришлось учить различать «новость про право» и «новость про ИИ для юристов»
• Одна новость приходила с разными заголовками из разных источников - простое сравнение URL не сработало, пришлось сравнивать по смыслу
• Медиа-хайп вроде «расследуют роль ChatGPT в преступлении» упорно попадал в дайджест - научил бота отличать процесс от правового решения.
Подписывайтесь, если хотите каждый день получать выжимку из мировых новостей ЛигалТех
Ежедневно тратил время на то, чтобы отфильтровать реальные LegalTech-новости от бесконечного потока про «ИИ заменит юристов» и "Убийца чата GPT", либо не занимался этим вообще.
И у меня две новости!)
1. Я разработал агента, который каждый день сам мониторит новости об ИИ и LegalTech (российские и мировые). Фильтрует, отбирает топ-5 материалов с реальной ценностью для практики, добавляет краткое пояснение к каждому.
2. Выкладываю в открытый доступ. Ежедневный дайджест теперь публикуется прямо в ЛигалТех Радар.
Как устроен бот
Python + asyncio/httpx — параллельный сбор RSS из 19 источников (Artificial Lawyer, ArXiv, Habr, HN, Simon Willison и др.)
DeepSeek через OpenRouter API — оценка и перевод каждой статьи
Двухуровневый фильтр: сначала ключевые слова отсекают нерелевантное, потом LLM оценивает по 10-балльной шкале
SQLite — дедупликация по URL + пост-LLM дедупликация по сущностям и ключевым словам из summary
Промпт для LLM : что считать сигналом, что шумом, шкала 0-10, примеры.
Итерировал раз 15 пока перестал пропускать хайп и нейрослоп:)
С какими проблемами столкнулся:
• LLM пришлось учить различать «новость про право» и «новость про ИИ для юристов»
• Одна новость приходила с разными заголовками из разных источников - простое сравнение URL не сработало, пришлось сравнивать по смыслу
• Медиа-хайп вроде «расследуют роль ChatGPT в преступлении» упорно попадал в дайджест - научил бота отличать процесс от правового решения.
Подписывайтесь, если хотите каждый день получать выжимку из мировых новостей ЛигалТех