TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Trashchenkov

28 Aug, 16:43

Открыть в Telegram Поделиться Пожаловаться

🔗 LangChain продолжают тему автоматизации разработки эвалов

В июле я уже писал про их скилл eval-engineering, который помогает кодинговому агенту превращать реальные трейсы в оценочные задачи. Теперь LangChain подробнее расписали, как они масштабируют этот процесс.

Чтобы полноценно проверить возможности агента, нужны кейсы со входными данными, средой с инструментами и состоянием, а также способ проверить результат. И таких кейсов нужны десятки и сотни, чтобы покрыть разные сценарии и надёжно оценивать качество. Всё это долго и дорого собирать руками.

Для упрощения этого процесса LangChain вводят промежуточное представление — Task Spec. На основе реальных трейсов сначала выделяют конкретный пользовательский сценарий и описывают его в текстовом виде: что должен сделать агент, в какой среде он будет работать и как оценить итог.

После ревью человеком запускается Spec2Task: кодинговый агент превращает Task Spec в готовую исполняемую задачу в формате Harbor — собирает окружение, данные и проверку.

Параллельно формируется World Spec — общая база знаний для всего бенчмарка: схемы API, правила генерации данных, способы проверки, вспомогательные скрипты и другие общие для множества задач вещи.

World Spec наращивают итеративно. Сначала вместе с кодинговым агентом создают одну полноценную задачу и на её основе формируют первую версию. Затем проверяют её на следующих задачах и добавляют недостающие знания. Когда World Spec становится достаточно полным, процесс можно масштабировать:

трейсы → Task Specs → ревью человеком → Spec2Task → готовые задачи

Готовую задачу ещё прогоняют реальными агентами и смотрят их траектории. Так можно обнаружить проблемы среды — например, случайные подсказки, позволяющие угадать ответ вместо полноценного решения. А чтобы проверить сложность, задачу запускают на моделях разного уровня и при необходимости дорабатывают.

Но мне здесь больше всего нравится общая идея. LangChain рассматривают такой бенчмарк не только как инструмент оценки. Они выделяют три сценария его использования: evaluate — измерять качество, hill-climb — оптимизировать промпты и харнесс, post-train — дообучать саму модель. Разумеется, для обучения и независимой оценки при этом нужны разные задачи или сплиты.

То есть в идеале получается непрерывный цикл: собираем новые реальные трейсы → превращаем их в воспроизводимые задачи → оцениваем и улучшаем агента → снова смотрим, что происходит в проде.
Trashchenkov
🔗 LangChain выпустили скилл для разработки эвалов В марте я уже писал про официальные скиллы LangChain, которые можно подключить к любому кодинговому агенту. На тот момент их было 11, с тех пор количество увеличилось до 15, в том числе eval-engineering, про который хочу сегодня рассказать. Если кра...

496 0 10 2 14
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot