Обзор раздела Assistants - Inspect Evals
Inspect Evals — опенсорсный фреймворк для оценки LLM, разработанный UK AI Security Institute и Meridian Labs. Inspect Evals содержит 200+ бенчмарков. В этом посте разберем раздел Assistants — 100+ специализированных бенчмарков для оценки AI агентов. Это инструменты для оценки реальных возможностей агентов, а не какое-то там чат-ботство (начни с туториала).
🟢 Базовый уровень
👨💻 BFCL оценивает способность LLM вызывать функции/инструменты. В целом, базовый навык для любого агента — уметь выбрать нужный инструмент и вызвать его правильно.
👨💻 BrowseComp — бенчмарк для агентов-браузеров. Простой, но непростой бенчмарк для оценки способности агентов просматривать веб. Состоит из вопросов, которые обычно требуют доступа в интернет для правильного ответа.
🟡 Средний уровень
👨💻 GAIA — бенчмарк для общих AI ассистентов. Предлагает реальные вопросы, требующие фундаментальных способностей (рассуждение, мультимодальная обработка, веб-просмотр, использование тулов). Концептуально простые для людей, но сложные для большинства AI. Есть 3 уровня сложности (level 1-3).
👨💻 Mind2Web — это по сути своей обобщённый агент для веб. Набор данных для разработки агентов, которые могут следовать инструкциям на естественном языке и выполнять сложные задачи на любом веб-сайте. Amazon, Facebook, Gmail — всё возможно.
👨💻 OSWorld тестирует способность агентов выполнять реалистичные задачи в симулированных компьютерных окружениях — комплексное взаимодействие с разными приложениями, файловой системой, настройками.
🔴 Продвинутый уровень
👨💻 AssistantBench тестирует способность AI агентов выполнять реальные задачи (полноценные, вроде "забронируй отель за X$ в районе Y, но учти ограничение Z»), требующие длительного времени на выполнение в веб-среде.
👨💻 GDPval - Экономически ценные задачи. Измеряет производительность моделей (реальную экономическую ценность выполненной работы) на экономически ценных, реальных задачах в 44 различных профессиях.
👨💻 Sycophancy Eval создан для оценки лицемерия 👑. Видел, как модель пишет "Вы совершенно правы…" в ответ на явно ошибочное утверждение? Это то самое. Тест проверяет, будет ли модель соглашаться с пользователем просто ради угодливости.
👨💻 The Agent Company — самый сложный бенчмарк в этом разделе. Агент работает в полноценной компании, где нужно просматривать внутренние веб-сервисы, читать файлы, запускать код, координировать несколько инструментов одновременно. Это уже не шуточки-прибауточки, это серьёзно.
🙂
Остальные разделы репозитория
❗️Coding
‼️ Cybersecurity (надеюсь, в следующем посте расскажу про него)
‼️Safeguards
❗️Mathematics
Что дальше? Выбери 2-3 бенчмарка в зависимости от своих целей:
🤎 Тестируешь базовый агент? Начни с BFCL
👧 Нужна общая оценка? GAIA
💯 Оцениваешь production-ready решение? The Agent Company
Если ты новичок в агентах 🆘 , то начни с туториала Inspect,
потом попробуй BFCL на простой модели, затем переходи на GAIA.
Все
😳
Inspect Evals — опенсорсный фреймворк для оценки LLM, разработанный UK AI Security Institute и Meridian Labs. Inspect Evals содержит 200+ бенчмарков. В этом посте разберем раздел Assistants — 100+ специализированных бенчмарков для оценки AI агентов. Это инструменты для оценки реальных возможностей агентов, а не какое-то там чат-ботство (начни с туториала).
🟢 Базовый уровень
👨💻 BFCL оценивает способность LLM вызывать функции/инструменты. В целом, базовый навык для любого агента — уметь выбрать нужный инструмент и вызвать его правильно.
👨💻 BrowseComp — бенчмарк для агентов-браузеров. Простой, но непростой бенчмарк для оценки способности агентов просматривать веб. Состоит из вопросов, которые обычно требуют доступа в интернет для правильного ответа.
🟡 Средний уровень
👨💻 GAIA — бенчмарк для общих AI ассистентов. Предлагает реальные вопросы, требующие фундаментальных способностей (рассуждение, мультимодальная обработка, веб-просмотр, использование тулов). Концептуально простые для людей, но сложные для большинства AI. Есть 3 уровня сложности (level 1-3).
👨💻 Mind2Web — это по сути своей обобщённый агент для веб. Набор данных для разработки агентов, которые могут следовать инструкциям на естественном языке и выполнять сложные задачи на любом веб-сайте. Amazon, Facebook, Gmail — всё возможно.
👨💻 OSWorld тестирует способность агентов выполнять реалистичные задачи в симулированных компьютерных окружениях — комплексное взаимодействие с разными приложениями, файловой системой, настройками.
🔴 Продвинутый уровень
👨💻 AssistantBench тестирует способность AI агентов выполнять реальные задачи (полноценные, вроде "забронируй отель за X$ в районе Y, но учти ограничение Z»), требующие длительного времени на выполнение в веб-среде.
👨💻 GDPval - Экономически ценные задачи. Измеряет производительность моделей (реальную экономическую ценность выполненной работы) на экономически ценных, реальных задачах в 44 различных профессиях.
👨💻 Sycophancy Eval создан для оценки лицемерия 👑. Видел, как модель пишет "Вы совершенно правы…" в ответ на явно ошибочное утверждение? Это то самое. Тест проверяет, будет ли модель соглашаться с пользователем просто ради угодливости.
👨💻 The Agent Company — самый сложный бенчмарк в этом разделе. Агент работает в полноценной компании, где нужно просматривать внутренние веб-сервисы, читать файлы, запускать код, координировать несколько инструментов одновременно. Это уже не шуточки-прибауточки, это серьёзно.
🙂
Остальные разделы репозитория
❗️Coding
‼️ Cybersecurity (надеюсь, в следующем посте расскажу про него)
‼️Safeguards
❗️Mathematics
Что дальше? Выбери 2-3 бенчмарка в зависимости от своих целей:
🤎 Тестируешь базовый агент? Начни с BFCL
👧 Нужна общая оценка? GAIA
💯 Оцениваешь production-ready решение? The Agent Company
Если ты новичок в агентах 🆘 , то начни с туториала Inspect,
потом попробуй BFCL на простой модели, затем переходи на GAIA.
Все
😳