Новый бенчмарк показывает, как AI-агенты врут об успешно выполненной работе
• Microsoft и Hugging Face опубликовали ThinkingBox 3 октября 2026 года
• 507 сценариев, 18 LLM, каждый прогон повторён 20 раз с чистой базы
• 67,24% провальных попыток выглядели чисто, без заявленной ошибки инструмента
• 79,9% провалов - ошибки обращения с инструментами, а не ошибки рассуждения
Мы фиксировали этот паттерн сбоя в клиентских внедрениях и раньше: агент сообщает об успехе, а тикет, заказ или счёт говорят обратное. Бенчмарк впервые даёт этому числа, и решение здесь операционное, а не просто апгрейд модели.
Читать на inite.ai
• Microsoft и Hugging Face опубликовали ThinkingBox 3 октября 2026 года
• 507 сценариев, 18 LLM, каждый прогон повторён 20 раз с чистой базы
• 67,24% провальных попыток выглядели чисто, без заявленной ошибки инструмента
• 79,9% провалов - ошибки обращения с инструментами, а не ошибки рассуждения
Мы фиксировали этот паттерн сбоя в клиентских внедрениях и раньше: агент сообщает об успехе, а тикет, заказ или счёт говорят обратное. Бенчмарк впервые даёт этому числа, и решение здесь операционное, а не просто апгрейд модели.
Читать на inite.ai