Лучшие ИИ-модели справляются только с половиной реальных финзадач.
Согласно лидерборду Snorkel AI, у которой есть платформа Snorkel Flow(помогает компаниям разрабатывать специализированные наборы данных и модели ИИ) выявлено, что лучшие ИИ-модели справляются только с половиной реальных финансовых задач (52% у Claude 3.7), хотя на академических тестах показывают 90%+.
Разрыв между 90%+ на MMLU и 51.9% на Finance Reasoning показывает, что индустрия оценивает ИИ по неправильным метрикам. Умение отвечать на вопросы из учебников кардинально отличается от способности работать с реальными бизнес-задачами.
Агентские возможности — это узкое место современных LLM
Все топовые модели проваливаются на задачах, требующих:
- Многошагового планирования (в среднем 12 шагов)
- Работы с инструментами (SQL, анализ документов)
- Самокоррекции при ошибках
- Интеграции разрозненной информации.
Это говорит о том, что текущая архитектура LLM плохо подходит для автономной работы в сложных средах.
Специализация домена критически важна
51.9% точности даже у лучших моделей на финансовых задачах показывает, что универсальные LLM недостаточны для корпоративного применения. Нужны либо специализированные модели, либо кардинально другие подходы к обучению.
Проблема не в размере модели, а в подходе
Факт, что открытые модели показывают 10-20% при том, что закрытые достигают 50-80%, указывает не только на разницу в вычислительных ресурсах, но и на фундаментальные различия в архитектуре или методах обучения.
Корпоративные ожидания завышены.
Если модели с трудом справляются с анализом финансовых документов (задача, которую делают тысячи аналитиков), то автоматизация более сложных бизнес-процессов пока невозможна. Это объясняет, почему многие корпоративные внедрения ИИ не оправдывают ожиданий.
Неструктурированные данные остаются проблемой.
Нужны новые метрики и подходы к оценке
Традиционные бенчмарки не только бесполезны, но и вредны — они создают ложное ощущение прогресса.
Ближайшее будущее — гибридные системы
Раз ИИ не может автономно решать сложные задачи, логичный путь — системы с участием человека, где ИИ берет на себя рутинные операции, а человек — контроль и принятие решений.
Согласно лидерборду Snorkel AI, у которой есть платформа Snorkel Flow(помогает компаниям разрабатывать специализированные наборы данных и модели ИИ) выявлено, что лучшие ИИ-модели справляются только с половиной реальных финансовых задач (52% у Claude 3.7), хотя на академических тестах показывают 90%+.
Разрыв между 90%+ на MMLU и 51.9% на Finance Reasoning показывает, что индустрия оценивает ИИ по неправильным метрикам. Умение отвечать на вопросы из учебников кардинально отличается от способности работать с реальными бизнес-задачами.
Агентские возможности — это узкое место современных LLM
Все топовые модели проваливаются на задачах, требующих:
- Многошагового планирования (в среднем 12 шагов)
- Работы с инструментами (SQL, анализ документов)
- Самокоррекции при ошибках
- Интеграции разрозненной информации.
Это говорит о том, что текущая архитектура LLM плохо подходит для автономной работы в сложных средах.
Специализация домена критически важна
51.9% точности даже у лучших моделей на финансовых задачах показывает, что универсальные LLM недостаточны для корпоративного применения. Нужны либо специализированные модели, либо кардинально другие подходы к обучению.
Проблема не в размере модели, а в подходе
Факт, что открытые модели показывают 10-20% при том, что закрытые достигают 50-80%, указывает не только на разницу в вычислительных ресурсах, но и на фундаментальные различия в архитектуре или методах обучения.
Корпоративные ожидания завышены.
Если модели с трудом справляются с анализом финансовых документов (задача, которую делают тысячи аналитиков), то автоматизация более сложных бизнес-процессов пока невозможна. Это объясняет, почему многие корпоративные внедрения ИИ не оправдывают ожиданий.
Неструктурированные данные остаются проблемой.
Нужны новые метрики и подходы к оценке
Традиционные бенчмарки не только бесполезны, но и вредны — они создают ложное ощущение прогресса.
Ближайшее будущее — гибридные системы
Раз ИИ не может автономно решать сложные задачи, логичный путь — системы с участием человека, где ИИ берет на себя рутинные операции, а человек — контроль и принятие решений.