TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Все о блокчейн/мозге/space/WEB 3.0 в России и мире

16 Jul 2025, 12:38

Открыть в Telegram Поделиться Пожаловаться

Лучшие ИИ-модели справляются только с половиной реальных финзадач.

Согласно лидерборду Snorkel AI, у которой есть платформа Snorkel Flow(помогает компаниям разрабатывать специализированные наборы данных и модели ИИ) выявлено, что лучшие ИИ-модели справляются только с половиной реальных финансовых задач (52% у Claude 3.7), хотя на академических тестах показывают 90%+.

Разрыв между 90%+ на MMLU и 51.9% на Finance Reasoning показывает, что индустрия оценивает ИИ по неправильным метрикам. Умение отвечать на вопросы из учебников кардинально отличается от способности работать с реальными бизнес-задачами.

Агентские возможности — это узкое место современных LLM
Все топовые модели проваливаются на задачах, требующих:
- Многошагового планирования (в среднем 12 шагов)
- Работы с инструментами (SQL, анализ документов)
- Самокоррекции при ошибках
- Интеграции разрозненной информации.
Это говорит о том, что текущая архитектура LLM плохо подходит для автономной работы в сложных средах.

Специализация домена критически важна
51.9% точности даже у лучших моделей на финансовых задачах показывает, что универсальные LLM недостаточны для корпоративного применения. Нужны либо специализированные модели, либо кардинально другие подходы к обучению.

Проблема не в размере модели, а в подходе
Факт, что открытые модели показывают 10-20% при том, что закрытые достигают 50-80%, указывает не только на разницу в вычислительных ресурсах, но и на фундаментальные различия в архитектуре или методах обучения.

Корпоративные ожидания завышены.
Если модели с трудом справляются с анализом финансовых документов (задача, которую делают тысячи аналитиков), то автоматизация более сложных бизнес-процессов пока невозможна. Это объясняет, почему многие корпоративные внедрения ИИ не оправдывают ожиданий.

Неструктурированные данные остаются проблемой.

Нужны новые метрики и подходы к оценке
Традиционные бенчмарки не только бесполезны, но и вредны — они создают ложное ощущение прогресса.

Ближайшее будущее — гибридные системы
Раз ИИ не может автономно решать сложные задачи, логичный путь — системы с участием человека, где ИИ берет на себя рутинные операции, а человек — контроль и принятие решений.

3k 1 73 24
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot