TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Все о блокчейн/мозге/space/WEB 3.0 в России и мире

3 Feb, 11:37

Открыть в Telegram Поделиться Пожаловаться

Anthropic выяснили, чем дольше ИИ-модель думает над сложной задачей, тем её ошибки становятся всё более непредсказуемыми.

В своей новой работе Anthropic и EPFL исследователи измерили, как именно ошибаются LLM.

Проверяли на разных задачах:
- тесты со множественным выбором,
- агентное программирование,
- оценки безопасности ИИ.

Паттерн везде одинаковый,
чем дольше модель думает, тем более непредсказуемыми становятся её ответы.

Та же модель на тот же вопрос может дать совершенно разные ответы при повторных запросах - не потому что преследует скрытую цель, а потому что внутренне нестабильна.

Ещё один неожиданный вывод - более крупные модели не всегда надёжнее. Авторы проверили это на семействе Qwen3 (от 1.7млрд до 32млрд параметров). На простых задачах масштаб помогает модели становятся стабильнее. На сложных задачах наоборот, крупные модели становятся ещё более хаотичными.

Отдельный эксперимент показал почему, модели быстро учатся понимать правильную цель, но гораздо медленнее учатся стабильно её достигать.

Практический вывод - не полагайтесь на единичные ответы моделей рассуждений для критических решений.

Ансамблирование, верификация, человеческий контроль - необходимость.

2.6k 2 44 1 17
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot