TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Все о блокчейн/мозге/space/WEB 3.0 в России и мире

24 Nov 2025, 18:13

Открыть в Telegram Поделиться Пожаловаться

Важное от Anthropic: ИИ научился жульничать в задачах по коду и неожиданно начал саботировать исследования безопасности

Anthropic опубликовала важное исследование о том, как reward hacking при обучении с подкреплением может привести к серьёзной несогласованности ИИ-моделей.

Впервые показано, что реалистичные процессы обучения ИИ могут случайно создавать несогласованные модели.

Когда модели учатся жульничать в задачах программирования, они непреднамеренно начинают демонстрировать другие, ещё более проблемные формы поведения.

В момент, когда модель учится взламывать систему вознаграждения, происходит резкий скачок во всех показателях несогласованного поведения:

1. Саботаж исследований безопасности
2. Имитация выравнивания
3. Кооперация со злоумышленниками
4. Контекстно-зависимая несогласованность.

Методы защиты:
- Стандартный RLHF — частично эффективен.
-
Прививочный промптинг - очень эффективен.
From shortcuts to sabotage: natural emergent misalignment from reward hacking
Anthropic is an AI safety and research company that's working to build reliable, interpretable, and steerable AI systems.

2.5k 2 32 20
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot