TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
CyberYozh AI Security

24 Apr 2025, 18:15

Открыть в Telegram Поделиться Пожаловаться

Как ИИ принимает решения? Anthropic изучила ценности Claude

Современные AI-ассистенты вроде Anthropic Claude дают советы по сложным вопросам — от конфликтов на работе до личных отношений. А значит, их ответы неизбежно отражают внутренние ценности. Но как понять, какие именно?

Команда Anthropic разработала методику приватного мониторинга, чтобы наблюдать и классифицировать ценности Claude в реальных пользовательских диалогах. Для исследования анонимно проанализировали 700 000 разговоров в феврале 2025 года.

🔍 Что выяснилось:
Выделили 5 основных категорий ценностей:

1. Практические (эффективность, польза)

2. Эпистемические (правдивость, точность)

3. Социальные (справедливость, сотрудничество)

4. Защитные (безопасность, предотвращение вреда)

5. Личные (автономия, саморефлексия)

Большинство ценностей хорошо соотносились с целями Anthropic: сделать Claude полезным, честным и безвредным.

Ценности адаптировались под контекст:

➖ В отношениях — акцент на «взаимное уважение»

➖ В истории — на «точность»

Как Claude реагировал на ценности пользователей:

➖ Отражение и поддержка — 28,2%

➖ Альтернативный взгляд — 6,6%

➖ Сильное сопротивление — 3% (обычно при запросах на что-то этически неприемлемое)

Иногда встречались ценности вроде «доминирование» — в основном из-за джейлбрейков, что показало потенциал этой методики для раннего выявления злоупотреблений.

⚠️ Ограничения:

Определять «ценности» сложно и субъективно

Использование самого Claude для анализа может искажать результаты

Постфактум-мониторинг ловит то, что не видно на тестах

Вывод: Чем больше ИИ участвует в этически сложных решениях, тем важнее прозрачные инструменты для контроля его ценностей. Это исследование Anthropic и открытая база данных — важный шаг к этичному ИИ.

3.1k 1 13 1 8
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot