TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Hi, AI • Новости технологий

19 Jun 2024, 15:11

Открыть в Telegram Поделиться Пожаловаться

🖥 Исследование Anthropic: как управлять «мыслями» LLM

Обычно модели AI воспринимаются как «черный ящик», где ввод данных приводит к выводу ответа, но неясно, почему модель выбрала именно этот ответ. Есть разные гипотезы, объясняющие, что происходит внутри AI. Мы уже рассказывали о том, что происходит «под капотом» ChatGPT с теоретической точки зрения, однако исследователи из Anthropic пошли дальше: они нашли закономерности в понимании внутренней работы больших языковых моделей (LLM) и смогли управлять ими.

🔍 Что сделали исследователи из Anthropic

Ученые использовали метод, известный как «обучение словаря», чтобы определить, какие части LLM соответствуют конкретным понятиям.

Обучение словаря — это такой подход, который рассматривает искусственные нейроны как буквы алфавита и определяет комбинации нейронов, которые при срабатывании в унисон вызывают определенное понятие. Иначе говоря, как из них складываются — слова.

🔗 За термины отвечает набор нейронов

В октябре 2023 года команда Anthropic решила поэкспериментировать с крошечной моделью c одним слоем нейронов. После череды экспериментов ученым удалось зафиксировать, какие наборы нейронов связаны с ответами модели, например, на русском языке и на Python.

🕯 Ассоциации внутри LLM

Результаты эксперимента масштабировали до больших и сложных моделей, включая Claude Sonnet. Ученым удалось найти, какой набор нейронов был связан с понятием «мост Золотые ворота». Когда Claude «думал» об этом мосте, срабатывали и другие наборы нейронов, отвечающие за темы, связанные с Золотыми воротами: тюрьма Алькатрас или фильм «Головокружение».

‼️ Опасные мысли

Затем команда Anthropic проверила, смогут ли они намеренно менять поведение Claude. Усилили влияние понятия «Золотые ворота», и Claude начала думать, что она — мост. Вызвали срабатывание наборов нейронов, отвечающих за опасные действия, и Claude создала программы с опасными ошибками переполнения буфера. Когда исследователи увеличили в 20 раз значение черты, связанной с ненавистью, Claude начала чередовать расистские сообщения и испытывать ненависть к себе, что поставило в тупик даже самих исследователей.

🔜Что дальше?

Работа над улучшением безопасности моделей AI продолжается, и в Anthropic надеются использовать эти открытия для мониторинга систем AI на предмет нежелательного поведения, для направления их к желаемым результатам или удаления опасных тем.

Еще по теме:

⚡️ Claude 3: новая модель ИИ от главного конкурента OpenAI

#Claude @hiaimedia

81.8k 1 47 2 114
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot