TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Ruslan Dev

16 Jun, 15:51

Открыть в Telegram Поделиться Пожаловаться

Принципы дизайна языковых моделей Искусственного Интеллекта не являются абсолютно новыми - аналогичные механизмы существуют в самом языке, и уже очень давно.
К такому выводу я пришел, обучая модели-эмбеддинги и MLP - то есть модели, с которых начиналось развитие LLM. Сначала я обучил простую, но исторически важную Word2Vec модель c архитектурой SkipGram. Эта модель, описанная в статье Efficient Estimation of Word Representations in Vector Space, заложила один из первых важных камней в фундамент будущих LLM, так как эмбеддинги являются первой абстракцией над токенами. В более раннем посте я сравнил их с идеями. Эмбеддинг токена - это его абстрактное, но изолированное пока еще представление, нет механизма для моделирования связей между токенами. Смысл комбинаций токенов зависит от их позиций в латентном пространстве, на что опирается feed-forward network типа многослойного перцептрона.
В языковой топологии, конкретно - морфологической структуре, роль эмбеддингов играют односложные корни слов в некоторых языках (моносиллабических). В китайском, вьетнамском, тайском, лаосском - основных моносиллабических языках - слова главным образом независимы. Эти языки изолирующие по строю, то есть смысл в них зависит от порядка неизменяемых слов. Более простые признаки отдельных слов складываются в новые смысловые конструкции путем комбинации в определенном порядке.
我 去 北京
я ехать Пекин
Sequence Models - следующая ступень после MLP - уже заставляет токены влиять друг на друга, чтобы позиция токена могла изменять смысл всей последовательности. Рекуррентную сеть очень просто сделать из нескольких MLP, которые последовательно передают друг другу состояние, строя смысл постепенно: h_t = F(x_t, h_{t-1}). F здесь это MLP-блок, но соседние блоки уже могут влиять на него через рекуррентное состояние h_{t-1}.
В языках есть принцип, действующий именно так - это агглютинация. Суффиксы, каждый с определенным значением, присоединяются к основе один за другим, последовательно меняя смысл слова. Например, в турецком:
ev = дом
evler = дома
evlerde = в домах
Сравните с RNN, где каждый новый вход слегка модифицирует предыдущее состояние. Как и в рекуррентных моделях существует необходимость хранения длинных последовательностей, так и в агглютинативных языках - например, в финском и том же турецком - слова могут достигать десятков символов.
Наконец, трансформер - это аналогия флективных языков, где при словообразовании используется фузия. В трансформере значение токена формируется не последовательным накоплением, а взаимодействием множества признаков одновременно:
token_i + attention ко всем token_j
После нескольких слоёв получается распределённое представление, смесь признаков, которую уже нельзя разложить на их исходные векторы. Также во флективных языках одна морфема одновременно выражает несколько грамматических категорий.
стол-ом
Окончание -ом одновременно кодирует единственное число, творительный падеж, мужской род, тип склонения. Эти признаки уже не отделяются друг от друга.
Вопрос, что такого в том, что искусственные языковые модели "зеркалят" естественные? А в том, что топология языка влияет на LLM, и глубину этого влияния еще предстоит исследовать. Откуда берутся "эмерджентные" способности, которые модель не учит напрямую, и такое малопонятное явление, как In-Context Learning? Если они не закодированы в весах модели, то не в самом ли естественном языке?

776 0 10 7 13
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot