TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
AI/ML Engineer | Владимир Маслов

29 Sep, 16:31

Открыть в Telegram Поделиться Пожаловаться

Репост из: Kantor.AI
Свершилось: свой претрейн

Я уже ранее писал, почему в России всё ещё нет своей конкурентоспособной LLM со своим pretrain. В посте, как тексте на массовую аудиторию, я осторожничал и говорил, что на горизонте нескольких лет ситуация может измениться. На живых выступлениях был чуть более категоричен: рано или поздно появится, уж как минимум когда наваливание вычислительных мощностей перестанет быть геймчейнджером.

Но вот с моего поста прошли никакие не несколько лет, а всего два месяца, а Яндекс уже выпустил AliceAI-Foundation-80B-A3B-Base (которую я уже вскользь упоминал пару дней назад). Это обученная с нуля модель с открытыми весами на 80 млрд параметров всего и 3 млрд активных на токен. В общем, теперь у нас есть результат своего претрейна. Причем у всех компаний разом (я про веса, конечно, а не процесс), потому что компания заопенсорсила модель. Так что давайте разбираться.

Во-первых, модель БЕЗ пост-трейна, и в этом в том числе её ценность. Её еще не испортили файнтюном под конкретные тексты и аллайнментом на какой-то определенный подход к выдаче реворда, поэтому все те, кто баловались дообучением, могут продолжить уже с Alice-AI-Foundation.

Во-вторых, уже видел первые отклики на модель: Turing Post включил модель в подборку моделей недели, а Аман Чадха из Google DeepMind отметил релиз в контексте перехода от размера моделей к эффективности. А японский разработчик уже портировал модель на MLX и подготовил экспериментальную GGUF-версию с патчем для llama.cpp.

В-третьих, любителей вопросов "у вас ML или AI", "а сколько у вас работает AI-агентов" и "а что это у нас 80 млрд параметров, если у всего мира уже триллионники пошли" тоже можно успокоить: задач, в которых реально для автоматизации или оптимизации бизнес-процесса нужен триллионник не то чтобы много, ведь экономика внедрения, как мы уже обсуждали с вами в недавнем посте, зависит еще и от затрат.

80 0 2
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot