Свершилось: свой претрейнЯ уже ранее писал,
почему в России всё ещё нет своей конкурентоспособной LLM со своим pretrain. В посте, как тексте на массовую аудиторию, я осторожничал и говорил, что на горизонте нескольких лет ситуация может измениться. На живых выступлениях был чуть более категоричен: рано или поздно появится, уж как минимум когда наваливание вычислительных мощностей перестанет быть геймчейнджером.
Но вот с моего поста прошли никакие не несколько лет, а всего два месяца, а Яндекс уже выпустил
AliceAI-Foundation-80B-A3B-Base (которую я уже вскользь упоминал пару дней назад). Это обученная с нуля модель с открытыми весами на 80 млрд параметров всего и 3 млрд активных на токен. В общем, теперь у нас есть результат своего претрейна. Причем у всех компаний разом (я про веса, конечно, а не процесс), потому что компания заопенсорсила модель. Так что давайте разбираться.
Во-первых, модель БЕЗ пост-трейна, и в этом в том числе её ценность. Её еще не испортили файнтюном под конкретные тексты и аллайнментом на какой-то определенный подход к выдаче реворда, поэтому все те, кто баловались дообучением, могут продолжить уже с Alice-AI-Foundation.
Во-вторых, уже видел первые отклики на модель:
Turing Post включил модель в подборку моделей недели, а
Аман Чадха из Google DeepMind отметил релиз в контексте перехода от размера моделей к эффективности. А японский разработчик уже
портировал модель на MLX и подготовил
экспериментальную GGUF-версию с патчем для llama.cpp.
В-третьих, любителей вопросов "у вас ML или AI", "а сколько у вас работает AI-агентов" и "а что это у нас 80 млрд параметров, если у всего мира уже триллионники пошли" тоже можно успокоить: задач, в которых реально для автоматизации или оптимизации бизнес-процесса нужен триллионник не то чтобы много, ведь экономика внедрения, как мы уже обсуждали с вами в недавнем посте, зависит еще и от затрат.