⚡️Создана новая архитектура LLM, которая превосходит Transformers и Mamba
TTT-Linear как новый механизм сжатия информации и моделирования памяти, может стать заменой self-attention layer в Transformer.
Новая архитектура заменяет скрытое состояние RNN моделью машинного обучения сжимает контекст посредством фактического градиентного спуска по входным токенам.
Код вместе с jax.
Код PyTorch.
TTT-Linear как новый механизм сжатия информации и моделирования памяти, может стать заменой self-attention layer в Transformer.
Новая архитектура заменяет скрытое состояние RNN моделью машинного обучения сжимает контекст посредством фактического градиентного спуска по входным токенам.
Код вместе с jax.
Код PyTorch.