Ходят слухи, что Harvey готовит очередной раунд, на $500 млн с оценкой $15,5 млрд. Мы все хлопаем глазами, когда они (и их конкуренты в Legora) тратят миллионы на звезд Голливуда, но это карманные деньги в сравнении с затратами на токены. Помним, по сути их бизнес - перепродажа токенов (да, это весьма упрощенное определение, но тем не менее). А стоимость этих токенов растет. Почему?
Причина растущей стоимости токенов - быстрый рост затрат на их производство. Спрос на компьютерные мощности стабильно высокий, датацентры не строятся так быстро, как лаборатории, операторы датацентров и инвесторы хотят. А мощности требуются все больше и больше с растущими возможностями моделей. Узкое место - сама архитектура моделей, т.е. архитектура трансформеров.
Коренной механизм трансформеров - self-attention (самовнимание) - приведет к проблеме при растущих возможностях моделей. В отличие от традиционных моделей, обрабатывающих данные последовательно (например, рекуррентные нейронные сети, RNN), self-attention анализирует весь контекст одновременно, что позволяет эффективно выявлять сложные взаимосвязи, в том числе между удалёнными элементами (архитектура CUDA позволяла сделать эти параллельные вычисления, поэтому NVIDIA сегодня стоит больше $5 трлн).
Все это было прекрасно, когда контекстное окно моделей было 4095 токенов. Но у self-attention есть серьёзная проблема - квадратная сложность. Это означает, что при входящем количестве токенов (n) модели потребуются n² операций для генерации выходящих токенов. Анализ текста из 1000 токенов требует 1 млн операций, а из 10000 токенов - уже 100 млн. Передовые коммерческие модели сегодня предлагают контекстное окно в 1 млн токенов, опенсорсные даже 10 млн. Коммерческие сознательно ограничивают контекстное окно, чтобы держать под контролем расход ресурсов. Принципиально большие языковые модели могли бы предлагать контекстное окно и на 100 млн токенов, на датацентры не выдержали бы такие нагрузки.
Что делать в такой ситуации? Вечно бегать по этой спирали не получится. Одной из самых перспективных концепций являются
Extended Long-Short-Term Memory Networks (xLSTM), предложенными немецким ИИ-пионером Сеппом Хохрайтером. У этой архитектуры линейная сложность, что существенно уменьшает потребности в ресурсах. Kimi Linear, например, уже использует эту архитектуру. Понятно, что трансформеры в обозримом будущем будут востребованы для комплексных задач. Но для более простых задач, например в embedded systems, xLSTM может стать альтернативой.
#ai