Некий стартап LithosAI предлагает сверхбыстрый инференс моделек у себя.
Обещают 800 токенов в секунду (на одного юзера) против 150 у другого стирального порошка других провайдеров.
При этом это все гоняется не на специализированных чипах Cerebras, а на какой-то обычной стойке из 8 B300.
В чем секрет такой выдающей скорости, не раскрывают, утверждают, что все дело в мегаэффективном движке инференса. По всей видимости основной фактор, определяющий latency, здесь - low-batch serving. И, само собой, удовольствие не дешевое, и чтобы не травмировать психику потенциальных юзеров, цену за мильон токенов не разглашают.
Обещают 800 токенов в секунду (на одного юзера) против 150 у другого стирального порошка других провайдеров.
При этом это все гоняется не на специализированных чипах Cerebras, а на какой-то обычной стойке из 8 B300.
В чем секрет такой выдающей скорости, не раскрывают, утверждают, что все дело в мегаэффективном движке инференса. По всей видимости основной фактор, определяющий latency, здесь - low-batch serving. И, само собой, удовольствие не дешевое, и чтобы не травмировать психику потенциальных юзеров, цену за мильон токенов не разглашают.