Что вы бы предпочли использовать при обучении LLM или использовании её в inference?
Опрос
- Использование токенизации (например, Byte-Pair Encoding или SentencePiece)
- Применение FP16 или quantization для ускорения inference
- Использование positional encoding в трансформерах
- Параллельная генерация через beam search, sampling или top-k