Я сейчас сдохну. Чуваки из хеджфонда сделали революционную LLM и вот это их функция рэнкинга в GRPO. Ничего не напоминает? А еще видимо как люди которым не привыкать писать лоу левел код для торговых систем они там на ручнике аллокациями памяти управляют вместо import pytorch as py.