🚀 AI Researcher (Middle — Senior+) в R&D NLP, SberAIМы — исследовательская команда на переднем крае LLM-технологий. Мейнстрим-рецепт LLM для нас — это потолок, который мы пытаемся пробить.
Ищем архитектурные ходы, новые objective-функции, нестандартные режимы reasoning'а — всё, что может дать кратный прирост качества/скорости. Жизненный цикл идеи: от гипотезы → PoC-фреймворк → прод. флагманской LLM. Если коротко: ищем людей, которым интересна прикладная исследовательская работа в среднем и высоком risk-reward профиле.
🔬 Над чем сейчас работаем
🏗 Альтернативные архитектуры— encoder-decoder, гибридные attention (linear + softmax), sparse/MoE с нестандартным dispatching, итеративные/loop-трансформеры
🎓 Новые training objectives и режимы обучения
— multi-token и future-state prediction, RL-pretraining, дистилляция против ансамблей teacher-моделей
🧠 Reasoning
— латентный/омнимодальный reasoning, обучаемые value-сети, MCTS-подобный поиск, self-play, ансамбли гетерогенных моделей
⚡️ Эффективность и inference
— адаптивные вычисления, MoD/early-exit, serving для нестандартных архитектур
🎨 Специализированные направления
— символьные/фонетические задачи, креативная генерация, agentic capabilities
Часть гипотез доедет до PoC/прода, часть умрёт на small-scale. Это ожидаемо.
🛠 Чем предстоит заниматься— Разбирать существующие LLM-пайплайны до компонент и находить места для апгрейда не на 1%, а в разы
— Формулировать research-гипотезы и доводить их от абляций до полного pretrain/post-train цикла со scaling laws
— Обучать, валидировать и имплементировать новые архитектуры и objectives — иногда с залезанием в инфраструктуру (kernel'ы, training-фреймворк, serving)
— Упаковывать результаты в PoC, инференс-движок, пилоты
— Публиковаться на A/A*-конференциях — опционально, но поощряем 📄
✅ Что ждём от кандидатов— Глубокое понимание современного трансформера и всех этапов LLM-пайплайна
— Качественный воспроизводимый ML-код, опыт обучения в multi-GPU (лучше multi-node) режиме
— Практический опыт на каком-то из этапов LLM-строения — индустрия или серьёзный pet-project, формат не принципиален
— Хорошая насмотренность по литературе, способность читать paper'ы критически — отличать зёрна от плевел
— Умение быстро валидировать смелые гипотезы
➕ Будет плюсом— опыт в классическом ML/NLP до эпохи больших моделей
— публикации уровня A/A* и опыт прохождения review-цикла
— large-scale training (multi-node, FSDP/DeepSpeed/Megatron)
— призовые места на Kaggle и подобных
🌟 One More ThingЕсли вы рок-звезда (уровень техлида и выше) — у нас отдельный трек найма:
💎 compute без бюрократии
💎 запуск нового research-трека под вас
💎 потенциально своя команда и инженерная поддержка под скейлинг
💎 прямое участие в стратегии направления — что делаем, во что не верим, на чём фокусируемся на длинном горизонте
Мы делаем ставку на архитектурные и training-инновации, где количество GPU перестаёт быть единственным фактором.
🔥 Если такая постановка задачи будоражит кровь — пишите.
Куда слать резюме:
@VeronikaShel или
@dmiryyТехнические вопросы:
@walfry или
@hukenovs#найм #hiring #job