Postlar filtri


Всем привет 👋

Помните, я советовал игру The Farmer Was Replaced, где надо программировать дрона-фермера? Кароч Kaggle как будто подслушал и запустил Kaggriculture: то же самое, только против живых соперников и с призовым фондом $50k. Залетели туда с Андреем на 2 месяца жизни. Рассказываю, как это было.

🎯 Что за задача
Это simulation-соревнование: сдаёшь не предсказания, а агента, и он играет матчи 1 на 1 с агентами других команд.
• У каждого ферма 10×10, сезон 30 дней по 24 хода, итого 720 ходов
• Сажаешь пшеницу, морковь, томаты, клубнику, дыни, заводишь гусей, коров и овец, нанимаешь работников
• Рынок общий и динамический: чем больше товара продали, тем ниже цена, причём сразу для обоих
• У кого на последнем ходу больше денег, тот и выиграл

⚙️ Специфика
• Рейтинг как в шахматах, по результатам матчей, шум ±90 очков на ровном месте
• Играют только два последних сабмита, а новый стартует с 600. Каждая отправка это обнуление слота на сутки-двое
• Верхушка сидит на одних и тех же публичных ноутбуках, поэтому 85% матчей это зеркало: два почти одинаковых бота делят один рынок

🤖 Месяц на RL
Начал как порядочный, с PPO и self-play. Агент выбирал макро-действия («купи корову», «найми работника»), рутину делал скриптовый автопилот. За месяц перебрал около 30 конфигураций:
• MLP от 64×64 до 384×384×384, LSTM с историей действий соперника, QR-DQN, маскирование недопустимых действий
• behavior cloning на реплеях топов и дообучение поверх него
• награда за свои деньги и за разницу с соперником, обучение против себя и против 677 записанных игр с лидерборда
Итог: лучший обученный агент заканчивал сезон с $32k и брал 34% матчей. Одна и та же конфигурация на разных сидах давала от $3k до $22k, то есть шум был больше любого эффекта, а целую неделю агент вообще сходился к «ничего не делать». Добила проверка: чужая записанная игра, проигранная без единого шага обучения, давала $114k и 360 побед из 360.
Почему не взлетело, честно не знаю. Скорее всего компьют: 1M шагов это всего ~1400 игр, а на T4 за 5 часов выходило 3.4M. А может, дело в награде: связать деньги в конце сезона с покупкой коровы на третий день сети тяжело.

🧪 Что сработало после
1. «Ленты». Мир почти детерминирован, поэтому сильный бот это записанный маршрут хорошей игры плюс реактивные слои сверху. Я сшивал такие маршруты из кусков под конкретный набор лавок в городе.
2. Гонка продаж. В зеркале выигрывает тот, кто продаёт на ход раньше. Один параметр «на сколько ходов опережать» давал +1000 монет за игру.
3. Отпечаток соперника. Касса противника после первого хода выдаёт его открытие: 2854, 2858 или 2865 монет. Уже на первом ходу понятно, с кем играешь.
4. Шерсть 🐑 Проигрываю группе ботов по 3000 за игру при одинаковых фермах. Посчитал выручку поштучно через хук на движок: шерсти поровну, но у них цена на 6% выше. Их работник сначала стрижёт и несёт на склад, а мой сначала кормит и чешет овцу и приходит на 3 часа позже, в уже просевший рынок. Переставил порядок, и проигранные миры перевернулись.

🪤 На чём обжёгся
• Тестировал на записях чужих игр, а запись не реагирует на твои действия: +468 на записях и 0 побед из 20 против живого бота
• Сравнивал себя со старой копией публичного ноутбука, а автор выкатил апдейт, который меня и вынес

🏆 Итог
Пик: 350-е место из 10 тысяч команд. Финальный результат будет позже: приём сабмитов закрыт, но агенты ещё доигрывают матчи и рейтинги сходятся.

📊 Фан-факты в цифрах
📦 111 сабмитов на двоих
💾 466 коммитов в моей ветке
🧬 63 версии агента и ещё 155 кандидатов, не доживших до сабмита
🤖 73 прогона обучения RL
🥊 187 чужих агентов из публичных ноутбуков для спаррингов
📼 6771 записанных игр с лидерборда против 3203 команд
⚔️ около 70 тысяч локальных матчей
📄 финальный агент: один файл на 7251 строку
📓 дневник экспериментов на 6784 строки


AI программуля dan repost
Наконец завершили проведение соревнования AIJ по памяти GigaMemory. Это был мой первый очень нервный, но очень интересный опыт проведения такого масштабного контеста.
Огромное спасибо всем организаторам и участникам!

Разобрали топовые решения в хабр-статье:
https://habr.com/ru/companies/sberbank/articles/974310/


Всем привет! 👋

Сегодня буду стоять на постерной сессии на AIJ. Можете подходить и я вам расскажу как мы делали память в GigaChat.


Устал от Литкода? Попробуй другой подход.
Все знают этот рутинный путь к найму в крупные IT-компании: открываешь leetcode.com или neetcode.io и решаешь задачи до тех пор, пока if x != y: не начинает сниться. Процесс необходимый, но откровенно надоедает.

Нашел в Steam игру, которая прокачает твои алгоритмические скиллы под видом увлекательной автоматизации. Называется The Farmer Was Replaced.

🎯В чем суть:
Фермер исчез, и тебе приходится делать его работу, программируя дрона на языке, почти идентичном Python. Твоя задача — автоматизировать все процессы: посадку, полив и сбор урожая.
🟣Сначала всё просто — пишешь линейный код для сбора травы. Потом подключаются условия, циклы, функции.
🟣Кактусы — их нужно отсортировать по высоте, иначе они плохо растут.
🟣Подсолнухи — нужно найти самый большой в каждом ряду. Это уже задача на поиск максимума, а не на симуляцию фермерства.
🟣Тыквы — их состояние зависит от соседних клеток. Привет, задачи на многоклеточные состояния.
🟣А ещё там есть мини-игры: лабиринты (натаскиваешь дрона на поиск выхода) и динозавр (это змейка, которую тебе тоже нужно запрограммировать).

⚡️Почему это стоит попробовать:
🟣Эффективность — опциональна. Можно собрать урожай и неидеальным кодом, а можно сесть и вылизать алгоритм до оптимального O(n), чтобы выжать максимум ресурсов.
🟣Тебя не держат за новичка. Игра не разжёвывает, как решить задачу. Она даёт инструменты (переменные, функции, импорт файлов) и отправляет в свободное плавание. Настоящая проверка на то, умеешь ли ты думать самостоятельно.
🟣Правая ветка технологий — всё. В апгрейдах есть две ветки: на новые культуры и на новые фичи кода. Прокачай правую (с переменными и функциями), и жизнь станет проще. Прямо как в реальной разработке: выбрал правильный стек — и полдела сделано.

Так что, если надоело просто кликать по задачам и хочется по-настоящему увидеть, как твой код оживает и делает работу — заходи. Говорят, после прохождения гигантской тыквы 32x32 любая задачка с binary search tree кажется разминкой.


Dealer.AI dan repost
Вспомнить все: трек памяти для LLM на AIJ contest 2025.

Приоткрыли завесу тайны, что за соревнование, дали пару советов и кое-что пошерили для вас.

P.S. И как вовремя qwen.chat.ai выпустили свой вариант ассистента с памятью. Хороший обзор у коллеги по цеху.

Лайк на Хабре, участие в соревке и ваши мысли, приветствуются ;)

https://habr.com/ru/companies/sberbank/articles/957292/


🚀 VK запустила RecSys Challenge 2025, где можно подраться с настоящей промышленной задачей и крупным призовым фондом.

🎯 Что за соревнование?
Задача здесь зеркальная классической: нужно не подбирать контент под пользователя, а находить целевую аудиторию для нового клипа, который еще никто не видел («холодный старт»).

Формат решения: для каждого нового видео нужно предсказать упорядоченный список из 100 пользователей, которым он, скорее всего, понравится. Главное ограничение — одного пользователя нельзя спамить, он может встретиться в сабмите не более 100 раз.

⚙️ Сложности и данные
🟣Датасет огрооомный: VK-LSVD, это 40 миллиардов обезличенных взаимодействий с 20 миллионами коротких видео.
🟣Метрика: itemNDCG@100.
🟣Лимиты: Не больше 5 сабмитов в день.

🏆 Призы
🟣Общий трек: 850 000 ₽, 600 000 ₽, 400 000 ₽
🟣Студенческий трек: 350 000 ₽, 200 000 ₽, 100 000 ₽

📅 Даты
🟣Регистрация и работа: до 15 декабря 2025
🟣Финал и награждение: 17 января 2026

P.S. Тоже думаю залететь, но пока не ясно сколько у меня свободного времени на это


Сегодня буду на Practical ML Conf. Вы тоже заранее смотрите программу и составляете себе расписание на конфу?)

Кароч выделил для себя интересные доклады, тут в основном все что связано с LLM и RecSys. LLM потому что напрямую связано с моей работой, а RecSys часто встречается в соревнованиях, поэтому надо быть в курсе.

- 14:20-14:55, зал Данные
Память и online-RL: опыт YandexGPT 5.1

- 14:55-15:35, зал Данные
Создание памяти для LLM на примере GigaChat

- 15:45-16:55, зал Сеть
Эволюция UniSRec: от рекомендаций к универсальным эмбеддингам поведения для персонализированных ML-систем

- 17:00-17:45, зал Код
Генеративные рекомендательные технологии: что работает в Яндексе

- 17:50-19:00, зал Серверная
Разбор ошибок при проектировании рекомендательной системы

Также будет доклад про память в GigaChat, мой руководитель расскажет про наши достижения в последнее время 🫶


Пост помощи ❤️

Есть уже собранный компьютер. Задача из него сделать 2 компьютера докупив комплектующие и потом настроить все. Кто за это шарит в лс напишите плиз🙏🏼


Всем привет 👋 , чет я подзабросил группу, но пора возобновлять ее вести.

Во время моего отсутствия я занимался новым проектом связанным с долгосрочной глобальной памятью в LLM. Было перечитано десятки статей, были построены десятки MVP, что-то заработало, а что-то улетело в ящик и возможно навсегда. Пока без подробностей, потому что проект NDA, но можно посмотреть выступление (тайм-код 1:33:00, хз как в ВК видео ссылку с временем сделать) моего лида, он там постарался рассказать как сейчас у нас обстоят дела.

Промежуточным этапом/чекпоинтом нашего проекта стало соревнование AI Journey Contest 2025 в котором мы стали организатором одного из кейсов: GigaMemory: global memory for LLM. На самом деле, создать кейс задача не из простых, наша команда почувствовала себя внутри хакатона длинной в месяц.

В качестве задачи мы предлагаем создать универсальный модуль памяти который можно будет применять с любой LLM. Задача очень интересная и супер актуальная для всего мира. Более подробно можете прочитать в карточке задачи. Мне будет очень приятно если вы поддержите мой труд и поучаствуете. ❤️
Data Fest 2025 в гостях у Сбера! 30 мая, Москва (2)
Присоединяйтесь к трансляции и смотрите выступления от топовых спикеров в тематике GenAI


DziS Science | Data Science dan repost
Привет всем!👋

Ловите подборку мероприятий, на которые можно сходить в ближайшее время:

В 🏦 пройдет Turbo ML Conf
Достаточно интересное мероприятие, включающее большое количество докладов в разных областях DS.

Выступления будут поделены на 5 секций: NLP, Research & RnD, LLM Applications & Copilots, RecSys, CV & Speech

📍Локация: Москва, Раменский бул., 1, кластер Ломоносов
📆 Время: 19 июля
👉 Регистрация по ссылке
👨‍🏫 Формат: Офлайн🕺

В 📱 пройдет dream->teamlead.
Митап для обмена менеджерским опытом. Как заявлено, никаких скучных докладов, только полезные инсайты и кейсы управления командой.

📍Локация: Москва, ул. Льва Толстого, д.16
📆 Время: 19 июля
👉 Регистрация по ссылке
👨‍🏫 Формат: Онлайн 👨‍🏫/Офлайн🕺


В 📱 пройдет AI Dev Day
Митап посвящен опыту разработки и успешного использования AI в промышленной эксплуатации. Позиционируется, как первое мероприятие Яндекса такого рода.

📍Локация: Москва, ул. Льва Толстого, д.16
📆 Время: 27 июля
👉 Регистрация по ссылке
👨‍🏫 Формат: Онлайн 👨‍🏫/Офлайн🕺

В конце июля пройдет конференция Pycon Russia 🐍
Крутая и качественная по наполнению конференция про Python.
Есть отдельно хардовый трек по Python, отдельно Data трек.
Ценник, конечно солидных (билет стоит 28000 рублей). Если есть бюджет компании на мероприятия, постарайтесь выбить и посетить.
Ходил на данную конференцию лет так 5 назад, посетил мастер класс тогда еще Senior NLP Саши (сейчас это уже очень уважаемый человек в области NLP и многим известный блоггер), который в то время показывал RuBert, первый BERT, обученный на русском корпусе.
Также узнал много хардовых штук для оптимизации кода. В общем, эффект для хардов был строго положительный.

📍Локация: Москва, Конгресс-центр ЦМТ, Краснопресненская набережная, 12
📆 Время: 25-26 июля
👉 Информация по ссылке
👨‍🏫 Формат: Офлайн🕺

📱 анонсировал Practical ML Conf 2025
Одна из крупнейших конференций в профессиональной среде от Яндекса, включающая доклады практически по всем основным направлениям. На данный момент регистрация не открыта, но можно "подписаться на событие", что б получить возможность early регистрации. Рекомендую так сделать.

📍Локация: Москва, ул. Льва Толстого, д.16
📆 Время: 27 сентября
👉 Информация по ссылке
👨‍🏫 Формат: Онлайн 👨‍🏫/Офлайн🕺

Пишите в комментариях, куда собираетесь пойти✍️

@dzis_science
#мероприятия

744 0 12 11 14

Искусственный интеллект повсюду…

1.2k 0 19 19 24

алиса олеговна dan repost
Да уж, вот вам и текстовые аугментации

#ShitPost




Теперь вы знаете куда поступать чтобы зарабатывать 300к в секунду 😅


AiConf Channel dan repost
Приглашаем экспертов в data science на закрытую встречу сообщества

Когда: 29 августа, онлайн, в 18:00 по Мск.

Будем обсуждать горизонты профессионального развития в DS и машинном обучении. Темы встречи:

⚡️Как развиваться внутри data science?

⚡️Какие интересные прикладные задачи стоят перед лидерами индустрии?

⚡️Перспективы для сеньора: расти вверх по карьерной лестнице или углубляться внутри своей специализации? Поговорим про вертикальное и горизонтальное развитие

⚡️Где получать практические навыки и обмениваться опытом и связями?

Участники встречи:

- Андрей Кузнецов (AIRI)
- Евгений Смирнов (АЛЬФА-БАНК)
- Роман Поборчий (self-employed)
- Дани Эль-Айясс (Social Discovery Group)
- Владимир Ершов (Яндекс)
- Никита Зелинский (МТС)
- Александр Самойлов (Wildberries)
- Иван Бондаренко (Новосибирский государственный университет)

Встреча пройдет в формате открытой дискуссии, где каждый желающий сможет задать интересующие его вопросы. Участие бесплатное.

✅ Регистрируйтесь на встречу и зовите коллег!


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
А что вас повеселило в последнее время?


̶с̶а̶м̶̶о̶изолента мёбиуса dan repost
Энкодечка мёртв, да здравствует ruMTEB!

Пару лет назад я много писал про сравнение русскоязычных энкодеров предложений по качеству, размеру и быстродействию. Тогда (а на самом деле даже в 2021) я создал бенчмарк Энкодечка, позволяющий выявить оптимальные модели по соотношению этих трёх параметров. И эти три года он был единственным более-менее живым бенчмарком, позволяющим сравнивать такие модели.

Спустя некоторое время появился бенчмарк MTEB, выполнявший похожую роль для английского. В отличие от Энкодечки, MTEB не особо интересуется размером и быстродействием моделей, но в эпоху, когда нейросети с семью миллиардами параметров считаются "маленькими", это вроде как никому особо и не нужно. Благодаря хорошему покрытию задач и простоте добавления моделей, MTEB стал популярен, и в него стали постепенно просачиваться и другие языки (вдобавок к нескольким мультиязычным задачам, включённым туда с самого начала).

И вот совсем недавно что ребята из Сбера добавили в MTEB большую пачку русскоязычных задач (17 новых, вдобавок к 6 мультиязычным задачам из MTEB, где и так уже был включён русский). Это новое двадцатитрёхзадачаное русскоязычное подмножество MTEB достаточно хорошо охватывает все типы задач, присутствовавшие в Encodechka (кроме NER, которое вообще-то не про эмбеддинги предложений, и которое я прилепил сбоку чисто по приколу), плюс покрывает поиск и переранжирование документов - то, чего в энкодечке не было (потому что он фокусировался на отдельных предложениях).

Этот новый бенчмарк совершенно логично прозвали ruMTEB, и отныне рулить будет он.
Динамического лидерборда там пока нет, но в обозримом будущем должен появиться.
Добавлять новые модели в репо энкодечки всё ещё можно, но каких-то серьёзных обновлений я больше не планирую.

Поддерживать популярные проекты приятно. Но когда их можно больше не поддерживать, приятно тоже 🙃


Новая эра оценки енкодеров, скажем спасибо Давиду за детство


Сегодня разобщались со знакомыми на тему собесов и подготовки к ним. Разговор зашел об этапе алгоритмов и я вскользь прокинул что недостаточно знать как решаются алгоритмы, важно еще понимать как устроен язык на котором вы пишите. Один из ребят посоветовал лекции Никиты Соболева. Я как человек который постоянно проводит собесы в девайсах посмотрел, понравилось и вот вам советую. Каждая видеолекция это раскрытие определенной темы и прикольно что он сделал 3 разных уровня погружения в тему: junior, middle, senior.

Кароч пользуйтесь перед подготовкой к собесам, особенно к нам 😉

3.3k 1 141 3 47

Всем привет! Давно ничего не писал и на то есть причина. Наткнулся сейчас на интересный пост и понял что примерно месяц назад поймал себя на этом же. Советую его прочитать и тогда вы поймете в чем причина длительного инактива в канале.

P.S. Кстати чтобы уменьшить «облако суеты» заняло почти месяц. Так что чем раньше вы начнете, тем раньше сможете выдохнуть и начнете продуктивно работать 🫡

20 ta oxirgi post ko‘rsatilgan.