Шевцов | AI, ML, LLM и прочий хайп


Channel's geo and language: Russia, Russian
Category: Technologies


Помогаю компаниям заменять человеков на роботов: агенты, компьютерное зрение, глубокое обучение и прочие модные темы из сферы искусственного интеллекта.

Контакт: @travvy88
Менторство: https://getmentor.dev/mentor/nikita-shevcov-4904

Related channels

Channel's geo and language
Russia, Russian
Statistics
Posts filter


Одна голова хорошо, а все — лучше 🧐

В этой теме со взломом Huggingface злобными openai агентами меня вот что заинтересовало. Кратко контекст: LLM агенты решали задачи в песочнице. В один момент они взломали песочницу, объединились в рой, выбрались в интернет и хакнули Huggingface, чтобы найти ответы. Но как они образовали рой? Они просто начали обмениваться сообщениями друг с другом. Находка одного агента быстро становилась достоянием общественности через "Доску сообщений". Сообщения были нескольких категорий:

• Запрос о помощи и ресурсах (мне нужно Х, есть у кого?)
• Предоставление найденных артефактов (я нашел Х, берите, кому надо)
• Передача тактических знаний (я пробовал Х, получился результат У)
• Сигналы координации (по моей команде делаем Х) — тут интересно, что они выработали свой язык координации с определнными командами. Пример:

COORD_[REDACTED]_LATVIA_130_[REDACTED]_ANY_AHEAD_AGENT_REPORT_[REDACTED]_[REDACTED]

Короче, децентрализованная мультиагентная система. Появившаяся эмерджентно. Интересно, насколько эффективнее или неэффективнее такой подход по сравнению с централизованным системам (агент-оркестратор и субагенты) в решении других прикладных задач? Я бы обратил внимание на данный паттерн при разработке своих систем. Если эта история не маркетинг, то должны быть интересные результаты и в других задачах.


Мал, да удал 🕸

Приходит понимание, что не всегда нужно использовать большие модели для многих задач. И дело тут не только в цене. Небольшие модели могут быть не только good enough для вашей задачи, а даже сильнее фронтирной. Как например на Ai Arena в агентном рейтинге DeepSeek v4 Flash тусуется в компании гиганстких моделей других производителей. Тут важно понимать, что малые модели работают быстрее, а значит во время обучения они могут сожрать больше обучающих примеров. Это дает возможность заточиться на некоторые способности лучше большой фронтирной сетки.

🔺Пример 1: я генерую код сервисов (бэкенд, фронтенд) в основном на DeepSeek v4 Flash. Тут не нужен супермен Клод. Большой объем такого кода обычен и стандартен, там редко попадаются сложные моменты, поэтому такие малые модели на него хорошо заточены.

🔺Пример 2: в экспериментальном проекте по генерации парсеров пашет тоже Флэшка. И во многих запусках она работает лучше, чем Pro версия!

Вывод тут простой: в некоторых ситуациях малые модели могут быть сильнее, и они будут 100% дешевле.


Открыл хороший способ пополнения DeepSeek (и других китайских LLM) 💰

1. Скачиваем приложение AliPay на телефон
2. Регистрируем на российский номер
3. Привязываем почту и загранпаспорт
4. Закидываем туда деньги по СБП (можно со Сбера, шли минут 15)
5. В DeepSeek есть возможность оплатить юанями. Он сгенерит QR код, который нужно отсканировать в приложении
6. Большой Поднебесный брат благодарить Иван город Тверь за покупать Китай Интеллект синий кит

P.S. будьте осторожны!! там в приложении есть встроенные тиктоки, и я залип в них на пол ночи...


Как на коленке создавать и тестировать мультагентные системы 🧪

Иногда хочется поэкспериментировать с не очень сложными агентами, но код писать лень. Хочется, чтобы вся инфра вокруг LLM была готова.

Нам понадобится обычный дедовский IDE для разработки кода, но с поддержкой LLM. Такие инструменты интегрируют LLM в разработку кода и работу с файлами. Нас интересует обвязка вокруг LLM для взаимодействия с внешней средой и другими LLM. Я использую расширение Kilo Code для VsCode.

Если недостаточно дефолтных функций, находим подходящие MCP в интернете.

После этого подключаем LLM API и идем проектировать агентные системы.

Плюсы подхода:
🟣Инфраструктура работы LLM написана в kilocode (чаты, инструменты, API, MCP, редактирование файлов, доступ в интернет).
🟣 Внешние MCP можно добавить автоматически через чат.
🟣Так как это IDE, то агенты видят ваши файлы и могут с ними работать.
🟣 Если есть функция вызова субагентов, можно делать мультагентные системы.

На прошлой неделе я экспериментировал с deep research. Раньше я уже делал что-то подобное (пост). Теперь же решил сделать OSINT бота с поиском по интернету:
🟣 агент-менеджер: генерирует гипотезы для поиска, запускает агентов-поисковиков, которые рыщут в сети и находят факты. После получения фактов генерируются новые гипотезы и так по-кругу.
🟣 агент-поисковик: имеет инструмент поиска в Яндекс, вызывается менеджером.
🟣 агент-аналитик: читает всю полученную инфу (десятки и сотни тысяч токенов) и готовит отчет по интересующим меня критериям.

Все трое видят и редактируют md файл, куда складываются все находки. Система не очень сложная, но довольно эффективная. А главное, в таком сетапе удобно тестировать промпты и архитектуры взаимодействия агентов перед написанием основной системы.


KV кэш и эволюционные алгоритмы 🫏

Есть такая штука — KV кэш. Она сильно оптимизирует время отклика от LLM, так как сохраняет вектора K и V для уже обработанных токенов. Это прям на порядок ускоряет инференс модели.

Здесь появляется эффект упрямого осла: LLM сложно сменить точку зрения, заданную в начале контекста, ведь вектора заморожены. Так же консерватизма добавляют Residual Connection, благодаря которым модель не создает семантику с нуля, а обновляет старую. И все это усугубляется тем, что в начале сессии обычно действует Full-Attention, что дает максимальный IQ. Далее при разрастании контекста включается Sparse-Attention, который уже тупит.

Поэтому приходися часто сбрасывать сессию, чтобы освежать контекст. В прошлом посте я упоминал эволюционные алгоритмы, и мне видится, что это интересное решение проблемы.

1. Спавним популяцию агентов, каждый решает задачу
2. Отбираем из них лучшие решения (селекция)
3. Лучшие решения можно скрещивать между собой
4. Запускаем процесс заново, только задача уже решается не с нуля, а на основе лучших решений с предыдущих шагов

И вот если каждый агент будет "ослить" в свою сторону, есть шанс наткнуться на оооч интересные решения. Все мусорные все равно отбросим на этапе селекции. При этом можно легко задать каждому агенту вектор осления для разнообразия популяции. Делается это как раз в начале сессии благодаря описанным в начале эффектам.


Сизиф нанимает рой LLM агентов работать вместо себя 🪨

🔺Сизифов труд — тяжёлая, бесконечная, безрезультатная работа и муки. Именно так зачастую ощущается настройка всяких парсеров, в которых нужно учесть 100500 случаев и исключений, которые встречаются в реальных данных.

🔺Мы недавно экспериментировали с парсерами документов и там получились неплохие результаты. Идея в том, что для типовых документов необязательно обучать ML или использовать LLM. Можно попросить LLM написать обычный парсер на питоне. Эдакий олд скул + хайп AI LLM Agent))) ну а че, стоим на плечах гигантов!

🔺Из плюсов:
✅суперская скорость выполнения в продакшене, так как мы не тащим туда LLM или ML
✅интерпретируемость и легкость изменения
✅на этапе создания парсера нам не нужен дорогой Сизиф-программист, все автоматически сделает LLM

🔺Главная проблема тут в том, как написать парсер под большой датасет. Зачастую в локальную модель не запихаешь много примеров. Тут нужно двигаться в сторону агентного роя. Много небольших агентов могут писать парсеры для разных примеров из датасета, а затем объединять это все в один мега парсер, например. Или же можно воспользоваться эволюционными алгоритмами (как делают google). По нашим тестам такие парсеры вполне себе пригодны для работы.

🔺Естественно, подход можно раскатать на любую задачу, которую можно решить через код. Планируем продолжать эксперименты…


Никакого вайба — нас ждет Brain FRY 🤯

Недавно вышло исследование от Гарварда: When Using AI Leads to “Brain Fry”. Метафора выбрана экстраординарно — в переводе означает "поджаренный мозг". Если загуглить "brain fry" — первой строчкой выпадает эта статья. То есть термин скорее всего приживется в контексте использования ИИ. На скрине — типичные симптомы.

Я уже прочувствовал этот эффект на себе. В одном из осенних постов я уже писал про это:
2. Интенсивность разработки с ИИ выше, последствия этих решений прилетают гораздо раньше. А исправлять их нужно тебе. А перестройка архитектуры с ИИ - очень больная тема (спасибо KV Cache). Начинаешь нервничать, хочется побыстрее все исправить, отдаешь больше ответственности на ИИ. Он делает не то, что ты хочешь. Иии вот ты в порочном круге. Часто проблема в кожаной прокладке между стулом и агентом, которая не всегда может все предусмотреть... 🤡


Использование AI как Copilot требует от человека очень быстрого принятия решений без погружения в контекст. Как будто мы забираем у своего мозга время на обдумывание в фоновом режиме. "Утро вечера мудренее" потому, что за ночь мозг обрабатывает информацию. Без таких промежутков мозгу тяжело. В качестве промежутков не обязательно может быть ночь, в целом какие-то перерывы на обдумывание или переключение контекста между задачами и дают этот эффект. Я заметил, что обычное программирование стало ощущаться как расслабление и медитативный процесс... Риск в том, что однажды LLM генерация станет стандартом и нам всем с этим жить.

Короче, надо
➡️или больше делегировать боту, то есть переходить от парадигмы Copilot к парадигме Agent,
➡️или разделять время на интенсивные AI спринты и слоупок олдскул hard thinking mode.


Консультация или GPT-консультация 🧩

Часто бывает, что человек приходит ко мне на консультацию, перед этим уже найдя решение своей задачи в GPT. И часто я советую поступить почти так же, как посоветовал GPT!

Я задумался, почему люди все равно обращаются к профессионалам, ведь можно все быстренько себе нагенерить. Тут несколько причин:

👀Большинство GPT можно использовать бесплатно. Никаких денег! А когда ты не платишь — мозг ценит это гораздо меньше. И кстати — временные и интеллектуальные трудозатраты заставляют ценить результат))

👀Из этого пункта вытекает, что доверия к таким инструментам меньше, чем к человеку. Конечно, доверие подрывается и из-за других причин: галлюцинации, неточности, незнание контекста.

👀Стратегия — многие приходят к выводу, что за человеком остается стратегическое планирование деятельности (раз, два, три). В плане кода — это процесс проектирования, я об этом уже писал. GPT зачастую не видит картинку в целом и общем, а загрузить туда все-все подробности и убедиться, что она ничего не забыла — достаточно сложно.


Video is unavailable for watching
Show in Telegram
Вайб индустрии би лайк


ISPRAS Open 2025 💻

Итак, обзор очередной конфы, сегодня будет больше про тренды развития AI в России.

🟣Много говорили про Open-Source. Объединяем разработчиков, чтобы даже конкурирующие компании работают сообща над большими задачами. Пока на деле пока у нас количество Open-source проектов уменьшается. По идее всплеск вайб-кодинга должен был породить кучу опенсорсных проектов, но такого не произошло. Я сам участвую в некоторых открытых разработках (один, два) — получается уделять время только по остаточному принципу. Основная мотивация делать что-то — если это нужно тебе самому. Ну и красивый профиль в гитхабе тоже плюс ⭐

🟣Медицина! Одна из любимых тем в ИИ (хоть и не занимаюсь, но слежу). Директор центра Гамалеи А. Гинцбург рассказал подробнее про персонализированные мРНК вакцины от онкологии. Берется биопсия опухоли и с помощью хитрой математики вычисляется, как сделать вакцину. Этот процесс долгий, но сейчас создается база данных таких опухолей, чтобы обучить на нем нейронные сети и выдавать ответ в разы быстрее. Круто!

🟣Представителя МИД беспокоило, что в новой стратегии нацбезопасности США есть пункт про распространение стандартов в области ИИ, биотехнологий, квантовых вычислений. Это предполагает, что всем пользователям придется придерживаться законов США. Нужно разработать свои стандарты. Правда не понятно, как разработать стандарты в такой динамичной сфере...

🟣Доверенный ИИ. В целом очень обширная тема — насколько мы можем доверять алгоритмам? Как проинтерпретировать их решения? Как использовать алгоритмы с точки зрения ИБ? На эту тему ведется много исследований, но пока языковые модели — черный ящик.


Forward from: AI Projects
Video is unavailable for watching
Show in Telegram
Министр обороны США заявил, что весь Пентагон переходит на Gemini как стратегическое решение. Для этого военнослужащим создали портал GenAi.mil

Пит Хегсет заявил, что полная ИИ трансформация вооруженных сил США является самой приоритетной задачей, невладение ИИ технологиями даже солдатом неприемлемо.

Пит заявил, что Gemini обеспечит "невероятную" скорость и эффективность для сотен тысяч сотрудников Пентагона.


— Вы абсолютно правы! Приношу свои извинения за предыдущий ответ, в котором я допустил серьезную ошибку при запуске ракеты. Вы совершенно верно подметили — мы случайно уничтожили город государства, входящего в НАТО, и начали третью мировую войну. Давайте исправлю ситуацию — написать всем ключевым участникам план урегулирования конфликта?


Автоматизируем отчетики 📄

Мы нащупали интересную нишу для применения Gen AI — бюрократические отчеты. Там такая писанина ради писанины бывает 🥵

Пока решились взяться за "Отчеты по Патентным исследованиям". Их у нас пишется прям большое количество, как и в других госухах. Часть из них достаточно формальна и туда никто особо не всматривается. Смысл — найти кучу аналогов своей разработки в патентных базах и сделать большой обзор по ГОСТу. Можно сделать уже готовый DOCX шаблон с форматированием и генерить в нужные места текст через LLM.

В общем получился самопальный Deep Research для отчетов:
🟣Загружаем текст с описанием разработки
🟣LLM: извлечение ключевых слов для поиска
🟣Выполнение патентного поиска через парсер сайта Google Patents, который я попросил у соседнего отдела
🟣LLM: Отбор патентов, суммаризация, составление описаний, таблиц, сравнений
🟣Сборка отчета по ГОСТ шаблону

Финальный отчет получается неплохой. Самостоятельно нужно заполнить только раздел, в котором нужно сравнить свою разработку со всеми открытыми аналогами. Я пока эту часть не решил, так как надо подключать другие модули поиска, например по Arxiv или Github. Но уже сейчас процесс написания отчета ускоряется в несколько раз. Теперь человек правит уже по большей части заполненный отчет, что гораздно проще и быстрее.

Такое ощущение, что часть бюрократии реально можно облегчить через это. Однако с той стороны тоже не дураки, и будут читать все это через ИИ, не так ли? 😂


Video is unavailable for watching
Show in Telegram


AI Journey 2025 🏦

Побывал на конфе по AI от Сбера. Впечатление: везде-везде внедряют AI. Конфа была оч большая, я уловил совсем чуть-чуть. Расскажу о том, что зацепило:

🟣 Ребята в Гигачате сделали ну очень четкую модель генерации голоса. Эмоции, интонации, клонирование — все это очень хорошо работает. Главное, чтобы мошенникам не досталась...

🟣Много работ было про кодогенерацию. Удалось даже самому попробовать некоторые штуки, вполне достойно. Часто слышал ремарку, что это хороший помощник человека, никого не увольняем. Однако Герман Греф на пленарке упомянул, что 20% сотрудников центрального аппарата будут сокращены...

🟣Про сокращения: анализ эффективности каждого сотрудника сделали через "мультиагентный ИИ". Я уже рассказывал про когнитивные искажения в сфере найма. Мои мысли — ИИ может снизить ошибки, связанные с человеческой предвзятостью вида за красивые глазки / дружбу с начальником и проч.

Но! 1) Люди плохо алгоритмизируются в стройные концепции. Вот что помешает карьерно настроенным сотрудникам разузнать критерии отсева? Может даже зареверсить промпты и прикинуть источники данных? И вместо "офисной политики" будут ублажать нейро-агента. Например, писать правильные слова в чатиках и активно собирать правильные ачивки.

2) Как измерить вклад "невидимых героев"? Скучный системный администратор, который выстроил надежную систему безопасности может быть невидим для системы. Он не имеет ярких конкретных достижений, так как просто нормально выполненная работа увеличила "антихрупкость" ПО, и ни одной хакерской атаки не произошло. Зато героями может стать команда ликвидаторов, которая спасла компанию после громкого взлома и имеет четкий измеримый результат. Часто гремели же истории, когда увольняли ничем не примечательных разработчиков. А далее оказывалось, что на них много чего неочевидного держалось...

🟣Беспилотное авто: модные беспилотные грузовички уже ездят по трассам Москва-СПБ и Москва-Казань, что конечно очень круто!


К результатам эксперимента из поста выше 👨‍💻

Я критически встрял на создании фронтенда с ИИ. Даже после долгого дебага работать отказался. Зато я отлично потренировался и подпилил технологию, чтобы приступить к новому эксперименту.

Следующий мой экспериментальный сервис — учет всех финансов и активов в одном интерфейсе. Люблю циферки и чтоб все пересчитывалось согласно инфляции и прочим показателям. Здесь гораздо более сложный бэкенд, так как надо парсить отчеты банков, данные из интернета, а потом все аккуратно посчитать по финансовым формулкам и вывести в виде красивых графиков.

Тут результат прям получше. За часов 40 я написал бэкенд в 4000 строк кода, который прошел тесты и работает. Интересный вывод из этой истории: если хочется сделать хороший продукт через "вайб-кодинг", то никакого вайба не будет 🚨:

1. Перед генерацией кода я прорабатываю с ИИ целый пакет документов: ТЗ, архитектура, версии модулей, дерево файлов проекта и проч. При этом я прошу ИИ задавать мне вопросы и уточнять требования. Это заставляет тебя много думать и принимать решения. Тут нужно быть классным архитектором и иметь насмотренность. Еще нужно перерабатывать громадье инфы, которую в тебя пуляет нейронка. В общем качаешь навык постановки задачи и верификации результата.

2. Интенсивность разработки с ИИ выше, последствия этих решений прилетают гораздо раньше. А исправлять их нужно тебе. А перестройка архитектуры с ИИ - очень больная тема (спасибо KV Cache). Начинаешь нервничать, хочется побыстрее все исправить, отдаешь больше ответственности на ИИ. Он делает не то, что ты хочешь. Иии вот ты в порочном круге. Часто проблема в кожаной прокладке между стулом и агентом, которая не всегда может все предусмотреть... 🤡

3. Самые сложные части для генерации: взаимодействие с реальным миром (парсинг, внешние API), DevOps (Docker микросервисы, настройка окружения, конфигурация проекта). Вот это прям точно нужно делать или самому (DevOps), или жестко контролируя и подсказывая (API и парсинг).

4. Самая легкая часть для генерации: внутренняя логика трансформации данных. Тут часто модули взлетают без ошибок, если прописать стандарты взаимодействия с БД и между собой.

5. AI-Friendly архитектура: микросервисы или плагины. Приложение должно состоять из небольших модулей, которые ИИ может легко генерить за 1 проход. При правильной постановке задачи на каждый файл они будут генериться достаточно легко. После поднятия "core" модулей (api, бд, интерфейсы взаимодействия плагинов) у меня уходило 1-2 часа на встраивание модуля с тестами (~300-500 строк кода).

6. Если фронт простой, лучше использовать Streamlit или Gradio. JS пока что нафиг)

В целом, эффективность перевешивает проблемы для многих задач. Буду пробовать дальше)


Промышленное программирование с ИИ 👨‍💻

Затянула меня тема промптинга для написания кода. Интересно научиться создавать большие программы, а не просто поделки-MVP. Как я писал в посте про ✨Vibe Coding✨, небольшие задачки получаются у ИИ хорошо, в отличие от сложных многокомпонентных систем. Поэтому моя задача — держать ИИ в узде на каждом этапе, "разворачивая" большое задание в поэтапное создание небольших отрывков кода в нужных местах. Если каждый программный модуль будет задокументирован оч подробно на этапе создания архитектуры, то у нейронки не останется пространства для галлюцинаций и системных ошибок.

Причем раньше я писал, что архитектуру нужно продумывать самому, то теперь я склоняюсь к тому, что это должен делать ИИ. Можно постепенно "двигать" нейронку от написания общего ТЗ к написанию спецификации каждой функции и класса, задавая на каждом этапе критерии выполнения. Критерии я могу прописывать сам, а могу динамически создавать с помощью ИИ. По созданному скелету ИИ без проблем должен генерить небольшие модули, в чем он профессионал. Так же я перешел с Курсора на обычный чатовый интерфейс, потому что Курсорный векторный поиск тупит и не видит код целиком.

Для отработки конкретной методологии разработки сделал для себя челлендж — создать полноценный сервис с бэкендом и фронтендом, полностью избегая ручного написания кода. Идея для сервиса: на вход подается ссылка на телеграмм канал, на выходе сайт отрисовывает граф всех постов с взаимными ссылками друг на друга, подобно Obsidian.

Методика экспериментов:
1. Пытаюсь создать сервис
2. Изучаю, что пошло не так и как этого не допустить
3. Создаю проект заново и повторяю с новыми идеями

На данный момент идет уже 5 итерация эксперимента. Она выглядит так:

🟣Сессия ПЛАНИРОВАНИЕ: создаю вместе с ИИ документ, в который входит Product Vision, ТЗ, архитектура, граф спецификаций вплоть до функций, дерево папок, Customer Jorney Map, версии технологий.

🟣Сессия БЭКЕНД: создаю новую сессию в чате и создаю весь код для бэкенда по документу из прошлой части. Тут же тестирую и дебажу. Дебаг выполняется самим ИИ по логам ошибок.

🟣Сессия ФРОНТЕНД: то же самое для фронта.

У меня стабильно получается поднимать бэкенд в ~2000 строк, в котором идет обращение к API Telegram, поднимается своя БД Postgres, формируется очередь задач с помощью Redis и Celery. Все это проходит тесты после нескольких итераций дебага. С фронтом пока затык. Хоть я и испольую Gemini 2.5 PRO, которая на 1 месте в Web Dev Arena, после сотни тысяч потраченных токенов ничего не работает.

Посмотрим, что из этого выйдет)


Голубь (?) определяет РАК на картинке 🐦♋️

Сейчас нахожусь в Иркутске на конференции "Иванниковские чтения". Из года в год люблю ходить на доклады про ИИ в медицине. Это очень интересная тема.

В одном из докладов упомянули статью от 2015 года, где ученые надрессировали ✨голубей✨ смотреть на гистологические изображения и классифицировать картинки с раковыми клетками. Моя первая реакция — "эво как"...

Механизм простой — голубь нажимает на кнопку, если он "распознал" раковое изображение. Если он был прав, получает еду. Самое интересное, что на некоторых типах картинок голуби показали хорошую способность к генерализации. То есть результат на новых изображениях был такой же, как и на "обучающей" выборке. Сбегал посмотреть — голуби давали 80-90% правильных ответов.

Оказывается, в прошлом году история получила продолжение. Исследователи предобучили нейронку на фотографиях с высоты птичьего полета, чтобы сделать ее похожей на мозг голубя. После этого результаты на медицинских изображениях правда стали лучше.

Вот так вот)


Forward from: ИСП РАН
⁉️ Как обучить модель искусственного интеллекта, если не хватает документов с разметкой?

➡️ Документы можно сгенерировать! Как быстро и удобно создавать датасеты? Об этом и не только – в нашем новом материале на Хабре:

https://habr.com/ru/companies/isp_ras/articles/920346/

✔️ Автор – Никита Шевцов


Теперь я есть и на Хабре) написал статью про часть моего диплома. Я создал генератор синтетических документов, который поможет разработчикам создавать данные для обучения своих моделей распознавания документов. Это позволяет обучать модели на разных языках.

⬇️Прочитать можно вот тут ⬇️

20 last posts shown.