Фильтр публикаций


🔬👕👗 QuantFit-VTON: диффузионная модель, которая действительно умеет виртуально примерять одежду «по размеру»

Современные диффузионные модели виртуальной примерки выдают фотореалистичные картинки, но реально не контролируют посадку: подол новой вещи чаще всего просто повторяет длину исходной одежды на фото, независимо от заявленного размера.

Авторы предложили QuantFit-VTON - модель на базе SDXL с отдельным энкодером измерений, который получает явные числовые параметры человека и одежды (рост, длина, ширина) и встраивает их прямо в генерацию через cross-attention. Дополнительно добавлены геометрические лоссы, контролирующие длину подола и силуэт.

📊 Как результат, модель достигает фотореализма на уровне лучших аналогов и при этом является лучшей по геометрической точности среди всех сравненных методов.

📄 Эта работа - часть диссертационного исследования одного из выпускников нашей лаборатории, опубликована в IEEE Access. Ознакомиться с успехами в разработке новой виртуальной примерочной можно по ссылке.

🔬 iMak AI Lab
😌 iMak AI Lab


🔬 IHIE: физика встречается с deep learning в мониторинге промышленного оборудования

Как понять, что турбина, станок или двигатель скоро выйдут из строя еще до того, как это произойдет? Существующие DL-модели для мониторинга износа оборудования обычно оценивают лишь одну характеристику деградации, игнорируя физические принципы, которые описывают, как реально «стареет» техника.

Наши исследователи представили новый подход и модель IHIE (Industrial Health Index Extraction) для мониторинга состояния промышленного оборудования, объединяющую данные с сенсоров и физические уравнения деградации.

Обычно нейросети «загоняют» скрытое представление устройства под одну конкретную характеристику, например, только под остаточный срок службы. Мы решили иначе: пусть система одновременно учится предсказывать сразу несколько показателей состояния устройства и сверяет их друг с другом. Это работает как перекрестная проверка, в результате которой модель меньше галлюционирует насчет нереалистичных сценариев износа и ее решения становится проще объяснить.

📊 Модель протестирована на двух эталонных промышленных датасетах NASA:

✔️NASA C-MAPSS (предсказание оставшегося срока службы турбовентиляторных двигателей): IHIE превзошла все современные аналоги (GNMR, RVE, DSFormer, MSTCN и др.) по RMSE на всех 4 подвыборках датасета;
✔️ NASA Milling (предсказание износа резцов): RMSE = 0.0056 — заметно лучше конкурентов (LSTM-based: 0.0148, TAKELM: 0.0134);
✔️ Модель содержит всего 5.1 млн параметров и работает со скоростью ~14 мс на инференсе на видеокарте V100;

🔧Систему можно внедрить для решения задачи мониторинга авиационных двигателей, станочного оборудования, любых промышленных систем с сенсорами: от предиктивного обслуживания до раннего обнаружения аномалий.

Для тех, кто работает с промышленным ИИ или анализом временных рядов, мы как всегда открыты к сотрудничеству

🔬 Наш сайт
😌 Наш ТГ


🔬🥲 CAFAS: как научить ИИ слышать эмоции в голосе и делать это легковесно

Голос выдаёт эмоции даже без слов: тон, темп, дрожь - всё это сигналы, которые слышит человек интуитивно. Наша задача - научить этому же нейросеть, причём так, чтобы для запуска модели не нужно было тратить кучу денег на аренду серверного GPU, а развернуть ее на обычном устройстве.

Наша команда представила новую архитектуру для распознавания эмоций в речи.

Современные SER-модели показывают хорошую точность, но платят за это огромным количеством параметров, становясь тяжёлыми и медленными. При этом большинство моделей опираются либо на акустические признаки (тон, частота), либо на семантические эмбеддинги из self-supervised моделей, но редко объединяют оба типа сигналов эффективно.

Наша архитектура CAFAS объединяет два потока информации через механизм cross-attention:
🎵 Акустическая ветка — MFCC-признаки проходят через специальный энкодер (LSTM + трансформер), который учит их «общаться» друг с другом;
🗣 Семантическая ветка — Wav2vec2.0 извлекает контекстуальные представления речи
🔀 Cross-Attention Fusion — запросы берутся из акустических признаков, а ключи и значения — из семантических, что позволяет модели выборочно подсвечивать релевантные детали

Дополнительно добавлен вспомогательный классификатор для более стабильного обучения.

📊 Немного сухих но показательных цифр

На датасете IEMOCAP (12 часов диалогов с аннотированными эмоциями) модель достигла:
✔️74.6% Weighted Accuracy, что делает модель конкурентной с современными аналогами;
✔️ Среди всех сравниваемых моделей CAFAS показал лучший показатель Unweighted Accuracy;
✔️ Всего 112 млн параметров, что почти в 3 раза меньше некоторых альтернатив (сравнимая модель с 317М параметров показывает похожую точность)
✔️ Латентность 24 мс на GPU, что для реальных приложений является практически мгновенным откликом

Модель показывает 91.87% точности лучшего бейзлайна, используя лишь 49.1% его параметров. Отдельно интересно: анализ attention-карт показал, что модель действительно «замечает» ключевые эмоционально нагруженные слова и игнорирует паузы, что делает её решения интерпретируемыми.

Применений этой модели может быть великое множество: от голосовых ассистентов до мониторинга психического здоровья - иными словами, везде, где нужно понимать не только «что» сказал человек, но и «как».

Если вы занимаетесь речевыми технологиями, обработкой аудио или HCI, мы открыты к коллаборации 🤝

🔬 Наш сайт
😌 Наш ТГ


🔬 Ранее мы рассказывали о нашей экосистеме инструментов для распознавания и перевода древнеегипетских иероглифов: датасетах MEH и MuMMy, инструменте pyThoth и полном пайплайне перевода. С тех пор проект сделал важный шаг вперед: от лабораторных метрик мы перешли к тестированию с участием реальных пользователей.

⭐️⭐️ На ACM CHI 2026, одной из ведущих мировых конференций по взаимодействию человека и компьютера, команда представила прототип веб-приложения, реализующего наш пайплайн, и результаты первого пользовательского исследования. В этот раз в команду вошли не только AIRI, ИСП РАН и ИТМО, но и Кембриджский университет с египтологической экспертизой и постановкой практических задач для системы.

📖 По фотографии надписи приложение последовательно формирует: коды Гардинера (стандарт классификации знаков), научную транслитерацию и перевод на английский. Вместо одной большой модели мы разработали конвейер из более компактных, каждая со своей узкой задачей: разметка строк и колонок, выделение отдельных знаков, сопоставление с каталогом, восстановление порядка чтения. На каждом шаге специалист может проверить и скорректировать результат.

⏳Восемь профессиональных египтологов и студентов выполняли одинаковые задачи с системой и без нее. С системой в среднем процесс занял 48 минут против 60, причем качество распознавания, транслитерации и перевода оказалось выше, чем при полностью ручной работе.

«Египтология — это чрезвычайно узкое сообщество, активно работающих специалистов в мире совсем немного, и собрать даже несколько из них на многочасовое исследование уже непростая задача. Для дисциплины такого размера восемь участников — это заметная часть доступного профессионального круга. Сам эффект мы считаем значимым: ускорение работы и сокращение ручных поисков по справочникам проявились не на уровне статистической погрешности, а вполне ощутимо, повторяясь от участника к участнику».

Подход и методика генерации синтетических данных уже адаптированы под другие древние письменности, статьи об этом приняты на международные конференции. А накопленный опыт синтеза данных нашел применение и в совершенно другой области распознавании русского рукописного текста. Но это уже совсем другая история)

🔗Полную версию интервью для издания "Коммерсантъ" по нашей работе можно прочитать на сайте.

🔬 Наш сайт
😌 Наш ТГ


Видео недоступно для предпросмотра
Смотреть в Telegram
Летел на конфу в LA, на пересадке высадили, долго куда-то везли на допрос, спросили Испания или Аргентина, дали кепку и посадили на 2 часа 😅😂⚽️🇦🇷


🙂🙁 Может ли ИИ понять по едва заметным жестовым маркерам без единого слова распознать эмоции человека? У нас есть ответ.

В рамках международного соревнования MiGA 2025 на базе IJCAI мы разработали две системы, которые анализируют видео и распознают:

✔️Микрожесты - мельчайшие движения рук и пальцев (всего 32 класса жестов);
✔️Эмоции по поведению - позитивное или негативное состояние, определенное исходя из движений тела и мимики.

В чём сложность? Обычные модели видят либо картинку, либо скелет человека, и работают с чем-то одним. Мы научили нашу систему объединять оба потока информации: видеоряд и трехмерные координаты суставов. Для этого был разработан специальный модуль слияния, который находит связи между визуальными признаками и позой тела в каждый момент времени. Дополнительно модель накапливает «память» о типичных представителях каждого класса жестов и уточняет свои предсказания, сравнивая новые примеры с уже изученными.

Для распознавания эмоций система одновременно анализирует общий контекст видео и детали лица через отдельные потоки, которые постепенно обмениваются информацией друг с другом, так же, как разные отделы нашего мозга работают совместно при считывании чужих чувств.

🥈В треке по распознаванию эмоций мы заняли 2-е место среди всех участников соревнования.

Такие технологии открывают путь к системам, которые могут понимать эмоциональное состояние человека в самых разных реальных сценариях: от клинической диагностики до адаптивных интерфейсов и систем обратной связи.

🔬 Наш сайт
😌 Наш ТГ


🔬🛣 Каждый год в регионах проводится перекраска дорожной разметки, но проводится она не по мере износа, а по расписанию. Вот только есть нюанс: разметка стирается не по расписанию. Как итог - одни участки красят раньше времени, когда обновление разметки еще не требуется, а другие - когда зебры или стоп-линии становятся едва заметными.

Мы сделали шаг к тому, чтобы это изменить.

Наша команда создала LCRM - датасет дорожной разметки, с которым можно обучить модель не просто находить разметку на снимке, но и понимать, в каком она состоянии: всё хорошо, пора наблюдать или срочно перекрашивать.

🚙Такую систему можно установить на специализированные машины дорожных служб или городские автомобили. Они едут по своим маршрутам, и параллельно автоматически оценивают состояние каждой разметки на пути. Никаких ручных обходов, никаких сюрпризов: город получает актуальную карту износа и может планировать ремонт заранее.

📹 Мы использовали линейную камеру, которая снимает дорогу равномерно, без перспективных искажений, которые мешают обычным видеорегистраторам четко видеть тонкие полосы разметки. Съемка проходила в Москве, Петербурге и Подмосковье, в разное время суток. Итог: более 20 000 изображений с 12 типами разметки и тремя уровнями износа.

Лучшая из протестированных моделей распознает разметку с точностью IoU 91.5%: это уже близко к уровню, пригодному для реального применения.

Датасет открытый, и его может использовать любая команда, которая работает над безопасностью дорог или автономным вождением.

🔬 Наш сайт
😌 Наш ТГ


🔬 🚗Наши исследователи научили машины «общаться» интеллектуальнее

Представьте: каждый автомобиль постоянно генерирует гигабайты телеметрии: обороты двигателя, давление тормозов, температура охлаждающей жидкости и десятки других параметров. Передавать все это по беспроводной сети в системах V2X «Vehicle-to-Everything» (буквально, «автомобиль ↔ всё») - это огромная нагрузка на канал связи. Как ее снизить на порядки, не теряя смысл данных?

✅ Именно эту задачу решает Car2Vec - наш новый фреймворк на основе контрастивного самообучения.

Как это работает?
Вместо того чтобы передавать поток сырых данных, бортовое устройство прямо на автомобиле «сжимает» всю телеметрию в компактный вектор из 40 чисел — семантическое описание состояния машины. Именно этот вектор и отправляется дальше: другим автомобилям, светофорам, серверам.

Что показали эксперименты?
✔️ Модель на основе GNN научилась без какой-либо разметки разделять поездки на кластеры в скрытом пространстве
✔️ Дополнительно выявились кластеры по марке топлива и вязкости моторного масла, хотя модель этому явно не обучалась
✔️ Задержка вывода на мобильном процессоре с NPU менее 1 мс, что делает систему пригодной для работы в реальном времени

Подход снижает беспроводную нагрузку на порядки величин по сравнению с передачей сырой телеметрии.

В дальнейшем мы планируем провести тестирование на парке из 100+ автомобилей, а также провести интеграцию с задачами совместного вождения.

⭐️⭐️ Статья представлена на ACM MOBICOM '25 в Гонконге

🔬 Наш сайт
😌 Наш ТГ


🔬🎓Исследователи iMak AI Lab с командой из ИТМО приняли участие в открытии совместной лаборатории

Вчера состоялось официальное открытие новой лаборатории «Мультиагентный интеллект и адаптивные системы» совместно с Университетом ИТМО.

Здесь мы с нашими коллегами будем разрабатывать ИИ-системы нового поколения: те, что самостоятельно ищут информацию, принимают согласованные решения, адаптируются к изменяющимся условиям и работают как единая исследовательская команда. Применений новым открытиям может быть масса: от автоматизации бизнес-процессов до генерации и рецензирования научных статей (этому направлению, кстати, будет уделено особое внимание).

«Команда iMak AI Lab уже давно и продуктивно взаимодействует с коллегами из ИТМО в рамках совместных исследований в области мультиагентных систем. Новая лаборатория станет настоящей точкой притяжения для талантливых студентов и молодых учёных, которые смогут включиться в работу над нашими фреймворками эволюционных мультиагентных систем и приблизить их практическое применение в реальных задачах».


📩Лаборатория открыта для студентов, магистрантов и аспирантов, владеющих навыками ML и программирования. Хочешь присоединиться? Отправь резюме на smuravyov@itmo.ru и пройди собеседование.

🔬 Наш сайт
😌 Наш ТГ


🔬 К слову, речь идет о нашем ИИ-рисерчере, про который мы рассказывали ранее.

SciForge - это рабочий инструмент, который уже превосходит своих конкурентов и помогает исследователям прийти от размытой идеи к вполне конкретной научной статье за часы, а не недели, как это было раньше.

🔬 Наш сайт
😌 Наш ТГ


Репост из: ИСП РАН
✏️На «Иванниковских чтениях»представили систему, способную автоматизировать полный цикл исследования до написания научной статьи

О разработке рассказал Илья Макаров (AIRI, ИСП РАН, Университет Иннополис) в рамках секции «Управление данными и искусственный интеллект». Сегодня система также обсуждалась на конференции в рамках пленарной дискуссии и проектной сессии «Доменные ИИ-пилоты для развития научных исследований».

Разработка уже продемонстрировала практический результат: с её помощью были подготовлены две научные статьи, опубликованные на ведущих международных конференциях уровня A*.

Создание данной системы демонстрирует фундаментальный сдвиг в исследовательской деятельности под влиянием ИИ: приоритет смещается с формального выполнения публикационных требований на достижение измеримой практической пользы. Роль исследователя трансформируется в определение социально и технологически значимых задач, тогда как инструментальная часть научного цикла будет автоматизирована современными ИИ-решениями,

— отметил Илья Макаров.

💬ИСП РАН в Telegram
💬ИСП РАН в МАКС


⌨️ На конференции Data Fusion мы приняли участие в дискуссии о том, как ИИ меняет профессию ученого, а также о кризисе публикаций, закрытии технологий и новой логике карьеры в науке

Участники сессии зафиксировали шесть сдвигов, уже меняющих правила игры:

✔️ Поток статей стал настолько огромным, что следить за ним физически невозможно. Знаком качества теперь служит имя лаборатории, а не журнал или конференция;
✔️ Фронтирные компании (OpenAI, Anthropic, DeepMind) публикуют результаты, но не раскрывают архитектуру и методы. Даже исследователи больше не знают, за счёт чего модели становятся лучше;
✔️ Математика остаётся исключением - это одна из немногих областей, где учёный может работать ради самого знания, без прикладного заказа;
✔️ Бизнес встраивается в исследования на ранних этапах, а не ждёт готового результата;
✔️ Новая стратегия выживания — искать области на стыке дисциплин, куда LLM ещё не добрались. Как отметил Илья Макаров, синергия специалиста по ИИ с экспертом из другой области даёт куда больший импакт, чем «прожимание метрик в конкретной маленькой модели»;
✔️ Сам исследователь становится активом для прямых инвестиций — академический путь перестаёт быть единственным.

«Если ты что-то делаешь полезное, то это должно быть не про понимание, а про то, что когда-то, через год, три, десять оно должно сконвертиться в ощутимый результат».


Полный разбор сессии → https://kod.ru/kak-ai-menyaet-nauku-uchenyh-i-biznes

🔬 Наш сайт
😌 Наш ТГ


Артём Липиньски из нашей совместной лаборатории с СПбГУ в пятницу представит промежуточные результаты работы над арабской языковой моделью.

О том, как мы собираем данные, строим пайплайн обучения и адаптируем LLM к низкоресурсным языкам расскажет на трансляции в эту пятницу👆


Репост из: Sinекура
Следующий анонс — на семинаре лаборатории Маркова мы теперь внезапно займёмся арабским языком:

Создание арабской языковой модели методом непрерывного дообучения (continuous pretraining)
Ссылка на трансляцию (пятница 8 мая, 14:00)

Артём Липиньски (Санкт-Петербургский государственный университет)

Арабский язык — один из крупнейших в мире по числу носителей, однако современные языковые модели работают с ним заметно хуже, чем с английским или китайским. Причина проста: качественных арабских данных в открытом доступе катастрофически мало, а существующие модели обучались преимущественно на англоязычных текстах.

В докладе будет представлена работа по созданию арабской языковой модели, которая способна осмысленно понимать и генерировать текст на арабском, при этом оставаясь достаточно компактной для практического применения.

Будет рассмотрено:

— как собрать и подготовить большой качественный корпус текста с нуля;

— почему смешение языков в обучающих данных помогает, а не мешает;

— полный pipeline адаптации LLM к новому языку, от сбора данных до SFT (с разбором того, как эффективно пройти каждый этап и каких ошибок избежать).

Результаты работы актуальны для всех, кто занимается адаптацией LLM к низкоресурсным языкам: подходы применимы далеко за пределами арабского.

#markovlab #seminar #spsu


🔬👨‍💻 Наша команда предложила решение проблемы распределения задач в команде разработчиков при помощи ИИ

Представьте: в крупной IT-компании тысячи задач и сотни разработчиков. Как автоматически назначить нужного человека на нужную задачу, учитывая не только прошлый опыт, но и контекст — описание задачи, коммиты, роль и профиль разработчика?

Именно эту проблему решает SODAOpt — наш трансформерный фреймворк для умного распределения задач в разработке ПО.

В чём проблема существующих подходов?
Большинство систем опираются на статические идентификаторы (ID разработчика) и историческую статистику — и полностью игнорируют семантику задач и социально-демографический профиль специалиста.

Как работает SODAOpt?
✔️ Текстовый энкодер на базе E5-large извлекает смысл из описаний задач и коммитов;
✔️ Адаптивные слои объединяют текстовые признаки с профилем разработчика;
✔️ Составная функция потерь сочетает контрастивное обучение с оптимизацией назначений;
✔️Поиск оптимального матча выполняется через FAISS-индекс.

Иными словами, модель «читает» описание задачи и одновременно изучает профиль разработчика: его опыт, роль и отдел. Затем она совмещает эти два потока информации и находит наилучшее соответствие: кому из команды эта задача подойдёт больше всего. Чем больше контекста — тем точнее назначение.

Модель в разы превосходит конкурентов как в ID-only, так и в text-only подходах.

📄 Статья опубликована на ACM FSE Companion '25 (Тронхейм, Норвегия)
💻 Код: https://github.com/SODAForge/SODAOpt

🔬 Наш сайт
😌 Наш ТГ


🔬🏛 На прошлой неделе в Москве прошёл фестиваль «Перспектива 2026» — одно из ключевых событий в сфере архитектуры и градостроительства. В рамках фестивальной программы состоялся круглый стол «Нейронные сети на службе архитектора: новая этика профессии», собравший ведущих экспертов на в области технологий и проектирования.

Руководитель iMak AI Lab Илья Макаров выступил в качестве эксперта по искусственному интеллекту. В центре обсуждения были вопросы о том, в каких задачах ИИ действительно усиливает работу архитектора, а где создаёт новые риски для качества проектов.

Если человек что-то делал на уровне рутины, то искусственный интеллект это повторит и сделает работу за него. Но возникает вопрос: насколько он будет удовлетворëн результатом?


В нынешних реалиях очень актуальный вопрос. Пока профессиональное сообщество восхищается новыми генеративными моделями и спорит о судьбе визуализаторов, наука не стоит на месте. В частности, наши коллеги активно развиваются новые проекты, в том числе в области энергомоделирования зданий и 3D-генерации архитектурных объектов.

✔️Архитектор в условиях постоянного развития искусственного интеллекта приобретает новые зоны ответственности, а не теряет старые. Поэтому, сводить архитектуру, как целый пласт науки и искусства, к одной лишь генерации визов с помощью условной нанобананы — подход как минимум нерациональный и не ведущий ни к чему кроме стагнации в этой области.

Участники круглого стола сошлись во мнении: нейросети — это мощный инструмент, но требующий грамотной адаптации и осознанного применения.

🔬 Наш сайт
😌 Наш ТГ


😆 Что если ИИ не просто отвечает на вопросы, но и чувствует контекст разговора, меняя своё поведение в зависимости от вашего эмоционального состояния?

Именно это изучает наш фреймворк HL-EAI. Это — мультимодальная платформа для исследования эмоционального взаимодействия между людьми и LLM в условиях стратегических игр.

Участники и ИИ-агенты играют в игры теории игр (например, «Дилемма заключённого»). Система, в свою очередь:
✔️ распознает эмоции участника через видеокамеру;
✔️ передает эмоциональный контекст языковой модели;
✔️ отображает эмоции ИИ через выразительные 3D-аватары

В ходе экспериментов с участием 30 студентов и GPT-4o:
✔️ В условиях гнев–гнев (у испытуемого эмоции вызывали показом грустных видеороликов, а LLM промптилась на злое настроение): и люди, и ИИ резко снижают уровень кооперации
✔️ В условиях радость–радость (соответственно, человеку предварительно показывали веселые видео, а LLM давали установку быть "радостной"): GPT-4o устойчиво поддерживает кооперацию, и люди следуют его примеру

Вывод: эмоциональный контекст значимо влияет на стратегическое поведение ИИ. Позитивный фрейминг может стабилизировать сотрудничество во взаимодействии человека и ИИ.

Фреймворк поддерживает более 80 игр (через OpenSpiel), интеграцию с GPT, Claude, LLaMA и настраиваемые сценарии от разовых решений до этических дилемм.

⭐️⭐️ Статья опубликована в сборнике ACM Multimedia 2025
🔗 Код открыт

#Emotion #GameTheory

🔬 Наш сайт
😌 Наш ТГ


📸🔬 FaceCluster: ИИ разбирает ваш семейный архив и не сливает данные в облако

Многие из вас хранят в своих архивах тысячи фотографий, разбросанных по папкам и телефонам. Облачные сервисы (например, Google Photo) справляются, но ценой загрузки всего личного в облако. А что, если можно организовать ваши снимки приватно?

Команда нашей лаборатории представила FaceCluster: систему для автоматической организации фотоколлекций на основе распознавания лиц, которая работает полностью локально.

В основе заложена улучшенная модель KP-RPE с новым методом Embedding Statistical Regularization. Вместо того чтобы просто оптимизировать расстояния между эмбеддингами (как делают классические метрические подходы), метод напрямую структурирует пространство признаков через три компонента:

✔️Compactness Loss: эмбеддинги одного человека тянутся к единому центру
✔️Orthogonality Loss: признаки разных людей максимально разделяются
✔️L2 Regularization: контроль масштаба векторов

📊 Результаты на бенчмарках

Обучение на датасете WebFace4M дало впечатляющие результаты:
✔️ TinyFace (распознавание низкого разрешения): 74.14% Rank-1
✔️ AgeDB (возрастные изменения): 97.78% accuracy
✔️ IJB-C (сложные условия съёмки): 97.25% TAR@0.01%
✔️ CFP-FP (профильные снимки): 98.94% accuracy

Особенность данной системы в распознавании одного и того же человека на фото с разницей в десятки лет.

Как это выглядит в деле?

Пользователь загружает фото через drag-and-drop интерфейс → система в реальном времени находит лица, кластеризует их с помощью DBSCAN и раскладывает коллекцию по людям. Всё разворачивается одной командой через Docker, при этом ваши данные никуда не уходят.

😉 Демонстрация работы системы представлена на видео: youtu.be/Dd068BcjAkk

🔬 Наш сайт
😌 Наш ТГ


📝 🔬 ИИ написал научную статью и прошёл международное рецензирование

Команда нашей лаборатории создала систему ИИ-агентов, которая самостоятельно провела полный цикл научного исследования от изучения литературы до готовой публикации.

По итогу мы получили полноценную научную статью в области интернета вещей, которая успешно прошла международное слепое рецензирование и была принята на конференцию уровня A*. Это первая подобная публикация, созданная российским ИИ-рисерчером.

Как это работает?

🤖
Система состоит из специализированных агентов, каждый из которых отвечает за свой этап:

✔️поиск и анализ научной литературы;
✔️постановка и проведение экспериментов на облачных серверах;
✔️написание и форматирование публикации.

90% работы выполнил ИИ-рисерчер. Оставшиеся 10% — это проверка и валидация данных учёными-людьми.

Почему это важно?

Существующие зарубежные аналоги (AI co-scientist от Google, SciAgents от MIT, Earth-2 от NVIDIA) либо проприетарные, либо заточены под одну узкую область. Единственная открытая система (Sakana AI) оказалась слишком негибкой и шаблонной.
Наша разработка решает эти проблемы: она гибко адаптируется к новым вычислительным сценариям и поддерживает продолжение работы с промежуточных этапов.

В перспективе подобные системы смогут бороться с кризисом рецензирования и помогать отсеивать фальсификации ещё до того, как они попадут к людям-рецензентам.

🔬 Наш сайт
😌 Наш ТГ


🔬🏥 EmoMed - медицинский ИИ-агент, который распознает эмоции пациента

Представьте: поздний вечер, вы замечаете тревожный симптом у себя или близкого и судорожно начинаете искать его в поисковике. А в ответ получаете лишь холодный список диагнозов от худшего к лучшему. Паника нарастает.

А теперь другая картина: система замечает вашу тревогу в тексте и выдает взвешенный спокойный ответ с точной, актуальной медицинской информацией.

Именно это делает EmoMed — новый мультимодальный агент, разработанный командой нашей лаборатории совместно с ИСП РАН, НИТУ МИСИС и Sber AI Lab.

Несколько кейсов для примера, в которых этот ассистент может быть полезен:

✔️ Мама проверяет симптомы ребёнка в 2 ночи — она напугана, пишет сбивчиво. EmoMed распознаёт тревогу и отвечает мягко, без медицинского жаргона, с чётким советом: «сейчас можно сделать вот это, а утром — к врачу»
✔️ Пожилой пациент после постановки диагноза — растерян, не понимает, что ему сказали. Система замечает confusion, структурирует ответ проще и предлагает уточняющие вопросы
✔️ Молодой врач на дежурстве использует агента как второе мнение при сложном клиническом случае с изображением (рентген, патология) — система обрабатывает снимок и текстовый контекст одновременно

EmoMed содержит три слоя в одном пайплайне:

Определение эмоции: GPT-4o считывает тревогу, растерянность, срочность из текста и фото;
Двойной RAG подключает актуальные данные из медбаз (MediSearch) + интернет-поиск (Tavily) в реальном времени
На выходе пользователь получает адаптивный ответ, в котором тон, структура и степень детализации подстраиваются под его эмоциональное состояние

📊 Что показали эксперименты?

Система протестирована на 7 ведущих LLM (GPT-4o/5, Qwen3, Llama 4, Gemini 2.5, Grok 4, Claude 3):

✔️ Эмпатия выросла у всех 7 моделей без исключения
✔️ Клиническая точность не пострадала — у большинства моделей она даже улучшилась
✔️ 77% реальных участников (44 человека, слепое сравнение) выбрали эмоционально-адаптивный ответ как более понятный и поддерживающий
✔️ Люди отметили: структура стала чище при растерянности, тон — мягче при тревоге, формулировки — точнее при срочности

💻 Код открыт: github.com/NasonovIvan/EmoMed-Agent

Мы верим: хорошая медицина — это не только правильный диагноз, но и грамотно построенный диалог. Наше решение учитывает оба этих фактора.

Если вы разрабатываете медицинские продукты, занимаетесь аффективными вычислениями, исследуете Human-AI взаимодействие или просто хотите обсудить идеи — мы открыты к коллаборации.

🔬 Наш сайт
😌 Наш ТГ

Показано 20 последних публикаций.