NSS Lab - на ICML 2026!
В этот раз от нас будут представлены 4 публикации на различных воркшопах. Первая и вторая работы сделаны в рамках новой коллаборации со Sber AI Lab (про это скоро расскажем); есть сотрудничество и с другими подразделениями ИТМО, компаниями и университетами.
1) Dmitry Gilemkhanov et al - On-Demand Multi-Agent Workflow Synthesis for Multimodal Long-Horizon Reasoning - Workshop on Multimodal AI Agents
Про создание MAS LLM с нуля в zero-shot режиме с помощью мета-агентов.
2) Alina Zhidkovskaya et al - AutoJudge: Automatic Generation of LLM-Based Judges from Execution Traces - Workshop on Failure Modes of Agentic AI
Про генерацию оценщиков для проверки корректности поведения МАС в конкретной области.
3) Andrey Getmanov et al - Beyond Lexical Similarity: A Benchmark for Evaluating Code Documentation Agents - Deep Learning for Code: Towards Human-Centered Coding Agents
Про бенчмарк для генераторов документации (таких, как OSA), использующий новые критерии оценивания. Тут имеет место очень продуктивное сотрудничество с GigaCode.
4) Ivan Dubrovsky et al - Selective Perturbations as a Diagnostic for Benchmark-Based LLM Comparisons - Workshop on Combining Theory and Benchmarks
Тоже про бенчмарк - но для проверки уcтойчивости сравнения LLM к формулировка запросов. Это работа по мотивам школы SMILES 2025 в сотрудничестве с ВШЭ.
Полные списки авторов и основные результаты - в приложенных постерах и препринтах.
До встречи на конференции!
В этот раз от нас будут представлены 4 публикации на различных воркшопах. Первая и вторая работы сделаны в рамках новой коллаборации со Sber AI Lab (про это скоро расскажем); есть сотрудничество и с другими подразделениями ИТМО, компаниями и университетами.
1) Dmitry Gilemkhanov et al - On-Demand Multi-Agent Workflow Synthesis for Multimodal Long-Horizon Reasoning - Workshop on Multimodal AI Agents
Про создание MAS LLM с нуля в zero-shot режиме с помощью мета-агентов.
2) Alina Zhidkovskaya et al - AutoJudge: Automatic Generation of LLM-Based Judges from Execution Traces - Workshop on Failure Modes of Agentic AI
Про генерацию оценщиков для проверки корректности поведения МАС в конкретной области.
3) Andrey Getmanov et al - Beyond Lexical Similarity: A Benchmark for Evaluating Code Documentation Agents - Deep Learning for Code: Towards Human-Centered Coding Agents
Про бенчмарк для генераторов документации (таких, как OSA), использующий новые критерии оценивания. Тут имеет место очень продуктивное сотрудничество с GigaCode.
4) Ivan Dubrovsky et al - Selective Perturbations as a Diagnostic for Benchmark-Based LLM Comparisons - Workshop on Combining Theory and Benchmarks
Тоже про бенчмарк - но для проверки уcтойчивости сравнения LLM к формулировка запросов. Это работа по мотивам школы SMILES 2025 в сотрудничестве с ВШЭ.
Полные списки авторов и основные результаты - в приложенных постерах и препринтах.
До встречи на конференции!