Можно ли использовать ИИ в расшифровке ЯМР?
Коллеги, мы возвращаемся к постам. В начале лета вышла небольшая заметка от Anthropic про то, как можно использовать Claude Opus 4.7 в расшифровке ЯМР спектров.
Эта заметка много обсуждалась, например, один из постов с достаточно подробным описанием вот здесь. И в целом, Claude в какой-то степени с этой задачей справляется: по 1H и 13C ЯМР в сочетании с данными HRMS и/или информацией об исходных реагентах получается восстановить исходную структуру или что-то подобное. Месяц назад многие просили нас прокомментировать эту заметку, но мы не имели возможности сделать это, используя конкретные цифры. Абстрактно, конечно, можно что-то сказать, но всегда хочется в своих рассуждениях на что-то опираться.
В итоге мы взяли, и проверили
И сегодня можем наконец-то показать, что у нас получилось. Для тестирования мы хотели взять как можно более широкий датасет, содержащий разные классы молекул и, что важно, разные уровни сложности молекул. Понятно, что структуру стероида предсказать сложнее, чем структуру этилового спирта. Но насколько сложнее?
Мы взяли базу ЯМР OdanChem, выгрузили из нее все молекулы, для которых приведены 1H и 13C ЯМР в одной статье, далее распределили эти молекулы по принадлежности к одному из классов органических соединений (21 класс), а потом распределили полученные молекулы по "молекулярной сложности" в соответствии с методикой, разработанной в лаборатории Ананикова.
В итоге получился датасет из 105 молекул, который перекрывает практически всё рабочее пространство химика-органика.
Еще одно важное ограничение — почти все, кто раньше делал такие тесты и разрабатывал модели для ИИ-расшифровки ЯМР в структуру, в качестве вводных данных использовали не только сами спектры, но и какую-то дополнительную информацию. Например, брутто-формулу. Но откуда на практике возьмётся эта брутто формула — не так очевидно.
Поэтому в своем сравнении мы ограничились подачей на вход только 1H и 13C ЯМР с одной молекулы.
В качестве средств расшифровки мы взяли шесть наиболее топовых моделей, доступных в июне 2026 года (Claude Opus
4.8, DeepSeek-V4-Pro, Gemini 3.1 Pro, GPT-5.5, Grok 4.3, Qwen3.7-Max), а также четыре специализированные модели: наша модель, которую мы в итоге назвали BLIND, а также NMRMind, NMRPeak и NMR-Solver. В выборку специализированных моделей попали те, что либо были доступны онлайн, либо без проблем разворачиваются из репозитория.
Результаты
В некоторой степени они нас удивили. Оказалось, что лучшая в данном тесте LLM (Gemini 3.1 Pro) нормально работает примерно для 1 из 4 молекул. В остальных случаях модель ошибалась в том или ином виде. А вот специализированные модели справляются заметно лучше: почти 70% структур удалось расшифровать с помощью BLIND (модель OdanAI), и остальные модели, за исключением NMRMind, выдавали результат не хуже Gemini 3.1 Pro. Выводы из этого исследования и наши мысли по поводу применения ИИ в расшифровке ЯМР напишем в следующих постах. А для желающих прочитать их прямо сейчас, данная статья доступна в виде препринта на ChemRxiv.
#OdanAI@odanchem
Коллеги, мы возвращаемся к постам. В начале лета вышла небольшая заметка от Anthropic про то, как можно использовать Claude Opus 4.7 в расшифровке ЯМР спектров.
Making Claude a chemist
Эта заметка много обсуждалась, например, один из постов с достаточно подробным описанием вот здесь. И в целом, Claude в какой-то степени с этой задачей справляется: по 1H и 13C ЯМР в сочетании с данными HRMS и/или информацией об исходных реагентах получается восстановить исходную структуру или что-то подобное. Месяц назад многие просили нас прокомментировать эту заметку, но мы не имели возможности сделать это, используя конкретные цифры. Абстрактно, конечно, можно что-то сказать, но всегда хочется в своих рассуждениях на что-то опираться.
В итоге мы взяли, и проверили
И сегодня можем наконец-то показать, что у нас получилось. Для тестирования мы хотели взять как можно более широкий датасет, содержащий разные классы молекул и, что важно, разные уровни сложности молекул. Понятно, что структуру стероида предсказать сложнее, чем структуру этилового спирта. Но насколько сложнее?
Мы взяли базу ЯМР OdanChem, выгрузили из нее все молекулы, для которых приведены 1H и 13C ЯМР в одной статье, далее распределили эти молекулы по принадлежности к одному из классов органических соединений (21 класс), а потом распределили полученные молекулы по "молекулярной сложности" в соответствии с методикой, разработанной в лаборатории Ананикова.
В итоге получился датасет из 105 молекул, который перекрывает практически всё рабочее пространство химика-органика.
Еще одно важное ограничение — почти все, кто раньше делал такие тесты и разрабатывал модели для ИИ-расшифровки ЯМР в структуру, в качестве вводных данных использовали не только сами спектры, но и какую-то дополнительную информацию. Например, брутто-формулу. Но откуда на практике возьмётся эта брутто формула — не так очевидно.
Поэтому в своем сравнении мы ограничились подачей на вход только 1H и 13C ЯМР с одной молекулы.
В качестве средств расшифровки мы взяли шесть наиболее топовых моделей, доступных в июне 2026 года (Claude Opus
4.8, DeepSeek-V4-Pro, Gemini 3.1 Pro, GPT-5.5, Grok 4.3, Qwen3.7-Max), а также четыре специализированные модели: наша модель, которую мы в итоге назвали BLIND, а также NMRMind, NMRPeak и NMR-Solver. В выборку специализированных моделей попали те, что либо были доступны онлайн, либо без проблем разворачиваются из репозитория.
Результаты
В некоторой степени они нас удивили. Оказалось, что лучшая в данном тесте LLM (Gemini 3.1 Pro) нормально работает примерно для 1 из 4 молекул. В остальных случаях модель ошибалась в том или ином виде. А вот специализированные модели справляются заметно лучше: почти 70% структур удалось расшифровать с помощью BLIND (модель OdanAI), и остальные модели, за исключением NMRMind, выдавали результат не хуже Gemini 3.1 Pro. Выводы из этого исследования и наши мысли по поводу применения ИИ в расшифровке ЯМР напишем в следующих постах. А для желающих прочитать их прямо сейчас, данная статья доступна в виде препринта на ChemRxiv.
#OdanAI@odanchem