Хуже gpt-5.6-sol (на скрине) с вызовом инструментов работает только DeepSeek-V4-Pro (0731, предыдущий работал с инструментами намного лучше). Путают аргументы и их имена, а иногда и придумывают, забывают обрамлять строковые литералы кавычками, не соблюдают валидационные ограничения из описаний инструментов и т.п.
После этой парочки идут маленькие локальные qwen3.6-35b-a3b и qwen3.8-27b — у них таких ошибок (внезапно) на порядок меньше. Ещё меньше — у opus-5.
И лидер рейтинга: практически по нулям подобных ошибок — у glm-5.3.
На одних и тех же: кодинг-агенте, кодовой базе, наборе инструментов и скиллов, задачах и т.п — всё одно и то же.
SOTA, блин 🤷♂️
После этой парочки идут маленькие локальные qwen3.6-35b-a3b и qwen3.8-27b — у них таких ошибок (внезапно) на порядок меньше. Ещё меньше — у opus-5.
И лидер рейтинга: практически по нулям подобных ошибок — у glm-5.3.
На одних и тех же: кодинг-агенте, кодовой базе, наборе инструментов и скиллов, задачах и т.п — всё одно и то же.
SOTA, блин 🤷♂️