Результаты
На IA-Bench Qwen-Image-Agent даёт IA-score 45.4.
Для контекста:
• Nano Banana Pro — 42.6
• GPT-Image-1.5 — 35.7
• Чистый Qwen-Image-2.0 без агента — 17.4
То есть агентский обвес поверх собственной модели даёт ~+28 пунктов и выводит её выше топовых закрытых рендереров на этом бенче.
На WISE-Verified, более старом бенче на world knowledge ситуация аналогичная.
В работе аблейтят влияние поиска (IA-score падает на 11 пунктов), ризонинга (минус 10 нуктнов). Удаление памяти и промежуточной оценки влияет меньше, но суммарно еще -8. А еще при замене GPT-5.5 на Qwen-Plus + Qwen-VL-Max IA-score падает с 45.4 до 27.8. То есть около половины прироста сидит в качестве закрытой VLM, а не в инженерии агента.
Замечания
Во-первых, цена. Один запрос — это: planning-проход на GPT-5.5, несколько ризонинг вызовов на каждый вопрос, до пяти хитов поиска с VLM реранкером, рендер на Qwen-Image-2.0, оценка качества через GPT-5.5, и так до трёх раундов фидбека
Во-вторых, зависимость от качества VLM. Падение IA-score с 45.4 до 27.8 при смене GPT-5.5 на Qwen-Plus говорит, что для качества системы важнее доступ к топовой закрытой VLM, чем конкретный дизайн агента
В-третьих, чувствительность к качеству поиска. Плохие результаты иногда полностью ломают рендеринг
В-четвёртых, как и у всех агентов есть проблема с разбуханием контекста и памятью, а из-за того что в этом пайплайне много дорогих по токенам картинок, эта проблема стоит еще острее
На IA-Bench Qwen-Image-Agent даёт IA-score 45.4.
Для контекста:
• Nano Banana Pro — 42.6
• GPT-Image-1.5 — 35.7
• Чистый Qwen-Image-2.0 без агента — 17.4
То есть агентский обвес поверх собственной модели даёт ~+28 пунктов и выводит её выше топовых закрытых рендереров на этом бенче.
На WISE-Verified, более старом бенче на world knowledge ситуация аналогичная.
В работе аблейтят влияние поиска (IA-score падает на 11 пунктов), ризонинга (минус 10 нуктнов). Удаление памяти и промежуточной оценки влияет меньше, но суммарно еще -8. А еще при замене GPT-5.5 на Qwen-Plus + Qwen-VL-Max IA-score падает с 45.4 до 27.8. То есть около половины прироста сидит в качестве закрытой VLM, а не в инженерии агента.
Замечания
Во-первых, цена. Один запрос — это: planning-проход на GPT-5.5, несколько ризонинг вызовов на каждый вопрос, до пяти хитов поиска с VLM реранкером, рендер на Qwen-Image-2.0, оценка качества через GPT-5.5, и так до трёх раундов фидбека
Во-вторых, зависимость от качества VLM. Падение IA-score с 45.4 до 27.8 при смене GPT-5.5 на Qwen-Plus говорит, что для качества системы важнее доступ к топовой закрытой VLM, чем конкретный дизайн агента
В-третьих, чувствительность к качеству поиска. Плохие результаты иногда полностью ломают рендеринг
В-четвёртых, как и у всех агентов есть проблема с разбуханием контекста и памятью, а из-за того что в этом пайплайне много дорогих по токенам картинок, эта проблема стоит еще острее