Reasoning модели OpenAI не смогли посчитать монеты
→ Хабр
Статья оценивает новые мультимодальные модели OpenAI o3 и o4-mini на разных визуальных задачах.
⭕️ Модели:
— o3 и o4-mini — новейшие модели OpenAI для рассуждения;
— Доступны через API с 16 апреля 2025 года;
— Могут интегрировать изображения в цепочку рассуждений;
— o3 — самая мощная, o4-mini — быстрее и дешевле.
◾️ Результаты тестов:
— o4-mini прошел 4 из 7 тестов, o3 — 3 из 7;
— Обе модели не справились с подсчетом объектов;
— o4-mini показал верный, но изменчивый результат при подсчете;
— o3 ошибся при ответе на вопрос по чеку.
🔸 Виды задач:
— Подсчет объектов на фото;
— Ответы на визуальные вопросы (VQA) по изображениям;
— OCR документов и текста с реальных объектов;
— VQA по документам (меню, чеки);
— Обнаружение объектов (получение координат bounding box).
→ Все статьи
→ Хабр
Статья оценивает новые мультимодальные модели OpenAI o3 и o4-mini на разных визуальных задачах.
Не стоит слепо доверять "рассуждающим" способностям: проверяйте модели на конкретные задачи (OCR, VQA), так как их производительность может отличаться от предыдущих версий (оценка моделей).
⭕️ Модели:
— o3 и o4-mini — новейшие модели OpenAI для рассуждения;
— Доступны через API с 16 апреля 2025 года;
— Могут интегрировать изображения в цепочку рассуждений;
— o3 — самая мощная, o4-mini — быстрее и дешевле.
◾️ Результаты тестов:
— o4-mini прошел 4 из 7 тестов, o3 — 3 из 7;
— Обе модели не справились с подсчетом объектов;
— o4-mini показал верный, но изменчивый результат при подсчете;
— o3 ошибся при ответе на вопрос по чеку.
🔸 Виды задач:
— Подсчет объектов на фото;
— Ответы на визуальные вопросы (VQA) по изображениям;
— OCR документов и текста с реальных объектов;
— VQA по документам (меню, чеки);
— Обнаружение объектов (получение координат bounding box).
→ Все статьи