😱 GPT-6 Astra.
Ну что, наверное, уже все слышали о том, что OpenAI дропнули новую модель Astra. (не зря же в Твиттере 130 миллионов просмотров)
OpenAI называет свое детище «самой умной и стабильной моделью в мире»
🌻 Давайте разбираться, что она может в реальности
Сначала пройдемся по бенчмаркам, а потом дам мини-сноску с практическим ревью
Теперь го ознакомимся с реальными ревью.
AI-энтузиаст Matt Shumer считает GPT-6 Astra самой лучшей моделькой для длинных задач и повседневного использования.
Она отлично понимает неоднозначные инструкции, сохраняет контекст во внимании и хорошо координирует субагентов.
Если смотреть на замечания, то часто говорят, что:
— визуальный вкус у Claude симпатичнее
— написание текстов чуть деградировало
— reasoning не всегда хорош
Я попробовал модель и сам на лайтовых задачах. Особого прорыва не увидел, но я и не гружу ее задачами «создай симуляцию», в отличие от некоторых)
Думаю, в огромных длинных задачах она реально хороша. И мы еще это увидим...
А вы успели потыкать GPT Astra?
❤️ — да, пробовал
🐳 — нет, скоро буду
Ну что, наверное, уже все слышали о том, что OpenAI дропнули новую модель Astra. (не зря же в Твиттере 130 миллионов просмотров)
OpenAI называет свое детище «самой умной и стабильной моделью в мире»
🌻 Давайте разбираться, что она может в реальности
Сначала пройдемся по бенчмаркам, а потом дам мини-сноску с практическим ревью
💻 Итак, Computer use.
Бенчмарки показывают 72,6% эффективности (против ~65,7% у GPT-5.6 Sol), а таски выполняются примерно на 47% быстрее
➕ Математика и наука
Тут тест FrontierMath Tier 4 показывает 97-98% (раньше считался невозможным для ИИшек)
💭 Абстрактное мышление
ARC-AGI-3 дали 99,9% на их harness. В стандартной упаковке модель чуть слабее, но результат все равно отличный
Теперь го ознакомимся с реальными ревью.
AI-энтузиаст Matt Shumer считает GPT-6 Astra самой лучшей моделькой для длинных задач и повседневного использования.
Она отлично понимает неоднозначные инструкции, сохраняет контекст во внимании и хорошо координирует субагентов.
Если смотреть на замечания, то часто говорят, что:
— визуальный вкус у Claude симпатичнее
— написание текстов чуть деградировало
— reasoning не всегда хорош
Я попробовал модель и сам на лайтовых задачах. Особого прорыва не увидел, но я и не гружу ее задачами «создай симуляцию», в отличие от некоторых)
Думаю, в огромных длинных задачах она реально хороша. И мы еще это увидим...
А вы успели потыкать GPT Astra?
❤️ — да, пробовал
🐳 — нет, скоро буду