У меня в Инсте и Ютубе просто вся лента засрана постами о том, что OpenAI достигли AGI, что GPT-6 это ебать какая неведомая хуйня, которая уже заменила людей, которая умеет делать что угодно и далее по списку.
Я даже умолчу о том, что в каждом втором из таких постов сравнивают видео (!) сгенерированное GPT-6 (!) и FABLE-5.1 (!) - типа сравните, вот такие видео делает Claude, а такие - ChatGPT (хотя не то, что ни одна из этих моделей не умеет в видео - обе компании, в принципе, уже не предоставляют моделей для генерации видео, даже OpenAI похоронили свою Sora и она станет недоступна в ближайший месяц).
В каждом первом же посте - сравнивают как GPT и CLAUDE покадрово воспроизводят модельки в Blender по видео. Выглдяит максимально убого, да и мы здесь не за этим. Оценка написания кода - это довольно субъективная штука и зависит в первую очередь от компетенций оценивающего. А что там у нас по более простым задачам? Научились ли ИИ-модели хотя бы тексты писать адекватно? Это ведь в первую очередь Large Language Models?
Если коротко - нет, даже с такой, казалось бы, простой задачей как копирайтинг (буквально то, ради чего разрабатывался совеременный ИИ) - оно справиться не может. Я взял единое ТЗ на подготовку SEO-шного текста, с которым еще до появления ИИ справлялся любой раб с fiverr за 10$, закинул парочку таких ТЗ в разные нейронки с разными настройками и получил неутешительные результаты. На разных ТЗ и разных текстах рейтинг получился примерно следующий
Первое место - Claude Opus 4.6, effort = high
Да, именно Opus 4.6 - не Opus 5, не Fable, а модель прошлого поколения. Из всех протестированных нейронок он стабильнее всего выдаёт текст, который хотя бы можно взять за основу. Результат не идеальный - лишнее убрать надо, кое-где подправить формулировки - но это именно "доработать", а не "переписать с нуля". Структура логичная, текст читается по-человечески, не вызывает желания закрыть вкладку после второго абзаца. Забавно, что именно 4.6, а не более свежие версии Claude, оказался стабильнее - на разных ТЗ он чаще выдавал пригодный результат, в то время как новые модели то попадали, то нет.
Второе место делят:
- Claude Fable 5.1, effort = high
- Claude Fable 5, effort = high
Обе модели выдают результат, близкий к Opus 4.6, но каждая со своими косяками. Fable 5.1 по сути повторяет стиль Opus, но формулировки чуть слабее - больше чувствуется "нейронность", больше воды, править приходится заметно больше. Fable 5 наоборот - текст легко читается, логически связный, но как будто пережатый: много информации опущено, всё слишком скомкано, плюс местами проскакивает какой-то подозрительный вульгаризм.
В разных случаях по-разному - то у одного получится вариант получше, то у другого, закономерности нет. До кожанных фрилансеров всем этим трём моделям (включая Opus 4.6) еще далеко, но при условии редактуры человеком, компиляции текста из нескольких генераций - оно может выдать какую-никакую базу, которую всё же можно доработать до чего-то вменяемого. Но говорить о замене даже самого дешевого фрилансера - не приходится. Без редактуры - это мусор. Хотя стоит отметить, что в руках умелого копирайтера такой инструмент может сэкономить до 50% рабочего времени, но уж точно не "заменить".
Третье место:
- Claude Fable 5.1, effort = high + Research
- Claude Fable 5, effort = high + Research
Казалось бы - тот же Claude, да ещё и с Research, должно быть лучше? А вот нет. Research-версии по сути повторяют тексты базовых моделей, но начинают пихать туда кучу информации, которая нахрен не нужна для SEO-текста. Читается тяжелее, местами загибает не по теме. Как самостоятельный текст - заметно хуже, чем без Research, править придётся ощутимо больше. Но есть нюанс: Research-генерацию можно рассматривать как дополнение к основному тексту - подтянуть оттуда цифры, факты, рейтинги. То есть оптимальный флоу: сделать текст без Research, потом отдельно с Research, и скопилировать вручную. Отдельно Research-текст на выход отправлять - не стоит.
Четвертое место - GPT-6 Astra, effort = pro
А вот и хвалёный ChatGPT. GPT-6 Astra структурно выдаёт что-то отдалённо похожее на Claude, но его стабильно несёт куда-то не туда. После нескольких абзацев буквально теряешь суть повествования - ловишь себя на мысли "о чём вообще была статья?". Нейронность чувствуется заметно сильнее, чем у Claude - текст более "пластиковый", хотя формально вроде и читаемый. Для SEO-задач без серьёзной переработки не подходит, а с учётом объёма этой переработки - проще написать с нуля или взять Claude.
Пятое место - GPT-5.6 Sol, effort = pro
GPT-5.6 Sol - это прямо классика нейрослопа. Его можно узнать из тысячи - формулировки настолько шаблонные, что аж подташнивает - ты сразу чувствуешь, что это писала нейронка, даже если не разбираешься в теме. Структурно текст вроде собран правильно, всё на месте, но читать это без кринжа невозможно. По сути та же проблема, что и у GPT-6, только ещё грубее и заметнее. Использовать как готовый текст - нет, спасибо. Принять такое от фрилансера - тоже нет.
Шестое место:
- GPT-6 Astra, effort = pro + Deep Research
- GPT-5.6 Sol, effort = pro + Deep Research
Худшее из всего, что попало в рейтинг. Deep Research у ChatGPT (который еще полгода назад на o3 показывал лучший результат среди всех LLM) превращает и так посредственные тексты в абсолютно нечитаемую кашу. Куча воды, бесконечное "наливание", нейронность - засыпаешь на втором абзаце. Обе модели с Research выдают примерно одинаковое по качеству дерьмо, разницы между ними практически нет. Если Claude с Research хотя бы можно использовать как источник фактов и цифр для компиляции - то GPT с Deep Research не пригоден вообще ни для чего. Даже как "дополнение" к основному тексту - слишком много мусора, чтобы оттуда что-то выцеплять. Просто зря потраченное время и токены.
Grok, Gemini, DeepSeek, QWEN - оказались тотальным мусором, не заслуживающим внимания, тупо нейрослоп.
Я даже умолчу о том, что в каждом втором из таких постов сравнивают видео (!) сгенерированное GPT-6 (!) и FABLE-5.1 (!) - типа сравните, вот такие видео делает Claude, а такие - ChatGPT (хотя не то, что ни одна из этих моделей не умеет в видео - обе компании, в принципе, уже не предоставляют моделей для генерации видео, даже OpenAI похоронили свою Sora и она станет недоступна в ближайший месяц).
В каждом первом же посте - сравнивают как GPT и CLAUDE покадрово воспроизводят модельки в Blender по видео. Выглдяит максимально убого, да и мы здесь не за этим. Оценка написания кода - это довольно субъективная штука и зависит в первую очередь от компетенций оценивающего. А что там у нас по более простым задачам? Научились ли ИИ-модели хотя бы тексты писать адекватно? Это ведь в первую очередь Large Language Models?
Если коротко - нет, даже с такой, казалось бы, простой задачей как копирайтинг (буквально то, ради чего разрабатывался совеременный ИИ) - оно справиться не может. Я взял единое ТЗ на подготовку SEO-шного текста, с которым еще до появления ИИ справлялся любой раб с fiverr за 10$, закинул парочку таких ТЗ в разные нейронки с разными настройками и получил неутешительные результаты. На разных ТЗ и разных текстах рейтинг получился примерно следующий
Первое место - Claude Opus 4.6, effort = high
Да, именно Opus 4.6 - не Opus 5, не Fable, а модель прошлого поколения. Из всех протестированных нейронок он стабильнее всего выдаёт текст, который хотя бы можно взять за основу. Результат не идеальный - лишнее убрать надо, кое-где подправить формулировки - но это именно "доработать", а не "переписать с нуля". Структура логичная, текст читается по-человечески, не вызывает желания закрыть вкладку после второго абзаца. Забавно, что именно 4.6, а не более свежие версии Claude, оказался стабильнее - на разных ТЗ он чаще выдавал пригодный результат, в то время как новые модели то попадали, то нет.
Второе место делят:
- Claude Fable 5.1, effort = high
- Claude Fable 5, effort = high
Обе модели выдают результат, близкий к Opus 4.6, но каждая со своими косяками. Fable 5.1 по сути повторяет стиль Opus, но формулировки чуть слабее - больше чувствуется "нейронность", больше воды, править приходится заметно больше. Fable 5 наоборот - текст легко читается, логически связный, но как будто пережатый: много информации опущено, всё слишком скомкано, плюс местами проскакивает какой-то подозрительный вульгаризм.
В разных случаях по-разному - то у одного получится вариант получше, то у другого, закономерности нет. До кожанных фрилансеров всем этим трём моделям (включая Opus 4.6) еще далеко, но при условии редактуры человеком, компиляции текста из нескольких генераций - оно может выдать какую-никакую базу, которую всё же можно доработать до чего-то вменяемого. Но говорить о замене даже самого дешевого фрилансера - не приходится. Без редактуры - это мусор. Хотя стоит отметить, что в руках умелого копирайтера такой инструмент может сэкономить до 50% рабочего времени, но уж точно не "заменить".
Третье место:
- Claude Fable 5.1, effort = high + Research
- Claude Fable 5, effort = high + Research
Казалось бы - тот же Claude, да ещё и с Research, должно быть лучше? А вот нет. Research-версии по сути повторяют тексты базовых моделей, но начинают пихать туда кучу информации, которая нахрен не нужна для SEO-текста. Читается тяжелее, местами загибает не по теме. Как самостоятельный текст - заметно хуже, чем без Research, править придётся ощутимо больше. Но есть нюанс: Research-генерацию можно рассматривать как дополнение к основному тексту - подтянуть оттуда цифры, факты, рейтинги. То есть оптимальный флоу: сделать текст без Research, потом отдельно с Research, и скопилировать вручную. Отдельно Research-текст на выход отправлять - не стоит.
Четвертое место - GPT-6 Astra, effort = pro
А вот и хвалёный ChatGPT. GPT-6 Astra структурно выдаёт что-то отдалённо похожее на Claude, но его стабильно несёт куда-то не туда. После нескольких абзацев буквально теряешь суть повествования - ловишь себя на мысли "о чём вообще была статья?". Нейронность чувствуется заметно сильнее, чем у Claude - текст более "пластиковый", хотя формально вроде и читаемый. Для SEO-задач без серьёзной переработки не подходит, а с учётом объёма этой переработки - проще написать с нуля или взять Claude.
Пятое место - GPT-5.6 Sol, effort = pro
GPT-5.6 Sol - это прямо классика нейрослопа. Его можно узнать из тысячи - формулировки настолько шаблонные, что аж подташнивает - ты сразу чувствуешь, что это писала нейронка, даже если не разбираешься в теме. Структурно текст вроде собран правильно, всё на месте, но читать это без кринжа невозможно. По сути та же проблема, что и у GPT-6, только ещё грубее и заметнее. Использовать как готовый текст - нет, спасибо. Принять такое от фрилансера - тоже нет.
Шестое место:
- GPT-6 Astra, effort = pro + Deep Research
- GPT-5.6 Sol, effort = pro + Deep Research
Худшее из всего, что попало в рейтинг. Deep Research у ChatGPT (который еще полгода назад на o3 показывал лучший результат среди всех LLM) превращает и так посредственные тексты в абсолютно нечитаемую кашу. Куча воды, бесконечное "наливание", нейронность - засыпаешь на втором абзаце. Обе модели с Research выдают примерно одинаковое по качеству дерьмо, разницы между ними практически нет. Если Claude с Research хотя бы можно использовать как источник фактов и цифр для компиляции - то GPT с Deep Research не пригоден вообще ни для чего. Даже как "дополнение" к основному тексту - слишком много мусора, чтобы оттуда что-то выцеплять. Просто зря потраченное время и токены.
Grok, Gemini, DeepSeek, QWEN - оказались тотальным мусором, не заслуживающим внимания, тупо нейрослоп.