Модели тупеют?
В LLM-сообществе постоянно всплывает тема деградации моделей после релиза. Якобы GPT-5.5, Gemini 3.1 Pro и Claude Opus 4.8 на релизе были умные, а потом их по-тихому занерфили, и сейчас это уже не те модели. Причём говорят так почти про каждый крупный релиз уже на протяжении нескольких лет. Реальных пруфов у этого нет.
Если бы компании реально тихо ухудшали свои модельки, конкуренты и независимые бенчмаркеры моментально выпустили бы кучу материалов с наглядными тестами и пруфами на эту тему. Такого нет. Единственный случай, когда за такими жалобами что-то стояло — история с Opus 4.6, это было в апреле. Сеньор-директор из AI-отдела AMD тогда выкатила гитхаб-ишшуе с разбором нескольких тысяч своих сессий, где видно, как просел ризонинг. Anthropic всё признали в официальном разборе и откатили. Но сама модель не менялась — это была единичная проблема Claude Code
А всякие «GPT-5.5 отупела!!!» обычно появляются когда модель не справилась с новой задачей. Хотя на релизе она не справилась бы с ней точно так же. Плюс требования у юзера со временем растут, он кидает модели всё более сложные задачи, и ошибок естественно становится больше. Ну и банально рандом, ИИ может решать одну и ту же задачу каждый раз по-разному.
В LLM-сообществе постоянно всплывает тема деградации моделей после релиза. Якобы GPT-5.5, Gemini 3.1 Pro и Claude Opus 4.8 на релизе были умные, а потом их по-тихому занерфили, и сейчас это уже не те модели. Причём говорят так почти про каждый крупный релиз уже на протяжении нескольких лет. Реальных пруфов у этого нет.
Если бы компании реально тихо ухудшали свои модельки, конкуренты и независимые бенчмаркеры моментально выпустили бы кучу материалов с наглядными тестами и пруфами на эту тему. Такого нет. Единственный случай, когда за такими жалобами что-то стояло — история с Opus 4.6, это было в апреле. Сеньор-директор из AI-отдела AMD тогда выкатила гитхаб-ишшуе с разбором нескольких тысяч своих сессий, где видно, как просел ризонинг. Anthropic всё признали в официальном разборе и откатили. Но сама модель не менялась — это была единичная проблема Claude Code
А всякие «GPT-5.5 отупела!!!» обычно появляются когда модель не справилась с новой задачей. Хотя на релизе она не справилась бы с ней точно так же. Плюс требования у юзера со временем растут, он кидает модели всё более сложные задачи, и ошибок естественно становится больше. Ну и банально рандом, ИИ может решать одну и ту же задачу каждый раз по-разному.