TGStat
TGStat
Type to search
Advanced channel search
  • flag English
    Site language
    flag Russian flag English flag Uzbek
  • Sign In
  • Catalog
    Channels and groups catalog Regional compilations Thematic compilations Платные каналы Search for channels
    Add a channel/group
  • Ratings
    Rating of channels Rating of groups Posts rating
    Ratings of brands and people
  • Analytics
  • Search by posts
  • Telegram monitoring
  • Promotion
    Advertising through Yandex Business Advertising in channels through TGStat Agency Advertising on TGStat.ru website
FastNews | Никита Пастухов

3 Sep, 17:14

Open in Telegram Share Report

Хватит нести бред про миллион токенов

Я заебался это слушать. Каждый релиз модели - новое окно на 1кк, и каждый раз находится кто-то, кто выдает: теперь можно не думать о контексте.

Нельзя. Больше 200к пихать в модель бессмысленно, и это не просто мой опыт. Умные дядьки все посчитали.

В июле я про это уже писал: https://t.me/fastnewsdev/360. Тогда это опиралось на мой опыт, без единого пруфа. На днях поспорил в чате, услышал, что представления у меня устаревшие, и полез за пруфами. Собрал сильно больше, чем ждал😅

Lost in the middle, 2023 год

Стэнфордская статья, с которой все началось. Модели дают вопрос и пачку документов, а нужный двигают - в начало, в середину, в конец. Выходит U-образная кривая: края модель использует, середину теряет.

Но самое прикольное даже не это. Когда нужный документ лежал в середине, GPT-3.5 отвечал ХУЖЕ, чем когда ему вообще не давали документов. Контекст в этой позиции не бесполезен, а даже вредит.

И вторая находка: модели с расширенным окном показали ровно те же цифры, что и базовые. Уже в 2023 измерили - окно побольше не значит, что модель им пользуется.

Context Rot, 2025 год

Отчет Chroma на 18 моделях - Claude 4, GPT-4.1, Gemini 2.5. Отсюда термин.

Главное: деградация - это НЕ переполнение окна. Модель начинает врать задолго до лимита и на тривиальных задачах.

• чем меньше вопрос буквально совпадает с ответом - тем быстрее падение качества
• на перемешанном тексте модели работают даже лучше, чем на связном

Почему так

Внимание - это распределение фиксированной суммы. Модель раскладывает 100% внимания по всем токенам окна: чем их больше, тем меньше достается каждому. Между 8к и 256к разница в 32 раза. Плюс училась она на коротких текстах - двухсоттысячную позицию почти не видела. Отсюда и края: начало с концом конкуренцию выигрывают, середина проигрывает.

И главное - у модели нет адресной памяти. Она не достает факт, а размазывает по нему внимание вместе со всем остальным мусором. Поэтому хорошим поиском это не лечится, измерено отдельно: даже когда модель извлекает все нужное идеально, качество падает на 13.9-85%.

Самое демонстративное

LOCA-bench, февраль 2026. Агенту дают задачу и раздувают вокруг него окружение, не трогая задачу. Точность по длине:

• Claude-4.5-Opus: 96% на 8к, 84% на 32к, 65% на 64к, 34% на 128к, 14.7% на 256к
• GPT-5.2-Medium: 72%, 60%, 52%, 38.7%, 21.3%
• Gemini-3-Flash: 64%, 40%, 36%, 21.3%, 17.3%

У Opus заявленное окно - 200к, и на 256к от него остается 14.7%. Причем мои 200к тут выглядят даже щедро. Половина точности теряется уже к 100к.

Самое свежее

PredicateLongBench от NVIDIA, июль 2026. Модели совсем свежие - Opus 4.6, GPT-5.4, Gemini 3.1 Pro.

История повторяется: на сложных вариантах Opus 4.6 проваливается до 7%, а на самом тяжелом лучший результат - 10% у Gemini при 1% у Opus и GPT😑

Что с этим делать

Вывод ровно один: контекст надо не чистить, а не засорять.

Там же померили, что помогает при 128к: programmatic tool calling поднимает GPT-5.2 с 38.7% до 49.3%, context awareness тащит Gemini с 21.3% до 33.3%. А тупое удаление старого не дает почти ничего - очистка тулколлов +1.3 пункта, автокомпакция (привет, /compact) местами вообще в минус.

Что из этого делаю я:

• Одна сессия - одна задача. Не тянуть диалог, пока он не превратился в тыкву
• План живет в файле, а не в диалоге. О чем и был пост про SDD
• Progressive disclosure. Пусть агент сам сходит за информацией, когда понадобится
• Никакой надежды на автокомпакцию. Померили на агентах: полный контекст 85.7%, он же со сжатием - 63.7%. Если использовать /compact - то только с указанием, что должно остаться

И перестаньте смотреть на чиселко максимального контекста при выборе модели. Его вам и так хватит.

Контроль контекста - не оптимизация и не тюнинг для задротов. Сейчас это ваша основная работа. Пока не поменяется архитектура моделей - придется приседать вокруг контекста руками.

Можете кидать этот пост любым приверженцам "А у X КОНТЕКСТ БОЛЬШЕ" - пусть спорят со мной в комментариях

#архитектура #AI
FastNews | Никита Пастухов
Поздравляю, вы уже пользуетесь SDD Если вы хоть раз гоняли агента через plan-mode - вы уже в SDD-клубе, просто об этом не знали. Я обещал вам рассказать про свой опыт с сетапом скиллов Мэтта, но без разговора об SDD ничего не получится Так что заходить буду издалека, с боли. Модели с заявленным к...

3.4k 2 80 34 46
Catalog
Channels and groups catalog Channels compilations Search for channels Add a channel/group
Ratings
Rating of Telegram channels Rating of Telegram groups Posts rating Ratings of brands and people
API
API statistics Search API of posts API Callback
Our channels
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Read
Академия TGStat Telegram Research 2019 Telegram Research 2021 Telegram Research 2023
Contacts
Справочный центр Support Email Jobs
Miscellaneous
Terms and conditions Privacy policy Public offer
Our bots
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot