На счет его подхода, что мне нравится, это что он придерживается концепции, что у моделей есть граница между smart zone и dumb zone. И эта граница где-то в районе 100к-150к токенов. В начале сессии, агенты показывают лучший перфоманс и затем все хуже и хуже.
Я в это сам верю из-за того, как механизм self-attention работает в LLM-ках. Чем больше слов в контексте, тем больше взаимосвязей нужно построить, и тем более запутанными они становятся.
Так вот он старается, какая бы большая задача ни была, разбить ее на маленькие кусочки, которые могут решиться в рамках одной сессии не выходя из smart zone.
Это полезно не только в работе с моделями, но и для меня самого, т.к. мой dumb zone начинается еще раньше, чем у моделей.
Я в это сам верю из-за того, как механизм self-attention работает в LLM-ках. Чем больше слов в контексте, тем больше взаимосвязей нужно построить, и тем более запутанными они становятся.
Так вот он старается, какая бы большая задача ни была, разбить ее на маленькие кусочки, которые могут решиться в рамках одной сессии не выходя из smart zone.
Это полезно не только в работе с моделями, но и для меня самого, т.к. мой dumb zone начинается еще раньше, чем у моделей.