🤓 Вся база по AI агентамЭто нужно знать!Йоу!Вчера мы
раскатали Claude Code на сервере, а сегодня я обещал рассказать о персонализации и памяти. Однако, обкумекав лучше, я понял, что перед этим нужен еще один промежуточный пост.
Пост с кучей терминов, объяснялок и прочими занудными штуками. Но поняв их, вы преисполнитесь! Буквально соберётся пазл по тому, как развивать вашего собственного агента. И да, это не только к клауд коду применимо, но и к Open Claw или любой другой агентной тулзе.
🟢
Окно контекстаПредставьте, что у ИИшки есть оперативка, как у компа. Всё, что вы пишете, все файлы, которые она читает, все её ответы — всё это складывается в одно окно контекста. Оно измеряется в токенах (
очень грубо: 1 токен ≈ 1 слово).
У разных моделей оно отличается:🟠GPT-4o — 128K токенов
🟠Claude Opus — 200K токенов
🟠Gemini 2.5 Pro — 1M токенов
Когда окно переполняется, модель начинает «забывать» начало разговора. Да и в целом, чем ближе к максималке, тем больше шанс на её затупы. Вот почему нельзя просто скормить ей всю свою жизнь в один чат и ждать чуда 😁
🟢 У моделей разные суперсилыОни отличаются не только размером окна. Одни лучше кодят, другие лучше ресёрчат, а третьи тупо дешевле. И вот что прикольно: можно собрать из них целую команду прямо внутри одного агента.
У меня Claude Opus — это дирижёр. Он думает, планирует и принимает решения. Но если нужно быстро пробежаться по файлам или сделать простую задачку, он делегирует это Sonnet. Потом можно докручивать: Grok ресёрчит твиттер, а Gemini, с его огромным окном, фигачит выжимки из длинных документов. Короче, каждый делает то, в чём силён.
Подключить кучу моделей можно через
OpenRouter. Там есть вообще все провайдеры: от дипсика до грока. Закинули 10 USDT (
да, можно криптой) и экспериментируйте. Но надо разобраться с ценами.
🟢 А за что платим?Когда вы платите за подписку — вам дают лимит запросов. В случае с Claude, это капец как выгодно. А когда работаете через API — платите за токены. Там два счётчика:
🟠Input: всё, что вы отправляете модели (ваш текст и файлы)
🟠Output: всё, что она отвечает
Вот почему важно не засорять контекст мусором: вы буквально платите за каждое лишнее слово, которое модель читает.
🟢RAG и памятьА вот тут самое интересное. Помните, я сказал про ограниченное окно контекста? Так вот, RAG — это хак, который обходит лимит.
Идея простая: вместо того чтобы пихать ВСЮ информацию в контекст, мы создаём базу знаний и подтягиваем только нужное.
Работает так:1. Берёте ваши заметки и доки
2. Режете их на чанки (кусочки по 200-500 слов)
3. Каждый чанк превращается в эмбеддинг — смысловая выжимка из этого кусочка.
4. Задаёте вопрос — он тоже становится эмбеддингом, система ищет ближайшие по смыслу чанки.
5. Найденные кусочки подставляются в контекст, и модель отвечает, опираясь на них
По факту это то, как работает память любого продвинутого агента. У моего, например, целое хранилище заметок. Когда я спрашиваю «что там по проекту Х?», он не помнит это из разговора, а чекает нашу с ним базу.
🟢Математика и инструментыУ ИИшек беда с цифрами. Попросите посчитать её в «уме», и она наврёт вам с уверенным лицом))
Но! Если дать ей калькулятор как инструмент и объяснить, когда и как его юзать, ответ будет точным. Это ключевой принцип агентов:
ИИ + правильные инструменты = машина, которая может почти всё.
Про тулзы отдельный пост будет!
🟢 MCP и SkillsMCP — это упаковка для подключения к внешним сервисам. Вот допустим, есть таск-трекер Trello. Чтобы по API поставить карточку выполненной, агенту каждый раз нужно искать доку, смотреть нужный запрос и вызывать его. А MCP — это его собственная инструкция, в которой все эти запросы уже записаны.
Один раз настроил MCP-сервер для Trello, и агент умеет создавать задачи, двигать карточки и читать списки.
Skills — готовые сценарии поведения. Вместо того чтобы каждый раз объяснять с нуля, вы один раз описываете алгоритм, и агент его выполняет по команде. По сути, любое повторяющееся действие оборачивается в скилл.
Я опять уперся в лимиты...Завтра продолжим!|IЧиталка | Писалка | СмотрелкаI|