Anthropic показал, как Opus 4.6 может несколько дней подряд автономно работать над сложными задачами почти без человека.
Исследователь из Anthropic взял задачу из области, в которой сам не является специалистом, и попросил Opus 4.6 написать сложный численный код для космологии, который обычно делают годами.
Запустил агента и ушёл пить кофе. Через несколько дней код работал.
Исследователь периодически проверял прогресс с телефона, пока стоял в очереди.
А агент тем временем сам писал код, сам тестировал, находил ошибки, фиксировал в журнале, что сработало, а что нет, чтобы не наступать на те же грабли в следующей сессии.
Главное открытие этого кейса не в том, что ИИ умный, а в том, что ему нужна правильная инфраструктура, как любому сотруднику нужны инструменты и регламенты.
3 ключевых элемента:
1. файл с заданием, который агент держит в голове всё время работы и может сам обновлять;
2. журнал прогресса, где фиксируются не только успехи, но и тупики, чтобы не повторять их;
3. эталон, с которым агент сверяет результат на каждом шаге. Без эталона агент не знает, движется ли он вперёд.
Ещё одна проблема, которую решили отдельно - агент склонен останавливаться раньше времени.
Этот кейс показывает, что ранее такие инструменты мы использовали в режиме диалога, а теперь появился другой режим - ставишь задачу, настраиваешь процесс и агент работает сам, пока ты занимаешься другим.
ИИ выводит на то, чтобы люди начали не только своим тайм-менеджментом заниматься эффективно, но и агента:)
Исследователь из Anthropic взял задачу из области, в которой сам не является специалистом, и попросил Opus 4.6 написать сложный численный код для космологии, который обычно делают годами.
Запустил агента и ушёл пить кофе. Через несколько дней код работал.
Исследователь периодически проверял прогресс с телефона, пока стоял в очереди.
А агент тем временем сам писал код, сам тестировал, находил ошибки, фиксировал в журнале, что сработало, а что нет, чтобы не наступать на те же грабли в следующей сессии.
Главное открытие этого кейса не в том, что ИИ умный, а в том, что ему нужна правильная инфраструктура, как любому сотруднику нужны инструменты и регламенты.
3 ключевых элемента:
1. файл с заданием, который агент держит в голове всё время работы и может сам обновлять;
2. журнал прогресса, где фиксируются не только успехи, но и тупики, чтобы не повторять их;
3. эталон, с которым агент сверяет результат на каждом шаге. Без эталона агент не знает, движется ли он вперёд.
Ещё одна проблема, которую решили отдельно - агент склонен останавливаться раньше времени.
Этот кейс показывает, что ранее такие инструменты мы использовали в режиме диалога, а теперь появился другой режим - ставишь задачу, настраиваешь процесс и агент работает сам, пока ты занимаешься другим.
ИИ выводит на то, чтобы люди начали не только своим тайм-менеджментом заниматься эффективно, но и агента:)