Агент выбрасывает рабочую идею не потому, что она плохая. Потому что замер не досчитался.
Санкальп, он же dejavucoder, две недели гонял Codex на конкурсе GPU Mode по батчевому QR-разложению. Больше 1 500 сабмитов, 12-е место из 183, ускорение в 232 раза: базовый torch.geqrf считал около 419 000 микросекунд, финальное ядро — 1 805.
Интересно не то, что получилось. Интересно, что он к концу вписал в AGENTS.md — файл опубликован целиком. Есть там и бодрящее «не бойся рисковать», но каркас держат четыре правила про улики.
— Таймаут — не улика. Дословно: «Treat a timeout as inconclusive, not as a correctness/performance rejection». Прогон не завершился — значит, про идею по-прежнему не известно ничего.
— Уликой считается только досчитавшийся прогон: пройденные или проваленные тесты и время.
— Никакого восхождения от одного лидера. Держать не меньше трёх живых семейств идей сразу, и одно из них — заведомо рискованное.
— Семейство не хоронить по одиночным провалам. Если две идеи по отдельности нейтральны, но чинят разные издержки, сначала совместить и только потом закапывать.
Вот это и есть приём, ради которого я притащил историю. Ни одно из четырёх правил не про модель и не про промпт. Все четыре про одно: что считать достаточным основанием, чтобы признать идею мёртвой. У агента по умолчанию таким основанием работает любой плохой ответ, включая отсутствие ответа.
Теперь переносим к себе, потому что схема у вас та же, только без лидерборда. Агент правит код, гоняет тесты, один падает по таймауту — и агент откатывает правку. Хотя про правку по-прежнему не известно ничего. У Санкальпа прогоны отваливались во многом из-за забитой очереди конкурса, у вас отвалятся из-за флейка, оборванной сети и кончившегося места в раннере. Для агента разницы нет.
Что сделать сегодня. Открыть свой AGENTS.md или CLAUDE.md и найти строку, которая отделяет доказательство от отсутствия данных. Нет такой строки — её место занимает догадка модели. Признак, по которому решать: пролистайте последние сессии и посчитайте, сколько раз агент переписал работающий код после прогона, который не дошёл до конца.
Честности ради, автор считает свой результат ограниченным — и ограничил его не протокол. Разбор топ-10 показал, что выше залезли за счёт знания предметной области: у входов с низким рангом много нулей, и это надо было использовать, а матрицу стоило держать в fp16, а не гонять между представлениями. Второй промах он называет «unknown unknown» — чистый пробел в предметной области, никаким протоколом он не лечится. Плюс цена вопроса: 14 дней, две подписки общей ценой 220 долларов и один запуск по цели, который крутился больше суток.
https://sankalp.bearblog.dev/autoresearch/
Что в вашем проекте агент считает провалом, хотя это был просто не доехавший прогон?
Санкальп, он же dejavucoder, две недели гонял Codex на конкурсе GPU Mode по батчевому QR-разложению. Больше 1 500 сабмитов, 12-е место из 183, ускорение в 232 раза: базовый torch.geqrf считал около 419 000 микросекунд, финальное ядро — 1 805.
Интересно не то, что получилось. Интересно, что он к концу вписал в AGENTS.md — файл опубликован целиком. Есть там и бодрящее «не бойся рисковать», но каркас держат четыре правила про улики.
— Таймаут — не улика. Дословно: «Treat a timeout as inconclusive, not as a correctness/performance rejection». Прогон не завершился — значит, про идею по-прежнему не известно ничего.
— Уликой считается только досчитавшийся прогон: пройденные или проваленные тесты и время.
— Никакого восхождения от одного лидера. Держать не меньше трёх живых семейств идей сразу, и одно из них — заведомо рискованное.
— Семейство не хоронить по одиночным провалам. Если две идеи по отдельности нейтральны, но чинят разные издержки, сначала совместить и только потом закапывать.
Вот это и есть приём, ради которого я притащил историю. Ни одно из четырёх правил не про модель и не про промпт. Все четыре про одно: что считать достаточным основанием, чтобы признать идею мёртвой. У агента по умолчанию таким основанием работает любой плохой ответ, включая отсутствие ответа.
Теперь переносим к себе, потому что схема у вас та же, только без лидерборда. Агент правит код, гоняет тесты, один падает по таймауту — и агент откатывает правку. Хотя про правку по-прежнему не известно ничего. У Санкальпа прогоны отваливались во многом из-за забитой очереди конкурса, у вас отвалятся из-за флейка, оборванной сети и кончившегося места в раннере. Для агента разницы нет.
Что сделать сегодня. Открыть свой AGENTS.md или CLAUDE.md и найти строку, которая отделяет доказательство от отсутствия данных. Нет такой строки — её место занимает догадка модели. Признак, по которому решать: пролистайте последние сессии и посчитайте, сколько раз агент переписал работающий код после прогона, который не дошёл до конца.
Честности ради, автор считает свой результат ограниченным — и ограничил его не протокол. Разбор топ-10 показал, что выше залезли за счёт знания предметной области: у входов с низким рангом много нулей, и это надо было использовать, а матрицу стоило держать в fp16, а не гонять между представлениями. Второй промах он называет «unknown unknown» — чистый пробел в предметной области, никаким протоколом он не лечится. Плюс цена вопроса: 14 дней, две подписки общей ценой 220 долларов и один запуск по цели, который крутился больше суток.
https://sankalp.bearblog.dev/autoresearch/
Что в вашем проекте агент считает провалом, хотя это был просто не доехавший прогон?