OpenAI заявила, что достигла собственного ориентира на сентябрь 2026 года: автоматизированный исследовательский стажёр уже умеет под человеческим руководством выполнять чётко поставленные задачи, на которые у специалиста ушло бы несколько дней. Не автономный учёный, а довольно серьёзный кусок исследовательского цикла: написать код, запустить эксперименты, разобраться с инфраструктурой и подготовить результаты.
Самая показательная цифра здесь не формулировка про стажёра. К середине августа исследовательская организация OpenAI использовала 3,1 агентских рабочих дня на каждый рабочий день людей. При этом медианный исследователь тратил на inference больше $600 в день по API-тарифам, а пользователь из 90-го процентиля превышал $7000 в день.
Это уже похоже не на чат с помощником, а на вычислительный слой вокруг исследовательской команды. Агентов запускают параллельно, и они постепенно забирают не только написание кода, но и техническую поддержку, мониторинг запусков и более длинные задачи.
Но в этой истории есть важная оговорка. OpenAI сама пишет, что более половины успешных задач длительностью 4-8 часов за последние шесть месяцев требовали хотя бы одного вмешательства человека. Сложность растёт быстрее, чем автономность, а вычисления пока тоже остаются ограничением. Метрики предварительные, внутренние и в основном основаны на данных самой компании.
Зацепило то, что OpenAI впервые показывает не красивый benchmark модели, а попытку посчитать AI как рабочую мощность внутри исследовательской организации. Похоже, следующий вопрос для лабораторий будет не только в том, насколько умна модель, но и сколько параллельных исследовательских циклов она реально выдерживает.
Источник: https://openai.com/index/research-acceleration-view-inside-openai ([openai.com]())
Самая показательная цифра здесь не формулировка про стажёра. К середине августа исследовательская организация OpenAI использовала 3,1 агентских рабочих дня на каждый рабочий день людей. При этом медианный исследователь тратил на inference больше $600 в день по API-тарифам, а пользователь из 90-го процентиля превышал $7000 в день.
Это уже похоже не на чат с помощником, а на вычислительный слой вокруг исследовательской команды. Агентов запускают параллельно, и они постепенно забирают не только написание кода, но и техническую поддержку, мониторинг запусков и более длинные задачи.
Но в этой истории есть важная оговорка. OpenAI сама пишет, что более половины успешных задач длительностью 4-8 часов за последние шесть месяцев требовали хотя бы одного вмешательства человека. Сложность растёт быстрее, чем автономность, а вычисления пока тоже остаются ограничением. Метрики предварительные, внутренние и в основном основаны на данных самой компании.
Зацепило то, что OpenAI впервые показывает не красивый benchmark модели, а попытку посчитать AI как рабочую мощность внутри исследовательской организации. Похоже, следующий вопрос для лабораторий будет не только в том, насколько умна модель, но и сколько параллельных исследовательских циклов она реально выдерживает.
Источник: https://openai.com/index/research-acceleration-view-inside-openai ([openai.com]())