Postlar filtri


Нет, не начали. Это бред без каких-либо доказательств.

Достаточно взглянуть на автора этого «NerfBench». Это наш старый знакомый инфоцыганин Bridgemind, про чей недобенчмарк я писал ещё в июне. Он каждый день делает посты в стиле «🚨 Я ОтМеНиЛ ВСЕ 50 подписок на Claude Max!!! Claude стал хуже рисовать пеликанов на велосипедах 😡 AnThRoPiC, вы серьёзно??? 🧵👇», лишь бы набрать просмотров. Этот бенчмарк из той же серии. Причём на самом сайте прямо написано, что 90–110% это нормальный разброс, так что падение «ниже 100%» вообще ничего не значит

О теории «отупления» моделей я уже писал, и моё мнение не поменялось. С тех пор не появилось ни одного подтверждённого случая. Всё, что есть, выглядит как эта поделка от Bridgemind, и верить этому нет никаких оснований. Модели не тупеют

И очень грустно, что паблики на 2+ млн подписчиков постят такое как правду, а люди в это верят


Anthropic начали раздавать доступ к проектам в Claude Code! Я подавался в вайтлист, и сегодня мне его открыли, а некоторым юзерам доступ включили и просто так. Только не путайте с проектами в обычном Claude, где это просто папки с чатами и файлами, здесь совсем другое. По сути это что-то вроде ChatGPT Dots, только для работы. И это моя любимая функция за последнее время, она полностью меняет работу с агентом!

Проект в Claude Code — это один чат с главным агентом, оркестратором. Вы создаёте проект, подключаете репозиторий с GitHub и даёте оркестратору задачу, например «найди, почему у юзеров слетает авторизация». Сам он её не делает, а отправляет в отдельный тред. Тред — это не субагент, а полноценная сессия Claude Code со своей веткой и копией репозитория. Причём запрос он передаёт слово в слово (фактически пересылая сообщение), а не пересказывает, как это бывает с субагентами

Сбросить или сжать контекст нельзя, но тут это и не нужно, у оркестратора он как бы бесконечный. Он всегда видит последние сообщения и треды, а всё важное сам складывает в общую память проекта (можно и попросить его что-то запомнить). На эту память опираются и он сам, и каждый новый тред, так что ваши правила не забудутся и через неделю. В итоге агент знает о проекте всё, что нужно, прям как человек, который давно в нём работает. А в отличие от Dots, эту память можно открыть в настройках и поправить ручками

Самое крутое, что оркестратору можно один раз сказать «простые задачи отдавай Sonnet medium, всё, что связано с UI — Opus high, а сложные баги и архитектуру — Opus max», и он это запомнит. Потом пишете одним сообщением «добавь экспорт в CSV, переделай страницу настроек и найди, почему слетает авторизация», и он сам создаёт три треда, каждый на своей модели и ризонинге

При этом оркестратор работает очень быстро, ведь он почти ничего не делает, только создаёт треды и следит за ними. Треды по умолчанию работают в облаке и не останавливаются. Но их можно запускать и локально, достаточно включить эту функцию в настройках и попросить об этом оркестратора. Сам оркестратор останется в облаке

Дальше за тредами почти не нужно следить.

— Когда тред закончит, оркестратор получит отчёт. Можно попросить его после каждой задачи писать краткую сводку, и в ней будет кликабельный тред, жмёте и попадаете прямо в него
— Оркестратор умеет вас отмечать. Например, пишете «как будут готовы экспорт и настройки — позови меня», и придёт уведомление
— Если тред завис на запросе разрешения, вы сразу это увидите. Придёт уведомление, а оркестратор может ещё и написать в чат. В Dots такая сессия молча висела бесконечно, и Dot этого даже не замечал

А ещё оркестратор может ставить реакции на ваши сообщения, и вы ему тоже можете. Так что если что-то не понравилось, можно поставить ему клоуна или какашку 🤡💩

В итоге у такой работы три больших плюса.

— Экономия времени. Вместо того чтобы создавать кучу чатов и кидать в каждый запрос, вы кидаете всё в один чат, как в свалку, а оркестратор сам разбирается
— Дикое удобство. Я стабильно работаю с 10–20 агентами одновременно, и теперь все они в одном окне, а слева оркестратор, у которого можно обычным языком спросить статус по всем. А если нужно, заходите в чат конкретного треда и дописываете ему сами, оркестратор об этом тоже узнает. И всё это доступно с телефона в любой момент, ведь треды работают в облаке, а интерфейс там тоже очень удобный
— Экономия лимитов. Вручную переключать модели под каждую задачу многим лень, поэтому всё подряд, даже мелкие правки, обычно делает Opus. А тут оркестратор сам ставит нужные модели, и Opus используется только там, где он реально нужен. На мелкие вопросы он вообще отвечает сам, не создавая тред. А сколько токенов ушло на каждый тред и модель, видно в настройках проекта

Пока проекты в бете и доступны только на Pro и Max, в вебе, десктопе и мобильном приложении (в терминале их нет). Доступ раздают постепенно, записаться в вайтлист можно тут claude.com/form/projects

В общем, это ровно то, чего я ждал после Dots, только сделанное под работу с кодом. Anthropic, спасибо!

2.1k 2 104 110 54

Вскоре после моего поста про медленный Codex Tibo ответил, что у них сейчас сильная нагрузка, и они уже подключили дополнительные мощности. И правда, сегодня всё работает в полтора раза быстрее, 35 токенов/с вместо 22. Лучше чем ничего, но это всё ещё очень медленно и ровно в 2 раза медленнее API

В X на меня сразу набросились с комментариями типа «ну так у них и лимиты огромные!». А как по мне, лимиты тут ни при чём. Человек платит до $500 в месяц за подписку на Codex и получает сильно замедленную модель под видом обычной, и об этом нигде ни слова. А Fast, который жрёт лимиты в 2.5 раза больше, по сути просто нормальная скорость. И даже он в 2 раза медленнее Fast в API

Было бы честно сделать отдельный Slow режим с текущими лимитами, а рядом оставить обычный и Fast. А сейчас Slow по умолчанию, а нормальную скорость продают под видом Fast за x2.5 лимитов. У Anthropic, кстати, скорость в подписке и по API одинаковая, а лимиты тоже огромные. Так что претензия тут именно к отношению к подписчикам 🤷‍♂️🤷‍♂️🤷‍♂️


Ух, какой жёсткий банвейв устроили Anthropic!

Сегодня забанили очень много аккаунтов с подпиской Claude, и деньги не вернули никому. А раньше при бане хотя бы возвращали. Сначала полную сумму за месяц (что было даже выгодно), потом остаток, а теперь ноль

Банят всех подряд, не только русских, в твиттере куча жалоб и от американцев. Как именно это работает — непонятно, это почти что полный рандом. Сам я попадал под бан всего один раз, летом, на только что зарегистрированном аккаунте, и деньги тогда вернули. А на своих аккаунтах ещё с 2023 года (да, я давний юзер клода!!!) спокойно оформляю подписки, и всё норм. Так что как избежать бана, я не знаю

Крайне сочувствую всем забаненным. Я бы после такого ушёл на Codex и ставил какашки под всеми постами про Claude, где только можно. Это участь, которая настигнет почти каждого юзера клода 🙂‍↔️

3.9k 1 304 259 85

Gemini 4 Argon сейчас модель с наименьшим количеством галлюцинаций на рынке, всего 15% против 45% у Astra и 59% у Opus 5.5

А ещё она заняла первое место на Text Arena. Радует, что Google, видимо, не забыл про главное преимущество своих моделей, то есть умение общаться и большую базу знаний. В этом она должна уделывать весь рынок

Про остальные бенчмарки промолчу, во многих она проседает и выходит хуже или дороже того же Opus. Но не думаю, что так вообще можно сравнивать, бенчмарки не отражают характер модели и реальную работу с ней. Потыкаем, там и посмотрим

Вряд ли захочется переходить на неё с Opus 5.5 для агентных задач. Но там, где Gemini всегда был в топе (тексты, общение, перевод), она снова должна стать лучшей!

2.5k 1 73 45 47

Чуть подробнее о модели, благо есть ещё и блог-пост

— Публичный доступ сначала откроют платным API-клиентам и подписчикам Google AI Ultra
— Цена $2 за 1M входных токенов и $10 за 1M выходных, кэшированный вход дешевле на 95%. Но в сноске мелким шрифтом сказано, что после стартового периода цена вырастет в два раза, до $4 и $20. Сколько продлится этот период, неясно. В целом всё равно недорого
— Лимит output токенов вырос до 1 миллиона (раньше было 64K)
— Внутри Google модель уже переводит C/C++ код на Rust (вплоть до 800K+ строк ядра Zircon), освободила больше 300 TiB памяти в дата-центрах и ускорила видеодекодер libgav1 в 2.7 раза
— У модели есть фильтры безопасности, как у Fable, а доверенным защитникам её дают без кибер-ограничений. Wiz с её помощью уже нашёл критическую уязвимость в больничном ПО, которую пропустили прошлые модели

Про катофф в статье ничего нет, но по утечкам его обновили примерно до марта 2026 (реально обновили, а не как у 3.8 Flash)

Logan Kilpatrick говорит, что над моделью проделали огромную работу. Для меня это, наверное, самый ожидаемый релиз 2026 года, столько надежд на него. Эх, Геминька, не подведи!

2.3k 2 32 19 57

OMG, Google живы!

Вышел Gemini 4 Argon. Пока только для закрытой группы киберзащитников, как когда-то было с Claude Mythos. И цена-то какая — всего $2/10 по API.

Сами Google называют его следующей эрой фронтирного интеллекта. Обещают заметный рост на бенчмарках и новый уровень в долгих реальных задачах по разработке.

Бенчи на фото 2. Жду не дождусь публичного релиза!


Ровно год назад, 30 сентября 2025, OpenAI выпустила Sora 2. Сегодня у неё первый день рождения, только празднует она его в гробу 🕯

Весной OpenAI объявила о закрытии, 26 апреля закрыли приложение, а 24 сентября отключили и API, до годовщины Sora не дожила всего шесть дней. А жаль, для меня это легендарная модель, не сосчитать, сколько удовольствия она мне в своё время принесла! Я генерировал видео просто ради развлечения, это был генератор дофамина

Сейчас я от видеомоделей очень далёк. Знаю только, что на рынке есть крутые SeeDance 2.5, Kling 3 и Minimax H3, но у них у всех одна проблема — для развлечения использовать их очень дорого. Выгодные генерации были только в Sora (на релизе давали аж 30 видео в день всем бесплатно!), ну и сейчас есть у Google по подписке, но видеомодели у Google паршивые. А ещё у SeeDance лютая цензура на лица, и я без понятия, как её обходят. Может, кто-то знает? Расскажите в комментах =D

Я бы, может, и нашёл, куда применять видеомодели, но когда 10-секундное видео обходится в пару-тройку долларов... nah. Очень хочу увидеть Sora 3, надеюсь, когда-нибудь она выйдет, и в подписке с нормальными лимитами.


А кодексеров-то по подписке замедляют 😑

Я попросил Opus 5.5 покидать одни и те же запросы через Codex и API, в обычном режиме и в Fast, а для сравнения ещё через Claude Code. У GPT-6.1 Sol на подписке скорость ~22 ток/с, это прям медленно. По API — 73, в 3,3 раза больше. Даже Codex Fast (46) медленнее обычного API. А в Claude Code по подписке скорость не урезана: Opus 5.5 выдаёт ~97 ток/с, а по официальному API Anthropic ~113, почти одно и то же

Цифры примерные, TPS меняется от времени суток и нагрузки. Но то, что Codex в разы медленнее API, это точно. Похоже, OpenAI так экономит на подписчиках

Подписчики Codex и так уже много чего заметили: банкед ресеты урезаны в 2 раза, скорость в 3 раза ниже API, а в Twitter есть жалобы, что в Codex урезан ризонинг и на том же max модель думает намного меньше, чем через API. При этом все тесты и бенчмарки проводят по API, а не по подписке. Думайте. OpenAI так понемногу теряет доверие пользователей. А если вы ждали в Codex какой-нибудь /slow по типу /fast, не ждите, он у вас и так включён по умолчанию xD


А GPT 6.1 Sol, в целом-то, очень даже неплохая! Даже не ожидал.

Сегодня весь день сижу на ней вместо Opus 5.5. Opus всё ещё лучше, но разрыв меньше, чем я думал. Сначала о хорошем.

— Сильно умнее 6 Sol, по уровню действительно ближе к Astra
— Очень дешёвая, кеш подешевел в 2 раза. На старом Pro 20x лимитов хватает примерно вдвое дольше, чем на Opus на сопоставимых планах. После урезания лимитов, а также на Plus и Pro 100 будет примерно как у Opus
— Лучшая для ревью коммитов и поиска багов. Тут она обходит даже Astra

Теперь о плохом.

— Очень медленная, раз в 5 медленнее чем Opus 5.5
— Совсем не проактивная, и это очень бесит. Модели Anthropic сами делают то, что логично и с чем вы почти наверняка согласитесь, но не лезут в опасные операции вроде работы с базами данных. GPT 6.1 Sol не проявляет инициативу даже там, где ничем не рискуешь. Например, после удаления функции она может оставить в коде мусор, и убрать его получится только отдельным запросом. Эта проблема была ещё у Astra и 6 Sol, и здесь она никуда не делась
— По вкусу и UI/UX сильно хуже Claude, хотя чуть лучше Astra (прогресс минимален)

В итоге за свои деньги модель достойная, для меня один из самых удачных релизов OpenAI со времён GPT 5.5. Она уступает Opus 5.5 во всём, кроме ревью, но очень дешёвая по API, юзабельная по подпискам (а ChatGPT даёт ещё много всего помимо лимитов на Codex) и после провальных 6 Sol и 5.6 Sol смотрится как глоток свежего воздуха. Больше всех повезло тем, у кого до вчерашнего дня был ChatGPT Pro 20x — им начислили $2500 кредитов, а большие лимиты сохранятся до конца октября.

Сам точно буду использовать GPT 6.1 Sol как минимум для ревью коммитов от Opus, выходит супер дёшево и качественно. Основной моделью оставляю Opus 5.5.


Dots уже начали раскатывать юзерам вне ЕС, достаточно врубить VPN, например США. Проверить, дали ли его вам, можно на chatgpt.com/dots

Я создал своего дота и попользовался им пару часов, вот главное:

— Работает на GPT 6 Astra, модель и уровень размышлений поменять нельзя
— Доступен на подписках от $100
— Первый месяц для всех без лимитов, в конце октября их введут
— Dot работает как оркестратор. Например, напишете «сделай 3D-модель лошадки», и он передаст задачу субагенту, а вам сразу ответит что-то вроде «Создам модель лошадки». Когда субагент закончит, Dot получит уведомление и пришлёт результат. Эти субагенты, судя по всему, не Codex и не Work, так что лимиты не тратят
— У Dot свой виртуальный компьютер с предустановленными Chrome, Blender, Paint и ещё парой приложений
— Можно подключить свой компьютер, и пока открыт ChatGPT App, Dot сможет запускать на нём сессии Codex
— Может смотреть и создавать сессии Codex и Work, в том числе с выбором модели. Это уже тратит лимиты

Больше всего бесит, что сессии Codex/Work Dot всегда создаёт в режиме разрешений Auto, и поменять это нельзя. Если вы попросите Dot забронировать отель в браузере на маке, сессия упрётся в первый же запрос разрешения на Computer Use и застынет. Dot этого не видит. Он думает, что всё идёт по плану, и будет ждать бесконечно, а вам ничего не скажет. Заметите это, только когда откроете ноутбук

И настроек у Dot нет вообще, даже контекст сбросить нельзя, всё в одном чате. Хотелось бы хотя бы базовых вещей вроде выбора режима разрешений, а ещё возможности подробнее смотреть, что происходит внутри. Хотя, похоже, это осознанное решение

Прародитель всего этого — OpenClaw, о котором узнали даже люди далёкие от ИИ. Но он был перегружен настройками и жутко неудобный. Dots — полная противоположность, максимально простой интерфейс и ни одной настройки. OpenAI явно метят в массовую аудиторию (у них в Dots даже интерфейс 1 в 1 с iMessage, лол, всё для американских подростков))

В целом Dots — интересная штука с большим потенциалом, но пока сыровато. Если допилят, возможно, даже продлю подписку на ChatGPT ради него. Мне давно не хватает такого личного агента! В обычных чат-ботах вроде Claude у каждого чата свой контекст, и один не знает, что было в другом. А тут один агент, который помнит всё, умеет всё и делает кучу задач параллельно. Это круто.

Очень надеюсь, что Anthropic тоже сделают что-то подобное. Их модели приятнее в общении, и из них вышел бы отличный повседневный ассистент!


OpenAI раздают по $2500 на баланс кредитов подписчикам Pro 200 в честь понижения лимитов. Раздача идёт постепенно

$2500 = почти 2 недельных лимита Pro 20x, то есть как 4 недельных лимита Pro 200 после уменьшения. Вполне щедро. Принимаем 😈

2.6k 2 81 26 31

Подписчики нового ChatGPT Pro за $500 уже жалуются на лимиты 😃

Неудивительно, ведь все сразу побежали пробовать Ultrafast, а он пока есть только на Astra и стоит в 6 раз дороже. Astra и сама по себе не из дешёвых, а с множителем х6 лимиты выходят наверное как у Sol на Plus за $20

Ultrafast для Sol 6.1 обещают «в ближайшее время» (когда-нибудь), и там он, скорее всего, будет юзабельным. По логике лимиты окажутся примерно как у Astra на Pro за $200 на старте. Жить можно.

Если у вас уже есть Pro за $200, переходить на $500 сейчас нет смысла. За доплату в $300 вы получите +25% к лимитам и Ultrafast, которым нормально не попользуешься. А вот после урезания лимитов в конце октября апгрейд может пригодиться тем, кому их станет не хватать, и у кого есть такие деньги и желание платить OpenAI 🤪

2.1k 2 27 30 22

В Codex всем выдали banked-ресет. А в Claude добавили… сбросы пятичасовых лимитов... что? То есть теперь видимо на релизах новых моделей вместо нормального сброса будут раздавать сбросы 5ч. Ладно.

2.2k 2 38 38 42

Theo в новом видео похвалил новую 6.1 Sol

Краткий пересказ:
- GPT 6.1 Sol — ответ OpenAI на Opus 5.5, вышла через неделю после GPT 6 Sol.
- Заметно умнее GPT 6, но медленнее по токенам: похоже на новую, более крупную модель, а не снапшот.
- $2 за миллион токенов на вход, $10 на выход, чтение из кэша $0,10 (скидка 95%). Для агентов это очень дёшево.
- Рекорд в Terminal Bench. В DeepSWE на low тот же результат, что у Opus 5.5 на max, за $0,21 против $14,65 и в 10 раз быстрее.
- Намного стабильнее Astra, без тупых провалов. Ей можно доверить даже заполнение банковских переводов.
- Лучшая для код-ревью и поиска багов: находит то, что пропускают Opus и Fable.
- Хороша в computer use и Blender.
- Фронтенд и дизайн ужасные, игровая механика кривая. Opus в этом гораздо лучше.
- В долгой автономной работе буксует: порт TypeScript на Rust не сдвинула, Opus сделал его за ночь.
- Opus 5.5 остаётся основной моделью, 6.1 Sol заменяет Sonnet для ревью и расследований.

Такие дела!

2.2k 2 63 34 16

Также dots не тратят лимиты использования — по факту, там безлимитная GPT 6 Astra, доступно и на тарифе за 100. Но может есть подвох, посмотрим 👀


Агенты dots начинают раскатывать с сегодняшнего дня, но в ЕС, Швейцарии и Великобритании они недоступны 🫤 ставим VPN'ы с США и надеемся что поможет


6.1 Sol, если что, и есть та самая "6 Astra Minor". Непонятно, зачем они выпустили 6 Sol в своё время, просто попозориться недельку.. Посмотрим, может 6.1 будет неплохой, они её как ответ Opus 5.5 по факту показывают.

1.9k 0 27 22 31

Лимиты на Pro $500 = 25х от Plus, то есть почти также, как было раньше за $200


Ultrafast будет доступен только на подписке за $500 для моделей GPT 6 Astra (боюсь что будет с лимитами) и GPT 6.1 Sol. Скорость — до 8 раз быстрее чем в обычном режиме

2k 1 29 13 16
20 ta oxirgi post ko‘rsatilgan.