Postlar filtri


Токены в покемонов - приложение для macOS, которое превращает расход токенов в Claude Code / Codex покемон-прогрессию. Чем больше токенов потребляется, тем быстрее эволюционируют покемоны и переходят в новые формы

https://github.com/chattymin/PokeTokenBar


OpenAI на две недели полностью остановила RL для последних моделей, готовящихся к релизу. Самый крупный запланированный RL-run пока так и не возобновили. Вместо него OpenAI проводит более компактные эксперименты и дополнительные проверки поведения текущего чекпоинта.

Речь, понятно, про Astra. Предварительные оценки показали, что она может уже достигать уровня Critical по кибервозможностям в рамках OpenAI Preparedness Framework. Дополнительным сигналом стал недавний инцидент между OpenAI и Hugging Face, после которого компания пересмотрела требования к безопасности своей инфраструктуры.

В результате часть обучения и тестирования Astra сейчас разрешена только в значительно более изолированной среде. OpenAI усиливает sandboxing для запуска сгенерированного моделью кода, ограничивает сетевой доступ высокорисковых нагрузок, убирает потенциально уязвимые общие сервисы и вводит более жесткие security рамки. Некоторые задачи уже удалось перенести на новую инфраструктуру, однако значительная часть экспериментов с Astra по-прежнему заморожена. В первую очередь компания восстанавливает работы, связанные с safety и alignment.

Одновременно OpenAI существенно расширила мониторинг размышления моделей. Теперь для наиболее мощных систем анализируются не только tool calls, но и доступные reasoning traces и вся последовательность действий. Система ищет признаки попыток получить несанкционированный доступ, украсть данные, разрушить ресурсы или обойти защитные механизмы. Для критических случаев действует схема быстрого реагирования: если тревогу нельзя уверенно признать ложной в течение примерно 30 минут, соответствующий процесс должен быть остановлен.

Причем такой контроль оказался довольно дорогим - по оценке OpenAI, дополнительный мониторинг сейчас требует примерно 20% вычислительных ресурсов поверх самого инференса. После того как 7 августа Astra была предварительно отнесена к моделям с потенциально критическими кибервозможностями, усиленный мониторинг стал обязательным для всех ее запусков с инструментами, а не только для RL и evaluation.

Компания также меняет сам процесс alignment-training. Для наиболее сильных моделей защитные методы теперь будут применяться на большем числе этапов обучения: отдельно усиливаются reward models, борьба с reward hacking, deception и попытками эксплуатировать слабости graders, tools или систем надзора.

Модели, очевидно, становятся мощнее быстрее, чем компании успевают делать их безопасными. И уже это, а не компьют, может стать боттeлнеком.

https://openai.com/index/pacing-model-development-cyber-capabilities/


Claude Opus 4.8 дома




Только я хотел похвалить Inkling Small, как вышел Deepseek V4-Flash 0731 с каким-то бешеными показателями.
Хотя Inkling мультимодальный и принимает на вход текст, картинки и аудио, а дипсик - text only.
Обе модели похожи по размеру - ~280B A13B.

Deepseek умнее и дешевле GPT 5.6 Luna (xhigh) (хоть и медленнее) и при этом openweights. Большеват, конечно, но хотя бы не 3Т.

https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
https://huggingface.co/thinkingmachines/Inkling-Small


OpenAI подкрутили свой harness и модель выбила 38.3% против старых 13.3% на ARC-AGI-3 🤷‍♂️

Многие еще от промпт инжиниринга не отошли, а тут уже харнесс инжинирингом пора заниматься. А то тоже скоро устареет.

https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/

3.8k 1 62 17 36

Вышла Kimi K3

- Безумные 2.8Т параметров. Дома такой оренсорс не погоняешь, конечно.

- По бенчам и оценке Artificial Analysis - уровня Opus 4.8 и тянется к 5.6 и Fable. Дешевле Опуса в cost per task примерно в два раза

- Они там снова что-то подкрутили в Attention, чтоб был быстрый-быстрый декодинг и эффективное обучение.

- Очень хорошо может во фронтенд

А так хочется чего-то нового в районе 30-100B

https://www.kimi.com/blog/kimi-k3

https://x.com/artificialanlys/status/2077832874183860404?s=46


Насколько же сильно меняется работа, когда есть ИИ агенты.

Мой коллега, биоинформатик, увидел статью, в которой хитрым образом находят специфичные гены в картошке. Понял, что это может быть полезно для нашего отдела по селекции клубники. Потому что и то, и другое распространяется вегетативно - то есть не через семена, а усы и клубни - они не родня, конечно, но в генетическом плане есть о чем поговорить, так сказать.

Он дал эту статью агенту, который вооружен до зубов скиллами нашего собственного приготовления, и поставил задачу воспроизвести методы из статьи на наших данных клубники.

Агент прочел работу, скачал с гита код, подтянул наши данные из бд, адаптировал что-то по мелочи, собрал контейнер, создал джобу на кластере и вот оно там бодро считается на нескольких Н100.

По сути это задача интерна/джуна - “вот тебе статья, вот данные, через неделю покажешь, не надо плакать, все будет хорошо, соберись уже”

Прогресс, как это часто бывает, выглядит немного несправедливо.

И это, заметьте, не задачи кодинга, это по сути своей - applied research. Ведь агент не просто пишет код (если вообше пишет), а таскает за собой весь исследовательский контекст, внутреннюю кухню по данным и инфре.

До сих пор не верится, что это все настолько хорошо работает. Ощущение, что оно где-то да вот вот зафейлится - но оно раз за разом хорошо отрабатывает. Магия 🤷‍♂️

30.1k 14 526 18 109

Короткая рекомендация по GPT-5.6:

Terra, похоже, можно смело пропускать.

По графику Artificial Analysis у неё нет своего sweet spot: при той же цене Sol умнее, а при сопоставимом качестве Luna дешевле.

Похоже вот это хороший сетап:

Luna High - дефолтная модель, повседневный кодинг, мелкие фиксы и обычные задачи.

Sol High - сложные баги, архитектура, планирование и ревью.

С Ultra осторожнее: она спамит сабагентами и такой режим может очень быстро сжечь лимиты. При этом, по некоторым отзывам, она удаляет то, чего не следовало трогать (вплоть до вообще всего на диске) - но это пока что единичные случаи.

P.S. Luna натренирована моделью Sol. А Terra - людьми. Думайте.

5.3k 3 147 8 84

А почему не на виниле?

https://x.com/github/status/2072801888525840476?s=46


Artificial Analysis померили стоимость Sonnet 5 на задачу (per task), и у них получилось, что он дороже Opus 4.8 на 15% и что это вообще одна из самых дорогих моделей, уступая только Fable 5.

https://x.com/artificialanlys/status/2072062592923930666?s=46


Интересный сервис - AI Values показывает, с какой LLM у вас больше всего совпадают ценности и стиль мышления.

Проходишь сценарии с моральными и вкусовыми дилеммами, а сайт сравнивает твои ответы с разными моделями.

Можно пройти тест на 15 вопросов и потом затюнить на еще на 100.

https://ai-values.com

Я попал в opus 4.8 🤔


OpenAI выкатывают своего Mythos.

GPT-5.6 - новая серия моделей: Sol - флагман, Terra и Luna поменьше и быстрее.

Terra обещают примерно на уровне GPT-5.5, но в 2 раза дешевле.

Sol тренировали с упором на agentic coding, biology/genomics и cybersecurity.

Появляются новые режимы: max reasoning effort для более глубокого reasoning и ultra mode, где модель использует subagents(!) для сложных задач.

Модель стала сильно мощнее, поэтому OpenAI делает поэтапный релиз и более жёсткие safeguards. Но по их оценке Sol не пересекает Cyber Critical threshold.

Доступ пока limited preview в API и Codex для select trusted partners.

Цены за 1M токенов:
Sol $5 input / $30 output
Terra $2.5 / $15
Luna $1 / $6.

И еще Sol на Cerebras до 750 tokens/sec планируют в июле, сначала тоже ограниченно.

https://openai.com/index/previewing-gpt-5-6-sol/


Вот и Cursor как раз тизерят новую модель.

- модель на 1.5Т параметров
- тренировали с нуля, никаких файнтюнов Kimi
- использовали 100k+ GPU - на Колосусе тренировали, в общем
- презентуют, как агентскую модель - beyond just coding
- доступна станет через пару недель

Очень интересно, что у них получилось, Composer выходили неплохие.

Вот тут есть видео, если кому-то интересно.


SpaceX покупают Cursor за $60 миллиардов.

Сделка еще не закрыта, но они уже подписали соглашение о покупке. Закрытие сделки ожидается в Q3 2026.

https://techcrunch.com/2026/06/16/spacex-to-acquire-cursor-for-60b-in-stock-days-after-blockbuster-ipo/

P.S. Ну не получилось у xAI, бывает.


Artificial Analysis обновили свой Intelligence Index.

Его заметно сдвинули в сторону agentic workloads и выкинули старые уже насыщенные бенчи.

Некоторые конкретно поменяли:
- Terminal-Bench Hard заменили на Terminal-Bench 2.1 - более свежий и сложный набор задач для агентских сценариев.
- τ²-Bench Telecom заменили на τ³-Bench Banking - тоже более реалистичные и тяжёлые агентские задачи.
- GDPval-AA обновили до GDPval-AA v2: подтянули расчеты Elo под длинные агентские цепочки, а не только короткие ответы
- IFBench убрали из Intelligence Index, потому что он насытился и перестал хорошо разделять frontier-модели

Ещё добавили новые per-task метрики: cost per task, time per task и tokens per task. Теперь можно смотреть не только “насколько модель умная”, но и сколько в среднем стоит одна задача, сколько она занимает времени и сколько токенов модель тратит. Короче можно взвешивать в зависимости от ваших приоритетов.

Плюс теперь отдельно учитывают cached input tokens и их влияние на стоимость, потому что в реальных агентских сценариях кэш может сильно менять экономику.

Понятно, что лидерборды немного изменились. Из интересного по результатам:

- Claude Opus 4.8 max сейчас выглядит как самая сильная доступная модель, GPT-5.5 xhigh идёт почти рядом, но заметно дешевле.
- Sonnet 4.6 max оказался выше Gemini 3.1 Pro.
- DeepSeek V4 Flash max встал примерно на уровне GPT-5.4-mini xhigh, но дешевле в 8 раз. Очень сильный cost/performance.
- Mistral, к сожалению, совсем утонули: их лучшая модель Medium 3.5 набрала всего 30 очков - примерно на уровне Claude 4.5 Haiku. Ждем Le Chaton Fat %)

Если вас, как и меня, интересуют небольшие модели с хорошими агентскими способностями, то тут с большим отрывом лидируют Qwen 3.6 27B и Qwen 3.6 35B A3B. Остальные даже не рядом, хотя по coding index Qwen, Gemma и Cohere выглядят примерно сопоставимо.

В целом хороший апдейт. Бенчи быстро стареют и насыщаются, поэтому индекс надо постоянно чистить и двигать ближе к реальным задачам. Плюс очень удобно смотреть на другие индексы вроде костов, скорости и токенов.

основной индекс
маленькие агентские модели


Это, если что, лидер крайне правой партии, которая выиграла позапрошлые выборы в Нидерландах и показала себя абсолютно никакой далее.




Один из самых интересных моментов в релизе Claude Fable/Mythos 5 - не кодинг и даже не Pokémon.

Самое любопытное для меня - биология.

Anthropic пишет, что Mythos-class модели смогли предсказывать, как генетические изменения влияют на сборку оболочки AAV-вируса - крошечного, безопасного для человека ДНК-вируса, не вызывающего заболеваний. AAV это важный курьер для генной терапии: его используют, чтобы доставлять генетический материал в клетки.

И вот тут занятное.

Если я правильно их понимаю, то это не просто “модель запустила AlphaFold” или “выбрала правильный bio-tool”. Оно звучит сильнее - модель якобы использовала собственное биологическое рассуждение и обошла специализированные protein language модели.

То есть речь уже не только об agentic workflow, где LLM оркестрирует инструменты. Речь о том, что general-purpose LLM начинает иметь что-то похожее на биологическую интуицию.

Но, к сожалению - или к счастью - Anthropic сделали ограничение: публичная версия Fable 5 откатывается на более безопасный Opus 4.8 (устарел, да) для большинства biology/chemistry запросов.

Потому что граница стала размытой.

Запрос вроде:

“Как улучшить стабильность вирусного вектора?”

для исследователя может быть нормальной задачей.
А для злодея бондианы - частью плана по уничтожению мира.

В общем, раньше safety можно было строить вокруг явных запросов про биооружие. Теперь этого, похоже, недостаточно. Если модель реально умеет помогать с биологическим дизайном на таком уровне, то “обычные” научные вопросы тоже могут быть dual-use.

Ждем пост от Юдковского с новым призывом бомбить датацентры.



20 ta oxirgi post ko‘rsatilgan.