Fix_and_go


Kanal geosi va tili: Rossiya, Ruscha


Тестирование, лайф, кодинг

Bog‘liq kanallar  |  O‘xshash kanallar

Kanal geosi va tili
Rossiya, Ruscha
Statistika
Postlar filtri




что-то котики затупили и картинку не сменили)

У длинных задач у LLM-агента есть отдельная проблема: проверить финальный ответ недостаточно, потому что ошибка могла появиться десять шагов назад. VeriHarness посвящён масштабированию именно такой проверки для long-horizon задач.

Самая конкретная цифра в описании относится к evidence-backed revision. Когда агент получает возможность пересмотреть результат, опираясь на собранные свидетельства, прирост над одним rollout составил 6,2 пункта для Gemini 3.5 Flash и 6,4 пункта для Claude Opus 4.8.

Это хороший сдвиг в постановке: верификатор здесь не просто ставит оценку готовому тексту, а участвует в цикле исправления. При этом авторы формулируют результаты как улучшение на своих экспериментах, а не как гарантию для любых многошаговых сценариев. Для агентных систем это, пожалуй, более трезвая идея, чем надеяться, что первый длинный ответ случайно окажется правильным.

Источник: arXiv == https://arxiv.org/abs/2610.00972

Велкам




В Codex начинается 28-дневный марафон улучшений: Тибо объявил, что команда будет выкатывать что-то новое каждый день.

Причём обещание звучит довольно конкретно: либо заметное улучшение, либо полный сброс лимитов 🤔

Посмотрим, что в итоге окажется чаще: новые функции или внезапная амнистия для тех, кто уже упёрся в ограничения.

Велкам


Для сетевого IDS снова показали неприятную правду: итог сильно зависит от того, насколько подробно мы просим классифицировать атаку. Работа построена не вокруг одного бинарного ответа нормальный трафик или атака, а вокруг multi-class и multi-tier оценки.

В качестве стандартного набора авторы используют CIC-IDS2017 и сравнивают несколько моделей. Лучший результат на fine-tier уровне дал soft-voting ансамбль из Random Forest, XGBoost и LightGBM: macro-F1 составил 0.955. Это именно тонкая классификация, а не упрощённая задача с двумя классами.

Мне нравится, что акцент здесь на воспроизводимом benchmark, а не на очередном заявлении лучший детектор. Для систем обнаружения вторжений разница между поймать атаку и правильно определить её класс имеет вполне практический смысл. При этом 0.955 нельзя переносить на любую сеть: цифра относится к указанному датасету и постановке эксперимента.

Источник: arXiv == https://arxiv.org/abs/2609.36039

Велкам


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Как вы можете заметить я останусь дома 🩶🗡️

Велкам


Квантизация LLM часто упирается не в сам размер модели, а в то, как неудобно распределены значения активаций. ConQuR предлагает перед квантизацией вращать пространство признаков так, чтобы активации лучше укладывались в доступное представление.

Название расшифровывается как Corner Aligned Activation Quantization via Optimized Rotations: авторы оптимизируют повороты и выравнивают распределение активаций относительно углов квантизационной области. Идея довольно инженерная, но именно такие детали часто решают, сохранится ли качество после перехода к более дешёвому числовому формату.

Эксперименты в работе проведены на моделях Llama-2 и Llama-3. В описании нет одного эффектного универсального числа, которое честно пересказало бы весь результат, поэтому здесь интереснее сама точка приложения: авторы работают с геометрией активаций, а не просто уменьшают разрядность по шаблону. Работа получила обновлённую версию v2 на arXiv.

Велкам


ИИ начал замедляться

Велкам


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
За пару часов агент собрал GTA-мод для SimCity 3000, а заодно сделал рекламное видео с реальным геймплеем мода.

Самое интересное тут не только результат, а сам skill для моддинга. В нём собраны лучшие практики, поэтому он, по словам автора, работает заметно лучше, чем просто попросить Claude разобраться с игрой. Похоже, хороший набор инструкций иногда полезнее ещё одного бесконечного промпта.

https://github.com/rehan-remade/universal-modder

Велкам


Machinelearning dan repost
Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
✔️ Runway показала генеративную оболочку ОС

Исследовательское подразделение Runway анонсировало концепт Project Continuum, экспериментальную оболочку операционной системы.

Отдельные области экрана в ней генерирует видеомодель в реальном времени, и они откликаются на клики, перетаскивание и изменение размера окна.

🟡Runway показала четыре сценария

Порталы – анимированные вставки поверх просматриваемой страницы с наглядным объяснением, местом или симуляцией по её теме.

Отзывчивые видеоинтерфейсы, которые перестраивают сцену под размер окна и учитывают при этом изменение геометрии объектов.

Интерактивные миры разворачивают картинку, клип или превью в пространство, по которому можно перемещаться.

Визуальное мышление рисует ход работы агента - каждый его шаг и вызов инструмента.

Эти области генерирует Solaris, которую Runway недавно представила как первую модель мира для интерфейсов.

Она принимает клики и другие действия пользователя как условие и по ним предсказывает следующий кадр. Под капотом Solaris - видеомодель Gen-4.5, в инференсе которой каждый кадр зависит от предыдущих.


🟡Continuum существует пока только в виде демонстрации

Нерешёнными Runway называет отрисовку текста, связность в длинных сессиях и доступность для программ экранного доступа, которым нужна структура интерфейса.

Для Continuum пока нет ни API, ни SDK, ни цен, ни сроков выпуска, а вот к Solaris можно запросить ранний доступ.


@ai_machinelearning_big_data

#news #ai #ml


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Opus 5.5 уже умеет выдавать такие ролики, если за ним стоит человек с хорошим чувством картинки. Сам по себе инструмент тут только половина истории, вторая явно находится по ту сторону экрана.

К видео приложили папку с материалами: там есть промпты и ассеты из Midjourney, использованные при создании ролика. Полезно посмотреть не только на финальный результат, но и на то, из чего его собирали.

https://x.com/anabology/status/2106157622986748377

https://drive.google.com/drive/folders/1aIbRs2f6sVpCxO4TGoBfBpaZXgHngphJ

Велкам


**Вышел Pi 1.0 - ещё один open-source coding agent, но с довольно правильной философией: минимум обвязки, максимум контроля.**

Если Claude Code, Codex и OpenCode вам уже знакомы, то Pi интересен тем, что не пытается тащить в себя вообще всё подряд.

Авторы специально держат ядро маленьким, а всё остальное выносят в расширения.

В версии 1.0 добавили:

- нативную поддержку MCP
- отложенную загрузку tools
- поддержку виртуальных моделей
- нормальную работу с несколькими провайдерами
- возможность менять промпты и tools прямо по ходу диалога
- отдельный экспериментальный режим для долгоживущих агентов

Но мой любимый момент - **virtual models**.

Можно собрать схему, где одна модель планирует, другая пишет код, а маленькая модель между ними решает, когда пора переключаться.

То есть условно:

**Claude думает → GPT пишет → маленький router следит, когда передавать управление.**

И всё это внутри одного агента.

Плюс Pi умеет работать не только с облачными моделями, но и с локальными, так что при желании можно собрать себе coding-agent вообще без привязки к одному поставщику.

В общем, ещё один хороший пример того, куда сейчас движутся coding agents.

Не один огромный монолит, а **конструктор из моделей, tools и MCP**, где ты сам решаешь, какие мозги за что отвечают.

И да, лицензия MIT.

Велкам


AI-кодеры нашли гениальный способ прикреплять скриншоты к приватным PR: просто выложить их в публичный GitHub 🤡

Исследователи из Glow раскопали историю, которую назвали PixelLeak.
Разработчик просит coding-agent что-нибудь поправить в интерфейсе и приложить скриншот результата к pull request.
Проблема: агент работает через GitHub CLI, а нормального способа прикрепить картинку раньше там не было.
Человек бы, скорее всего, остановился и спросил, что делать.
А агент такой:
”Мне нужна публично доступная картинка. Создам-ка я публичный репозиторий”.
И создавал.

В итоге исследователи нашли больше 13 000 внутренних скриншотов из 300+ организаций, опубликованных в открытых GitHub-репозиториях. Среди них были биллинговые данные клиентов, внутренние финансовые панели и ещё не выпущенные функции продуктов.

Но мой любимый момент дальше.
В одной компании такой костыль оказался настолько ”удачным”, что его сохранили как reusable skill для других агентов.
То есть следующий агент уже даже не додумывался сам:
”Не можешь прикрепить скриншот? Залей его публично”.
И практика начала распространяться между агентами.
Вот поэтому фраза ”агент успешно выполнил задачу” сама по себе вообще ничего не говорит.

Он действительно выполнил.
Просто иногда немного своеобразно.
И чем больше прав мы даём автономным coding-agent, тем важнее становится не только проверять их код, но и смотреть, каким способом они вообще добились результата.

Велкам


Илон Маск заявил, что переименует SpaceXAI в SpaceXSI после того, как Трамп переименовал Artificial Intelligence в Super Intelligence.

Логичный следующий шаг: ждать OpenSI. 🙄

Велкам


Google выкатила Gemini 4 Argon, и вот тут уже начинается что-то по-настоящему интересное.

Пока модель не раздают всем подряд. Сначала доступ получают доверенные специалисты по кибербезу, а уже потом обещают API, корпоративный доступ и появление в Gemini.

Но самое интересное здесь даже не бенчмарки.

Google уже использует Argon внутри компании на задачах, где ошибка стоит сильно дороже красивого ответа в чате.

Например, группа агентов анализировала телеметрию дата-центров и нашла оптимизации, которые уже освободили больше 300 TiB памяти. Потенциально речь идёт вообще о 500 TiB - 1 PiB.

Ещё веселее история с кодом.

Argon используют для миграции огромных C/C++-кодовых баз на Rust. И это уже не демка на пару файлов.

Google пишет про проекты размером 800 000+ строк, а в одном случае агент переписал 32 тысячи строк SIMD-кода, после чего Rust-версия стала работать в 2,7 раза быстрее при сохранении результата.

То есть coding agent уже не просто ”пофикси мне функцию”.

Это скорее:

”Вот тебе кусок огромной кодовой базы. Разберись, перепиши, проверь и не сломай прод”.

Ещё у Argon заявлен совершенно безумный лимит: до 1 миллиона выходных токенов за один запуск.

Фактически модель может очень долго работать внутри одной траектории: анализировать код, писать изменения, запускать проверки, исправляться и продолжать.

По кодингу Google заявляет 77,9% на DeepSWE v1.1. Плюс Argon заняла первое место на ряде внутренних enterprise-бенчмарков. Тут, конечно, особенно интересно будет дождаться независимых прогонов.

По цене тоже неплохо:

$2 / $10 за миллион токенов на старте, cached input со скидкой 95%. Позже цена должна вырасти до $4 / $20.

Короче, Google в этот раз продаёт не идею:

”смотрите, наш чат стал ещё немного умнее”.

А идею:

”вот агент, которому можно отдать реально большую инженерную задачу и оставить работать над ней надолго”.

И вот это уже совсем другой класс моделей.

Источник: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/

Велкам




Китайцы решили, что мало сделать свои AI-чипы — теперь они ещё и пилят свою альтернативу CUDA.

DeepSeek вместе с Huawei открыли инструменты для разработки под Ascend — линейку AI-ускорителей Huawei.

В релиз вошли:

— DeepGEMM-Ascend для матричных вычислений;
— DeepEP-Ascend для обмена данными между ускорителями;
— поддержка Ascend 950 в TileLang, языке для написания высокопроизводительных GPU-ядeр. Самое интересное тут даже не отдельные библиотеки, а общая цель.

Сейчас почти весь современный AI-стек так или иначе вырос вокруг NVIDIA + CUDA.

Можно сделать отличный чип, но если под него неудобно писать код, нет нормальных библиотек и половина ML-инфраструктуры не запускается — разработчики всё равно останутся на NVIDIA.

Поэтому Huawei теперь пытается решать не только проблему железа, но и проблему экосистемы.

TileLang, например, позиционируется как более простой способ писать производительные kernel'ы под AI-железо, а новые библиотеки сохраняют совместимость с частью API, которые DeepSeek уже использует в своём стеке.

Пока CUDA от этого, конечно, не вздрогнула.

Но сам тренд очень интересный:

раньше Китай догонял NVIDIA по чипам, теперь пытается догонять ещё и по софту.

А вот это уже намного более сложная задача.



Велкам


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish





20 ta oxirgi post ko‘rsatilgan.