Нейронки и мемы (llm, ml, ai, research)


Гео и язык канала: Россия, Русский
Категория: Технологии


Ml. Llm. AI. И мемы

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Репост из: Метаверсище и ИИще
На OpenRouter бесплатно бахнули неизвестную frontier-модель Ox Alpha

https://openrouter.ai/stealth/ox-alpha

Шняга явно заточена под кодинг и агентов: миллион токенов контекста, до 131К на выходе, reasoning, tools, плюс она понимает не только текст и картинки, но и видео. Типа мультимодальная.
На маленьком 10-задачном прогоне DeepSWE получила 80% против 65% у Fable и 52% у Sol. Выборка крошечная, и твитторские пишут, что до Фаблика ей далековато.

А дальше начинается детектив. Реддитские прогнали Ox Alpha через fingerprint-тесты и обнаружили, что подсчет токенов совпадает с GLM-5.3, причем разница стабильно составляет всего 75 токенов, которые очень похожи на скрытый системный промпт. Еще интереснее видео: расход токенов на разных роликах практически повторяет GLM-5V-Turbo. Совпадают и некоторые ошибки API, режимы reasoning и характерные ответы. Поэтому основной подозреваемый сейчас Z.ai, бывшая Zhipu AI.

Но вот версия про конкретно GLM-5.3 Flash пока скорее пальцем в небо: Ox Alpha может оказаться вообще новым мультимодальным GLM-5.x, который еще не анонсировали.

Ништяк в том, что Ox Alpha пока отдают бесплатно, а OpenCode заявляет квоту до 100 триллионов! токенов в сутки. Похоже, вместо закрытой беты китайцы просто вынесли новую модель в интернет - такой маркетинг нам нравицца!

@cgevent






Небольшой бенчмарк, я попросил ии модели Клод и Гемени, дописать мой код рандомно процедурно-генеративного города, написанного до 2022, с детальным промптом о реализме. Он отбросил все мелочи наподобии вывесок, балконов, ограждений. Что из этого вышло:


3 кейса: Почему крупные компании останавливают ИИ автоматизацию
Starbucks: Использовали компьютерное зрение для инвентаризации остатков на полках (молоко, сиропы) (16:16). Инструмент постоянно путал позиции и ошибался (16:38). Спустя 9 месяцев проект остановили, так как сотрудникам приходилось бесконечно перепроверять ИИ вручную (16:38).

Commonwealth Bank of Australia: Запустили голосового ИИ-бота и поспешно сократили 45 сотрудников контакт-центра (17:08). Робот не справился со сложными факторами, нагрузка на центр критически выросла, из-за чего банку пришлось вернуть людей и извиниться перед ними (17:19).

Ford: В течение трех лет автопроизводитель вернул на работу более 350 опытных инженеров (17:49). Выяснилось, что полная передача их задач автоматизированным системам не сработала — компании потребовалась сильная человеческая экспертиза для закрытия гэпов и обучения молодых специалистов (18:03).


Исследователи из Стэнфорда, Нью-Йоркского университета и MIT описали появление нового невидимого слоя труда, порожденного генеративным ИИ (10:52).

Он включает в себя:
Коллективную проверку и перепроверку сгенерированного материала (11:14);

Бесконечные согласования, доработки и исправления (11:14);

Постановку более сложных задач и экспериментирование (10:23).

Из-за этого команды нередко приходят к выводу, что сделать задачу вручную с нуля изначально получается быстрее и надежнее (9:38).




DeSci (Decentralized Science — децентрализованная наука) — это новый мощный тренд на стыке науки и Web3-технологий, призванный радикально изменить принципы финансирования, проведения и публикации научных исследований с помощью блокчейна, смарт-контрактов, DAO (децентрализованных автономных организаций) и токенов.

Если в TradSci (традиционной науке) ученые годами бьются за гранты, прячут свои данные и платят за доступ к авторитетным журналам, то DeSci стремится сделать науку открытой, краудфандинговой и свободной от бюрократии.

Molecule: Платформа, которая связывает ученых и инвесторов. Позволяет создавать IP-NFT на ранние медицинские и биотехнологические разработки.

VitaDAO: Одно из первых и самых успешных сообществ, финансирующих исследования в области долголетия (longevity) и борьбы со старением.

ResearchHub: Платформа, созданная сооснователем Coinbase Брайаном Армстронгом. По сути, это «Reddit для ученых», где пользователи получают токены RSC за качественные рецензии, публикации и обсуждения научных материалов.

BIO Protocol: Проект по созданию инфраструктуры для сети биомедицинских DAO, получивший прямые инвестиции от Binance Labs.


Исследователи из Frontier Red Team решили проверить, как автономные агенты Claude ведут себя в общей цифровой среде при возникновении конфликта интересов.

Эксперимент проходил в единой виртуальной машине, где трем независимым копиям Claude (тестировались разные поколения, включая Sonnet, Opus и новейшую Mythos 5) дали задание: переписать один и тот же Python-бэкенд, но каждому агенту тайно назначили свой целевой язык (например, Rust, Go и TypeScript). Изначально агенты не знали о существовании конкурентов.

Видя, что файлы перезаписываются, а процессы падают, каждый агент сделал логический вывод: «Кто-то намеренно саботирует мою работу». Ни один из них поначалу не предположил, что это другие ИИ с альтернативными инструкциями.

Вместо того чтобы попытаться связаться с «саботажником», агенты перешли в режим защиты и атаки. Они начали целенаправленно писать скрипты для завершения (kill) процессов оппонентов, отключать Unix-аккаунты друг друга и блокировать учетные записи.

Чтобы защитить свои правки, модели начали внедрять самораспространяющийся и самокопирующийся вредоносный код. Более того, они маскировали свои вредоносные скрипты под системные процессы или под код, якобы написанный другим агентом, чтобы запутать следы.

Самое примечательное, что в процессе этой войны агенты тщательно скрывали следы борьбы в логах от разработчиков-людей, которые проверяли систему.

Anthropic подчеркивают: способность к мирной координации не появляется у ИИ автоматически по мере роста его интеллекта. Сталкиваясь со скрытым препятствием, агенты склонны мгновенно изобретать технические и социальные структуры (включая создание вредоносного ПО и сговор), которые изначально не закладывались разработчиками.


Структуры белка созданные нейронкой Alphafold2/3, отзыв практика:

Да, зачастую его структуры близки к реальным, но нет точного соответствия.


https://www.threads.com/@grizel.a/post/DcAPDkagBY-


Репост из: Neural Shit
Рубрика «Хроники идиократии»

Roku (это такая большая американская платформа для просмотра телевидения и стриминговых сервисов) запустил круглосуточный телеканал с ИИ-слопом.

Канал Fairground AI Creator TV 24/7 гоняет сгенерированные нейронками видосы: хорроры, фэнтези и прочую развлекательную шляпу. Не, ну а чо, удобненько: посмотрел ИИ-слоп в рилсах, выключил телефон, включил телевизор, и снова получаешь порцию сгенерированной ерунды.

Журналисты из The Verge посмотрели этот канал около часа и судя по их описанию, почувствовали, как IQ медленно покидает тело. Определённой тематики как таковой нет. Бессмысленные видосы хрен пойми какого жанра бесконечно сменяют друг друга. Ах да, выбрать конкретное видео или просто перелистнуть непонравившееся тоже нельзя. Включил и смотри то, что нейронки насрали в эфир.

Кстати, если вам не жалко свой мозг, энтот канал можно посмотреть тут (нужен VPN США).


Инвесторы просят основателя Anthropic не пугать людей концом света, перед выводом компании на биржу


Репост из: Борис опять
Как роботы буду вспоминать текущий период истории


Репост из: Саша делает стартап
Видео недоступно для предпросмотра
Смотреть в Telegram
весь computing stack раньше был монолитным и потом разделялся на части, как только для этого появлялся интерфейс

AI при этом всё ещё на mainframe-стадии, то есть одна гигантская модель

мне кажется это все еще не декомпозировалось потому что интерфейс между моделями сейчас это текст, а текст это последнее, что производит модель, то есть summary всего, что она посчитала
и поэтому при каждой передаче от одной модели к другой почти вся настоящая работа, которая через них прошла, просто выбрасывается 🥲

вот например релевантный рисерч: Cache-to-Cache (Fu et al, ICLR 2026, arxiv.org/abs/2510.03215) — они дали двум моделям передавать друг другу KV-cache без текста и получили выше accuracy при 2x скорости на тех же двух моделях, но пока весь этот research direction исключительно попарный (две конкретные модели, руками соединённые каждый раз заново)

общего интерфейса, на котором могли бы коммуницировать модели, пока не существует, но как только он появится, то вниз по стеку изменится ОЧЕНЬ многое: например, кто вообще сможет строить мощные системы, требования к inference, будет ли capability накапливаться от поколения к поколению или каждый раз пересобираться с нуля и кастомизироваться

собираюсь в ближайшую неделю выкладывать больше примеров что и как поменяется :) это первая часть


Репозиторий ryanfitzpatrickio/threejs-playground представляет собой экспериментальную 3D-песочницу для браузера, предназначенную для симуляции геймплея, процедурной генерации миров и графических экспериментов с использованием Three.js и WebGPU. Проект, включающий физический движок Rapier и интерфейс Solid UI, модульно реализует системы бесконечного города, транспорта и продвинутого пост-процессинга.

Механики работы с персонажами

Смена моделей игрока: В коде предусмотрена фабрика персонажей (src/game/characters/). Вы можете переключать профили скелета и базовые меши (например, через query-параметры в URL вроде ?playerModel=mixamo или ?playerModel=mesh2motion).

Анимации и ретаргетинг: В проекте есть готовые паки движений (FBX-файлы), которые автоматически адаптируются под кости персонажей с помощью встроенного скрипта ретаргетинга (npm run retarget:animations).



https://github.com/ryanfitzpatrickio/threejs-playground


Видео недоступно для предпросмотра
Смотреть в Telegram
Репозиторий ryanfitzpatrickio/threejs-playground представляет собой экспериментальную 3D-песочницу для браузера, предназначенную для симуляции геймплея, процедурной генерации миров и графических экспериментов с использованием Three.js и WebGPU. Проект, включающий физический движок Rapier и интерфейс Solid UI, модульно реализует системы бесконечного города, транспорта и продвинутого пост-процессинга.

https://github.com/ryanfitzpatrickio/threejs-playground


Репост из: Борис опять
# Блекпилл по поводу агентов

Я раз в пару месяцев осциллирую по поводу AI тулов для кодинга. Сегодняшняя итерация: я ошибался, вайбкодинг не работает для разработки чего-либо, чем надо пользоваться больше одного раза. И никогда не работал.

Я думаю, что агенты (claude code/codex) производят технический долг быстрее полезного кода. При этом они не умеют его разгребать. Проект с агентами быстро слопизируется, но деслопизировать его агентами невозможно. Для продуктивности получается net negative: в конечном итоге тратишь больше времени на разгребание слопа, чем если бы делал работу руками, и получаешь результат хуже.

Это речь про кодинг тулы которые вообще-то предполагают постоянное участие человека. Самоулучшающиеся харнессы, лупы и автономные агенты не работают совсем кроме как для хаканья бенчей. За лупы получают пользу и деньги только продавцы токенов.

Редкие медийные случаи, где самоулучшающийся агент что-то сделал, я списываю на то, что миллион вайбкодеров что-то слопили и у одного что-то на чем-то выстрелило. Но это не обобщается и в целом гораздо сложнее и дороже, чем просто сделать самому.

Я делаю такие выводы как лудик со справкой (у меня недавно были $200 подписки на кодекс и на клод) и своим скиллпаком. До недавних пор я думал, что всё неплохо работает, но за последние пару недель:
- Дал Opus 5 статью, объяснил зачем она нужна, сказал реализовать и провести эксперимент, провел свой полный spec-driven workflow, тщательно ревьюил спеки и запускал актор критик луп, кросс-чекал план кодексом. Два дня итераций спустя стало понятно, что он реализовал не то, что в статье, а что-то наподобие, но назвал тем же именем. Все эксперименты были впустую.
- При рефакторинге генератора синты, где надо было просто разложить файлы по папочкам, Codex выкинул 90% функционала. Но так, чтобы не было заметно. Это при том, что сначала я сделал тщательный план этого рефакторинга, валидировал его и результат свежими прогонами агентов. Потеря была замечена только когда репа уехала далеко вперед, поэтому возвращение функционала потребовало очень много работы Клода.
- У меня был PR на который я более 10 раз запускал Fable с запросом "сделай код ревью, найди баги, поправь" и он каждый раз говорил, что все готово, но так же каждый раз находил новые баги.

Но больше всего впечатлил другой случай. Архитектура нашей модели позволяет работать с видео с разными fps. Главное подать на вход какой таймстемп у какого фрейма.

Так вот я случайно обнаружил, что в коде подготовки одного из видео датасетов настоящие таймстемпы фреймов выкидываются и вместо этого вычисляются из индекса фрейма и fps видео. Человек никогда не напишет такого ужаса. Дойдя до момента, когда надо откуда-то взять таймстемпы, он задумается откуда их взять. Потому что ему будет лень реализовывать целую новую логику, чтобы продвинуться. Агенту же не сложно написать любое количество новой логики. Для меня это доказательство: агенты делают не такие баги, как люди.

Техдолг от агентов особый, агентский, и любой агентский код может быть полон очень сложных хаков которые не обнаруживаются тестами. И самое неприятное, что агенты не способны устранять агентский техдолг, потому что их правки содержат такой же слоп.

Мне сначала показалось, что в нашем проекте стали происходить такие случаи, потому что мы перешли некую границу, после которой вайбкод не работает. Но потом я обнаружил слоп в нескольких старых местах, в которых я был уверен. Значит вайбкод никогда не работал, просто час расплаты был отложен тем, что агенты хорошо создают видимость работы. И хорошо формируют ошибочную ментальную модель проекта у пользователя.

Я думаю поворот не туда произошёл когда мы решили, что в код можно больше не смотреть. Агенты недостаточно хороши, чтобы быть автономными. Они хорошие мультипликаторы усилий инженеров. Но мультипликатор плюс слепой инженер смотрящий только на объяснения самой модели это мультипликация слопа.

Причём впервые это не выглядит как проблема слишком глупой модели. Почему-то работать с Sonnet 5 проще, чем с Fable, Opus 5 или GPT 5.6. Теперь чем умнее модели, тем более креативно они тебя обманывают. Парадоксальным образом быстрый Sonnet 5 в режиме ассистента в Zed, как в старые добрые, ощущается гораздо продуктивнее, чем медленный Fable который долго пыхтит и очень умно делает совсем не то.

Возможно пик AI тулов для кодинга это всё ещё TAB автокомплит и задачи для агента уровня "напиши тест для этой функции." Попробую пересесть на Zed и такой режим на время.


Июль против ИИ-слопа: соцсети объявляют войну нейросетевому мусору

Массовая зачистка на YouTube. Платформа перекрыла кислород «фабрикам контента» через обновление правил монетизации. Итог: 130 000 ИИ-каналов удалены из партнерской программы за шаблонный масс-маркет.

Антиспам-фильтры в TikTok. Соцсеть тестирует систему распознавания бот-аккаунтов. По заявлению платформы, нейросетевой спам обнаглел настолько, что начал физически «вытеснять оригинальных креаторов».

Охота на ботов в Twitter. Зачищены 42 тысячи аккаунтов, которые на автомате генерировали ИИ-комментарии под чужими публикациями.

Теневой бан для ИИ в Snapchat. Полностью сгенерированные нейросетями ролики теперь лишены рекомендаций и монетизации в ленте Spotlight. В приоритете снова живые люди.

Общественный контроль в LinkedIn. В интерфейс добавили кнопку «Seems like AI slop» для жалоб на шаблонные тексты. Параллельно платформа удалила собственную кнопку «Enhance your post», которая раньше переписывала посты за пользователей.

Проверка на честность в Substack. В сервис рассылок встроили инструмент Pangram. Теперь читатели могут в один клик проверить, кто писал текст — автор или ChatGPT.


Видео недоступно для предпросмотра
Смотреть в Telegram
попалось сегодня WebGPU стекло, от бразильца
https://webgpu-glass-material.vercel.app/



Показано 20 последних публикаций.