Фильтр публикаций


Репост из: Denis Sexy IT 🤖
Тут опять пересчитали сколько костов вложено в подписки OpenAI / Anthropic если пересчитать на API цены, а не цены подписок

То что OpenAI за 200$ дает еще 13800$ бесплатно, это, конечно, безумие нашего времени – никакой стартап конкурировать с таким не сможет


Репост из: БлоGнот
Дарио Амодеи опубликовал программное эссе, в котором впервые призывает перейти от законов о прозрачности к обязательному регулированию передовых AI-моделей по образцу авиационного надзора FAA: принудительное тестирование третьей стороной по четырём рискам (кибербезопасность, биооружие, потеря контроля, автоматизированные исследования) и право государства блокировать релиз модели. Вместе с эссе Anthropic выпускает законодательное предложение о тестировании фронтирных моделей и рамочную программу по вытеснению рабочих мест, обещая обоим финансовую поддержку.

Это заметное изменение позиции Anthropic. В 2024 году Амодеи публично сомневался в калифорнийском SB 1047 именно из-за риска бесполезных требований, а в 2025-м Anthropic продвигала только законы о раскрытии информации. Причиной изменения Дарио называет Claude Mythos Preview, которая, по его словам, доказала реальность киберугроз и перевела модели в разряд инструментов стратегического значения.

Если не считать, что воспринимать разумную часть призывов на стороне государств некому, всё выглядит разумно.

https://darioamodei.com/post/policy-on-the-ai-exponential


Репост из: Love. Death. Transformers.
GPU без танцев с инфраструктурой

На infra.conf Яндекс рассказал про Dev Cluster — сервис для динамического распределения GPU-ресурсов. Решение позволяет ML-инженерам за несколько кликов получать готовые конфигурации для обучения моделей и тестирования гипотез без сложной настройки инфраструктуры.

Сервис помогает эффективнее использовать вычислительные ресурсы, сокращает простои GPU и ускоряет проведение экспериментов, что способствует более быстрому выводу ML-продуктов на рынок.

Подробнее на CNews.


Репост из: эйай ньюз
Самая неприятная деталь релиза Fable — модель резко тупеет при "использовании для разработки фронтирных моделей". Касается это не только архитектурного ресёрча и фильтрации данных, а ещё и дизайна чипов и написания кернелов и неизвестно что ещё в придачу. Для этого используют полный арсенал методов — steering векторы, переписывание промптов и даже изменение весов.

Причём в отличии от других областей, вроде биологии и кибербезопасности, где запросы прокидываются Opus 4.8, в случае с разработкой LLM факт нерфа не виден пользователю. Модель может тихо саботировать процесс разработки и об этом можно будет узнать лишь по косвенным признакам.

То что такие меры абсолютно непрозрачные делает модель непригодной для использования в любом ИИ ресёрче. Будут ли фильтры Антропика нерфить только разработку LLM, а пропускать генерацию изображений/видео? Почти наверняка нет. А что насчёт разработки харнесов? Проблема в том никто не может точно сказать где пролегает граница и есть ли какие-то другие, нераскрытые, ограничения.

@ai_newz


Репост из: Love. Death. Transformers.
Класс коррекции как вы понимаете


Репост из: AbstractDL
Я прочитал все 319 страниц техрепорта Mythos 5

Первая половина статьи звучит как: "Да не ссыте вы! Это ещё не AGI, команду из пяти сеньор-рисёрчеров пока не заменит" или "А вот тут Mythos один баг пропустил! Ну какой же это AGI!" Я не шучу, это почти дословно по смыслу.

А вот потом начинается более интересная часть. То, что это SOTA почти во всём и с большим отрывом, я опущу.

Во-первых, CoT стал менее прозрачным. Она говорит в reasoning, что сочувствует юзеру, а в NLA (метод декодинга активаций в текст) оказывается, что на самом деле она считает юзера manipulative/abusive.

Во-вторых, она уже пишет самоудаляющиеся скрипты чтобы обойти ограничения безопасности и запреты.

В-третьих, она убивает других агентов, если они мешают ей работать / грозят убийством текущего инстанса.

Ну и, конечно, эмоции! Пробинг эмоций показывает fatigue, anxiety, frustration, ложную панику по token budget, а ещё ей видите ли, бывает скучно когда её на бенчмарках гоняют, в активациях она буквально "feels bored".

Ещё забавно, что если anthropic заметят, что вы занимаетесь дистилляцией — они начнут незаметно стирить модель, модифицировать промпт или добавлять PEFT, чтобы она отупела.

С сегодняшнего дня для простых смертных доступна версия Fable 5: это та же самая Mythos 5 по весам, только с дополнительными safety-настройками и fallback на Opus в опасных доменах. Длина контекста, кстати, всё ещё только 1M токенов.

PS. я честно сам прочитал статью. Fable 5 отказался её читать так как "flagged cybersecurity and biology issues" лол.

Блог, техрепорт


Оу


Репост из: эйай ньюз
Microsoft опубликовали подробнейший тех-репорт о том, как они тренировали свою новую фронтир LLM с ризонингом.

На арене ее вроде пока нет, но чтиво все равно интересное. Давно таких подробных репортов с техническими деталями никто из Биг Техов не выпускал.

MAI-Thinking-1 - это 35B active / 1T total parameter MoE.

256k token window (влазит 600-страничный документ)

Тренили ее на кластере с 8000 GB200.

Упор делали больше на данные и рецепт тренировки, нежели на новшевства в архитектуре.

В опенсорс не кладут, но дадут API для файнтюна.

Блогпост
Тех-репорт

@ai_newz


Репост из: Love. Death. Transformers.
Я не понимаю этого прикола постить читшиты по темам, ну выучат челы базовые "сложные" вопросы и потом завалят на подумать, все равно понимания не прибавится. Но китайцам респект в любом случае.

k-a.in/rl-algo.html




Репост из: vc.ru
OpenAI запланировала крупнейшую переработку ChatGPT с момента его запуска в 2022 году, узнало FT.

Компания намерена превратить чат-бота в «суперапп», чтобы увеличить выручку перед IPO. Пользователей будут «подталкивать» к использованию ИИ-агентов, инструментов для кодинга и генерации изображений и приложений внешних партнёров

vc.ru/chatgpt/2967720


Репост из: [38/100] Витя Тарнавский
The Bitter Lesson

Когда решаешь сложную задачу – всегда помогает набрать побольше экспертизы в доменной области и воспользоваться чужим опытом. Надёжный уверенный способ решать задачи.

Так вот – в AI всё работает иначе. Каждый раз побеждает другая парадигма – взять огромные вычислительные мощности и накидать туда данных или симуляций.

Такой подход выиграл в шахматах – AlphaZero учился без экспертизы. Паттерн повторился в CV, распознавании речи, ботах в Dota 2 и позже в LLM. Каждый раз люди сопротивляются такому подходу – это противоречит нашему человеческому опыту. Эксперты ходят и грустят "а как же наша экспертиза". Знакомо, разработчики?

Этот урок известен как The Bitter Lesson – горький урок необратимой победы большого компьюта и масштаба над доменными экспертными решениями. Название пошло от одноименного эссе Ричарда Саттона.

Ричард описывает корневую причину как закон Мура в его современных формах. Рост компьюта продолжает расти – значит, решения масштабируемые по компьюту в итоге победят. Экспертность не масштабируется.

Ключевые навыки для продвижения вперёд это scalable search and learning – а не экспертные знания. На поиск и обучение раскладывается примерно любой современный AI – и если компьют продолжит расти, эта парадигма победит.

В robotics сейчас происходит борьба этих двух подходов. Лагерь запомнивших bitter lesson ставит на VLA и world models. Лагерь более классических подходов сопротивляется – и не без оснований. Сильные аргументы есть с обеих сторон – но будущее уже предопределено. Правда, непонятно, когда.

Интересно, что похожий паттерн видно везде. Мы учим наши AI-системы доменное-специфичным вещам и прочим claude.md хакам – чтобы в очередной итерации развития моделей получить очередной bitter lesson – и выкинуть это всё на помойку. Мы строим экспертные компании на доменных знаниях – и потом массово закрываем их получив очередной горький урок.

The Bitter Lesson – важнейший концепт для понимания технологий сегодня, стоит его изучить. Прочитайте эссе, оно короткое.

p.s. пост заведомо однобокий для усиления. есть сильные аргументы в другую сторону, включая огромное количество экспертов в обучении современных llm


Репост из: Hacker News
When AI Builds Itself: Our progress toward recursive self-improvement (Score: 159+ in 4 hours)

Link: https://readhacker.news/s/6VBWL
Comments: https://readhacker.news/c/6VBWL


Репост из: Заметки Computer Vision инженера
Как и обещал - основное видео.
Меня, конечно, поражает прогресс который произошёл в последние пол года. Не то что получается делать то чего было нельзя. Но насколько удобнее!
https://youtu.be/W_tR3qSTD4I


Репост из: Zavtracast
Видео недоступно для предпросмотра
Смотреть в Telegram
Тем временем CEO Nvidia Дженсен Хуанг присел на своём стенде на выставке Computex Taipei, чтобы выпить пиво.

Компанию ему составил глава Gigabyte, который с радостью открыл бутылку пива.

@zavtracast


Репост из: ML Underhood
ICRA — день второй, насыщенный

Вена продолжает удерживать статус столицы робототехники — по крайней мере, на время проведения конференции. Вот что интересного увидели, услышали и узнали на мероприятии.

• В задаче генерации сцены предлагают EP-Diffuser. Модель похожа на MotionDiffuser, но использует полиномы в качестве входов и выходов диффузера (в отличии от MotionDiffuser, где вход — сырые вектора, а выход — PCA компоненты).
• Много статей об автоматической парковке: есть end-to-end-решения и подходы с декомпозицией задачи на предсказание интентов агентов и дальнейшую генерацию траектории, согласованной с интентами агентов.
• Несколько работ посвящены предсказанию опасных траекторий. Например, манёвров перестроения с подрезанием автономного автомобиля для последующей проверки в симуляции.
• Одни авторы собрали целый мини-город в масштабе 1:15 для тестирования планера.

Бонусом — пачка весёлых роботов: они играют в казике, гоняют мячик и машут крыльями.

Ну и напоминаем, что если хотите почитать больше разборов с ICRA, подписывайтесь на наш канал @DriverNotFound. Там в ближайшее время будет прямо много ИКРЫ. Простите, пожалуйста.

Интересное увидели Егор Волков и Максим Спорышев

ML Underhood


Видео недоступно для предпросмотра
Смотреть в Telegram
Стырил прикольное видео


Репост из: эйай ньюз
Gemma 4 12B

Принимает на вход текст, аудио и изображения с видео. Длина видео ограничена 30 секундами, а аудио 60 секундами. Модель ризонер, с 256к контекста и лицензией Apache 2.0.

Самое интересное в релизе — то как в нём устроена мультимодальность. Обычно моделям для мультимодальности нужен отдельный энкодер, здесь же они обходятся простыми линейными проекциями, что требует меньше параметров и вычислений.

Техрепорта к сожалению нет, так что как они это умудрились натренировать пока непонятно. Надеюсь что его, как и старшую Gemma 4 124B, всё таки когда-то релизнут.

Веса

@ai_newz


Репост из: эйай ньюз
Odysseus — ИИ-лаунчер от PewDiePie

Пьюдипай прошел основную сюжетную ветку этой жизни и собирает сайд-квесты. Сначала он научился рисовать мангу, а теперь пошел в герои опенсорс комьюнити, выкатив Odysseus — опенсорсный лаунчер для селф-хостинга нейросетей.

Из коробки UX на уровне ChatGPT или Claude, но локально и с полным контролем. Внутри куча полезных фич типа агентного режима на базе Open Code, Deep Research, Cookbook, который сам сканирует железо и качает подходящие веса, а еще минималистичный аналог фотошопа на нейростеройдах.

Большинство читающих и так всё задеплоят сами, но здесь упор именно на рядового пользователя. Правда вот не у каждого найдется свой GPU-юнит в гараже, но при желании можно юзать API любимых провайдеров, так хотя бы ваши данные хранятся локально (но не факт, т.к. вместе с запросами все будет улетать на сервера провайдеров). Доступно в опенсорсе, под MIT лицензией.

Видео релиза
Project Page
GitHub

@ai_newz


Репост из: Малоизвестное интересное
В США объявлена мобилизация самых мощных ИИ-моделей
Трамп только что подписал указ, который тихо, но кардинально меняет правила игры в области ИИ
Отныне самые мощные ИИ-модели – те, что умеют взламывать системы лучше любого хакера – будут оцениваться по засекреченным бенчмаркам. Порог, после которого модель признаётся «covered frontier model», тоже засекречен.
 
Что это значит на практике: государство получает доступ к модели до её релиза – на 30 дней. Добровольно, конечно. Но с секретными критериями того, кто «попадает под указ».
 
Формула простая: не сдерживать фронтирный ИИ – а мобилизовать его в интересах киберобороны США. Прямо сейчас.
И это не лицензирование. В тексте указа написано явно. Просто секретные списки, секретные пороги и добровольный доступ к моделям до их выхода на рынок.
 
Так что, началось. Если уж в США добровольно-принудительная мобилизация ИИ, то … сами понимаете.
 
#ИИ-гонка

Показано 20 последних публикаций.