Сингулярочка | Ride the AI Singularity


Гео и язык канала: Россия, Русский
Категория: Технологии


Ещё один канал о Generative AI, LLM, GPT, и новой волне стартапов ⚛️
dm @stansler

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Антропики релизнули Mythos-class модель – Fable 5, хороший повод вернуться к постингу в этот канал. Пишут, что полноценно модель доступна только избранным, а нам с safeguards, иногда могут резать даже безопасные промпты, тогда Claude будет даунгрейдится на Opus.

Го тестить /model claude-fable-5, доступна по подпискам Pro, Max, Team до 22 июня, потом только API credits.


Репост из: эйай ньюз
Маск продолжает вставлять палки в колёса OpenAI

Группа инвесторов, во главе с Илоном, предложила 97,4 миллиарда долларов за OpenAI. Компанию продавать им никто не собирается, о чём уже заявил Сэм Альтман, но такое предложение само по себе создаёт OpenAI с инвесторами огромные проблемы.

Дело в том, что у OpenAI крайне необычная структура - компания всё ещё принадлежит нонпрофиту со своим советом директоров. Это уже привело к инциденту с увольнением Сэма Альтмана в конце 2023, когда основного инвестора — Microsoft, даже не предупредили. Представьте шок, когда вы инвестировали более 10 миллиардов долларов и узнаёте о том, что совет директоров сместил CEO, из новостей.

После таких финтов ушами, следующий крупный раунд OpenAI уже был с условием превращения компании в коммерческую в течении двух лет. В противном случае, OpenAI обязались вернуть инвестированные 6 миллиардов.

Но выполнить требования инвесторов так просто нельзя - коммерческую структуру OpenAI нужно выкупить из под контроля нонпрофита. До предложения Маска, такую сделку можно было достаточно легко провернуть за относительно небольшую сумму, теперь всё сильно усложнилось.

Если совет директоров нонпрофита согласится на меньшую ставку, то такое решение придётся объяснять целой куче инстанций, которые могут легко заблокировать сделку. А перебить предложение Маска будет сложно — в его предложении вишенкой на торте служит обещание перебить предложение любых других инвесторов такой же либо ещё большей ставкой.

То есть у OpenAI выходит неприятная ситуация — либо вступать в ценовую гонку с Маском, что сильно облегчит кошельки инвесторов, либо их затаскают по судам. Если отменить превращение в коммерческую организацию, то компания будет в минусе на 6 миллиардов и с туманными перспективами будущих инвестиций.

В ситуации есть ещё куча неизвестных, кажется, мы ещё долго будем обсуждать новую драму с OpenAI.

@ai_newz


Репост из: Дмитрий Савостьянов Вещает
DeepSeek R1

В штатах какое-то безумие на фоне выхода R1. Разошелся слух, что Китайцы обучили свою модель за $6M и понеслась:
- Люди на новостях стали продавать акции бигтеха, рынок пролился
- Менеджеры в корпорациях с ЗП по $1M+ обосрались, ведь им надо выбивать бюджеты на $100M для своих команд
- Трамп вчера говорил про Stargate для OpenAI за $500B, а сегодня deepseek приложение в топ-1 апстора, когда на повестке торговые войны с Китаем, тарифы и баны тиктока

Забавно наблюдать всю эту панику на ровном месте. Оптимизация уже давно идет, GPT-2 можно обучить чуть ли не на тостере. Но за фронтир модели первопроходцы всегда платят больше, потому что метод проб и ошибок требует кучи ошибок, прежде чем найдутся бодрые идеи.


Репост из: Агенты ИИ | AGI_and_RL
Забавные моменты:
* получить 91% на 400 примерах public arc-agi стоило x172 больше ресурсов чем на 82%. Похоже больше ляма баксов (6677*172 = 1148444) если в деньгах.
* авторы ARC-AGI все же не думают что это AGI.

😏


Репост из: Data Secrets
Anthropic выпустили очередной интересный материал. Тема, на этот раз, "Как построить эффективного агента"

Вокруг все только и говорят, что об агентном подходе, но мало кто на самом деле объясняет, что этот агентный подход из себя представляет. Правда, кроме всей шумихи, что это такое на самом деле, какой у таких систем дизайн, и как их создавать? Материал Anthropic как раз об этом. TLDR:

Во-первых, чем отличаются агенты от воркфлоу? Воркфлоу — это предопределенные сценарии, где правила взаимодействия систем прописаны. Например, интеграция модельки в какое-то приложение – это воркфлоу, а не агент. Агенты управляют процессом сами, выбирая инструменты и принимая решения по ходу дела.

Во-вторых, использовать агентов вообще нужно далеко не всегда, а только если прописать сценарий заранее невозможно. Агенты гибкие, но за это придется платить и монетой, и временем.

В-третьих, агент – это не какая-то магия, обычно построить их можно но основе простых паттернов. В статье перечисляют такие:

➡️ Prompt chaining: что-то среднее между агентом и воркфлоу с ризонингом. Есть последовательное выполнение шагов, и каждый шаг проверяется на корректность, но гибкость тоже присутствует за счет появления гейта (программируемые проверки, которые модель устраивает сама себе).
➡️ Routing: разные типы запросов отправляются по разным тропинкам. Сам роутер – тоже отдельная модель.
➡️ Parallelization: делим задачу на части и делегируем разным экземплярам или даем решать всем одно и то же а потом аггрегируем другой моделью.
➡️ Orchestrator-workers: это уже корпоративная структура, в которой есть центральные агенты-менеджеры, которые распределяет работу по другим и аггрегируют результаты.
➡️ Evaluator-optimizer: модель генерирует ответ, затем другая модель дает фидбэк и/или улучшает его и так по кругу. Похоже на смесь ризонинга и RL.

Вот это все – базовые строительные блоки. Берите их, адаптируйте, комбинируйте, и получайте хорошее решение для вашей задачки. Главное правило — не усложнять просто чтобы усложнить. Anthropic подчеркивают, что хорошие агенты – это прозрачность, простота и приятный не галлюцинирующий ACI.

Конечно, еще есть автономные агенты, к которым мы все стремимся, но это уже другая история...

Ну вот, теперь туманность и завеса тайны вокруг агентов немного рассеялись и вы знаете о них чуть больше, а полностью текст читаем тут


Репост из: The Edinorog 🦄
Просто гигантский раунд у Databricks, автор «Венчура по понятиям» продал свой стартап, Grammarly прикупила стартап, чтобы продвинуться в AI, сервис доставки Grubhub штрафанули за серые практики

🦄Доброе утро, наши маленькие любители единорогов!

🎉SpatialChat продан! Его купила компания QuestionPro, которая занимается онлайн-исследованиями и сервисами для них. Сумма сделки не называется. SpatialChat — это проект автора «Венчура по понятиям» Алмаса Абулхаирова и еще четырех его кофаундеров Владимира Закоулова, Андрея Грудкина, Романа Скважа и Дани Чепенко. Они замутили этот проект в 2020-м в самом начале пандемии. Этот сервис для видеовстреч, но более неформальных чем в том же Zoom. Парней поздравляю со сделкой! И надеюсь, что у Алмаса теперь появится больше времени на его крутецкие статьи про венчур.

😱На днях писал вам про готовящийся рекордный раунд Databricks. Тогда речь шла про $9 млрд. Раунд анонсировали, но теперь оказалось, что они подняли аж $10 млрд. Оценка — $62 млрд. Никогда не видел таких деньжищ в одном раунде. Интересно, OpenAI сможет перебить эту сумму в следующем раунде? Databrics занимается софтом для быстрой обработки больших данных, а еще делает разные AI-модели и сервисы.

💲И еще одни сделка. Grammarly, которая помогает в написании текстов, прикупила компанию Coda. Сумма не раскрывается. Последняя оценка у Coda была $1,4 млрд, но это было в 2021-м году. Эти чуваки делают сервис для совместной работы с документами, таблицами и так далее. По сути, это аналог Notion. Как пишет Bloomberg, в этом году Grammarly стала больше вкладываться в AI. И через покупку хочет продвинуться в этом направлении.

🙅‍♂️Сервис доставки заказов из ресторанов Grubhub штрафанули на $25 млн в США. Причин несколько. Первая — занижали стоимость доставки для клиентов. Называли одну сумму, а по факту из-за разных сборов она оказывалась сильно больше. Вторая — водителям в рекламе обещали одни почасовые ставки, а на деле они были меньше. Третье — добавляли рестораны без их согласия. Таких ресторанов насчитали более 325 000. В общем, штрафанули и обязали отказаться от таких практик.

@TheEdinorogBlog — тот самый канал про стартапы🦄


Еще несколько важных сделок 🙂


Grammarly (тулза для проверки грамматики) купили Coda (тулза для рабочих документов типа Monday, Notion). Звучит как хороший ход для Grammarly, потому что зачем теперь использовать отдельный продукт для исправления текста, если можно загнать всё в ChatGPT, которые еще с 10 другими задачами помогут. А вот сделать AI платформу c документами норм тема.

Сумма сделки не разглашается, но предыдущие оценки компаний: $13 млрд и $1.4 млрд для Grammarly и Coda соответственно.

источник


Репост из: Denis Sexy IT 🤖
Я решил, что продолжу отдавать OpenAI $200 в месяц (пока не вышли конкуренты у Google / Anthropic) — потому, что o1 Pro фантастический компаньон в жизни/работе

— Наверное, стоит сказать пару слов, что LLM-бенчмарки часто критикуют за их неспособность объективно оценить качество модели — и с Pro O1 такая же ситуация:
Я видел результаты, где какая-то новая модель, якобы, пишет код также и даже лучше, чем Sonnet 3.6 — а по факту, альтернатива может и хорошо пишет код, но не способна в то, что Anthropic делает лучше всего — Sonnet эстетически лучше, чем конкуренты, не только в коде, но и в дизайне, в UX, в чувстве прекрасного у решений которые он предлагает

— Такая же ситуация с o1 Pro — очень сложно выразить в числах, почему эта модель хорошая; я уже писал выше, что мне нравится o1 Pro потому что она для узких специалистов (место для дилятор-шутки), но я чуть дополню свой тогдашний отзыв — o1 Pro модель ответам которой можно доверять и это полностью меняет мой подход к работе с LLM. Если раньше, за ответами Sonnet / Gemini / 4o — мне приходилось ходить и пруфчекать факты, пытаясь понять придумала она их или нет, то внутренние рассуждения o1 Pro практически полностью лечат модель от галлюцинаций (в разумных пределах, время на циферблате она все еще не распознает). То есть: я готов платить за гарантии того, что модель с очень высокой вероятностью не ошибется в ответе, потому что если она не уверена — она откажется давать ответ в целом и мне кажется это самой ценной фичей этих моделей

— o1 Pro сложнее поддается инструкциям — и не потому, что она им плохо следует, а наоборот, потому что она слишком хорошо им следует и любая ошибка в инструкциях может привести к неправильным результатам (например, если приложить непродуманный пример решения задачи, в таком же формате все и придет и тп)

— Самое клевое: помните я с вами делился кастомными инструкциями для ChatGPT которые доказательно улучшали качество ответов gpt4o на 7%? Так вот, во-первых — я их выложил на GitHub, можно подписаться и получить уведомление когда будет новая версия; во-вторых — o1 Pro полностью раскрывается с такой инструкцией: модель, перед тем как начать цепочку внутренних рассуждений, сначала назначает себе профессиональную роль и уже потом, от имени этой роли «думает» и пишет промежуточные ответы. Я попробовал пару дней пожить без инструкций этих и не смог — o1 модели по настоящему раскрываются с такой инструкцией, потому что вешают на себя роли каких-то выдающихся специалистов в области

— Я перевел в o1 Pro вообще все, что делаю или потребляю: она пишет для меня вики-лайк статьи (они совпадают с реальными в фактах, я проверял), книги-истории, помогает в учебе, бизнесе и творчестве, и сейчас мой день больше всего напоминает какой-то SciFi фильм 60х, где коммуникатор героя решает для него все вопросы и задачи. У меня однажды уже было похожее чувство — когда мне было 12 лет и я попал в интернет по карточкам, и ощутил что теперь можно узнать что угодно и не мог выбрать с чего начать, куда пойти, потому что интернет уже тогда был большим, и все было интересным

Я понимаю, что $200 заградительная цена для многих — и не призываю вас тратить на нее деньги; я просто рассказываю свою мотивацию, почему я продолжу платить — потому что люди часто спрашивают в личке

Если вы хотите похожие на o1 модели дома, вы можете рассмотреть эти: QwQ 32B, Phi 14B и Deepthought 8b, но все они будут всегда ограничены знаниями которые поместились в их размеры, ну и не забывайте их просить решать задачи шаг-за-шагом и проверять свои ответы по пути

tl;dr Денис поехавший — отдает ClosedAI 200 баксов в месяц


Репост из: ЭйАйЛера
Видео недоступно для предпросмотра
Смотреть в Telegram
У Runway потрясающее новое обновление — улучшенное управление камерой

Можно будет выбрать направление движения, скорость, сочетать это все в ролике. Есть даже панорамирование объекта, то есть обучали не только на видео. Подробнее и с черрипиками тут.

Готовлюсь тестировать на все деньги, вместе с новым обновлением в Midjourney (позволяющим работать со своими изображениями) — это новое слово в творчестве и рекламе. После сотни итераций, конечно.


Репост из: Сиолошная
Тезисно:
— Anthropic представили новую возможность для публичного тестирования: использование компьютера (уже доступно в API). Разработчики могут давать Claude использовать компьютер так, как это делают люди — глядя на экран, перемещая курсор, нажимая кнопки и печатая текст.
— Claude 3.5 Sonnet — первая передовая модель, предлагающая использование компьютера в публичной бета-версии (ну, из коробки да, но для других моделей это уж было года два...на GitHub. А тут они прям уверены!)
— этими возможности уже тестируют Asana, Canva, Cognition (которые Devin делали), DoorDash, Replit, и The Browser Company (это браузер Arc, на котором я сижу; они делают большую ставку на AI в браузере для выполнения действий вместо вас)
— The Browser Company отметили, что при использовании модели для автоматизации веб-задач Claude 3.5 Sonnet превзошла все модели, которые они тестировали до этого (но без деталей. Ждём обновление браузера? 🙂)
— новая модель сильно прокачалась в кодинге. На бенчмарке по внесению изменений в код на уровне целого большого репозитория (десятки тысяч строк кода) SWE-bench Verified качество выросло с 33.6% до 49% — это если сравнивать старый Sonnet и новый с использованием SWE-Agent (открытый фреймкорк из Berkley). Но были и другие решения, которые заточены именно на улучшение оценки, но недоступны нам — они выдавали 45.2%. Они, наверное, пробьют 55% просто через замену модели.
— Haiku (младшая версия, дешёвая) получает 40.6% на этом бенчмарке, что лучше старого Sonnet 3.5. Видно, что Anthropic вложились в ИИ-агентов и/или reasoning

Что это за "использование компьютера"? Claude транслирует ваши инструкции вроде «возьми данные с моего компьютера и из Интернета для заполнения вот этой формы и пройдись по всем полям») в компьютерные команды (прочитать таблицу на экране; переместить курсор, чтобы открыть веб-браузер; перейти на соответствующие веб-страницы; заполнить форму данными с этих страниц и т. д.)

Пока работает с достаточно базовыми командами и на разных бенчмарках вроде OSWorld выдаёт всего 22% (прошлый лучший результат был 7.8%, если использовать только скриншоты экрана, без трансляции в специльную форму для слабовидящих). Однако компания ожидает быстрых улучшений в ближайшем будущем через сбор обратной связи от разработчиков. Тут они сильно обошли OpenAI и других — как мы знаем, данные это новая нефть, и каждый день отставания других игроков приносит ценность. Очень ждём, что ответят OpenAI.


Репост из: Мысли Рвачева
🧠 Anthropic представили новую возможность: Claude теперь умеет пользоваться компьютером

Anthropic выпустили обновленную модель Claude 3.5 Sonnet и новую версию Claude 3.5 Haiku. Основное новшество — это способность Claude 3.5 Sonnet в бета-версии использовать компьютеры так, как это делают люди: открывать вкладки, двигать курсор, вводить текст и заполнять формы. Этот функционал пока еще экспериментальный и не всегда идеален, но открывает новые возможности для разработчиков, например, автоматизацию сложных задач или тестирование ПО.

Claude 3.5 Sonnet уже доступен через Anthropic API, Amazon Bedrock и Google Cloud. Многие компании, включая Asana и Replit, уже начали тестировать эти новые возможности.

▶️ Video: https://www.youtube.com/watch?v=ODaHJzOyVCQ
🔗 Подробнее: https://www.anthropic.com/news/3-5-models-and-computer-us

#ai #agi #anthropic #ui #agents


Репост из: Denis Sexy IT 🤖
А еще мы вошли в эру, где корпорации строят мини-ядерные реакторы для своих нужд

Все 4 новости вышли недавно 🔌


Репост из: Сиолошная
Дошли руки посмотреть интервью с CTO Poolside, cтартапа, который делает AI-ассистента для программистов с прицелом на автоматизацию всё большего и большего количества задач (они формулируют это как human-led + AI-assisted -> AI-led + human-assisted). Я за компанией слежу чуть больше полугода. К ним ушло работать несколько очень хороших знакомых/приятелей (но на радары они попали до этого).

Мне очень нравилась их страничка с виженом — там написано много дельного. Отдельно выделю блок «our strong beliefs» и первые пункты из него:
— Вы не можете достичь успеха только дообучением готовых моделей — основные их навыки «возникают» в процессе длительного и ресурсоёмкого обучения базовой модели
— Масштаб имеет значение, больше вычислений и данных решают большую часть проблем

Из этого вытекает, что нужны большие ресурсы на обучение, и вот как раз потому компания привлекала полмиллиарда долларов инвестиций при оценке больше трёх (а ведь им меньше двух лет, и публичного доступного продукта нет 🙉).

Тезисно из интервью:
— Данные, на которых обучают модели, представляют собой результат работы, а не промежуточные размышления, проделанные для того, чтобы эти данные получить. Поэтому такие данные нужно создавать самостоятельно (примерно это делают для обучения o1, генерируя траектории размышлений)
— В программировании для валидации корректности решения есть надёжные способы: исчерпывающие тесты. Если для всех задач есть тесты, то можно запускать автоматический цикл обучения на синтетически генерируемых решениях на основе фидбека от тестов (что сработало а что нет)
— вычислительные мощности безумно важны, это как входной билет в текущую гонку (если мощностей нет — «you're not even in the race»). Без мощностей даже если всё остальное ок (данные, люди, процессы) — ничего не выйдет. И очень важно, что мощности можно превращать в данные высокого качества, чтобы продолжать учить модели (как раз описанный выше процесс с генерацией и проверкой тестами)
— кроме синтетических данных используют человеческую разметку в виде корректировки рассуждений модели (например, если ответ правильный, но часть рассуждений были ошибочными, или есть ошибка в логике, из-за которой и вышел неправильный ответ). Нечто похожее делали OpenAI ещё для GPT-4
— почти все инвестиции пойдут на закупку и оплату мощностей для дальнейшего масштабирования, без этого не могли этим заняться
— в августе у компании появилось 10'000 видеокарт, чего хватит, чтобы продвинуться и натренировать модельки побольше, получить новые навыки в них, и так далее
— инфраструктурные решения по мощностям очень важные, так как это не появляется по щелчку. Приходится принимать решения с горизонтом реализации 12-18 месяцев. поэтому нужно подстраивать стратегию и темп развития под это; сейчас уже думают о том, что и как будет в следующем раунде (при успехе реализации текущего)
— когд появились новости о задержке производства GPU следующего поколения (которые почти полностью выкуплены Microsoft, Google, Meta...), то Eiso был рад: ведь это поможет им дольше оставаться конкурентоспособными и не отставать существенно. Но эти карты всё равно очень ждут, каждое поколение даёт прирост скорости обучения в 1.5-2 раза, а при применении карты серии Blackwell на бумаге ещё более выгодно смотрятся
— не важно что покажут в GPT-5 и удивит/не удивит, через 10 лет мы на это всё равно будем смотреть как на что-то из начала истории компьютеров
— одно из самых важных изменений в понимании Eiso за последний год — что масштабирование данных тоже супер важно, на уровне с мощностями [тут имеется в виду что для дообучения можно собирать и собирать ещё разметку, конца-края не видно, модели недоучены под конкретные задачи — я так понял]


Гугл подписал соглашение о запуске ядерных реакторов общей мощность в 500 МВт до 2035.

Речь про малые модульные реакторы. Суммарная мощность проекта как у средней АЭС.

Интересно, что у Kairos Power еще нет запущенных станций. Гугл пионерит, пишет, что это первый такой запуск в мире. Короче говоря, пока пилот, если все сложится, то ММР могут стать нормой (привет Fallout).

Цели понятны: обеспечить аишку питанием, оптимизировать расходы на электричество, не зависеть от общей электрической сети, снизить карбоновый след.

Релиз Google
Релиз Kairos Power


Репост из: Psy Eyes
Всем спасибо, все свободны!

PS: Motion Brush от Kling в действии.


Репост из: Сиолошная
От слов к делу — Microsoft подписали контракт на покупку любого количества энергии, производимой на американской АЭС Three Mile Island, в следующие 20 лет. Эта АЭС — как Чернобыльская станция в СССР: в 1979-м году там произошла авария на одном из двух блоков. Это была крупнейшая авария в истории коммерческой атомной энергетики США, которая усилила уже существовавший кризис и вызвала всплеск антиядерных настроений в обществе. Хотя всё это и не привело к мгновенному прекращению роста атомной энергетической отрасли США, её историческое развитие было остановлено. После 1979 и до 2012 года ни одной новой лицензии на строительство АЭС не было выдано, а ввод в строй 71 ранее запланированной станции был отменён — ушла эпоха.

Первый (из двух) блоков станции в порядке, он работал до 2019-го года (на ЧАЭС тоже после выхода из строя четвертого блока продолжалась выработка энергии на остальных трёх — вплоть до 2000-го года). Но его решено было остановить по экономическим причинам: столько энергии не было нужно, да и в США появились более дешёвые источники выработки.

Старющий реактор в штате Пенсильвания должны перезапустить к 2028-му, на АЭС вернутся ~600 специалистов — и всё это для того, чтобы получить лишние 835 мегаватт энергии для подпитки датацентров. Этого примерно хватит для содержания 700'000 домов в США, но всё уйдет на обучение GPT-N+1 и генерацию картинок 😐

Google не отстаёт — буквально на днях СЕО Alphabet Sundar Pichai хвастался, что у них уже в работе гигаваттный датацентр, и что его хотят подпитывать современными небольшими модульными ядерными реакторами. Ну и новости про Oracle/Amazon не забываем — те тоже ударились в ядерку.

Кажется, AI гонка и нехватка энергии для будущих датацентров подстегнули развитие атомной энергетики в США как никто другой в последние 40 лет. Интересно, что в планах дальше у OpenAI x Microsoft и Co?

Подпись к мему:
Я не против ядерной энергетики, но перезапуск THREE MILE ISLAND, потому что Sam Altman нужно больше гигаватт, чтобы выяснить, сколько букв «r» в слове «strawberry» — это знаменательная веха в раздутии пузыря искусственного интеллекта.

Sama 🤝 Мирный Атом



Показано 18 последних публикаций.

107

подписчиков
Статистика канала