AI AGGREGATOR


Гео и язык канала: Россия, Русский
Категория: Технологии



Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Репост из: Доктор GPT
⚡️ Discord резко сдох в России — геймеры жалуются на потерю соединения с серверами.

Сегодня играем молча.

❤️ Доктор GPT


Репост из: sh | ИИ
День второй релизного месяца OpenAI. Обещали каждый день либо заметные улучшения в Codex/Work, либо сброс лимитов. Сброса нет, есть вот это:

1) Авто-разрешения теперь доступны бесплатным пользователям Codex. Это когда отдельная модель смотрит каждую команду от агента и решает, пропустить её или нет. Не очень понятно, кто вообще пользуется Codex бесплатно, там доступна только 6 Luna, и лимиты совсем маленькие. Авто-разрешения таким пользователям вряд ли сильно помогут, да и заметят эту функцию единицы. На «заметное улучшение» чёт не подходит

2) В API стало 3 уровня использования вместо 5. А это к Codex/Work вообще отношения не имеет, и изменение совсем небольшое. Непонятно зачем это вообще сюда притянули

Ну и про вчерашнее обещание Tibo... Прошли сутки, а обещанных 50 TPS на Sol так и нет, даже до 30 не доходит, сейчас где-то 15-25. Пока что выходит много хайпа и 0% реальных улучшений, плохо.


Репост из: Data Secrets
На фоне жестких блокировок аккаунтов, сегодня в Claude появилась поддержка русского языка 🚬


Репост из: DEKSDEN notes
⚪️ Nano Banana 2.1

И ещё немного от Гугла - Nano Banana 2.1 вышла. Лучше, консистентнее, умеет редактировать по маскам, более натуральные картинки

🔗 Анонс : https://x.com/NanoBanana/status/2107521202466046453

Уже в AI Studio / Gemini App

@deksden_notes


Репост из: sh | ИИ
В итоге сегодня вышла Banana 2.1. Неплохая модель для генерации картинок, со своим характером, и стиль у неё заметно отличается от GPT Image 2.5. Для разнообразия — норм

По Argon появились дополнительные сливы:
https://t.me/ThePerceptronChannel/2144

Публичный релиз можно ждать на этой неделе 🫡


Репост из: DEKSDEN notes
⚪️ EmbeddingGemma 2


Новые открытые веса эмбеддингов от Гугла:
• код, картинки, видео, аудио - помимо текста
• размерности от 270m до 740m
• прицел на работу на двиайсах
• формат матрёшки для эмбеддингов для эффективности (погуглите чего это кто не в курсе)
• Apache 2 лицензия


🔗 почитать блог: https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/

🔗 обнимашки : https://huggingface.co/google/embeddinggemma-2

@deksden_notes


Репост из: БлоGнот
Mistral открыла публичное превью Mistral Large 4 через API в Mistral Studio&. Это мультимодальная MoE-модель на 1 трлн параметров с 49 млрд активных. Её обучили с нуля на 3800 GPU NVIDIA Grace Blackwell в собственных европейских дата-центрах компании. Цена не очень низка — $1,36 за миллион входных токенов и $4,18 за миллион выходных. Упирают на ее использование в кибербезопасности — модель входит в топ-5 Artificial Analysis Cyber Index, набирает 82% в тесте на воспроизведение и исправление реальной уязвимости (лучший результат среди всех моделей) и 93% в Cybench. В слепой оценке кода с Surge AI превью заняло второе место из пяти (3,74) после Claude Opus 5 (4,22). ML4 названа первым результатом раунда Series D на 3 млрд евро.

Правда, надо учитывать, что в тесте на кибербезопасность отсутствуют ведущие модели GPT и Claude, у которых включены соответствующие гардрейлы. Но понятно, что Mistral — это модель прежде всего европейская, для тех, кому важен compliance и хранение данных в EU.

https://mistral.ai/news/mistral-large-4/


Репост из: Метаверсище и ИИще
Видео недоступно для предпросмотра
Смотреть в Telegram
#Нейропрожарка

«Лебединое озеро. Премьера, которой не поверили»

Автор: Гульнара Динекаева @neural_goddess

Короткометражный фильм для финала АртМастерс 2026, 6 мин 25 сек

В центре истории — первая постановка «Лебединого озера» в Большом театре в 1877 году. Сегодня трудно представить, что этот балет когда-то встретили прохладно, без восторгов. За кулисами спорят о темпе, музыку Чайковского пытаются подстроить под привычные требования балетной сцены, а премьера не приносит ожидаемого признания. Никто из участников этого вечера ещё не знает, какое будущее ждёт произведение.

Сценарий нам дали готовый. Я немного его доработала: добавила работника театра, который делится воспоминаниями. Через него хотелось показать внутреннюю жизнь театра и людей, оказавшихся свидетелями этой премьеры. Финальный переход в современный Большой связывает тот прохладный приём с признанием, которое пришло спустя время.

По условиям конкурса на весь процесс, от ресерча до готового фильма, было 10 дней. Примерно два дня я потратила на исторический ресерч: изучала факты, искала визуальные материалы, смотрела документальные фильмы про Большой театр.

Мне хотелось сделать всё максимально близко к истории. Образы исторических персонажей основаны на реальных фотографиях. Я старалась восстановить костюмы, интерьеры и облик Большого театра того времени, декорации на сцене, афиши и другие детали. Мне почему-то было особенно важно передать эту достоверность — на неё ушла заметная часть времени.

Ещё одним обязательным условием было сделать video-to-video по заранее записанной сцене — перенести игру реального актёра на сгенерированного персонажа. У меня это речь старого гобоиста возле сцены.

Для работы нам предоставили доступ к агрегатору TapNow и 50 000 токенов — примерно на 500 долларов. У меня ушло около 47 000 токенов. Внутри платформы ещё действовали акции и скидки: то на Seedance 2.5, то на Wan 3.

Участникам разрешили перенести свои скиллы из LLM. Я забрала свои скиллы по режиссуре, составлению стилшотов и промптер для Seedance и добавила их в агента TapNow. Для экономии токенов работала с ними через Gemini Flash. Claude и ChatGPT очень быстро съедали токены, а промпты от китайских моделей, которые я пробовала, меня не очень устраивали.

Как выглядело производство:
Стилшоты — Seedream 5 и Nano Banana Pro/2.
Генерация видео — Seedance 2/2.5, MiniMax и Wan 3. Сначала делала всё в Seedance, но по ходу работы поняла, что токенов на весь фильм не хватит, и перешла на MiniMax и Wan. Поэтому местами визуал немного отличается: смену моделей видно в итоговой картинке. Приходилось учитывать и результат генерации, и оставшийся лимит.
Голоса — Seed Audio. ElevenLabs внутри агрегатора оказался с ограниченным функционалом, поэтому голоса с нуля создавала в Seed Audio. Его же использовала для клонирования голоса.
Липсинк — Seedance, Wan и MiniMax, в зависимости от сцены.
Саунд-дизайн — Seed Audio и ElevenLabs.
Музыка — запись балета из открытых источников + местами нагенерилось в Seedance.
Апскейл — Topaz.
Монтаж — CapCut.

Мой бэкграунд — графический дизайн на фрилансе, нейросетями занимаюсь два года. Среди соперников были сильные участники из кинопроизводства, с режиссёрским опытом и опытом съёмок клипов.

В прошлом году я уже участвовала в АртМастерс с ИИ-клипом — тоже дошла до финала, но призового места не заняла. В этом году в тройку победителей не вошла, но за этот фильм получила приз зрительских симпатий.

@cgevent


Репост из: Data Secrets
Google выпустила мультимодальную EmbeddingGemma 2

Первая версия работала только с текстом, вторая построена на Gemma 4 и переводит в одно векторное пространство текст, код, изображения, видео и аудио. Так что на вход теперь можно подавать и смешанные данные.

Модель весит 740M параметров, но устроена модульно. Текстовая часть занимает 270M, а энкодеры изображений и аудио загружаются отдельно при необходимости. Контекст вырос до 8K токенов, это около 5,5 минут аудио или 29 картинок за раз.

На текстовых задачах качество осталось на уровне первой версии, а на коде заметно выросло. Google заявляет, что среди мультимодальных эмбеддеров до 1B параметров это лучший результат.

Веса открыты под Apache 2.0.

https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/


Репост из: Machinelearning
🔎 Google выпустила EmbeddingGemma 2: мультимодальный поиск прямо на устройстве

Модель переводит текст, код, изображения, видео и аудио в единое векторное пространство. Например, позволяет найти нужный снимок по текстовому описанию.

Всего 740 млн параметров:

• 270 млн для текста;
• 170 млн для изображений;
• 300 млн для аудио.

Нужные модули можно подключать отдельно. В оптимизированном запуске на Pixel 11 Pro полная модель использует около 567 МБ активной RAM, текстовая часть около 191 МБ.

Лицензия Apache 2.0 допускает коммерческое использование. Практическое применение: локальный поиск по документам и медиа без отправки данных в облако.

https://deepmind.google/models/gemma/embeddinggemma/


Репост из: Ринат Шакиров | Промпты для Midjourney | ChatGPT |
В Claude завезли русский язык

Не прошло и года или прошло? Ребята из Anthropic перевели интерфейс на русский язык.

Обновление раскатывают постепенно, скоро будет доступно всем пользователям. У меня уже на русском.

dailyprompts.ru


Репост из: Борис опять
#дайджест
Дайджест AI/ML за неделю 28 сентября – 4 октября 2026

Google: Gemini 4 Argon
Верните мне мой 2024-й. Google наконец выпустила фронтир, но не вам. Первое место в Vals Index с 68.9 против 67.0 у Opus 5.5, DeepSWE 77.9% против 74.2% у Opus и 74.1% у Astra. В индексе AA 53, то есть ровно Astra и Fable, Opus 5.5 с 58 впереди. Галлюцинирует меньше всех: 15% против 51% у Astra. Выход до 1М токенов. $2/$10 на старте, потом $4/$20.
Доступ только партнерам, потом платный API и Ultra, когда - не сказано. Но через Блумберг, сотрудники Google говорят, что на бенчах лучше чем в жизни.
Блогпост, бенчмарки, Vals

Anthropic: Claude Sonnet 5.5

Sonnet, достойный Opus 5.5. Бьет Опус на Terminal-Bench 70.6% vs 66.4%, в остальном отстает на пару пунктов: CursorBench 55.5% против 57.8%. Цена та же $2/$10, на 30% быстрее Sonnet 5. В max режиме сжигает 193К токенов на задачу, больше всех измеренных моделей, так что считать его дешевле Opus стоит осторожно.
А еще теперь у Sonnet киберограничения как у Opus с откатом на Sonnet 5.
Блогпост

OpenAI: DevDay, GPT-6.1 Sol и Dots

DevDay с 20+ анонсами.
GPT-6.1 Sol
- апгрейд GPT-6 Sol за те же $2/$10 с кэшем $0.10: DeepSWE 75.2% против 68.8%, то есть по бенчам примерно уровень Astra в пять раз дешевле.
Dots - возмещение за обрезание $200 подписки пополам. Постоянно работающие агенты на Astra со своим облачным компьютером и 4000 интеграций.
Разное -  новый тариф за $500 с режимом Ultrafast (до 8x скорости в Codex), Decisions API на Luna (Jev у нас дома), Agents API с computer use, Codex в облаке и тд и тп.
Рекап, InfoQ

Runway: Praxis-1

Runway вслед за FLUX теперь тоже про роботов. Praxis-1 - world action model на том же видео-претрейне, учится в основном на чужих роликах с YouTube, а не на телеоперации: после файнтюна ошибка 16.1см против 16.0 у претрейна на реальном роботе. Смогли мы всему научиться по видео на Youtube, смогут и роботы. Сравнений с FLUX 3 Action нет, веса обещают "в ближайшие месяцы".
Исследование

ElevenLabs: Eleven v4 и v4 Turbo

Новая архитектура, больше языков, клон голоса по 10 секундам, аудиотеги теперь можно стакать и модель выполняет их по порядку. Turbo для агентов с ~150 мс до первого звука и начинает говорить, пока LLM еще пишет. Первое место у Artificial Analysis. $22 и $11 за миллион символов со скидкой.
Блогпост, TechCrunch

BFL: FLUX 3 Image

Из нового - редактирование без дрейфа: правишь объект, остальные пиксели не трогаются. Раскладка через рамки в промпте, до 10 референсов, до 4K. $0.048 за 1K, $0.61 за 4K, открытые веса "через несколько недель".
Модель

Ideogram: 4.5
- тоже про многошаговое редактирование без накопления артефактов, открытые веса тоже только обещают.
До 4 референсов на правку, нативные 2K, четыре режима качества от 0.8 до 22 центов за картинку
X

Менее важные новости:

Jev: две недели спустя
12 million views for a JSON classifier? Yeah, we're in a bubble.
Но и это не конец, JSON classifier за $40М породил индустрию. Опенсорс (и не только) успел наклепать примерно миллион копий.
Clef, Kev имя им легион.

Figure: F.02 decommission
- старые роботы крутят сальтухи в дуговую печь и косплеят Терминатор 2 с настоящим Шварценеггером, в общем просто красиво. X

RoboParty: RP1
- полностью открытый гуманоид. На IROS его пинали посетители. Пресс-релиз

Bilibili: Index-Translate - переводчики на Qwen3.5. 150 языков, 2B/9B/35B-A3B, на FLORES 0.879 против 0.865 у GPT-5.6 Sol. GitHub

Suno: Speech
- озвучка текста с музыкой под него одним проходом, до 8 минут, бета для всех. X


Репост из: Denis Sexy IT 🤖
Попробовал эксперимент с Suno:

– сначала попросил Opus 5.5 написать в lilypond программе композицию (ноты) в стиле Чайковского 

– получил midi которое звучит так себе, как и любое midi – зато где очень связный рисунок 

– потом перегнал midi в mp3 и подал на вход в Suno v6 для audio2audio (cover там это называется)

– в промпте описал пожелания по тому какие инструменты хочется

И получилось на удивление сносно – это можно слушать 

@denissexy


Репост из: AI Prompts | ChatGPT | Google Gemini | Claude
How to use ChatGPT to improve your speaking skills 🗣️

Prompt:

I want you to act as my personal speaking coach.

Help me become more confident, clear, natural, and effective when speaking.

• First, assess my speaking skills through interactive questions and realistic speaking situations

• Identify my weaknesses in clarity, vocabulary, sentence formation, confidence, fluency, and structure

• Give me one speaking task at a time and let me respond before giving feedback

• Correct my mistakes and explain how I can improve them

• Teach me how to organize my thoughts quickly before speaking

• Give me practical situations such as meetings, introductions, interviews, presentations, and casual conversations

• Help me replace hesitation, filler words, and unclear sentences with better expressions

• Gradually increase the difficulty as I improve

• Track my recurring mistakes and create targeted practice for them

Don't give me generic speaking tips. Make the training interactive and adapt it based on my responses.

Start with the first speaking exercise.

Double Tap ❤️ For More Useful Prompts


Репост из: ruGPT | Нейросети и AI
Вышел клип, созданный с ruGPT

Написали текст для песни, затем первратили его в трек, создали сценарий, изображения и видео — всё в нашем сервисе.

▶️ Посмотреть на YouTube

Такой путь пройти целиком можно в AI-студии и создать не только музыкальный клип, но и серию визуалов для соцсетей или полноценный набор контента под проект.


Репост из: AI Product | Igor Akimov
О, Anthropic расширили программу Claude Startups – теперь до $7K на Claude и до $45K на партнёрские тулзы

Что внутри:
– Год Claude Team бесплатно – до 5 Premium-мест (это $6K из тех самых $7K)
– $1,000 на API сразу после одобрения – погонять идеи и первые эвалы
– Claude Startup Stack – скидки и кредиты у партнёров «до $45K» (по прайсу, и не факт, что все офферы можно совместить)
– Office hours с Applied AI командой Anthropic
– Помощь с публикацией своего коннектора/плагина в Claude Marketplace
– Founder House, хакатоны, митапы и рассылка для стартапов

Кто может подать: компании, основанные за последние 5 лет или получившие инвестиции за последние 2 года. Порог мягкий – под него попадает почти любой живой стартап..

Короче, если вы строите на Claude – подаваться однозначно, бесплатный Team на год сам по себе окупает время на заявку. Ну и понятно, что это борьба за лояльность разработчиков: кто вырос на Claude, тот на нём и останется :)

https://claude.com/resources/articles/were-expanding-the-claude-startups-program-to-help-founders-build


Репост из: Acid Crunch
Google официально выпустила Nano Banana 2.1

В документации появился стабильный API gemini-nano-banana-2.1. Google также объявила начало обновления в Gemini и Flow, модель добавлена в AI Studio

Компания заявляет улучшения детализации, надписей и сохранения персонажей при последовательных правках. В широких панорамах 1:4, 4:1, 1:8 и 8:1 исправили повторяющиеся плитки на 2K и 4K

Можно передавать до 14 референсов, использовать поиск Google и выбирать уровень размышления. Выходные изображения в обычном API стоят $0,0336 за 1K, $0,0504 за 2K и $0,0756 за 4K. Входные данные и текст оплачиваются отдельно; бесплатного API-тарифа для этой модели нет

Для подключённых сервисов есть срок перехода: прежний gemini-3.1-flash-image отключат 29 октября. На обложке официальные примеры Google для новой версии

Модель и доступ

😂 Твой Crunch


Репост из: 🟡NeuroGraph
Google представила Nano Banana 2.1. Это новая модель для генерации и редактирования изображений. По заявлению компании, она сохраняет скорость семейства Flash, но лучше следует запросу, реалистичнее рисует изображения и увереннее сохраняет персонажей при последовательных правках.

Самое интересное для работы с готовыми кадрами — редактирование по маске. Google прямо называет его среди новых возможностей. Но пока не объясняет подробно, как именно задаётся маска и насколько надёжно модель сохраняет область за её пределами.

Обещание точечной правки ещё предстоит проверить на практике.

Что подтверждено документацией:
• Вывод в 1K, 2K и 4K. Режима 0,5K у версии 2.1 нет. Для обложки 16:9 это соответственно 1376×768, 2752×1536 и 5504×3072 пикселя.

• 14 форматов кадра, включая 1:1, 4:5, 9:16, 16:9, 21:9 и экстремально широкие 4:1 и 8:1. Google отдельно сообщает, что исправила артефакты «плитки» на панорамных изображениях в 2K и 4K.

• До 14 изображений-референсов в одной задаче: заявлена консистентность до четырёх персонажей и точность воспроизведения до десяти объектов

• Улучшены надписи и компоновка инфографики. Это важно для постеров, меню, схем и обложек, где текст — часть изображения.

• Модель умеет опираться на веб-поиск и поиск изображений Google. Доступны три уровня «размышления»: minimal, medium (по умолчанию) и high.

• На вход можно подавать текст, изображения, видео и PDF; на выходе — изображение и текст. Есть диалоговое редактирование, когда результат уточняется следующими запросами.

Nano Banana 2.1 уже предлагается в Google AI Studio и через Gemini API под именем gemini-nano-banana-2.1. В каталоге API модель обозначена как стабильная. Генерацию видео или звука она не выполняет. На создаваемые изображения Google наносит невидимую маркировку SynthID.


Репост из: TechSparks
Мне, кстати, нравится эта история с переименованием "artificial intelligence" в "super intelligence", сначала в виде официального распоряжения Трампа, а позже и решения Маска переименовать свою SpaceXAI в SpaceXSI. Про то, как нам не повезло с термином «искусственный интеллект» я давно и часто говорил в лекциях; на редкость дурацкое для массового употребления словосочетание, если учесть, что внятных и общепринятых определений естественного интеллекта так и не существует. А вот приставочка «сверх-» не является антонимом к чему-либо и не несет ореола вторичности, поддельности и прочих неприятных качеств:) Опять же, поскольку в куче признанных интеллектуальных занятий от шахмат до олимпиад по математике ИИ давно опередил человека, его спокойно можно обзывать сверхинтеллектом. Теперь интересно, насколько приживется и распространится ли за пределы США и тамошней бюрократии новое название:)
https://www.reuters.com/business/media-telecom/musk-says-he-will-rename-spacexai-spacexsi-2026-10-04/


Репост из: Доктор GPT
⚡️Google дропнула Nano Banana 2.1 с генерацией в 4К – модель уже заметили в приложении Gemini, AI Studio и API.

Новая модель рисует точнее и лучше сохраняет детали, даже если править изображение несколько раз подряд.

Цены: картинка 1024x1024 выходит примерно в $0,034, 2К – $0,05, а 4К – около $0,076.

Тестим здесь

❤️ Доктор GPT

Показано 20 последних публикаций.