слИИвки


Гео и язык канала: Россия, Русский
Категория: Технологии


новости искусственного интеллекта и генеративных сетей
чат канала: https://t.me/niishtyaki_chat

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Видео недоступно для предпросмотра
Смотреть в Telegram
А теперь вишенка на тортИИке: Идеограм 4.5 будет опенсорс (говорят - скоро).

Наконец-то достойный прогресс в картиночном редактировании. По сути это качественный народный инпеинт уровня 2026, без колор шифтов, без зацепов в местах не требущих редактирования, понимающее в текст. То, за чем мы бегаем в «банану», правда все это уже было в фотошопе с его ии инструментами (но это отдельная тема с бубнами).

Чем это ещё меня радует: ребята конкретно демонстрируют понимание проблемы деградации всего изображения с ростом числа итераций при, казалось бы, локальном редактировании. Глядишь - другие подтянутся и пофиксят этот момент…


Репост из: Ринат Шакиров | Промпты для Midjourney | ChatGPT |
Ideogram 4.5 научилась нормально редактировать одну картинку много раз подряд

Ideogram выпустила 4.5. Главный упор теперь не только на генерацию картинок с текстом, а на последовательное редактирование одного изображения без постепенного разрушения деталей.

У модели появилось два режима редактирования. Precise Edit меняет только нужную часть изображения и старается сохранить всё остальное без изменений. Обычный режим 4.5 может сильнее перестраивать исходную картинку.

Например, можно сначала поменять цвет товара, затем освещение, потом текст на упаковке и после этого заменить отдельный объект. Модель оптимизирована под такие цепочки правок, чтобы после каждого шага изображение не начинало заметно плыть.

Ideogram 4.5 умеет менять надписи прямо внутри готового дизайна, переводить их на другой язык с сохранением оформления, перекрашивать предметы, менять свет вместе с тенями и отражениями, а также переставлять мебель или отделку в фотографии комнаты.

Модель поддерживает генерацию и редактирование до 2K, маски и несколько референсных изображений. В одном запросе можно использовать исходную картинку и дополнительные изображения с нужным человеком, товаром или стилем.

Есть несколько уровней качества. Стоимость через API начинается примерно с $0.008 за изображение и доходит до $0.22.

Модель уже доступна в Ideogram, API и сервисах партнеров. Компания также планирует позже открыть веса модели.

dailyprompts.ru


Репост из: Метаверсище и ИИще
Видео недоступно для предпросмотра
Смотреть в Telegram
Мертвые заговорили!

Полный Kling 4.0 выходит в октябре, а Kling 4.0 Flash уже бахнули для подписчиков Ultra Yearly.

Главное:

- до 30 секунд видео одной нативной генерацией вместо прежних 15;
- до 10 keyframes;
- до 15 мультимодальных референсов одновременно - персонажи, предметы, изображения, видео и другие материалы;
- более развитый Omni Reference и редактирование уже существующего видео;
- 4K;
- 10-bit HDR (воще непонятно какой именно);
- улучшенный native stereo audio;
- более точный lip sync;
- video extension;
- больше языков, акцентов и диалектов.

Теперь про Kling 4.0 Flash.

Это облегчённая версия 4.0 для более быстрой генерации. Она уже работает в early access, тогда как полноценный 4.0 появится только в октябре.

Но: Kling пока не опубликовал нормальную официальную таблицу 4.0 vs 4.0 Flash.

Из предварительных материалов и утечек Flash примерно так:

Kling 4.0:
до 30 секунд
до 4K
до 15 референсов
до 10 keyframes
максимальное качество и контроль

Kling 4.0 Flash:
предварительно до 20 секунд
предварительно 720p
часть продвинутых функций может быть урезана

Цена, Карл?

https://kling.ai/release-note/release-notes/Kling_4

@cgevent


Репост из: AItoolz
Видео недоступно для предпросмотра
Смотреть в Telegram
Google выпустила монстров синтеза речи

Google выпустила Gemini 3.8 Flash TTS и облегченную Flash Lite TTS для генерации голоса. Flash TTS понимает 130 языков, Flash Lite, 101, а в библиотеке больше 2000 готовых голосов с разными акцентами, плюс можно собрать голос с нуля по текстовому описанию. Модель держит согласованный, без сбоев звук даже на длинных файлах, поддерживает смех, вздохи и диалоги на несколько голосов сразу.

По бенчмаркам все не так однозначно, как заявляет сама Google: в независимом голосовом рейтинге Artificial Analysis Flash TTS занял второе место, первым остался Cartesia Sonic 3.6, хотя по устойчивости произношения Google действительно на первом месте с 89,5%.

🧠 Следи за AItoolz — тестируем новые голосовые ИИ без хайпа

#Google #Gemini


Нарвался тут на проект в Хиггсфилде. Просто посмотрите как оно органзиовано.
https://higgsfield.ai/@higgsfield.studio/projects/cully-hill-boys

полноценный нейропрод.
Если не говорить что это AI, то никто и не поверит.
Но если задаваться вопросом: "на сколько была интересна история? ", так с этим вопросом можно обратиться и к Голливудским фильмам, каждый фильм вас цеплят?


IMG_6214.PNG
1.7Мб
Как же быстро горят лимиты в астре… Закончили вот на чем: выплюнул из последних горящих токкенов маску и сказал: «дальше сам. Я устал, я ухожу».

Может у вас есть свой топ-лист нейрообтравочника?


IMG_6213.PNG
489.4Кб
IMG_6212.PNG
3.5Мб
Чего травить кота за яй, ой, о чем я вообще?

Решил проверить GPT на обтравку в сложных условиях: светлое на светлом, волосяки тонкие… Есть ощущение, что там какой-то общедоступный скриптовой алгоритм, но хочется заставить себя верить, что присутствует немного генеративной магии поверх.

Идеальный пайплайн внутри жпт, как по мне, должен быть такой - обтравка ИИ алгоритмом BiRefNet - анализ результата обтравки и исходника - дорисовка с прогнозированием по альфе.

П.С.: пока годится только для веба под белый и фон не ниже среднего серого. Но я от жпт так просто не отстану)


Видео недоступно для предпросмотра
Смотреть в Telegram
AI Anime | Crazy Rari vs Weeping Argent
Это микс - 3D на вход, ручные иллюстрации, и немного простого промптинга.
Seedance 2 at 480P, about $200 worth of token burn
Music was made with Suno.

2026 - косяков в аи видео осталось меньше видимого вдумчивого уровня) для потребления с мобильных устройств, уж точно


Видео недоступно для предпросмотра
Смотреть в Telegram


Хиггсфилд продолжает за вас настраивать нейросети. По сути их GENJUTSU это готовые прокаченные редактирующие промпты для Сиданс 2.5

Здесь, скорее, меня привлекает не Хиггсфилд, а Сиданс 2.5, в очередной раз убеждаюсь, что китайцы на голову впереди в видеогене


Репост из: Neurogen
FLUX Video Edit

Bfl запустили модель видеоредактор, типо видеомонтаж больше не надо делать

Работает все с промпта, закидываешь видос, пишешь что должно поменяться, и модель меняет ТОЛЬКО то что ты указал в промпте, как заявляет черная лаборатория, все что не упомянуто в промпте, остается как в оригинале

🔘Как это работает:

- Один POST-запрос: клип (URL или base64) + текстовая инструкция
- Поллинг результата - когда статус «Ready», получаешь ссылку на готовый mp4
- Можно накладывать несколько правок одну за другой на один и тот же клип

Видео до 15 секунд и 50 МБ. Минимум 160px по стороне и 17 кадров (≈0,7 сек)

Выход - всегда 24 fps, ролики больше 720p даунскейлятся

Звук сохраняется из источника — если не просишь изменить диалог или звук

Промпт до 4 096 символов

🔘Цена

$0.03 за секунду выходного видео. Пример: одна правка 10-секундного клипа = $0.30

Цена не зависит от сложности правки, длина всегда как у оригинала

⚠️ Ограничения

- Ролики длиннее 15 сек отклоняются (не обрезаются!)
- Нельзя задать длительность, разрешение или aspect ratio (берутся из источника)
- Не поддерживаются: референс-видео, вход по картинке, маски, продление клипа
- Новый диалог должен влезать в длину заменяемой фразы

Playground (за баланс)
Блогпост (можно глянуть как работает модель на примере)
Fal.ai


Астра тебе не по зубам. Или: ты можешь поездить на арендованной Феррари, но за твои деньги - лишь час :)

Исходя из этой логики для уверенного средняка на двадцитидолларовом аккаунте ОпенАи сделают 6-sol. Подешевле, попроще, но с тем же "вайбом" :)

Кстати, для справки - от первой модели Опенаи до Астры прошло 4 года (30 ноября 2022 года - 3 сентября 2026 года). Астра тренировалась на кластере 100+ К Топовых НВИДИА.

CEO Нвидиа (Хуанг, крутой чел в кожане) признал, что ОпенАи достигли АГИ. Говорит, что теперь у них в планах кластер 400 К + Нвидиа GPU для обучения новых моделей


Репост из: Топор+
Видео недоступно для предпросмотра
Смотреть в Telegram
Первое живое видео с iPhone Duo публикуют в сети.

Да, перед нами действительно новый айфон.

👉 Топор +18. Подписаться


Репост из: Ai molodca
Вышел Suno 6 💃

Так что качество нейротреков соссмыслом про пацанских волков и любовную любовь в такси чуть подрастет.

Можно править отдельные слова и припевы, не пересобирая песню целиком, скрещивать несколько треков и делать музыку по картинкам и видео. Версий теперь три: обычная, wild для экспериментов и бесплатная mini.

Ну и сюда же. Я.Музыка (наконец-то) ввела маркировку AI-треков, собственную детекцию и настройку «Меньше ИИ» в реках. Хорошо бы, если при заказе такси еще добавили такую.


https://www.threads.com/share/BAioOyYCcc/ впечатляет


Время шестерок. GTA 6, GPT 6 (Astra), кто следующий?

If you're 555, then I'm 666
If you're 555, then I'm 666
What's it like to be a heretic?


без лишних слов, с 1 снтбббряяя!

Суно кавер кастом войс


Репост из: Телеканал ТНТ
Видео недоступно для предпросмотра
Смотреть в Telegram
😱 СЛИЛИ ЕЩЁ ОДНУ СЦЕНУ ИЗ ТРЕЙЛЕРА GTA VI

Канон? 😏


OpenH3-IR — дополнительные «мозги» для MiniMax H3 🧠

Open-source инструмент, который превращает обычный промпт в структурированный Context-IR: продумывает сцены, тайминги, камеру, персонажей и работу с референсами перед генерацией.

По сути, это дополнительный reasoning-слой: промпт → OpenH3-IR → MiniMax H3 → видео, что концептуально приближает пайплайн H3 к «думающим» видеогенераторам уровня Seedance 2.

⚙️ Для работы нужно поднять локальную LLM через OpenAI-compatible API. Автор свои примеры делал на Qwen3.6 27B 4-bit через vLLM, после чего непосредственно видео рендерил уже MiniMax H3.

Есть готовые ноды для ComfyUI.

🔗 https://github.com/ruashots/open-h3-ir

Показано 19 последних публикаций.