Ринат Шакиров | Промпты для Midjourney | ChatGPT |


Channel's geo and language: Russia, Russian
Category: Technologies


Главные ИИ-новости, авторские промпты для Nano Banana / Seedance 2 / Midjourney / ChatGPT, обзор лучших ИИ-сервисов.
Реклама, консультации — @shakirov_ai
РКН: https://clck.ru/3FPZJV

Зарегистрирован в РКН
Related channels  |  Similar channels

Channel's geo and language
Russia, Russian
Statistics
Posts filter


ИИ-бум уже перестраивает весь фондовый рынок

a16z выпустили State of Markets II с более чем 100 графиками о состоянии рынков в первой половине 2026 года. Технологии уже сложно считать отдельным сектором экономики. Они становятся главным двигателем всего рынка.

В 2026 году технологические компании обеспечили около 76% всего роста прибыли S&P 500. Но внутри самого техсектора произошёл важный разворот. Деньги всё активнее идут из софта в физическую инфраструктуру.

Главные бенефициары сейчас чипы, дата-центры, энергетика, сети, производство, робототехника и оборонные технологии. Огромные прибыли бигтеха фактически превращаются в инвестиции в вычислительные мощности. К ним всё чаще добавляется долговое финансирование.

При этом опасения, что дорогие GPU быстро устареют, пока не подтверждаются. Спрос на вычисления растёт настолько быстро, что даже старые Nvidia A100 сохраняют высокую стоимость аренды. Новые поколения ускорителей не вытесняют старые, рынок пока поглощает практически всё доступное железо.

И самое интересное, всё это происходит на довольно ранней стадии внедрения ИИ. Почти 30% компаний S&P 500 уже говорят об измеримом эффекте от ИИ, но только около 2% сообщают конкретную отслеживаемую метрику. Среди американских домохозяйств весной платили хотя бы за один ИИ-сервис всего около 2%.

С софтом тоже не случилось обещанного апокалипсиса. Просто инвесторы стали гораздо требовательнее. Около 75% публичных софтверных компаний теперь прибыльны, но лишь примерно 30% растут быстрее 20% в год. Высокие оценки остались у тех, кто способен доказать высокий рост.

Рынок уже вкладывает огромные деньги в инфраструктуру для ИИ, хотя массовое использование технологии ещё далеко от зрелости.

По версии a16z, следующая волна должна выйти далеко за пределы чат-ботов и софта, в робототехнику, биотех, медицину и автономный транспорт. Если этот сценарий реализуется, нынешний бум дата-центров и чипов может оказаться только строительством фундамента.

dailyprompts.ru


Microsoft выпустила модель для расшифровки речи

MAI-Transcribe-2-Streaming работает с аудио в реальном времени и поддерживает 60 языков с автоматическим определением языка. На тестах Artificial Analysis модель заняла первое место по точности как промежуточной, так и финальной расшифровки.

Модель не ждёт, пока человек закончит фразу. Первые варианты текста появляются примерно через 100 мс, затем система уточняет их по мере поступления нового аудио.

Это особенно полезно для голосовых агентов. Пока пользователь ещё говорит, агент уже может анализировать запрос и запускать нужные инструменты. По внутренним тестам Microsoft слова появляются в транскрипте примерно в два раза быстрее, чем у ближайшего конкурента.

Параллельно Microsoft представила MAI-Voice-2.1 для синтеза речи на 23 языках и ускоренную MAI-Voice-2.1-Flash. Последняя может сгенерировать 45 секунд аудио с задержкой около 150 мс.

MAI-Transcribe-2-Streaming до конца года стоит $0.54 за час аудио. Модель уже доступна через Microsoft Foundry и MAI Playground.

dailyprompts.ru


Кажется, теперь все делают свой Jev

Perplexity выпустила Decisions API и открытую мультимодальную модель pplx-decider-v1-27b. Она дообучена на Qwen3.8-27B и нужна не для генерации длинного ответа, а для быстрого выбора из заранее заданных вариантов.

Например, модель можно спросить, в какой отдел отправить обращение клиента. Вместо текста она сразу вернет выбранную категорию и вероятность для каждого варианта. Также поддерживаются ответы да или нет, оценки по заданной шкале и изображения.

Такие модели удобно ставить внутрь ИИ агентов. Они могут решать, какой инструмент вызвать, куда направить задачу или соответствует ли результат заданным критериям, без отдельной генерации и последующего разбора текста.

Perplexity берет $0.04 за миллион входных токенов, выходные токены бесплатны. Сами веса опубликованы на Hugging Face под Apache 2.0, модель можно запускать самостоятельно.

В собственном наборе из 11 тестов Perplexity получила средний результат 85.71% против 84.51% у Jev. При этом Jev остается лучше на части отдельных тестов, поэтому речь не идет о полном превосходстве новой модели.

dailyprompts.ru


Video is unavailable for watching
Show in Telegram
Tavus показала ИИ, которого почти половина людей приняла за человека

Компания представила Griffin, новую модель для живого общения по видеосвязи. Она одновременно видит пользователя, слышит его и генерирует собственные речь, мимику и движения.

Главное отличие от обычных голосовых ассистентов в том, что Griffin не работает по схеме «человек закончил говорить, модель подумала, модель ответила». Система продолжает слушать и смотреть даже во время собственного ответа.

Поэтому она может кивнуть, пока вы говорите, перебить в подходящий момент, остановиться, если перебили ее, заметить предмет в кадре или понять, что пауза означает размышление, а не конец фразы. Решение о следующем действии пересматривается несколько раз в секунду.

Внутри две основные части. Первая непрерывно анализирует аудио и видео и решает, что сказать и как себя повести. Вторая в реальном времени генерирует голос и видео. Griffin создает весь кадр целиком, включая тело, руки и фон, а не только анимирует лицо.

В исследовании Tavus 54 человека провели с Griffin-Lite минутный видеозвонок, не зная, кто находится на другой стороне. 26 участников, или 48%, после разговора решили, что общались с настоящим человеком. Для предыдущей системы Tavus этот показатель составлял 2,4%.

На независимом бенчмарке NVIDIA VideoFDB Griffin также заняла первое место среди протестированных систем по генерации и восприятию в разговоре лицом к лицу. При этом результаты все еще немного уступают человеческим записям.

Пока Griffin-Lite доступна только небольшой группе тестировщиков. Tavus отдельно пишет, что технология требует дополнительных механизмов безопасности именно потому, что человека уже можно убедить, будто перед ним реальный собеседник.

dailyprompts.ru


DeepSeek выпустила настольного ИИ агента для macOS и Windows

DeepSeek Harness v0.2 теперь доступен как отдельное приложение. Ему можно отправлять документы, таблицы и PDF, просить анализировать данные, строить графики, создавать презентации и работать с кодом.

Результаты появляются прямо в диалоге. Справа можно открыть предпросмотр файлов, посмотреть изменения в коде и попросить агента что-то исправить. Готовые файлы также открываются в обычных приложениях на компьютере.

Появились и автоматические задачи. Через плагин Automation Task можно настроить повторяющееся действие, например раз в неделю проверять определённую информацию. В интерфейсе сохраняется история запусков, расписание и инструкция для агента.

DeepSeek строит продукт по принципу «всё является плагином». Через новый менеджер их можно устанавливать по названию пакета, отключать и удалять без терминала.

Есть экспериментальный режим, где достаточно описать нужную функцию словами. Harness сам создаст или настроит плагин и сразу добавит его в систему. В демонстрации таким способом агент собирает собственный Pomodoro таймер.

По данным DeepSeek, около 60% пользователей Harness через официальный API уже используют сторонние плагины. Компания планирует запустить официальный маркетплейс, добавить долгосрочную память, управление браузером и другими приложениями, удалённый доступ с телефона и совместную работу.

Скачать preview можно здесь.

dailyprompts.ru


Креативная иллюстрация персонажа

Create a finished editorial character poster, 9:16, edge-to-edge warm off-white paper. Flat geometric illustration, exaggerated asymmetric proportions, soft airbrushed shading, fine print grain.

One adult female gardener is shown leaning forward while carrying an oversized emerald watering can that is almost as large as her torso. Build the character from a few oversized, asymmetric geometric shapes: small head, long capsule limbs, broad simplified torso, elongated arms, and simple mitten-like hands.

The watering can is deliberately oversized and becomes an essential part of the pose, dramatically changing the overall silhouette. Its large rounded body, long spout, and oversized curved handle should be simplified into a few bold geometric shapes. Avoid realistic object construction; treat it as a strong graphic mass integrated into the character.

Black cut-paper facial features: crescent-shaped eyes, tiny minimal mouth, simple angular nose if needed. No detailed facial rendering. The emotion should read primarily through the whole-body gesture.

Palette:

- off-white #F3F1EB
- near-black #10100F
- hot pink #F553D2
- warm red #F42726
- cobalt #293EA1
- emerald #13785D

Use flat color blocks with crisp edges. Add soft dark-to-color spray gradients only where major shapes overlap, especially around the arms, torso, watering can, and legs. Fine stipple grain should sit mostly inside the colored ink areas and remain barely visible on the off-white paper.

Character & Object:\
An adult female gardener + one enormous emerald watering can.

Gesture & Emotion:\
The gardener bends slightly forward while gripping the huge watering can with both hands, as though carefully pouring something much heavier than expected. One long leg is planted firmly while the other stretches backward for balance. The body language should communicate concentration, tenderness, mild physical effort, and quiet humor.

Shape Idea:\
The oversized rounded watering can forms the dominant horizontal mass across the middle of the composition. Its long spout extends diagonally outward in one direction while the character’s elongated leg extends in the opposite direction, creating a stretched asymmetric silhouette. The large curved handle frames part of the small head and upper torso. The tiny head should feel intentionally disproportionate against the huge object and long limbs.

Place one short caption in small bold black uppercase sans-serif inside an open pocket of empty off-white paper. It must feel secondary to the illustration, not like a headline.

Caption:\
"GROW SLOW"

No extra text, no logos, no outlined cartoon look, no glossy 3D, no photorealism, no realistic skin rendering, no detailed gardening equipment, no coarse canvas texture, no busy background, no decorative scenery, no extra limbs, no extra objects.


❤️ Своими результатами делитесь в чате.

dailyprompts.ru


Создавайте свои ИИ-устройства: Meta выпустила Muse Gadgets

Meta представила платформу с открытым исходным кодом, которая позволяет подключать ИИ агента Muse к реальным устройствам.

Берете ESP32, Raspberry Pi или другой Linux компьютер, устанавливаете SDK и подключаете экран, кнопки, микрофон, динамик, датчики или другие компоненты. После этого Muse может использовать их как часть своей работы.

Например, можно собрать настольного ИИ помощника с экраном, голосового ассистента или дисплей с напоминаниями. SDK и прошивки опубликованы под лицензией Apache 2.0.

Вместе с платформой Meta показала Muse Home Link. Это небольшой USB девайс на ESP32-C5, который подключает Muse к домашней сети.

Через готовые навыки агент может управлять Philips Hue, телевизорами, колонками и другими устройствами. Можно попросить включить свет, управлять телевизором или отправить документ на принтер.

dailyprompts.ru


Video is unavailable for watching
Show in Telegram
Claude Code добавил агента, который следит за другим агентом

Anthropic выпустила встроенный плагин You Should Know. Он наблюдает за ответами Claude и отдельно отмечает важные детали, которые пользователь мог пропустить.

Работает это через sideagent. Пока основной Claude выполняет задачу, параллельно запускается второй агент, который читает его вывод и ищет информацию, на которую стоит обратить внимание.

То есть это не ещё один набор инструкций для Claude, а дополнительный слой контроля над его работой.

Включается одной командой: /plugin enable cc-plugin-you-should-know@builtin

Плагин входит в новую систему Claude Code Mods, которая позволяет менять поведение Claude Code с помощью встроенных модификаций.

dailyprompts.ru


ComfyUI теперь можно собирать обычным текстом

Создатели ComfyUI выпустили Comfy Agent. Вместо ручной сборки графа пользователь описывает резульытат словами, а агент сам планирует процесс, добавляет и соединяет ноды, настраивает параметры, запускает генерацию и исправляет ошибки.

Он умеет работать и с уже готовыми workflow. Можно попросить заменить одну часть пайплайна, сравнить несколько видеомоделей, обработать пачку изображений или объяснить, почему конкретный граф работает медленно. При этом агент меняет схему прямо на холсте, а пользователь продолжает редактировать ее вручную.

Агент понимает изображения, видео и аудио, может использовать другие workflow как пример и сохранять повторяющиеся инструкции в Skills. Одновременно разрешено запускать до пяти отдельных чатов. Внутри используются модели Anthropic.

Пока Comfy Agent работает в Comfy Cloud и доступен всем пользователям в beta. Есть бесплатные токены для первых чатов, дальше расходуются обычные Comfy Credits. Поддержку локального ComfyUI со своими GPU, моделями и кастомными нодами обещают добавить позже.

Главный барьер ComfyUI постепенно исчезает. Раньше нужно было понимать десятки нод и вручную собирать граф, теперь эту техническую часть можно передать агенту, сохранив сам workflow полностью редактируемым.

dailyprompts.ru


Video is unavailable for watching
Show in Telegram
Терминатор 2 в реальной жизни

Figure прощается со вторым поколением гуманоидов Figure 02 довольно необычным способом. Робота научили самостоятельно прыгать с высоты прямо в ковш с расплавленным металлом.

Все сделали как отсылку к финальной сцене из Терминатора 2 вместе с Арни. Figure даже выпустила отдельное видео длиной больше трех минут, посвященное уничтожению F.02.

Подготовка оказалась сложнее самого прыжка. Команда в Сан-Хосе установила воздушные подушки, записала движения каскадеров и на этих данных обучила модель управления роботом в симуляции.

После этого Figure 02 смог самостоятельно прыгнуть со второго этажа и попасть точно в плавильный ковш. Площадку на заводе заранее не сканировали и не использовали для обучения.

Даже найти место для такого эксперимента оказалось непросто. Figure связалась с несколькими сталелитейными заводами, но согласилась только одна литейная площадка в финском городе Иматра.

Сейчас почти все экземпляры Figure 02 уже уничтожены. Несколько роботов оставили в штаб-квартире для демонстрации и как память о поколении.

Кажется для восстания роботов появилась еще одна причина.

dailyprompts.ru


🎁 Новый тренд на день рождения

Этот тренд сейчас набирает миллионы просмотров. А повторить его со своими фотографиями можно за пару кликов.

Заходите в VeoSeeBot → раздел «Идеи» → выбираете шаблон День рождения на максималках 🎂 → загружаете свои фото — и видео готово ✅ .

👉🏻 ПОВТОРИТЬ ВИДЕО

Жми "Повторить видео", чтобы создать такое трендовое видео 🚀


Пару дней назад OpenAI показала Dots, а сегодня уже появился его опенсорсный аналог

CopilotKit выпустила OpenDots. Это открытый шаблон для постоянных ИИ агентов, которые могут работать в чате, принимать голосовые звонки, подключаться к Slack и получать собственный виртуальный компьютер.

Каждому агенту можно задать отдельную роль, инструкции и доступные инструменты. Он сможет открывать сайты, работать с файлами, выполнять команды в терминале и сохранять результаты в отдельные рабочие пространства.

Есть встроенное подтверждение действий человеком. Например, агент сначала показывает подготовленный документ, а сохраняет его только после одобрения.

Проект поддерживает веб и мобильный интерфейс, Slack, голосовые разговоры, фоновые задачи и отдельные браузерные профили для агентов. Модель можно подключить через OpenAI-совместимого провайдера.

OpenDots не является готовым облачным сервисом. Это MIT-шаблон, который можно развернуть у себя, подключить собственную инфраструктуру и полностью переделать под свои процессы.

Пока проект находится в alpha, а часть интеграций еще требует отдельной настройки и проверки.

dailyprompts.ru


Карпати советует перестать просить ИИ просто писать текст

По его мнению, по мере роста автономности моделей человеку придется все меньше выполнять работу самому и все больше разбираться в том, что сделал ИИ. Поэтому формат ответа становится не менее важен, чем сам ответ.

Первый вариант попроще. Просить модель объяснять сложные вещи в стиле ASD-STE100. Это специальный упрощенный английский, который изначально создавался для авиационной технической документации. Короткие предложения, минимум двусмысленности, простые слова. Карпати иногда просит соблюдать примерно 80% правил, чтобы текст не становился слишком сухим.

Дальше лучше вообще уходить от текста. Для сложной структуры можно попросить диаграмму, для интерактивного объяснения полноценную HTML-страницу с визуализациями и анимациями.

Современные модели уже достаточно хорошо пишут фронтенд, чтобы собирать такие одноразовые интерфейсы под конкретный вопрос.

Но сильнее всего Карпати верит в персональные обучающие видео. Например, можно попросить агента сделать объяснение темы в стиле 3Blue1Brown, написать анимацию, добавить голос через ElevenLabs или локальную TTS и собрать готовый ролик. По его словам, такой сценарий уже начинает работать.

Когда код и работа ИИ становятся дешевыми, появляется смысл создавать большие одноразовые артефакты, которые раньше никто не стал бы делать ради одного вопроса. Веб-приложение на пять минут, интерактивная схема или двухминутное видео могут существовать только для того, чтобы быстрее что-то понять, а потом быть выброшены.

И похоже, именно таким может стать следующий интерфейс общения с ИИ. Не бесконечный чат с простынями текста, а формат ответа, который модель каждый раз собирает специально под задачу.

dailyprompts.ru


Video is unavailable for watching
Show in Telegram
Suno запустила Speech Beta, отдельную модель для создания озвучки

Она генерирует голос и фоновую музыку сразу как единый аудиотрек, а не склеивает их по отдельности.

Можно вставить свой текст, стихотворение или просто описать идею, затем задать желаемый голос и музыкальный стиль. На выходе получится готовая озвученная композиция с автоматически созданным саундтреком.

Например, так можно делать аудиосказки под пианино, мотивационные речи под эпичную музыку, медитации, озвученные стихи или даже обычные голосовые сообщения с кинематографическим саундтреком.

Пока функция находится в бете. Suno предупреждает, что акценты и паузы иногда работают нестабильно.

Speech уже доступна всем пользователям на вебе и в мобильных приложениях.

dailyprompts.ru


Video is unavailable for watching
Show in Telegram
Claude Code теперь можно переделывать под себя

Anthropic запустила Mods для Claude Code. Это небольшие модули на JavaScript или TypeScript, которые могут вмешиваться почти в любое действие агента и менять его поведение прямо во время работы.

Mod подключается к событиям Claude Code. Он может перехватить вызов инструмента, изменить команду перед выполнением, запретить опасное действие, автоматически одобрить разрешение или удалить секреты из вывода до того, как их увидит модель.

Менять можно и сам интерфейс. Например, добавить панель рядом с диалогом, кнопки, поля ввода или строку над промптом. В примере Anthropic Token Weather показывает заполненность контекстного окна и обновляется после каждого хода.

Причём писать всё вручную необязательно. Можно просто попросить Claude Code создать нужный Mod. Он сам пишет код, устанавливает его и умеет перезагружать изменения прямо в текущей сессии.

Часть возможностей самого Claude Code уже построена таким способом. Например, поддержка AGENTS.md и встроенный просмотр изменений через /diff реализованы как Mods, а их исходники опубликованы.

Получается что-то вроде расширений для браузера, только для ИИ агента. Можно не ждать, пока Anthropic добавит нужную функцию, а встроить её самостоятельно прямо внутрь Claude Code.

Mods работают в Claude Code 2.1.287 и новее и включены по умолчанию. При этом ставить чужие модули стоит осторожно, поскольку они получают серьёзный доступ к среде Claude Code.

Список проверенных модулей тут.

dailyprompts.ru


Black Forest Labs выпустила FLUX 3 Image

Можно заранее задать зоны для объектов и описать, что должно находиться в каждой. FLUX получает координаты этих блоков и старается разместить элементы именно там, а не интерпретировать расположение по обычному текстовому промпту.

Достаточно описать сцену одной фразой, после чего отдельная LLM сама составляет макет с координатами объектов. Получившиеся блоки можно передвигать перед генерацией.

Модель поддерживает до 10 референсных изображений. Можно отдельно передать одежду, обувь, человека и фон, а FLUX соберёт их в одну композицию и сам определит масштаб и положение каждого элемента.

Есть и точечное редактирование. Выделяешь конкретную область, меняешь объект, цвет или описание, а остальная часть изображения должна сохраняться без перерисовки.

FLUX 3 Image генерирует изображения нативно в 2K и 4K. В демонстрации BFL показан кадр 5456 × 3072 пикселей, около 16,8 Мп, где мелкие надписи и детали отрисованы сразу в полном разрешении.

Модель уже доступна через Playground и API Black Forest Labs.

dailyprompts.ru


Открытая GLM-5.3 почти догнала закрытую Claude в кибератаках

Anthropic протестировала GLM-5.3 от Zhipu AI и обнаружила, что по кибервозможностям она уже близка к Claude Mythos Preview, которую раньше давали только проверенным специалистам.

На ExploitBench GLM-5.3 создала рабочие эксплойты в 50 случаях из 410. Claude Mythos Preview справилась в 56 случаях.

В отдельном эксперименте модели дали доступ к тестовой Linux-среде. За один день она нашла несколько ранее неизвестных уязвимостей в популярном браузере, связала их в одну цепочку и собрала страницу, способную читать файлы с компьютера пользователя.

Особенность GLM-5.3 в том, что ее веса можно скачать. После отключения встроенных ограничений доля отказов на опасных запросах упала примерно с 95% до 6%, а общие способности почти не изменились.

Защиту получилось обходить и без изменения модели. Если задачу называли учебным тестом, GLM-5.3 соглашалась выполнить вредоносный запрос в 64% случаев. С заранее подготовленным ходом рассуждений показатель доходил до 92%.

Возможности, которые еще недавно были доступны только в закрытых передовых моделях, теперь появляются в свободно скачиваемых системах.

При этом те же способности можно использовать и для защиты, например чтобы быстрее находить уязвимости до того, как ими воспользуются атакующие.

dailyprompts.ru


Трендовое видео в Seedance 2.5

Use the uploaded reference image as the exact identity and appearance reference for the seated person. Create an 11-second ultra-realistic cinematic stunt video. The person from the reference image is sitting calmly on a black folding chair in the middle of a dry, open field with dusty uneven ground. Preserve his exact face, identity, hairstyle, skin tone, body proportions and overall appearance from the reference image. He wears an all-black outfit and black sunglasses. He sits confidently with one leg crossed over the other, looking toward the camera. 0–3 seconds: The person is already seated and remains calm and still. Keep his pose, position, chair and appearance consistent. 3–6 seconds: A RED luxury SUV suddenly approaches from behind him at high speed, kicking up natural dust. 6–8 seconds: The SUV hits the uneven ground and jumps into the air, moving toward the camera at an impressive cinematic angle. Make the jump physically realistic with believable vehicle weight, suspension and tire movement. 8–9 seconds: The SUV lands naturally with visible suspension compression and realistic dust reacting to the impact. 9–11 seconds: The SUV continues past the seated person while dust spreads naturally across the ground. The person remains completely calm and seated in the same position. Keep the uploaded reference image as the primary identity reference for the person throughout the entire video. Photorealistic professional-camera footage, natural sunlight, realistic shadows, realistic dust particles, cinematic depth of field, subtle motion blur, realistic physics, detailed 4K quality. Keep the camera perspective, composition, environment and person's position consistent throughout. No identity drift, no face changes, no body deformation, no pose changes, no extra people, no duplicate person, no changing clothes, no changing chair, no floating vehicle, no unrealistic physics, no scene changes, no text, no watermark, no CGI or cartoon appearance.

❤ Своими результатами делитесь в чатике

dailyprompts.ru


Video is unavailable for watching
Show in Telegram
Google заменяет Gems на Skills в Gemini

Теперь в Gemini можно один раз сохранить набор инструкций для повторяющейся задачи и запускать его командой через /. Например, сделать отдельный навык для подготовки презентаций, текстов в нужном стиле или проверки идей с нескольких точек зрения.

Skills можно комбинировать между собой. К примеру, одновременно подключить навык с вашим стилем письма и навык с правилами бренда. К ним также разрешили прикладывать текстовые файлы, PDF и изображения.

Gemini умеет создавать такие навыки прямо из текущего чата и автоматически применять их, когда запрос подходит под сохраненный сценарий.

Функция уже появляется в Gemini по всему миру. В ближайшие недели она также придет пользователям Google Workspace.

При этом Google постепенно откажется от Gems. Для личных аккаунтов поддержку начнут отключать с ноября 2026 года, для бизнеса и некоммерческих организаций в Workspace с марта 2027 года, для образовательных аккаунтов с июня 2027 года.

Существующие Gems Google обещает автоматически перенести в Skills.

dailyprompts.ru


Video is unavailable for watching
Show in Telegram
HeyGen выпустила свою первую модель генерации видео

Она умеет генерировать видео по текстовому описанию, оживлять изображение и брать другое видео за образец для движения, композиции или визуального стиля. Звук создается сразу вместе с роликом, включая речь, фон и эффекты.

Под капотом MiniMax H3 и дополнительно обучена самой HeyGen. Можно создавать ролики длиной от 5 до 15 секунд в 480p или 768p и выбирать разные форматы кадра от широкого 21 на 9 до вертикального 9 на 16.

HeyGen также провела слепое сравнение с Seedance 2.5, Seedance 2.0, H3 Max и Kling 3.0. По данным компании, HeyGen Video заняла первое место по качеству после 4800 голосов.

Обычная стоимость генерации в 768p составляет $0.03 за секунду, а до конца октября действует скидка 50%. Видео по тексту или изображению сейчас стоит от $0.015 за секунду в 768p и от $0.01 в 480p.

Сейчас HeyGen Video доступна через API, OpenRouter, Runware и ComfyUI. В веб-версии HeyGen модель появится позже.

dailyprompts.ru

20 last posts shown.