AI Роман | Про нейросети


Гео и язык канала: Россия, Русский
Категория: Технологии


Полезные инструкции к нейросетям, которые упростят вам жизнь и работу.
Канал Романа Куцева @roman_kucev – Founder LLM Arena & VseLLM. Выпускник ВМК МГУ, 10 лет в сборе и разметке данных.
👉🏼 Для сотрудничества: @grigoryev_ni

Связанные каналы  |  Похожие каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Ты едешь или нет?
Нет.


Читал новости, вспомнил мем, не смог удержаться, чтобы не сделать этот ролик

Motion Control моя любимая функция 😅


🤯 Если нет разницы – зачем платить больше?

Затестил SeeDance 2.5 и Gemini Omni Flash на сложной детализации и движениях, результат прикрепляю.

Flash немного теряется, но стоит на всех платформах минимум в 3 раза дешевле.

Промпт по традиции в комментариях ⤵️

Какое видео вам понравилось больше?
🔥 – 1 (SeeDance 2.5)
❤️ – 2 (Gemini Omni Flash)


Расшифровываете звонки с клиентами и записи встреч с командой, а ИИ выдает неразборчивое полотно текста... Знакомо?

CEO крупного Saas прогнал 491 запись речи через 11 движков распознавания и выложил у себя в канале записи, которые можно прослушать самостоятельно (и всё проверить) 😱

Дмитрий Бороздин сооснователь и генеральный директор RetailCRM. Платформы, на которой продажи, маркетинг и лояльность выстраивают Lacoste, Твой Дом, 12 Storeez и ещё тысячи ритейлеров.

В своём канале он много пишет о внедрении ИИ в продукты, собственных тестах с новыми моделями и успешных практиках ритейла. Из последних интересных постов:

Полное исследование 11 движков распознавания речи, с методологией и ссылками на каждую запись (177 минут звука)

Кто лучше управляет компанией: ИИ или простой скрипт на 200 строк. Спойлер: результат совсем не тот, которого ожидаете

Чем вайбкодинг отличается от харнесс-инжиниринга и почему это важно понимать не только разработчикам

Как OpenAI встраивает рекламу прямо в диалоги ChatGPT и что происходит с независимостью советов модели, когда компания зарабатывает на клике

Без инфошума и рекламы Дмитрий делится своим мнением, подкрепляя всё цифрами и многолетним опытом, конечно 😎 → Подписывайтесь


🤪 Поясняю за цены на SeeDance 2.5

🍀 Dreamina AI - официальный дилер, 30 секунд в разрешении 720 стоят около 600 рублей.

Возьмёте годовую подписку - упадёт до 400₽, но кредитов всё равно не хватает, доплачиваете и выходите на те же 600.

🍀 Пометка по всем сервисам: разрешения 1080 нет вообще - модель в бете, мощности размазывают, чтобы очереди не встали колом. Апскейл в помощь.

Цензура у модели также жёсткая. Зато держит пятьдесят референсов на вход и реально их помнит.

По агрегаторам:

🍀 Runway ML при оформлении Max-плана за 100$ даёт семь дней безлимита на модель после релиза - но только новым юзерам (до 14.08). У меня на новом акке работает.

🍀 Мой совет: прогуглите заранее актуальные промокоды на Runway, можете легко выцепить -25 и -50% скидку (тогда тариф будет стоить 75$ или 50$ соответственно).

Topaz для апскейла SeeDance-роликов здесь как раз есть в безлимите.

🍀 У Higgsfield тридцать три дня безлимита сразу на Seedance 2.5 и 2.0, доступ открывается от тарифа Plus и растёт по цене вместе с планом (около 540$).

Пишите в комментариях, где новой моделью пользуетесь вы 🍀

Первое видео – SeeDance 2.5, второе – Kling AI 3.0 Pro, какое понравилось больше?
❤️ – Seedance 2.5
🔥 – Kling 3.0 Pro
👍 – Оба норм


🎙 Как бесплатно перевести любое аудио в текст?

Рубрика #эксперименты. Собрал для вас Telegram-бота на базе Gemini – для полной расшифровки аудио в текст.

Главная фишка от меня: помимо расшифровки получаете ещё саммери звонка и текущие таски – удобно для расшифровки созвонов.

Пока ограничил бот тремя транскрибациями в день на один профиль, чтобы не перегружать. Если интересно – расскажу, как собрал бота и сколько на него потратил (спойлер – я не кодер и бюджет на него был нулевой).

Работает бесплатно, без смс и регистрации, без рекламы и донатов. Если хотите поблагодарить – накидайте реакцией, комментов или бустов.

Тестим тут: @voice_ai_roman_bot

Приятных генераций 👍


📌 ПОДБОРКА ПОЛЕЗНЫХ ПОСТОВ НА КАНАЛЕ

Собрал в одном месте все актуальные посты, которые сильно упростят вам жизнь и работу.

Сохраните, чтобы не потерять 📌

Доступы
🔵 Как скачать ChatGPT, Gemini, Claude, Grok и другие заблокированные в РФ приложения себе на iPhone
🔵 Как получить бесплатный доступ к Nano Banana Pro
🔵 Ещё один способ бесплатно пользоваться Nano Banana Pro
🔵 Как пользоваться Gemini в РФ: Обновлённые DNS-профили для Android и IOS/Mac
🔵 Где бесплатно генерить картинки в 2K

Фото и видео
🔵 Как добавить любого человека в популярный мем
🔵 Как улучшить качество фото до 4к
🔵 Генерируем фото и видео без цензуры
🔵 Повторяем эффект размытых фоток
🔵 Как генерировать реалистичные человечные фото
🔵 Как сделать селфи со звездой

Подборки
🔵 5 бесплатных нейросетей для генерации изображений
🔵 3 Telegram-бота для тех, кто продвигается в соцсетях
🔵 Как выбрать ИИ-браузер и зачем они нужны

Полезные инструкции
🔵 Как сделать раскадровку своего образа для генерации фото и видео
🔵 Секретные промпт-коды для ChatGPT, которые сэкономят вам кучу времени
🔵 Полная инструкция к Suno AI
🔵 База готовых промптов для Nano Banana
🔵 Сайт с лучшими референсами и промптами для генерации фото

Буду обновлять, приятных генераций


Как вам такой способ? 😏


🥸 Anthropic выкатила Opus 5

Он в 2 раза дешевле Fable 5, а на бенчмарках местами его обгоняет.

$5/$25 за 1 млн токенов, как стоил 4.8. На Max сделали моделью по умолчанию, на Pro – топовой.

По цифрам:
- На независимых замерах взял первые места по интеллекту и коду, обойдя и Fable 5, и GPT-5.6 Sol
- На тестах по коду держится в полпроцента от Fable 5, но за половину цены
- Режим Low выдаёт тот же результат, что 4.8 на максималках, только в восемь раз дешевле и заметно быстрее

Гоняю прямо сейчас, по коду - гуд, задачи разбирает уверенно, лимиты больше не сгорают за 5 минут, как это было на Fable.

Модель не бросает задачу на середине, сама себя перепроверяет и доводит до конца. Один раз даже сама собрала себе тестовый стенд, чтобы проверить свою же работу.

Как скачать Claude и другие заблокированные в РФ приложения себе на iPhone – рассказал в этом посте.

В веб-версии включаем прокси, на Android ставим usa-почту в Play Market.


🥣 Устал от трендовых шрифтов в CapCut и сделал свой

Тестирую Claude на разных задачах, которые нужно решить вот прям сейчас. Если вы так и не дошли до скиллов, коннекторов и плагинов – сделаю постоянной рубрикой.

В этом случае я не использовал никакие навыки, а просто: 

1⃣ Написал короткий промпт в новом чате:
Создай новый трендовый шрифт, чтобы он цеплял внимание и его можно было было вставлять в рилсы акцентным заголовком и мелким текстом тоже. Сделай и скинь в формате ttf. Прикрепляю референсы шрифтов, которые мне нравятся.

2⃣ Прикрепил скрины пары шрифтов, которые мне нравятся
3⃣ Загрузил получившиеся файлы в CapCut через "Текст" - "Стиль" - "Шрифты" - "Мои шрифты" - "Добавить".

Можете использовать мой шрифт – я оставил его в комментариях – можете создать свой. Делитесь результатами в комментах ⤵️

Как скачать Claude и другие заблокированные в РФ приложения себе на iPhone – рассказал в этом посте.

В веб-версии включаем прокси, на Android ставим usa-почту в Play Market.

❤️, если интересно


🤣 Знакомо?

Забавно, что пока делал этот мем в GPT – пришлось ему раз 15 объяснить, как правильно покрасить забор, чтобы сохранить логику мемаса.

Сделал жизу, получается?


🇨🇳 Встречаем нового конкурента GPT Image 2 и Nano Banana Pro

Китайцы дропнули Qwen Image 3 – можно бесплатно погенерить картинки уже сейчас на сайте.

Главное обновление – промпт до 4500 токенов против 1000 у версии 2.0. Справляется со сложными макетами: газеты, сториборды, слайды. Отлично умеет в тексты.

Ещё жёстко не тестил, первую генерацию прикрепил к посту.

Тарифы на API пока не опубликованы, весов модели для скачивания ещё нет, главная заявка модели – текст третьего поколения, который остаётся читаемым даже в очень мелком размере.

Тестируем в вебе:
🔗 chat.qwen.ai


☝️ Где бесплатно генерить картинки в 2K

Собрал сервисы с ежедневными кредитами без подписок. Актуально на момент написания, всё быстро меняется – пишите в комментах, если есть инфа точнее ⤵️

1⃣ Google Flow
Изначально студия под ИИ-видео (Veo 3.1), но картинки там тоже генерятся, причём в 2K.

Бесплатно дают 50 кредитов в день (сброс каждые 24 часа) плюс 100 приветственных при первом входе, карту привязывать не надо. Одна картинка стоит 1-2 кредита, то есть десятки штук в день.

Под капотом Nano Banana 2 Pro, разрешение до 2048×2048, до 4 картинок за один промпт. Сейчас разрабы тестят приложение на iOS, кстати, ждите дроп. Пока в веб-версии работает норм.

2⃣ Genspark AI
На бесплатном тарифе примерно 100-200 кредитов в день, обновляются каждые 24 часа.

Внутри – доступ к Nano Banana Pro 2K, GPT Image, FLUX 2 Pro, Seedream 4.5. По сути агрегатор моделей.

3⃣ Adobe Firefly
В 2026-м Adobe переделали фри-тариф: вместо 25 кредитов в месяц теперь ежедневно обновляемые генерации с потолком в 2K.

Отдельный жирный плюс – Firefly обучен на лицензионном контенте Adobe Stock, самый безопасный вариант для коммерции.

4⃣ Leonardo AI
150 Fast-токенов в день, сброс каждые 24 часа, без переноса на завтра.

Стандартная генерация стоит 2-4 токена, то есть выходит примерно 37-75 картинок в день. Стандарт – 1024, но есть апскейл и куча дообученных моделей.

5⃣ Google Gemini
Лимит с нюансом. Бесплатно в приложении около 20 картинок в день на Nano Banana 2 в разрешении до 1K.

А вот Nano Banana Pro (платная модель) на фри-тарифе ограничен примерно 2 картинками в день.

6⃣ ChatGPT Image
GPT Image 2 поддерживает разрешение до 2K, но лимит жёсткий: около 2-3 картинок в окно 24 часа. Зато удобно итерировать прямо в чате.

Если что-то не работает – идём в чат и пытаемся разобраться вместе

Сохраните, чтобы не потерять 📌

❤️ – нужно больше инструкций


Видео недоступно для предпросмотра
Смотреть в Telegram
Все обсуждают, что новая Kimi K3 умеет гонять 300 агентов параллельно

Но это не главная новость – агент-свармы Moonshot внедряли ещё в прошлых версиях Kimi.

Важнее вот что:
➡️ у модели 2,8 триллиона параметров – это одна из крупнейших опенсорс-моделей на сегодня
➡️ контекст в 1 миллион токенов – под огромные кодовые базы, длинные документы и многошаговые агентские задачи
➡️ новая архитектура внимания Kimi Delta Attention + Attention Residuals – экономит вычисления примерно в 2,5 раза эффективнее, чем у K2
➡️ нативная работа с текстом, картинками и видео

По собственным бенчмаркам Moonshot, K3 обходит Claude Opus 4.8 и GPT-5.5 в ряде задач, но по их же признанию Fable 5 и GPT-5.6 всё равно впереди по общему счёту.

Что по лимитам:
☺️ 3$ за 1М входных токенов
☺️ 15$ за 1М выходных
☺️ 0,30$ за 1М кэшированных входных

Модель явно заточена под масштабный код и агентские задачи, а не под обычный чат.

Забавная деталь: рекламный ролик к запуску смонтировал сам Kimi K3 – ему дали 56 исходных клипов, он сам нарезал всё под ритм и прошёл несколько раундов правок без монтажёра.

Комьюнити не теряло времени: за первый день на K3 уже собрали браузерные игры, десктопные интерфейсы, расширения для браузера, 3D-сцены и полноценные full-stack приложения.

Попробовать можно уже сейчас – через Kimi, Kimi Code или API. Открытые веса обещают выложить 27 июля.

Тестим тут:
🔗 kimi.com
🔗 kimi.com/code


🥸 Anthropic оставляет Fable 5 в подписках

С 20 июля модель войдет во все подписки Max и Team Premium. Причем пользователи этих тарифов получат доступ за половину стандартной стоимости.

Для владельцев Pro и Team Standard Fable останется доступен, но пользоваться им придется за счёт кредитов. В качестве компенсации Anthropic начислит дополнительный кредит на 100 долларов.

Компания также уточнила, что для активных пользователей Fable базовый уровень доступа составит 50% от полного объема ресурсов, предусмотренных тарифом.

Ждём теперь Gemini 3.5 Pro – думаю, уровень будет около Fable 5 🔥


😏 Куда так часто пропадаешь?

Получилось снова выбраться в Америку. И, к сожалению, не таким я себе представлял Лос-Анджелес…

LA оставил крайне мерзко-грустные ощущения и дикое разочарование.

Тысячи талантливых, творческих людей тут просто загибаются от нар🥱иков.

Так, например, выглядит вечерний пляж в Санта Монике…

Какие эмоции у вас вызывает это видео?


☝️ Сегодня вышли сразу две модели: GPT-Live и Grok 4.5

🤖 OpenAI сделала голосового помощника, с которым можно болтать как с живым человеком: без пауз, можно перебивать на полуслове, отвечает сразу.

Что умеет:
- Слушает и говорит одновременно, а не по очереди
- Пока думает над сложным (например, ищет что-то в интернете) - не молчит, а продолжает поддерживать разговор
- Различает, когда ты просто задумался или закончил фразу; убирает уличный шум; поддакивает, показывая, что слушает
- Прямо во время звонка показывает в приложении карточки: погода, спорт, курс акций
- Можно выбрать режим: быстрый ответ или подольше, но поумнее

С камерой и демонстрацией экрана пока не работает - для этого остался старый голосовой режим.

Где взять: уже раскатывают на iPhone, Android и в браузере. На платных тарифах (Go, Plus, Pro) дают полную версию, на бесплатном - облегчённую mini. Доступ для разработчиков обещают позже.

🤖 xAI выпустил новую модель
Grok 4.5 заточена под код - её натаскивали на огромном количестве рабочих сессий в редакторе кода Cursor.

По тестам вплотную подбирается к GPT-5.5. Но есть нюанс: похоже, модель могли тренировать прямо на тех задачах, по которым потом и замеряли, так что верить цифрам на все сто рановато.

Что по цифрам:
- Держит в памяти до 500К за раз - можно закинуть очень много текста (примерно пара толстых книг)
- Цена $2 / $6 за млн токенов
- Уже доступна в Grok Build, API и в вебе


🤣 Как исчерпать безлимит?

Последние 3 месяца использовал Runway на тарифе Unlimited для генерации видео и вот что понял.

Безлимит – громко сказано. Да, SeeDance 2.0 работал всё это время в неограниченном доступе, я успел наклепать кучу контента, но:
- приходилось постоять в очереди за роликами,
- больше двух генераций одновременно запускать было нельзя
- и качество со второго месяца стали резать до 720р.

В сентябре безлимит на SeeDance планируют снять вообще – оставить Veo и Kling. Но Veo генерит только за токены ещё с прошлого месяца, а SeeDance выдаёт ошибку уже сейчас.

В месяц на тарифе Unlimited вам дают 3400 кредитов. 1 видео на 10 секунд в качестве 720p стоит 360 кредитов. То есть за $95 вы можете сделать 10 роликов. Вот такой вот безлимит получается)

Вместо безлимита предлагают тариф Max с 9500 кредитами. Значит за 95 долларов вы можете сделать 26 видео по 10 сек в качестве 720p. То есть 1 видео на 1 секунду будет стоит $3,6. Тоже такая себе математика.

В общем, в этом месяце вряд ли буду продлевать – платить 95$ за безлимитный Kling не то же самое, что $50 за Kling + Veo + SeeDance (брал по промо на 3 месяца со скидкой).

Мысли?
👍 – обдиралово
❤️ – пользуюсь другой платформой и мне спокойно
🔥 – расскажи, чё будешь брать вместо runway


↔️ Промпты в стиле GTA искали?

Заходим в ChatGPT Image, копируем промпт, вставляем его и прикрепляем своё фото в качестве референса.

1-ый промпт:
Convert this image into a 9:16 official GTA VI-style game poster for the charactera as in the reference image standing full-body confidently from extreme low angle camera angle: high-energy, collage-driven cinematic poster art in the game's native promotional language preserving the subject's face and requested pose for immediate recognition while allowing full creative re-layout of background, props, and color-driven mood. CHARACTER: Render the subject as the poster's central playable-character in a full-body shot standing and supporting vignette figures in the same frame; preserve facial likeness, wearing gta character clothing, and signature accessories. Translate clothing into stylized gta vi game-asset costume blocks with sharp edge read, layered foreground/backdrop separation, and strong silhouette hierarchy.FACE & ANATOMY: Use canonical Rockstar-style face logic: realis-tic-but-stylized proportions, clean jaw definition, slightly angular noses, and crisp eyebrow planes; eyes retain recognizable placement but reduced microdetail. Body ratios remain realistic with confident stamding posture; hands simplified for legibility and scaled for cam-era-read impact.ENVIRONMENT: DEVELOP the background into a Miami/urban neon coastal montage: make the attached image characer doing different missions in each montage shape in the background. Make a layered midground architecture, palm silhouettes, fast cars, and neon signage arranged in triangular composition that points to the main portrait.
Keep original character pose and placement but rebuild environment as dynamic, narra-tive-driven vignettes without overpowering the central portrait.RENDER PIPELINE: Medium: stylized digital game-poster illustration. Rendering technique: hard-contour vector-aware paint with painterly texture accents, crisp ink-like edgework, and selective halftone grit in background planes. Shading logic: softened cel-to-painterly hybrid with strong rim highlights and high-contrast cast shadows; no photographic depth-of-field or camera optics.-COLOR & LIGHT: Saturation-forward palette anchored in warm magentas, teal-cyan contrast accents, saturated gold highlights, and deep near-black shadows. Lighting: cinematic key from upper-left with neon rim light accents; highlights clipped for graphic punch and mid-tones kept richly saturated. MATERIALS & TEXTURES: Skin reads as smooth stylized matte with subtle micro-tone but no photographic pores. Hair uses layered painterly strokes with specular strips for neon catch.Clothing and vehicles use simplified PBR-inspired surfaces: clean specular blocks, brushed metal sheens, and soft fabric matte fills. DETAILS: Add high-impact poster elements: bold title area reserved for the exact official GTA VI logo (place once, unmodified, in lower center or upper-center as composition requires). Integrate diegetic props (car silhouettes, palm trees, skyline) as separated graphic planes with light bloom halos and selective film grain.Apply minimal paper-grain and a few controlled brush-scuff marks for authentic promo texture. STYLE EXCLUSIONS: Exclude photorealistic live-action photography, anime/cel-shaded cartooning, flat icon vector art, vintage/retro film treatments, plastic toy or chibi caricature styles.


Остальные промпты в комментариях, своими результатами делитесь там же.

Приятных генераций ☑️


🏗 Повторяем самый хайповый тренд в инсте*

Мне не особо нравится, что лента в моменте забита подобными видосами, но это тренды, и вы сами их просите, поэтому рассказываю ⤵️

Как повторить:
1⃣ Заходим в GPT Image или Nano Banana, прикрепляем своё фото в качестве референса и вставляем промпт:
Use the uploaded photo as the identity reference for the person: preserve the overall identity, silhouette, and recognizability from the reference, but do not redesign the model. Create a realistic cinematic photo in 9:16 vertical format.

Show one single person standing on the very top of a skyscraper antenna / mast, high above New York City. The composition is dramatic and vertigo-inducing: the person is positioned near the top center-left of the frame, balancing on the small metal structure at the summit, while holding a large black flag that extends diagonally across the frame. The background shows a hazy panoramic Manhattan skyline far below, with the Empire State Building clearly visible on the right side and the river plus dense city blocks fading into atmospheric distance.

The person should wear the same style of outfit as in the reference image: all-black outfit, including a black sleeveless fitted top, black pants, black shoes, and a black face covering / balaclava or mask, creating a bold minimalist urban look. Keep the outfit clean, tactical, and striking.

The flag should be large, black, and wind-blown, attached to a pole and occupying a big portion of the middle-right of the image. Leave a clearly visible area for text on the flag. Render the flag text as [ТЕКСТ НА ФЛАГЕ] in a bold uppercase condensed sans-serif font, large white letters, centered and highly legible.

The antenna structure should include realistic industrial details: metal ladder sections, safety rails, a narrow platform, and a small red warning beacon light near the top. The overall framing should feel like a high-end extreme urban photography shot captured with a long lens: compressed city background, realistic scale, and intense sense of height.

Lighting should be soft daylight / overcast haze, with natural muted colors, subtle contrast, and realistic shadows. Style: ultra-realistic photography, cinematic tension, documentary/editorial feel, high detail, slight atmospheric haze, no fantasy look.

Negative prompt: two people, extra people, different outfit colors, cartoon, CGI, surreal fantasy, low detail city, distorted anatomy, extra limbs, unreadable flag, messy text, low resolution, watermark, logo, text outside the flag.

2⃣ Переходим на платформу, где есть SeeDance 2.0 (здесь рассказывал, как получить доступ к нейронке)
3⃣ Вставляем получившееся фото и промпт (оставил его в комментариях)

🔥 – нужно больше трендовых инструкций

*запрещена в рф

925 0 11 2 21

🥸 МОЛНИЯ: Claude Fable 5 вернули в общий доступ

До 7 июля можно использовать до 50% недельного лимита своего тарифа на Fable 5. Если лимит будет исчерпан, можно продолжить работу с моделью, используя кредиты. При этом Fable 5 расходует лимит быстрее, чем Opus 4.8. И стоят кредиты немало.

Также Anthropic ужесточили классификаторы безопасности: если запрос покажется подозрительным, то его перекинут на Opus 4.8.

Все платные пользователи Claude уже могут пользоваться этой версией на сайте и в мобильном приложении.

Как скачать Claude и другие заблокированные в РФ приложения себе на iPhone – рассказал в этом посте.

В веб-версии включаем прокси, на Android ставим usa-почту в Play Market.

Приятных генераций 🔥

Показано 20 последних публикаций.