AI новини


Гео и язык канала: Россия, Русский
Категория: Технологии


Канал про все, що стосується AI

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Репост из: Denis Sexy IT 🤖
⚙️ Меня немного запарило, что все кодинг агенты не умеют из коробки делать актуальных на сегодня агентов, потому что внутри – модели еще не обучены всем современным агентским трюкам – поэтому я прошелся по исходникам Codex, Claude Code и других популярных уроков по созданию агентов, работу с кешами, авто-сжатием контекста и тп, и собрал скилл agents-best-practices который чинит эту проблему – причем, там отдельно прописано, что эти знания для всех видов агентов, не только для кодинга:

Там нет кода, есть текстовые справочники на темы – мне помогло:

Архитектура агентного harness
Как устроить runtime вокруг модели: контекст, инструменты, permissions, память, наблюдаемость и остановочные условия.

Agentic loop
Базовый цикл: модель → tool call → валидация → permission check → выполнение → observation → следующий шаг или финальный ответ.

System prompts и инструкции
Как проектировать слои промптов: global, workspace, domain-specific, task-level и runtime reminders.

Tools и permissions
Как делать инструменты узкими, типизированными, безопасными, проверяемыми и разделёнными по risk class.

Planning mode
Как отделять планирование от исполнения: read-only exploration, план-артефакт, approval и потом мутации.

Goal-like loop
Как задавать долгоживущие цели с budget, checkpoints, validation criteria и stop condition. Это вместо Ralph Loop.

Context, memory и auto-compaction
Как управлять контекстом, делать retrieval, сохранять рабочее состояние и сжимать историю без потери критичных данных.

Prompt caching и cost-aware context
Как строить стабильные prompt-prefixes, deterministic tool ordering и cache-friendly agent runtime.

Skills и progressive disclosure
Как подключать reusable workflows: короткий skill index сначала, полные инструкции только при необходимости.

MCP и external connectors
Как подключать внешние системы через governed connectors: namespacing, auth, permissions, audit logs и least privilege.

Security, approvals и sandboxing
Prompt injection, secrets, approval flows, draft-vs-commit, sandbox для open-world tools.

Observability и evals
Как логировать agent runs, tool calls, approvals, compactions, failures и тестировать harness на реальные failure modes.

Provider API patterns
Практики для OpenAI, Anthropic и OpenAI-compatible API без привязки к одному провайдеру.

Checklists и coverage audit
Готовые списки для проверки: перед запуском, перед добавлением tools, перед подключением skills/connectors и перед продом.


Репост из: Поляков считает: AI, код и кейсы
🧪 Mastra: агентный фреймворк, от которого я отмахивался год

Рефат @nobilix периодически рассказывал у себя про Mastra. Я открывал их сайт, думал клевый дизайн, видел TypeScript и такой: «я же питон-пацан, обойдусь». Возвращался к собственным велосипедам и бесился от настройки обсервабилити.

😤 Почему Питон перестал справляться

Как только агентский проект выходит за пределы терминальной песочницы — нужны трейсы, эвалы, UI для отладки — вокруг питоновских библиотек приходится городить адский обвес. Проект перестаёт быть агентом и превращается в слой котроля и наблюдения за ним.

У меня сейчас как раз висит задача: оркестрировать тысячи deep research для финтеха, сервис должен быть отказоустойчивым, гонять эвалы разных конфигураций и быстро тестировать скиллы и тулы.

Когда подбирал стек через ChatGPT PRO, он в конце списка предложил: попробуй Mastra + Temporal. И тут Костя @kdoronin_blog с Рефатом анонсируют субботний стрим. Ну всё, пробую.

🚀 Что зашло

🔸 Агент — объявил один раз, переиспользуешь везде. Регистрируешь в инстансе Mastra, вызываешь через mastra.getAgentById() из workflow, других тулов, CLI, server adapters.

🔸 Тулы — это просто импорты. Вот как агенту даются тулы:


import { Agent } from '@mastra/core/agent'
import { planTrackerTool } from '../tools/plan-tracker'
import { xResearchTool } from '../tools/x-research'

export const researchAgent = new Agent({
id: 'research-agent',
name: 'Research Agent',
instructions: '...',
model: 'openai/gpt-5.4',
tools: { planTrackerTool, xResearchTool },
})


И всё. Никаких декораторов, регистраций в двух местах, ручного маппинга схем.

🔸 Mastra Studio — веб-UI из коробки. Трейсы, цепочки вызовов, логи, токены по шагам. То, что в питоне собираешь сам из подручных средств.

🔸 Эвалы встроены. Model-graded (который LLM-as-a-Judge), rule-based (выбрали ли правильный вариант), статистические (или семантическая близость) — из коробки.

🔸 Набор шаблонов. Не могу сказать, что прям уау, но есть встроенные, можно изучать, посмотрите как лаконично.

😐 Что не понравилось

TypeScript не мой язык, но вайбкодинг лечит. Отображение workflow в Studio заточено под сам workflow, а мне хочется видеть обвязку вокруг агента — связи, каналы, состояние. Но у большинства фреймворков и такого нет.

💡 Mastra забирает на себя то, что в питоне превращает агентский проект в проект по обсервабилити.


📺 Суббота, 18 апреля, 14:00 МСК

Костя с Рефатом проводят практический стрим «Создание AI-агентов с помощью фреймворка Mastra». Буду смотреть сам, хорошая возможность, посмотреть крутые практики соседнего стека.

Кстати кто на чем пишет агентов? расскажите?

----

Поляков считает — AI, код и кейсы


Репост из: Метаверсище и ИИще
LongCat-Video:
A Unified Foundational Video Generation Model


Новый опенсорсный видеогенератор и доставка еды.

И да, это новая базовая модель, а не нашлепки над WAN или миксы из WAN и CogVideo, коих развелось немеренно.

И судя по размеру (13.6B параметров) она в той же лиге, что и WAN.
Как следует из названия, ее главная фишка - это способность создавать длинные (несколькоминутные) видео с (как пишут авторы) сохранением консистентности.

Сейчас вы идете вот сюда:
https://meituan-longcat.github.io/LongCat-Video/
и мотаете на Long Video Gallery, чтобы посмотреть примеры.

Кроме того, еще одна фишка - продолжение видосов: Video Continuation - даже можно указывать в промпте временные метки типа:

0:00
The kitchen is bright and airy, featuring white cabinets and a wooden countertop. A loaf of freshly baked bread rests on a cutting board, and a glass and a carton of milk are positioned nearby. A woman wearing a floral apron stands at the wooden countertop, skillfully slicing a golden-brown loaf of bread with a sharp knife. The bread is resting on a cutting board, and crumbs scatter around as she cuts.
0:06
Camera zooms out, The woman puts down the knife in her hand, reaches for the carton of milk and then pours it into the glass on the table.
0:11
The woman puts down the milk carton.
0:16
The woman picks up the glass of milk and takes a sip.

Само собой у них есть text2video и image2video (6 секунд), 720p.

Причем генерация идет в два этапа, где второй - это рефайнер\улучшайзер первого этапа генерации. Также внутри есть лора-дистиллятор, которая позволяет считать всего на 16 шагах.

Про потребление видеопамяти(VRAM) ничего не написано, но судя по весам и тестам на H800, где-то 60 гиг

А про скорость есть табличка в техрепорте:
93 кадра в 720р и 50 шагов - 24 минуты
93 кадра в 480р и 16 шагов - 1 минута

Код есть, можно расчехлять H100 или ждать Киджая для Комфи.

Но самое интересное дальше.

Авторы - компания Meituan — крупнейшая в Китае платформа «local life» (супер-приложение для локальных услуг): еда с доставкой, «мгновенная» розница, купоны/бронирования офлайн-услуг, отели и путешествия, транспорт/велошеринг и сервисы для бизнесов. Компания монетизирует комиссию с заказов, рекламу внутри экосистемы и платные B2B-инструменты для продавцов.

Да-да, доставщики еды теперь тренируют базовые модели для видеогенерации.

Живите теперь с этим.

Еда тут: https://meituan-longcat.github.io/LongCat-Video/

Информативный Апдейт от подписчика Бориса:
Что я понял из папиры:
1. в одной модели: t2v, i2v, + продолжение видоса.
2. генерация минут(!), а не только секунд
3. Нет фигни которая была в скользящем окне WANа, когда у тебя с кажой итерацией росла контарстность и шум + артекфакт в деталях накапливались. К концу видоса каечство падать не должно.
4. Модель с нуля тренили на продолжение видео
5. "Запоминает" начальные кадры один раз и не пересчитывает каждый шаг
6. Coarse-to-fine генерация. Сначала делает видео: 480p, 15 FPS (быстро и дешево), Потом апскейлит до 720p, 30 FPS
7. Block sparse attention — считает только 10% от обычного внимания, но результат почти такой же. Непонятно как это коррелируется\работает с sage. (Block Attention с KVCache их собственная разработка)
8. По азявлени авторов: Модель понимает физику мира лучше всех . По физике/здравому смыслу — 1-е место (обходит даже Google Veo)
9. Юзают энкодер ВАНа - 2.1, но архитектура не ван
10. НЕ дифузная модель , а флоу (Flow Matching). Физика обрастает пикселями, а не предсказание пикселей во времени без учета физики. Тренили с поощрением по референсным образцам - т.е. в теории физику можно дообучать.

ЗЫ чуваки решили проблему GRPO. крутой метод обучения из мира LLM. Но когда попытались применить к видео (Flow Matching), всё сломалось: градиенты пропадали, обучение тормозило. Они починили математику - теперь все круто.

Про лоры не понятно но поскольку Dit есть - то наверное можно.

@cgevent


Репост из: make ai.
Codex і Claude Code навчили працювати з CAD. Набір скілів готовий, і AI-агент збирає працюючі механізми. Робо-руку. Шестерні, що реально крутяться.

Кидаєш йому запит звичайними словами - на виході модель. Будь-який запит, обіцяють.

Експортує в STEP, STL, 3MF, DXF, GLB.

А якщо зібрався робити саме робота - ще й топологія та описи в URDF, SRDF, SDF.

Поправити одну деталь? Править її точково, не перегенеровуючи всю модель з нуля.

Вайб-інженеринг - тут.


Репост из: make ai.
Видео недоступно для предпросмотра
Смотреть в Telegram
Скажеш смартфону “зроби додаток” - і він уже стоїть на екрані. Через пару секунд.

Google AI Studio на Gemini 3.5 Flash генерує Android-додатки та ставить їх в один клік. Підтягує Gmail, Docs, звичні інтеграції з коробки.

Цінність переїжджає туди, де її складно натренувати за вікенд: побачити задачу, спроєктувати рішення, зібрати архітектуру в голові до того, як модель напише перший рядок.Розробка стає роботою з ідеями.


Репост из: Силиконовый Мешок
Ну чего, понимаю, что уже давно никто из вас не пишет текст руками. Честно скажу, сам сопротивлялся до последнего - хотя этот пост я отстукиваю на клавишах, но с Клод Кодом общаюсь голосом. Но на слух он только английский понимает, поэтому приходится использовать сторонние софтинки.

За последнее время перепробовал почти все, что есть на рынке, платное и бесплатное, в общем на данный момент мой фаворит - это опенсорсный FluidVoice.

Почему он. Во-первых, бесплатный и открытый. Superwhisper за такое просит 250 баксов, а Wispr Flow гоняет голос через облако, что мне не нравится. Тут все крутится локально.

Во-вторых, скорость. Под капотом модель Parakeet от Nvidia, которая работает на Neural Engine, и текст появляется практически в реальном времени - ты еще говоришь, а он уже печатает. Памяти при этом ест копейки, у меня на Air с 24 гигами его в мониторинге вообще не видно.

В-третьих, как-то понравился...

https://github.com/altic-dev/FluidVoice/
Неофициальный порт для винды: github.com/huslermaniac/fluidvoice-windows


Репост из: Силиконовый Мешок
hermes_ru.pdf
169.8Кб
Я уже рассказывал про агента Hermes и даже делился небольшой инструкцией по его запуску и настройке.

Но круто, что вы так активно обсуждаете его в чате @prompt_chat и делитесь используемыми скиллами, настройками и воркфлоу. Например, я уже для большинства задач использую именно Hermes, так как любимый Harness Engineering там более нативен, чем в OpenClaw.

В общем, делюсь расширенным гайдлайном по запуску, настройке и использованию агента.


Репост из: Силиконовый Мешок
Я понимаю, что языковые модели уже давно стерли разницу, на каком языке потреблять контент, но меня часто просят поделиться бесплатными курсами или материалами по ИИ именно на русском языке. Видимо, для кого-то это важно, поэтому публикую подборку для начинающих (и не очень): с чего можно вкатываться в ИИ, не напрягая «языковую мышцу».

- Можно начать с моих переводов и материалов для начинающих: про n8n, ИИ-агентов, промпты и автоматизации. Вот тут все ссылки на одной странице.
- А вот это прям база про LLM в картинках!

У Microsoft есть отличные курсы для начинающих на разные темы в сфере искусственного интеллекта на русском:
- Курс по машинному обучению
- Курс о данных и аналитике
- Курс про ИИ-агентов
- Курс по генеративному интеллекту

Еще рекомендую изучить масштабные переводы от Сергея, которые я тут выкладывал:
- Материал про программирование с помощью языковых моделей
- Материал про LLM и их обучение
- Материал про бенчмарки

Отличные репозитории с кучей ссылок и полезной информации (уже на английском):
- Большая коллекция практических примеров, руководств и рецептов для создания приложений на базе LLM. От простых чат-ботов до продвинутых ИИ-агентов.
- Тщательно отобранная коллекция отличных приложений и сервисов на базе LLM, созданных с использованием RAG, ИИ-агентов, мультиагентных команд, MCP, голосовых агентов и многого другого.


Репост из: Силиконовый Мешок
Я рад, что тема с погружением в мир искусственного интеллекта вам интересна. После публикации этого гайда от Google мне человек десять в личку написали с вопросом: «Как структурно изучать ИИ?». Так появился этот материал про «7 этапов изучения ИИ».

А сегодня хочу поделиться интересными курсами от Microsoft — главная их прелесть в том, что текстовая часть переведена на разные языки, в том числе и на русский, а еще они рассчитаны на начинающих. Итак, начнём:

1) ИИ для начинающих

2) ИИ-Агенты для начинающих

3) MCP для начинающих

4) Генеративный ИИ для начинающих

5) Машинное обучение для начинающих


Репост из: Тимур Хахалев про AI Coding
CLI Creator Skill

Тут ребятки из openai вчера релизнули новый curated skill — CLI Creator

Skill уже добавлен в Codex App

Он позволяет создать cli + skill для вашей рутины из имеющихся: API docs, OpenAPI JSON, SDK docs, curl examples, browser app, existing internal script, article, or working shell history.

Звучит потрясающе!

Я уже пошёл и проверил на себе. У меня был skill, который ходил в мой сервис по api (через curl + api key) и доставал read only инфу.
Сейчас попросил gpt создать cli версию этого инструмента.

Мы с ним обсудили то, как это будет выглядеть, добавили апдейтов (skill немного отставал) и с помощью моего planact реализовали задачу за 1.5 часа. Всё работает прекрасно!

Напоминаю, что главная идея такой связки cli+skill состоит в том, чтобы дать вашему кодинговому агенту доступ к вашему любимому сервису.
Юзкейс может быть, к примеру, такой: "Ок, агент, сколько пользователей у нас сегодня зарегистрировалось с параметром %PARAM%?". Агент подтягивает этот созданный skill, далее использует CLI, идёт в ваш сервис, тянет инфу и отвечает на ваш вопрос.

Так что если у вас есть какие-то процессы, которые можно так упаковать, то 100% рекомендую это сделать!

Кстати, этот skill является продолжением идеи Валеры и Пашиopenapi-to-cli, инструмент который генерирует cli из вашего openapi. Кому актуально — тоже рекомендую!

#aicoding@the_ai_architect

Лайк, репост,
✔️ Тимур Хахалев про AI Coding, подписывайтесь!


Репост из: Not Boring Tech
Видео недоступно для предпросмотра
Смотреть в Telegram
🔥 Firecrawl запустил молниеносный парсер Fire-PDF — он извлекает всё содержимое из любых документов в формате Markdown.

• Выдаёт обычный текст, который легко считывают любые нейронки даже без режима распознавания фоток.
• Работает в 5 раз быстрее — конвертирует каждую страницу за 400 мс.
• Финансовый отчёт на 216 страниц обрабатывается всего за 83 секунды.
• Идеально вытаскивает таблицы, заголовки и форматирование, при этом сохраняет формулы в LaTeX.
• Поддерживает Excel-таблицы, PDF, Word и многие другие документы.

В избранное — тут.

@notboring_tech


Репост из: Syabro About WebDev and Things
Исследователи Yaniv Leviathan, Matan Kalman и Yossi Matias обнаружили, что повторение одного и того же промпта дважды подряд улучшает точность моделей (Gemini, GPT, Claude, Deepseek) на 21-97% в зависимости от задачи — просто дублирвешь перед отправкой.

Эффект работает для моделей без режима рассуждений и не требует никаких дополнительных вычислений.

https://arxiv.org/abs/2512.14982


Репост из: Вайб-кодинг
Видео недоступно для предпросмотра
Смотреть в Telegram
LLM-база знаний → слайды

После поста Karpathy (про свой сетап LLM Knowledge Base) стало понятно: вики удобно хранить, но неудобно показывать. Нужен быстрый способ превращать это в презентации.

Один чувак сделал простой пайплайн: вики с AI-статьями (1000+ работ, 20 тем) автоматически уходит в Gamma и превращается в слайды.

Флоу: Obsidian → Gamma MCP → сразу предпросмотр в дашборде.

Одна команда агенту и он сам берёт нужные статьи, прогоняет через Gamma и отдаёт готовую презентацию.

Подключаешь коннектор Gamma к Claude , и у агента появляется доступ к инструментам генерации.
Оркестрация через Claude Agent SDK, с встраиванием результата через iframe.


Репост из: Syabro About WebDev and Things
Исследователи Yaniv Leviathan, Matan Kalman и Yossi Matias обнаружили, что повторение одного и того же промпта дважды подряд улучшает точность моделей (Gemini, GPT, Claude, Deepseek) на 21-97% в зависимости от задачи — просто дублирвешь перед отправкой.

Эффект работает для моделей без режима рассуждений и не требует никаких дополнительных вычислений.

https://arxiv.org/abs/2512.14982


Репост из: sh | ИИ
Вышла Gemini 3.1 Flash TTS!

Наконец, обнова TTS-модели от Google. Прошлые Gemini TTS были оч классными, и это обновление я ждал

Модель стала в 2 раза дороже предшественника (2.5 Flash TTS), зато появилось много новых голосов, настройка стиля (например, шёпот), темпа, и даже акцента! Очень круто, очень!

Пожалуй, лучшая TTS-модель на рынке прямо сейчас. Попробовать можно на ai.dev


Репост из: Data Secrets
36к звезд за два дня набрал репозиторий с единственным файлом CLAUDE.md

Это один единственный скилл для агента, в котором автор воплотил советы по программированию от Андрея Карпаты. Скилл, кстати, так и называется в честь Андрея:

github.com/forrestchang/andrej-karpathy-skills

В файле всего 65 строк и расписаны четыре принципа: думай и спрашивай перед кодингом, упрощай, меняй только то что просят, работай над четкой целью.

Все эти принципы основаны вот на этом посте Андрея (мы частично переводили его тут), в котором он делился наблюдениями о кодинге с агентами.

Пользователи пишут, что файлик действительно бустит поведение моделей: PR становятся чистыми и минималистичными, исчезают ненужные диффы, агенты меньше путаются и лучше следуют инструкциям.

Видимо все, в чем фигурирует имя Карпаты, обречено на успех


Репост из: make ai.
Видео недоступно для предпросмотра
Смотреть в Telegram
В цьому короткому уроці ви дізнаєтеся:

✦ Як обрати між хостингом на сервері клієнта та розміщенням на власному обладнанні, а також плюси й мінуси кожного підходу

✦ Чому деякі клієнти надають перевагу власним акаунтам: питання контролю, безпеки даних та незалежності від розробника

✦ Як організувати роботу на спільному сервері (наприклад, Contabo), використовуючи окремі папки для різних проєктів та користувачів

✦ Основи ціноутворення за підтримку: чому не варто працювати за $2 та як запропонувати клієнту вигідну річну підписку, що підвищить ваш середній чек

✦ Методи моніторингу навантаження на сервер: як за допомогою термінальних команд, таких як htop або top, відстежувати споживання оперативної пам'яті та процесора

✦ Вплив різних типів задач на ресурси: відмінність між легкими завданнями з генерації контенту та ресурсомісткими Telegram-ботами


🦞 Запрошуємо вас записуватися на наш інтенсив з Open Claw, щоб
отримати ще більше практичних знань та інструментів для професійної автоматизації!

Долучитись до інтенсиву 👈🏻 Тисни


Репост из: make ai.
Це матеріал про те, як зв’язати Claude та Obsidian у систему, де знання не губляться після закриття чату, а поступово накопичуються в структуровану особисту вікі. У статті розбирається практичний сетап “другого мозку”: від встановлення до щоденного використання для збереження розмов, досліджень і робочого контексту.

Матеріал знайдений, адаптований українською AI агентом, але,аппрувнутий адміном, всі збіги - галюцинації 😄

Посилання


Репост из: make ai.
Видео недоступно для предпросмотра
Смотреть в Telegram
В цьому короткому відео-уроці ви дізнаєтеся:

✦ Як вирішити проблему з помилками парсингу HTML у Telegram, коли спецсимволи (наприклад, ) ламають відображення повідомлень

✦ Як використовувати регулярні вирази для автоматичної заміни конфліктних символів на HTML-сутності, щоб ваші сповіщення про помилки завжди доходили до адресата

✦ Як створити один універсальний Error Handler для всіх існуючих workflow, незалежно від того, які тригери чи боти ви використовуєте

✦ Як динамічно формувати посилання на конкретне виконання (Execution URL), щоб миттєво переходити до помилки прямо з чату Telegram

✦ Різницю в обробці помилок від тригерів та екшенів всередині одного обробника для максимальної надійності системи

🦞 Запрошуємо вас записуватися на наш інтенсив з Open Claw, щоб дізнатися всі тонкощі професійної автоматизації та навчитися будувати відмовостійкі системи!

Долучитись до інтенсиву 👈🏻 Тисни


Репост из: ️Нейросети: Волшебство ИИ, IT ️и маркетинг⚡️
🔥 Привет, друзья! Nvidia опубликовала бесплатные обучающие курсы для пользователей любого уровня подготовки по нейросетям и нейромоделям для понимания работы ИИ

объяснение генеративного ИИ: базовый двухчасовой курс, в котором подробно объясняется устройство нейросетей, их применение и возможности;

✅  введение в ИИ в центре обработки данных: всё про машинное обучение и глубокое обучение; какие есть фреймворки и как видеокарты двигают ИИ;

✅  создаём «мозг» за 10 минут: объясняется, как нейросеть обучается на данных и показывается вся математика у неё под капотом;

✅  как усилить свою LLM с помощью RAG: объяснит всю базу по генерации с дополненной выборкой;

✅  создание своих RAG-агентов: мощнейший 8-часовой курс про масштабируемые стратегии развертывания для LLM и векторные базы данных;

✅  ускорение работы с Data Science без изменения кода: всё об обработке данных и машинном обучении без переписываний кода;

✅  усиление рекомендательных систем с помощью ИИ: курс-коллаб NVIDIA и YouTube;

✅  устройство сетей: базовый курс про протоколы TCP/IP и Ethernet, знания про которые необходимы для понимания процессов обработки данных.

#полезное #обучение

Нейросети: Волшебство AI

Показано 20 последних публикаций.