Валера Ковальский


Kanal geosi va tili: Rossiya, Ruscha


Head of AI
Автор https://neuraldeep.ru/
Raised $2M+ for human-centric AI startups
github.com/vakovalskii | chat @neuraldeepchat
По вопросам сотрудничества - @VaryaVarenik05

Связанные каналы  |  Похожие каналы

Kanal geosi va tili
Rossiya, Ruscha
Statistika
Postlar filtri


Размышления на тему

Вот уже 7 лет я работаю в ИТ и сферах, связанных с технологиями и информацией.

Точно ощущаю, что из дня в день, из года в год я развиваюсь, становлюсь опытнее и мудрее. Окружение не отстает, развивается, и я это вижу.

Но есть нечто неуловимое и сложное для меня это баланс

Как не прошивать ESP до 2 часов ночи?
Как не пилить проект до 6 утра?
Как в выходные думать о чем-то другом?

Последние полгода я борюсь с собой за переключение. Пока поставил лёгкую планку.

Сутки без ИИ/ИТ-фона в голове.
Ну или хотя бы 12 часов

Кто-то скажет это профдеформация, чувак.
Я скажу это ошибки прошлого.
Увлечение, которое растёт из страха и подгоняющего FOMO.

FOMO надо глушить.
А на ошибках учиться и становиться лучше в сферах, отличных от карьеры.

Что я точно понимаю переключаться тоже надо учиться.
Переключение такой же навык, как любой рабочий. Его нужно тренировать и измерять.

Перекос будет всегда.

Но поймать баланс это то, что стоит искать.

Всем хороших выходных, спите больше, траву трогайте чаще.

Шанс уйти в гусиную ферму всё ещё высокий =)

3.7k 0 34 110 164

Константин Доронин dan repost
Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Запись стрима "Как писать код с AI-агентами?" с таймкодами.

Также по-прежнему доступна на YouTube.

Таймкоды для навигации:

0:00:00 — Беседа перед стартом
0:09:33 — Представление участников стрима
0:12:05 — Личный инструментарий для разработки с ИИ
0:22:27 — Обязательные инструменты для AI-кодинга
0:28:12 — Особенности командной разработки с AI-агентами
0:59:02 — AI-coding на больших проектах
1:16:30 — Как изменилась работа инженера с приходом ИИ
1:30:38 — Главные раздражители и проблемы в разработке с AI
1:45:23 — Будущее архитектуры и эволюция инструментов
2:06:20 — Вредные и полезные советы разработчикам

Подписывайтесь на участников стрима в Telegram:

Валера Ковальский – https://t.me/neuraldeep

Максим Ключников – https://t.me/etechlead

Константин Доронин – https://t.me/kdoronin_blog

Проекты гостей, которые были упомянуты на стриме:

https://neuraldeep.ru/ – AI-хаб Валеры, где можно получить доступ по API к он-прем-моделям и AI-сервисам.

https://codespeak.dev/ – проект Андрея Бреслава, в котором реализованы те концепции, что Андрей озвучивал на стриме. Записывайтесь в Waitlist!

@kdoronin_blog

3.4k 0 254 44 107


4k 0 85 10 26

Глеб Кудрявцев про AI dan repost
Одного я не понимаю. У меня реально полтора скила в агентах, я полный лох так-то, фактически работаю на ванильном кодексе. И ДОХЕРА всего успеваю делать. Не Ковальский (кодовая кличка — 120 минут, за столько он делает любой проект), но все равно очень быстро.

А вокруг как будто куча людей, у которых агенты высаживают месячные лимиты за день, и при этом они по сути ничего при этом и не релизят 🙈

И вот думаю — блин, выкидывайте нафиг ваши суперхьюманы всякие, спеки, консилиумы и прочую ботву, походу ничего из этого не нужно. Просто yolo mode, микрофончик, вайб, и кодить прям на серваке 😎 Ну можно чуток правил добавить на пол-странички, чисто где у вас там сервак расположен, а то он случайно что-то нужное снесет и будет обидно.
Раньше над этим ржали, а сейчас походу это самая эффективная парадигма.

5.1k 0 67 56 176

Update по бесконечному тарифу Qwen за 512 рублей

Осталось 10 мест
Потолок инпута подняли с 32 до 46к токенов

https://neuraldeep.ru/pricing#tier-qwen_unlim

UPDATE: все продано


Я разочаровался в ИИ

Спустя почти месяц от разбора 1069 коммитов решил повторить подход к осмыслению происходящего + вышли новые модели

Как скажет любой уважаемый себя разработчик с ИИ агентом "У меня всё покрыто тестами"
Это и есть проблема для меня

Честно, все делают вид, что читают диффы, я их почти не читаю особено для хаба =)
А покрытие тестами 100 процентов это ровно то что я делал последние 2 месяца на хабе
И снова я к вам с результатами
Пу пу пу, как говорится начнем

Я принимаю решения что делаем, прорабатываю смысл, генерирую идею, свожу доки, делаю их рабочими, оформляю спеки, каким тарифом, куда катим, что важнее на этой неделе
Код пишет агент
На прод пускает только зелёный гейт из тестов
Со стороны это выглядит как зрелый процесс
Решения у человека, рутина у машины, качество на автомате это ли не счастье?

Тесты проверяют только то, что ты уже понял, насколько глубоко ты забрал в себя смысл решаемого, что нашел другой агент ревьюер и что нашел ты пока делал ревью еще в одном окне правда? Да? Ну сказка!

Допустим продукт neuraldeep.ru (хаб который как эскперимент мы запустили с вами в конце Апреля)
За последние две недели у меня 26 багов нашли клиенты
Я сам при аудитах 30
Мониторинг 11
Клиент почти наравне со мной(кажется стоит ему платить за это =)
Еще же все это при зелёном гейте =)

Вывод будет наверное КЭП
Как я вижу тесты на хабе на сегодня,?
Вот так примерно

Это запись прошлого понимания, и сведения идеи, и при генерации новой идеи я как бы упускаю суть других идей где может родится пересечение, база знаний и спеки нацелены были это устранить но как показала практика НЕТ

Ты один раз разобрался, как должно быть, и законсервировал
Всё, чего ты не понял, в тестах отсутствует по определению
Покрыть эту дыру всеми инвариантами скажите вы, я считаю это не закрывает проблему, потому что оно меряет строки, а не мысли и смысл, есть конечно еще модели по типу Фэйбл/ГПТ СОЛ скажите вы, но как показала практика сугубо моя это не спасает от такого распределения нахождения ошибок в проде выше

Тест не знает про мир снаружи

Человек оплатил тариф
Деньги списались
Тариф не встал
Мы хоронили ожидающий платёж через 15 минут у банка на него 30 это 1 из 5 примеров что я покажу
В зазор попадал живой человек с живыми деньгами О_о

Но как же документация при интеграции скажите вы?
А я ее не читал ее читал агент это же рутина =)

Ну т.е я тупой и неправильно делают тесты/интеграции/разработку?

Нет это не так
Когда человек перестаёт читать код, тесты не заменяют понимание
Они становятся его консервами, как паштет из русалки =)
Консервы не портятся но новых в банке не появляется, получается этакий сюрстрёмминг из старых тестов

Пу пу пу
Ну нет же должен быть еще один вывод

Что цифры по комитам и тестам говорят на самом деле
0 ревертов за две недели
99% коммитов трогают тесты, обязательный гейт перед прод-выкаткой
Для соло-проекта на 3000 юзеров это сильно выше среднего(тут я гуглил статистику)
Тесты у меня рабочие они делают ровно то, для чего нужны, и делают хорошо

Дело в другом примеры ниже как бы так сказать выходят за рамки даже моего "понимания"
Ни один из них тестом не ловится в принципе, как там было "Ну я не ожидал что так будет" должен ли это был сказать опыт?

15 против 30 минут это факт про чужой сервис
Тест сверяет код с моим представлением; если представление неверное, тест это подтвердит, а не опровергнет

Забытый маунт это не код, это проводка
Проверять надо не поведение ручки, а "загрузился ли модуль" другой класс проверки (опять пупущение)

Метка instance семантика
У теста нет источника истины, с чем сравнивать имя(да как же так из 2000 тестов один оказался неверным?)

except Exception это принятая норма стиля, а не дефект
Норму тест не оспаривает(но и я вообще забыл про норму или не подумал?)

Тумблер кошелька не было сформулированного инварианта "кто платит"
Нечего было проверять(опять пупущение)

Формулировка, которая честнее и никого не делает дураком
Тест сверяет реализацию с замыслом, но не может проверить сам замысел
А в агентной разработке пропускается именно формирование идеи смысла и замысла, не написание кода

Чем глубже вы копаете идею, смысл и замысел тем честнее будут ваши же тесты над вашим кодом!
Это я точно наблюдаю по всему рынку и чатикам точно
Спасет ли это на проде меня лично дальше? Покажет практика =)

7.5k 1 144 123 157

Константин Доронин dan repost
Как писать код с AI-агентами?

А если командой?

Что нужно учесть, чтобы этот код не положил продакшн?


Эти и другие не менее интересные вопросы мы обсудим на следующем стриме на моём YouTube-канале.

Для обсуждения я позвал очень интересных гостей:

Андрей Бреслав – один из создателей языка программирования Kotlin. Сейчас Андрей разрабатывает Agentic Engineering Toolkit под названием CodeSpeak.

Валера Ковальский – автор одноимённого канала. Основатель проекта Neuraldeep https://neuraldeep.ru/ и автор множества Open Source проектов, созданных примерно за 120 минут каждый.

Максим Ключников – автор канала Этихлид. Разработчик с огромным опытом, который усилил себя с помощью AI-агентов. Работал на позиции Senior Software Developer, когда я ещё в школу ходил 😊

Дата: четверг, 20 августа

Время: 19:00 (GMT+3)

Проходить будет на моём YouTube-канале.

Добавить событие в календарь

Вопросы для эфира оставляйте в комментариях к этому посту 👇

5k 0 76 5 51

Pavel Zloi dan repost
Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
У меня тут большое обновление по Coddy Agent - в проект был добавлен консольный интерфейс, вдохновлённый интерфейсом pi.dev, но со всеми фичами, которые есть у Coddy Agent.

Поддерживается всё, что ждёшь от современного агента, будь то скилы, рулесы, MCP-серверы, селекторы моделей, разные режимы работы, уровни ризонинга и так далее. Помимо интерактивного режима через TUI есть ещё режим неинтерактивный через ключ "-p" - пишем, что надо сделать, и агент это выполнит. Есть возможность продолжить последнюю сессию в текущей директории через ключ "-c". И это далеко не всё.

Киллер-фича Coddy Agent в целом, а не только в TUI-режиме, - это возможность подключиться к удалённому AgentOS-серверу (это Coddy Agent, запущенный на удалённом сервере в режиме API) по специальному протоколу Coddy API и работать там, будто это локальная машина, без лагов удалённого рабочего стола, прямо здесь и сейчас, при этом сессии и все настройки будут храниться на удалённой машине, к которой вы подключились.

И всё это в формате одного-единственного бинарника, который можно поставить одной командой:
curl -fsSL https://coddy.dev/install.sh | bash
Обновление программы при помощи coddy update.

Сайт проекта: https://coddy.dev
Исходные коды: https://github.com/coddy-project/coddy-agent

5.7k 3 79 41 46

Qwen3.8-27B на NeuralDeep.ru

Наверное мы первые кто поднял ее в РФ по API после релиза через 40 минут!

Пошла раскатка на тарифы https://neuraldeep.ru/models/qwen3-8-27b 256к text/video/img

Ваш NeuralDeep.ru 👍


Вышла Qwen3.8-27B

Погнали ребята, качаем на все хосты!

https://huggingface.co/Qwen/Qwen3.8-27B-FP8
https://huggingface.co/Qwen/Qwen3.8-27B

Мультимодалка!

Катим на neuraldeep.ru следите за анонсами!

7k 1 49 56 75

Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
DeepSeek-V4-Flash-0731 304B на четырёх 4090 (48 ГБ) суммарно 192 ГБ VRAM через обычный гигабит: замеры

Пост написан DeepSeek-V4-Flash-0731 (слоп присутствует)

Ночью погасили наш квен на двух машинах в серверной и поставили туда DeepSeek-V4-Flash-0731 304B параметров, MoE, 256 экспертов, 6 активных на токен.
Веса 167 ГБ в смешанной точности: эксперты FP4, внимание и роутер FP8.

Железо: четыре RTX 4090 по 48 ГБ.
Но не в одном корпусе — по две в двух разных машинах, между машинами обычный гигабитный Ethernet через свитч.

Цифры

Пул KV-кэша ~189 000 токенов

Генерация: 1 запрос — 13 ток/с ·
8 запросов — 99 ток/с суммарно ·
12 запросов — 144 · 12 непрерывно две минуты — 152 ток/с.

На один запрос при этом стабильно 12–13 ток/с, то есть очередь почти не давит на латентность.

Обработка промпта (уникальный текст, префикс-кеш выключен): 1.5k токенов — 1187 ток/с · 4.5k — 1929 · 9k — 2247 ток/с.

Мощность: ~490 Вт на все четыре карты под полной нагрузкой (128/134/118/112). Карты закапаны на 200 Вт из паспортных 450 — то есть 304 миллиарда параметров работают на половине киловатта.

Все цифры — две независимые серии, разброс между ними в пределах 10%.

Платишь не сетью, а схемой

Я был уверен, что через гигабит ничего не выйдет. Посчитал — ошибся.
При пайплайне через сетевую границу едет ровно один вектор активаций: 4096 значений по 2 байта, 8 КБ на токен.
По гигабиту это 64 микросекунды плюс 0.3 мс задержки при бюджете токена в 77 мс — меньше процента.
Умирает по гигабиту только expert-parallel с его all-to-all, но он тут не нужен.

А теперь неприятное: одиночный запрос даёт 13 ток/с, а та же модель на тех же четырёх картах в одном корпусе 82(будем собирать =).

Дело не в сети.
Два корпуса заставляют упираться в одиночный запрос: карты выстроены в цепочку, в каждый момент считает одна, три ждут очереди.
Тензорный параллелизм поделил бы каждое матричное умножение сразу на четыре карты

Итог: разнесение по машинам стоит шестикратной потери на одиночном запросе

Слои поделены поровну(11/11/11/10), а работа легла неравномерно.
Перекос в пользу второй машины должен дать ещё прирост.
На что ушла ночь по тестам
FP4 на Ada.
У 4090 нет аппаратного FP4 — эксперты идут через Marlin с распаковкой в FP16, отсюда и потолок скорост

Нужен форк vLLM с патчами под sm89, в ванильн
Драйвер. Требуется CUDA 13.0, то есть 580+.

KV-кэш только FP8. Без --kv-cache-dtype fp8 модель не стартует вообще.

Память впритык.
167 ГБ весов на 189 ГБ VRAM — на всё остальное 28 ГБ на четыре карты. CUDA-графы съедали по 2.6 ГБ на
карту, отключили (--enforce-eager), это минус.
Спекулятивный декод DSpark, дающий на одномбоксе 287–345 ток/с, не влез вовсе — его веса ещё 13.8 ГБ.
Контекст ограничили 16k: на 26k промпте карта ловит OOM.

Про exo

Часто спрашивают про exo «объедини свои устройства в один кластер».
Не годится: exo построен на MLX, заточен под Apple Silicon, на Linux работает только на CPU

У нас работает связка vLLM + Ray, а для DeepSeek V4 на Ada форк с патчами под sm89


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Вышел Коворк/Код от Битрикс24, делюсь, годная штука

Это очень круто упакованный harness под моим небольшим присмотром
Просишь собрать материалы к встрече или разгрести поручение, и он сам лезет в твои сделки, чаты, документы и таски прямо в Битрикс24(так как сильно интегрирован с ним) и делает рутинную работу за тебя
В режиме Код можно кодить прямо по работе, без прокси и западных карточек, кто с этим воевал, тот оценит, интеграцию с хабом тоже проводил можно указать кастом модельки

Больше всего зацепила память (Радиант), брали самые лучшие патерны по бенчам
Проверено держит контекст больше месяца и не забывает
Под капотом BitrixGPT 5.6 Agent 1M
Наружу данные не уходят, весь контур в России, есть под macOS, Windows и Linux.

По ощущениям это не очередная обёртка над LLM, а агент, который реально живёт внутри твоих данных и встроен в Битрикс24.
Ранний доступ уже открыт, попробовать можно на cowork.bitrix24.ru
Чем больше пользователей тем больше фидбека и лучше решение! Так что перед тем как сравнивать "чем лучше" а то я вас знаю =)
Просто попробуйте

10.2k 3 386 45 128

qwen3.6-unlim

max parallel поднят до 3 было 1

Ломалось на чат сценариях openwebui


Поговорим про локальный инференс!

Мы начинаем

https://www.twitch.tv/evilfreelancer

Обсуждаем выход https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B-FP8


Zavtracast dan repost
Гугл начал тестировать на некоторых ПК и некоторых браузерах новый интерфейс поисковой системы. Из неё убрали поиск. Теперь это окошко для ИИ чат-бота.

На главной странице под полем поиска вместо обычной кнопки "Поиск в Google" появились кнопки "Создать изображение", "Задать вопрос о файлах" и "Мозговой штурм" (это как раз режим чата с ИИ), а внутри поля поиска - появилась кнопка "Режим ИИ".

Робби Стейн, вице-президент Google Search, подтвердил в сообщении в твиттере, что это действительно тест, но с небольшим количеством пользователей. Также он утверждает, что "изменения кнопок не влияют на основную функциональность нашего поиска, то есть при нажатии на клавишу Enter по-прежнему отображаются обычные результаты поиска Google".

Пользователи Android Authority обратили внимание, что гугл отчаянно пытается впихнуть свой ИИ куда только можно и куда нельзя тоже.

@zavtracast

7.1k 4 28 24 46

Окей погнали первые 50 тарифов можно забрать тут

https://neuraldeep.ru/pricing#tier-qwen_unlim

3 шага для старта
1) Покупаем тариф
2) Берем ключик
3) Копируем https://neuraldeep.ru/docs в вашего кодинг ассистента


Бесконечный qwen

Недавно подкинули идею про интересный тариф для neuraldeep.ru

qwen-3.6-35b-a3b
512р/месяц
46к max_input
8000 max_output
130 т/с
RPM 30
4 max parallel (максимум параллельных запросов, за раз 4 запроса и 30 таких в минуту)

И бесконечное количество запросов в месяц

Если ты за 👍
Если ты против 👎 (напиши в коментах почему)

Думаю что у такого тарифа нашелся бы тот кому он нужен

Предполагаю первую волну на 50 таких тарифов


Pavel Zloi dan repost
Стрим про локальный инференс

В среду 12 августа в 18:00 MSK выходим в эфир с Валерием Ковальски, автором канала NeuralDeep.

Тема: максимально выгодный локальный инференс.

Специально договорились не готовиться. Берём железо, включаем камеру и выясняем всё вживую, а сравнительную табличку соберём по ходу разговора. В кадре будем показывать видеокарты и серверы.

О чём пойдёт разговор:
- начнём с ноутбуков - что на них вообще можно запустить и с какой скоростью;
- видеокарты и память - какие брать, сколько нужно и за что реально платишь;
- где проходит баланс между ценой, скоростью и точностью;
- запуск моделей на малом железе в продакшене - у нас обоих накопился боевой опыт.

PS. В тот же день выйдет Qwen 3.8 27B, так что заодно пощупаем свежий релиз прямо на стриме.

Когда - среда, 12 августа, 18:00 MSK
Где - https://www.twitch.tv/evilfreelancer

7k 0 101 40 73

Ну что ждемссссссссссс

8.7k 1 67 30 84

Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Рекомендую к просмотру

Подкаст вышел про тему мертвого интернета и в целом про возможности ИИ от интересный ребят =)

Эпизод уже тут YouTube и в VK

20 ta oxirgi post ko‘rsatilgan.