SQL и Анализ данных


Kanal geosi va tili: Rossiya, Ruscha


Базы данных и всё, что с ними связано!
Сотрудничество: @haarrp
РКН № 6766085482

Зарегистрирован в РКН
Связанные каналы

Kanal geosi va tili
Rossiya, Ruscha
Statistika
Postlar filtri


🖥 Учим SQL не по учебнику, а расследуя преступления

В Steam выходит Ghost in the SQL - детективная игра, где главный инструмент расследования не лупа и не допросы, а SQL-запросы.

Чтобы найти подозреваемого, восстановить события или докопаться до нужной улики, придётся работать с базами данных, фильтровать информацию, связывать таблицы и писать запросы.

Каждое дело постепенно знакомит с SQL через практику - от простых выборок до более сложного анализа данных.

Обещают разные расследования - поджоги, убийства и другие преступления.

Редкий случай, когда SELECT, JOIN и WHERE действительно помогают найти преступника.

https://store.steampowered.com/app/5072430/Ghost_in_the_SQL_Data/


Как в PostgreSQL называется виртуальная таблица, содержимое которой определяется SQL-запросом и не хранится физически на диске?
So‘rovnoma
  •   Materialized View
  •   Temp Table
  •   Index
  •   View


☁️☁️☁️☁️☁️☁️☁️

24 сентября Yandex Cloud проведёт ежегодную флагманскую технологическую конференцию Yandex Scale 2026.

🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨
В программе четыре продуктовых трека — AI, Data, Security и Hybrid Infrastructure & DevOps, — и отдельный углублённый технологический трек DeepTech, который пройдёт только онлайн.

В треке Data расскажем, как Yandex Cloud развивает аналитику от отдельных сервисов к единой бесшовной среде: от загрузки данных до готовых бизнес-инсайтов, где ИИ помогает на каждом этапе. Разберём, как YDB помогает строить рекомендательные и поисковые системы и ИИ‑ассистентов. «Додо Пицца» представит честную историю миграции десятков терабайт данных в Yandex Cloud, а также расскажет о сравнении с западным облаком и совместном преодолении ограничений. Расскажем, как Yandex Cloud движется к самоуправляемым базам данных на основе опыта эксплуатации тысяч баз в Яндексе. «Азбука вкуса» разберёт миграцию Oracle Exadata на Lakehouse в Yandex Cloud без единого аврала. И покажем, как Yandex Managed Service for Valkey научили растягиваться под нагрузку — и вширь, и вглубь.

🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨
Отдельно пройдут воркшопы по Data: разберём ключевые сценарии использования ИИ‑агента Нейроаналитика в Yandex DataLens. На практике посмотрим, как PGHouse позволяет OLTP‑базе PostgreSQL прозрачно выполнять OLAP‑запросы в ClickHouse без переписывания SQL. И соберём поисковую систему на Serverless YDB с настройкой полнотекстовых и векторных индексов.

🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨

И это ещё не всё: демозоны, питчинг решений, IT-квест и мерч — офлайн, а розыгрыши призов и секретный гость — в онлайн-студии.


Вся программа — на сайте, регистрация занимает пару минут, а участие бесплатное!


Создатель PostgreSQL фактически поблагодарил Oracle за успех своей базы

Майкл Стоунбрейкер считает, что поворотным моментом стала покупка MySQL компанией Oracle в 2010 году.

Разработчики испугались, что MySQL теперь зависит от одного владельца, и начали активнее смотреть в сторону PostgreSQL.

По словам Стоунбрейкера, именно тогда и начался его взлёт.

Спустя годы PostgreSQL стал одной из главных баз для разработчиков, а AWS, Google и Microsoft построили вокруг его протокола собственные сервисы.

Стоунбрейкер объясняет успех просто: PostgreSQL контролирует не корпорация, а небольшая группа очень сильных open source-разработчиков.

Ирония в том, что Oracle 15 лет строила главное преимущество PostgreSQL даже не специально:

у PostgreSQL нет одного владельца, которого все должны бояться.


Machinelearning dan repost
📌Scale AI измерила, насколько хорошо модели переписывают других агентов

HarnessOpt-Bench - бенчмарк, который проверяет, умеет ли модель улучшать харнесс чужого ИИ-агента.

🟡Механика

Модель-оптимизатор получает исходную обвязку целевого агента, размеченную обратную связь по результатам прогонов и фиксированный бюджет.

Она переписывает код, а в конце собирает финальную версию, которую оценивают на отложенном наборе задач - его оптимизатор во время работы не видит.

Тесты выполняются в доверенной среде исполнения на базе VeRO - она следит за бюджетом, прячет отложенные данные, считает потраченные токены и сохраняет каждую версию для аудита.

Так сделали для того, чтобы защита от накрутки была свойством песочницы, а не инструкцией, которую модель может обойти.


🟡Результаты

Прогнали пять топовых моделей на четырех наборах - OfficeQA, BrowseComp-Plus, Terminal-Bench и GAIA, - всего 111 запусков.

Модели четко разошлись по уровням, причем выбор самой модели влияет на результат примерно в 1,8 раза сильнее, чем то, в каком кодинг-агенте она работает.

Впереди Opus-5, она выбрала около двух третей доступного запаса улучшений на OfficeQA и половину на BrowseComp-Plus, а всего выиграла три задачи из четырех.

Родная среда для модели (Сodex для GPT, Сlaude Сode для Claude, Kimi Cli для Kimi) устойчивого преимущества не дает.

Отдельно Scale AI посмотрела динамику по поколениям. У пяти релизов GPT прирост рос монотонно, с +0,03 до +0,49, у пяти релизов Claude Opus - с +0,37 до +0,59.

Важно понимать, что настоящим самоулучшением это назвать пока нельзя, так как одна модель переписывает среду другого агента, исходный тестовый харнесс которого специально был сделан с большим запасом для оптимизации.


@ai_machinelearning_big_data

#news #ai #ml


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Вчера запрос летал, сегодня умер. Виноват новый query plan

Код не менялся, а SQL внезапно стал медленным. Причина почти всегда в том, что оптимизатор выбрал другой план: статистика устарела, данные перекосило, редкий фильтр начал бить по трети таблицы. Сравниваешь EXPLAIN ANALYZE вчера и сегодня, смотришь расхождение estimated и actual rows, обновляешь статистику и проверяешь селективность индексов.


⚡️ Harness Engineering - полный курс на русском

Как заставить AI-агента писать код надёжно. Не «какую модель выбрать», а как спроектировать вокруг неё рабочую систему: инструкции, инструменты, среду, состояние и верификацию.

Курс - от нуля до продвинутых тем: теоретическая база из 11 блоков, 14 модулей, 8 практических проектов, 14 лабораторных работ, диагностический протокол «как починить агента», библиотека готовых шаблонов, карта инструментов, 40 приёмов и каталог антипаттернов.

Главный тезис курса: способность модели и надёжность исполнения - это две разные вещи. Одна и та же модель в «голой» среде и в среде с продуманным harness даёт качественно разные результаты. Апгрейд модели - это самый дорогой и обычно не самый эффективный способ починить агента.

https://github.com/justxor/Harness_ru


🔥 9B-модель на 7 ГБ, которая по тестам автора лезет на территорию 27B

На Hugging Face вышла Qwen3.5-9B The Defiant Fable от DavidAU. Это многоэтапный fine-tune Qwen3.5-9B с упором на reasoning, instruction following, код и creative-задачи. Модель распространяется под Apache 2.0, а автор также позиционирует её как uncensored/heretic-версию с минимальными отказами.

Самое интересное в результатах. По собственному набору из семи бенчмарков автор заявляет, что 9B-версия обходит базовые Qwen3.5-9B, Qwen3.5-27B и Qwen3.6-35B-A3B, а местами приближается к Qwen3.6-27B. Причём сильные результаты сохраняются даже после 4-bit квантования. Это пока именно авторские тесты, а не независимый leaderboard.

Для локального запуска уже готовы обычные и MTP GGUF с NEO IMATRIX. Q4_K_M занимает примерно 6,8-7 ГБ, IQ3_M около 5,6 ГБ, а экстремальный IQ2_M всего 4,94 ГБ.

Контекст у базовой архитектуры до 262K токенов. Запускать можно через llama.cpp, Ollama, LM Studio, vLLM и другие локальные рантаймы, а через llama.cpp сразу поднимается OpenAI-compatible API.

Если независимые тесты подтвердят цифры, это хороший пример того, насколько далеко сейчас можно вытянуть маленькую 9B-модель правильным fine-tuning, merge и квантованием.

https://huggingface.co/DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF

#AI #Qwen #LLM #LocalAI #GGUF


🛡️ Uber открыла ADR - систему защиты для корпоративных AI-агентов.

ADR расшифровывается как Agentic AI Detection and Response. Проект уже используется внутри Uber и предназначен для наблюдаемости, тестирования безопасности и обнаружения угроз в агентных системах.

Что умеет ADR:

- собирает телеметрию от AI coding agents;
- отслеживает действия агентов и вызовы инструментов;
- помогает находить подозрительное поведение;
- позволяет строить security monitoring вокруг автономных агентов;
- включает инструменты для security benchmarking и threat detection.
-
Особенно интересно, что ADR смотрит на AI-агента уже не как на обычное приложение, а как на отдельного участника инфраструктуры, за действиями которого нужно постоянно следить.

Похоже, рядом с EDR для компьютеров и серверов появляется новый класс инструментов - EDR, но уже для автономных AI-агентов.

GitHub:
https://github.com/uber/ADR

#AI #AIAgents #Cybersecurity #Uber #OpenSource


Для чего используется команда TRUNCATE вместо DELETE для очистки большой таблицы?
So‘rovnoma
  •   Для удаления только части строк
  •   Для мгновенного освобождения места без сканирования строк
  •   Для сохранения триггеров уровня строк
  •   Для удаления таблицы из базы
76 ta ovoz


🎓 Если вы планируете поступать в ШАД в 2027 году, сейчас можно присоединиться к текущему потоку ShadHelper.

Мы больше 6 лет готовим к ШАД и ML-магистратурам. Среди преподавателей - специалисты из Сбера, МГУ и МФТИ; 120+ выпускников уже поступили в ШАД и ML-магистратуры.

Курс рассчитан на системную подготовку за год: математика, теория вероятностей, дискретная математика и алгоритмы, регулярная практика, домашние задания с обратной связью, поддержка в чате и пробные экзамены.

Поток уже идёт, и сейчас начинается основная часть программы - ключевые темы вступительных экзаменов. Присоединиться к текущей группе можно до 24 августа.

Если пока не готовы принимать решение сразу, оставьте заявку: откроем материалы первой недели курса и договоримся о 15-минутной консультации с академическим куратором. Вы посмотрите, как устроена программа, и сможете задать вопросы по подготовке и входу в текущий поток.

👉 Посмотреть программу и условия


⚡️ QueryTuner - open-source инструмент, который разбирает SQL-запрос и показывает, почему он может тормозить.

Подключаться к базе вообще не обязательно. Можно просто вставить SQL и получить диагностику.

Поддерживаются сразу 5 диалектов:

- PostgreSQL
- MySQL
- Oracle
- SQL Server
- SQLite

Внутри два уровня анализа.

1. Детерминированный heuristic engine

Он мгновенно ищет типичные anti-patterns:

- SELECT *
- функции внутри WHERE
- leading wildcard в LIKE
- потенциально отсутствующие индексы
- ORDER BY без ограничения результата
- другие проблемы производительности

Сейчас заявлено 12 правил, и для них не нужны ни LLM, ни внешний API.
2. Опциональный AI-слой

Можно подключить Qwen через Hugging Face или OpenAI. Тогда QueryTuner умеет:

- объяснять проблему человеческим языком;
- переписывать запрос;
- предлагать CREATE INDEX;
- объяснять, зачем конкретный индекс нужен.

Особенно интересно, что можно передать ещё и CREATE TABLE DDL. Тогда рекомендации становятся schema-aware: инструмент видит реальные таблицы, колонки и существующие индексы.

Например, для такого запроса:


SELECT *
FROM orders
WHERE YEAR(created_at) = 2026;

Хороший проект для тех случаев, когда SQL уже работает, но хочется понять, почему через полгода он начнёт работать плохо.

#SQL #PostgreSQL #Database #OpenSource #DataEngineering

https://github.com/AutoShiftOps/querytuner


💡 SQL-трюк: сравнивайте `NULL` без костылей

В PostgreSQL обычное сравнение может неожиданно сломать условие:


SELECT NULL = NULL;


Результат:


NULL


Потому что NULL означает «неизвестное значение», а не конкретное значение.

Из-за этого часто пишут громоздкие условия:


WHERE a = b
OR (a IS NULL AND b IS NULL)


Но есть оператор, о котором многие забывают:


a IS NOT DISTINCT FROM b


Он работает как NULL-safe equality:


SELECT NULL IS NOT DISTINCT FROM NULL; -- true
SELECT 10 IS NOT DISTINCT FROM 10; -- true
SELECT 10 IS NOT DISTINCT FROM NULL; -- false


Есть и обратный вариант:


a IS DISTINCT FROM b


Например, удобно искать реально изменившиеся значения:


SELECT *
FROM old_data o
JOIN new_data n USING (id)
WHERE o.email IS DISTINCT FROM n.email;


Если оба email = NULL, строка не считается изменённой.

Без этого обычное:


o.email n.email


может просто вернуть NULL и пропустить изменение.

Особенно полезно при синхронизации данных, аудите изменений, ETL и UPSERT-логике.

#SQL #PostgreSQL #Database


Единственные соседние степени во всей математике

Числа 8 и 9 выглядят обычно, но их соседство уникально:


2³ = 8
3² = 9


Это единственная пара степеней натуральных чисел больше 1, которые отличаются ровно на единицу.

Иными словами, уравнение


xᵖ - yᑫ = 1


при x, y, p, q > 1 имеет только одно решение:


3² - 2³ = 1


Эжен Каталан сформулировал эту гипотезу в 1844 году. Доказать её смогли лишь спустя более 150 лет: в 2002 году это сделал математик Преда Михэйлеску.

Сегодня результат известен как теорема Михэйлеску.

Простое утверждение оказалось настолько глубоким, что для доказательства понадобились современные методы алгебраической теории чисел.


⚡️ Программистов пытаются отменить уже больше 60 лет

COBOL создавали так, чтобы код могли писать менеджеры. SQL называли «структурированным английским». Затем появились 4GL, UML, low-code и no-code. Каждый раз индустрия обещала программирование без программистов — и каждый раз получала новые специализации.

Теперь ту же роль играют LLM и вайбкодинг.

Проблема упирается в естественный язык. Фраза «удали файлы старше 30 дней» сразу порождает вопросы: учитывать дату создания или изменения, трогать ли подпапки, скрытые файлы и симлинки?

Чем сложнее система, тем опаснее такие умолчания. Кто-то всё равно должен уточнить требования, проверить результат и отвечать за прод.

ИИ убирает бойлерплейт и ускоряет написание кода. Ценность разработчика смещается в архитектуру, доменную логику, безопасность и контроль.

Профессия не исчезает. Она снова меняет название.

Статья: https://habr.com/ru/articles/1058500/


Искусственный интеллект. Высокие технологии dan repost
📌 Oracle сократила 21 000 сотрудников и теперь может получить счёт на $7 млрд из-за ИИ

За финансовый 2026 год штат Oracle сократился примерно на 21 000 человек, или на 13%. Компания прямо указала, что внедрение ИИ стало одним из факторов сокращений.

Параллельно Oracle строит гигантскую ИИ-инфраструктуру для OpenAI. Один из проектов - дата-центр в Висконсине мощностью около 1 ГВт, связанный с контрактом OpenAI и Oracle на $300 млрд.

Регуляторы Висконсина требуют от крупных дата-центров с недостаточно высоким кредитным рейтингом финансовые гарантии, чтобы расходы на электростанции и сети не легли на обычных потребителей.

После снижения рейтинга Oracle до BBB-, компания может попасть под требование предоставить более $7 млрд обеспечения. Банковская гарантия такого размера способна обходиться более чем в $100 млн ежегодно. Oracle уже оспаривает правила в суде.


Machinelearning dan repost
📌Cursor переписал SQLite на Rust по документации

Anysphere опубликовала отчёт об эксперименте, в котором группе агентов поручили реализовать на языке Rust всё содержимое 835-страничного руководства SQLite.

Исходный код СУБД, её готовые сборки, тестовые наборы и доступ в интернет агентам, по словам Cursor, были закрыты.


🟡Конфигураций было четыре

В двух одна и та же модель и планировала, и выполняла работу - это были GPT-5.5 и Grok 4.5. В остальных планированием занимались Opus 4.8 или Fable 5, а исполнение отдавали собственной Composer 2.5.

Все конфигурации в итоге прошли тестовый набор целиком.


Качество измеряли по набору sqllogictest из проекта SQLite, который сверяет ответы разных движков на одинаковые запросы.

Агентам о существовании этого набора не сообщали. Cursor после каждого прогона вручную проверяли код на подгонку под тесты и на то, равномерно ли построена система.

Код соло-запуска Opus 4.8 выложен на GitHub.

🟡Разброс по деньгам

Дешевле всего вышла связка Opus 4.8 с Composer 2.5 - $1339, дороже всего работа на одной GPT-5.5 - $10 565.

Две оставшиеся конфигурации стоили $1,9 тыс. (Grok 4.5) и $2,2 тыс. (гибрид с Fable 5).

Дополнительно Cursor прогнала Opus 4.8 и Fable 5 поодиночке - за $5153 и $20 057, но эти запуски оценивались неформально и в сравнение по качеству не включались.

Из эксперимента Cursor делает вывод, что топовая модель нужна на отдельных этапах - при первичной декомпозиции задачи и принятии проектных решений, а дальше инструкции может выполнять модель подешевле.


🟡Фан-факт

В качестве одной из конфигураций рассчитывали использовать GPT-5.6 Sol, но модель оказалась чувствительной к буквальным формулировкам и уходила в неконтролируемые циклы. От нее отказались - не было времени на переписывание промптов.


@ai_machinelearning_big_data

#AI #ML #Agents #Cursor #Research


GeoSQL превращает Claude, Codex и Copilot в агента для геоаналитики

Инструмент подключается к PostGIS, BigQuery, Snowflake и Wherobots. Агент сам изучает схему данных, пишет spatial SQL, проверяет стоимость запроса и валидирует геометрию.

Результат можно вывести на карту через Dekart. Модель анализирует визуализацию и исправляет ошибки с полигонами, пересечениями и системами координат. По бенчмарку авторов, map-in-the-loop повышает качество выполнения геопространственных задач в четыре раза.

Работает локально или на своём сервере. Лицензия MIT.

https://github.com/dekart-xyz/geosql


Какой тип данных в PostgreSQL лучше всего подходит для хранения денежных сумм с фиксированной точностью без ошибок округления?
So‘rovnoma
  •   REAL
  •   DOUBLE PRECISION
  •   NUMERIC
  •   FLOAT
480 ta ovoz


🔥 Хочешь быстрее расти в IT? Хватит учиться в одиночку

В IT прокачивается тот, кто каждый день видит сильные идеи, новые инструменты, реальные задачи, вакансии и разборы.

Окружение решает больше, чем кажется.

Собрал папки и каналы, где можно быстрее влиться в нужное направление, следить за трендами и не вариться в своём пузыре.

AI: t.me/ai_machinelearning_big_data
Python: t.me/pythonl
Linux: t.me/linuxacademiya
Хакинг: t.me/linuxkalii
DevOps: t.me/DevOPSitsec
Docker: t.me/DevopsDocker
Golang: t.me/Golang_google
Rust: t.me/rust_code
C++: t.me/cpluspluc
C#: t.me/csharp_1001_notes
Java: t.me/java_library
JavaScript: t.me/javascriptv
React: t.me/react_tg
Frontend: t.me/front
PHP: t.me/phpshka
Android: t.me/android_its
Мобильная разработка: t.me/mobdevelop
Базы данных: t.me/sqlhub
Data Science: t.me/data_analysis_ml
Big Data: t.me/bigdatai
Математика: t.me/data_math
Физика: t.me/fizmat
Kubernetes: t.me/kubernetc
GameDev: https://t.me/gamedev
Haskell: t.me/haskell_tg

Собеседования и карьера:

DS собеседования: t.me/machinelearning_interview
Python собеседования: t.me/python_job_interview

Папка с вакансиями: t.me/addlist/_zyy_jQ_QUsyM2Vi
Папка Go разработчика: t.me/addlist/MUtJEeJSxeY2YTFi
Папка Python разработчика: t.me/addlist/eEPya-HF6mkxMGIy
Папка ML: 'https://t.me/addlist/2Ls-snqEeytkMDgy' rel='nofollow'>https://t.me/addlist/2Ls-snqEeytkMDgy
Папка Frontend: https://t.me/addlist/mzMMG3RPZhY2M2Iy

Полезное сверху:

ИТ-мемы: t.me/memes_prog
Английский для программистов: t.me/english_forprogrammers
ИИ и технологии: t.me/vistehno
954 ГБ open-source курсов: @courses
ИТ-книги бесплатно: https://t.me/addlist/BkskQciUW_FhNjEy

Max Ai: https://max.ru/ai_machinelearning_big_data
Max python: https://max.ru/pythonl
ТЕХНО: https://max.ru/vistehno
Max Go: https://max.ru/Golang_google
Max Linux: https://max.ru/linuxkalii
Devops: https://max.ru/DevOPSitsec
C#: https://max.ru/csharp_ci
C++: https://max.ru/cpluspluc
SQL: https://max.ru/sqlhub
Java: https://max.ru/javatg

Подписывайся на нужные направления и собирай себе ленту, которая реально двигает вперёд.

Пока кто-то листает шум, ты будешь видеть инструменты, задачи и идеи, которые помогают расти в профессии.

20 ta oxirgi post ko‘rsatilgan.