Селективные индексы
Вы часто задумываетесь, какие у вас индексы в БД?
Предположим, вам надо быстро отдавать данные смежной команде или внешней системе, представители которой решили купить какое-то решение у компании, в которой вы работаете.
Но данные надо отдавать за условные пару секунд.
Смотрите, как проходит запрос, и обнаруживаете, что замедление идет в момент обращения к БД.
Первая мысль: давайте оптимизируем SQL-запрос. Но как?
• с помощью индексов
• возможно, нужна денормализация (меняем логику)
• кэширование (Redis/Memcached, в этом случае оптимизируем за счет архитектуры)
• партиционирование (для таблиц, в которых больше миллиона строк) и т. д.
Напомню, что индекс в базе данных – это структура, которая ускоряет поиск данных, примерно как оглавление в книге. Без индекса БД проверяет каждую строку (Full Scan), с индексом БД сразу находит нужную запись через структуру поиска.
На какие столбцы все же можно вешать индексы, а на какие не стоит?
Например, в столбце “пол” возможно два варианта: “женский”, “мужской”. Индексируем?
Вот тут и стоит подумать о селективности индекса. Селективность = насколько уникальны значения в колонке. Высокая селективность – индекс очень эффективен.
Низкая селективность – индекс бесполезен, так как БД все равно прочитает половину таблицы.
Селективный индекс по сути – это индекс по колонке с высокой уникальностью значений, который сильно уменьшает количество найденных строк.
При этом если колонку с полом вы будете рассматривать одновременно, скажем, с колонкой "страна" и сделаете сложный индекс, он вполне может принести пользу и быть селективным в данной комбинации.
Держу пари, сегодня вы не задумывались, селективны ли у вас индексы в БД или нет? Угадала?
Да - 👍
Нет - 🙈
Полезно -❤️
Вы часто задумываетесь, какие у вас индексы в БД?
Предположим, вам надо быстро отдавать данные смежной команде или внешней системе, представители которой решили купить какое-то решение у компании, в которой вы работаете.
Но данные надо отдавать за условные пару секунд.
Смотрите, как проходит запрос, и обнаруживаете, что замедление идет в момент обращения к БД.
Первая мысль: давайте оптимизируем SQL-запрос. Но как?
• с помощью индексов
• возможно, нужна денормализация (меняем логику)
• кэширование (Redis/Memcached, в этом случае оптимизируем за счет архитектуры)
• партиционирование (для таблиц, в которых больше миллиона строк) и т. д.
Напомню, что индекс в базе данных – это структура, которая ускоряет поиск данных, примерно как оглавление в книге. Без индекса БД проверяет каждую строку (Full Scan), с индексом БД сразу находит нужную запись через структуру поиска.
На какие столбцы все же можно вешать индексы, а на какие не стоит?
Например, в столбце “пол” возможно два варианта: “женский”, “мужской”. Индексируем?
Вот тут и стоит подумать о селективности индекса. Селективность = насколько уникальны значения в колонке. Высокая селективность – индекс очень эффективен.
Низкая селективность – индекс бесполезен, так как БД все равно прочитает половину таблицы.
Селективный индекс по сути – это индекс по колонке с высокой уникальностью значений, который сильно уменьшает количество найденных строк.
При этом если колонку с полом вы будете рассматривать одновременно, скажем, с колонкой "страна" и сделаете сложный индекс, он вполне может принести пользу и быть селективным в данной комбинации.
Держу пари, сегодня вы не задумывались, селективны ли у вас индексы в БД или нет? Угадала?
Да - 👍
Нет - 🙈
Полезно -❤️