#кейсы #ML
Итак, победил (пусть и не абсолютно) кейс с модельной архитектурой.
Полностью и исключительно вымышленный, естественно, просто плод воображения.
Когда застройщик обращается в банк за кредитом для планируемого строительства жилых корпусов, залоговой службе нужно оценить насколько проект в целом интересный — то есть посчитать будущий денежный поток. Для этого надо понять когда и по какой цене квартиры распродадут (а еще неплохо и парковки и коммерческую недвижимость если есть). Причем тк деньги имеют свою цену — еще и поквартально.
То есть в этом квартале продадут x кв метров при средней цене y рублей, в следующем тоже прогноз и так до тех пор пока не распродадут все.
В руках у нас только даты старта строительства, старта продаж и параметры объекта, который хотят построить — какие есть квартиры, какой площади, с отделкой или без, сколько этажей и прочее.
Понятно что в ЖК может быть несколько корпусов с разными датами ввода и пр (привет, GroupKFold).
Мб и было бы здорово сразу прогнозировать денежный поток одной моделькой, но увы и ах, залоговики хотят знать как выбирались объекты аналоги (которые рядом и похожи на искомый), насколько модель в своем ответе уверена, насколько вообще объект ликвиден, плюс иметь возможность закладывать разные макропрогнозы (инфляция, ключевая ставка, льготные программы в регионе и пр.), поэтому моделей сильно больше одной вышло).
Сбор датасета невероятное чутдо (например, часть объектов с эксроу, часть без), найти где-то реальные данные о темпах и ценах продаж (не из объявлений же брать), нормализовать адреса и между собой перематчить — а они по объекту могли меняться в процессе, добавить POI, и только тогда приступить к построению моделей.
Чтобы сократить объем поста, приложу схему и отвечу на наиболее популярные вопросы:
- Откуда цены —проектные декларации, выписки из Росреестра, ипотечные договора физиков
- Объекты-аналоги — с одной стороны реликт ручного процесса, с другой стороны в своей стоимости и ее динамике несут какую-то инфо о локации.
Модель цены предиктит попарно для каждого ОА, затем предикты усредняются
- Ликвидность — про то какая доля будет продана к условно-готовой стадии
- Почему уверенность а не доверительный интервал? — потому как человеку проще объяснить одним числом где модель применять вообще не следует, плюс в этих моделях использовались фичи, которые просто беггингом (см. RMSEWithUncertaincy) не поймаешь
- В продажах есть сезонность — однозначно
- Киллер-фича по темпам — ликвидность, затем сам застройщик, степень готовности, остатки площадей, ср. площадь квартир
- Макро правда влияет на цену — более того, накопленная инфляция учитывается в применении к объектам-аналогам.
Напоминаю, что все это исключительно плод чьего-то больного воображения.
Итак, победил (пусть и не абсолютно) кейс с модельной архитектурой.
Полностью и исключительно вымышленный, естественно, просто плод воображения.
Когда застройщик обращается в банк за кредитом для планируемого строительства жилых корпусов, залоговой службе нужно оценить насколько проект в целом интересный — то есть посчитать будущий денежный поток. Для этого надо понять когда и по какой цене квартиры распродадут (а еще неплохо и парковки и коммерческую недвижимость если есть). Причем тк деньги имеют свою цену — еще и поквартально.
То есть в этом квартале продадут x кв метров при средней цене y рублей, в следующем тоже прогноз и так до тех пор пока не распродадут все.
В руках у нас только даты старта строительства, старта продаж и параметры объекта, который хотят построить — какие есть квартиры, какой площади, с отделкой или без, сколько этажей и прочее.
Понятно что в ЖК может быть несколько корпусов с разными датами ввода и пр (привет, GroupKFold).
Мб и было бы здорово сразу прогнозировать денежный поток одной моделькой, но увы и ах, залоговики хотят знать как выбирались объекты аналоги (которые рядом и похожи на искомый), насколько модель в своем ответе уверена, насколько вообще объект ликвиден, плюс иметь возможность закладывать разные макропрогнозы (инфляция, ключевая ставка, льготные программы в регионе и пр.), поэтому моделей сильно больше одной вышло).
Сбор датасета невероятное чутдо (например, часть объектов с эксроу, часть без), найти где-то реальные данные о темпах и ценах продаж (не из объявлений же брать), нормализовать адреса и между собой перематчить — а они по объекту могли меняться в процессе, добавить POI, и только тогда приступить к построению моделей.
Чтобы сократить объем поста, приложу схему и отвечу на наиболее популярные вопросы:
- Откуда цены —проектные декларации, выписки из Росреестра, ипотечные договора физиков
- Объекты-аналоги — с одной стороны реликт ручного процесса, с другой стороны в своей стоимости и ее динамике несут какую-то инфо о локации.
Модель цены предиктит попарно для каждого ОА, затем предикты усредняются
- Ликвидность — про то какая доля будет продана к условно-готовой стадии
- Почему уверенность а не доверительный интервал? — потому как человеку проще объяснить одним числом где модель применять вообще не следует, плюс в этих моделях использовались фичи, которые просто беггингом (см. RMSEWithUncertaincy) не поймаешь
- В продажах есть сезонность — однозначно
- Киллер-фича по темпам — ликвидность, затем сам застройщик, степень готовности, остатки площадей, ср. площадь квартир
- Макро правда влияет на цену — более того, накопленная инфляция учитывается в применении к объектам-аналогам.
Напоминаю, что все это исключительно плод чьего-то больного воображения.