История 3. Тут кирпичик ещё старше первых двух. В 1637 году философ и математик Рене Декарт предложил штуку, которая сегодня кажется очевидной: любую точку на плоскости можно описать парой чисел — координатами. До этого геометрия и алгебра существовали как будто в разных мирах, Декарт их поженил. Так мы приходим к пониманию того, что данные могут быть точками в пространстве.
Возьмём квартиру. У неё есть площадь, этаж, расстояние до метро. Три числа — три координаты. Квартира — точка в трёхмерном пространстве. Добавьте ещё сто параметров — и это уже точка в стопятимерном пространстве, которое невозможно представить, но с которым прекрасно работает математика.
Товар в каталоге — тоже точка: цена, рейтинг, категория, CTR за последний месяц. Пользователь — тоже точка: история покупок, средний чек, устройство, регион.
И как только вы начинаете думать про данные как про точки в пространстве, почти все ключевые понятия машинного обучения превращаются в геометрию:
• Классификация → это проведение границы между двумя облаками точек, «купит» с одной стороны, «не купит» — с другой.
• Похожесть → расстояние между точками: два товара похожи, если их точки стоят рядом.
• Рекомендация → поиск ближайших точек к вам в этом пространстве.
• Экстраполяция → достраивание линии в ту область пространства, где точек никогда не было.
Это не метафора ради красоты. По сути именно так построены современные системы поиска и рекомендаций: товары и запросы превращают в векторы — наборы чисел, то есть координаты в пространстве, — и дальше вся система работает с геометрией этого пространства: ищет ближайшие точки, проводит между ними границы, группирует по кластерам.
Декарт, разумеется, ни о чём таком не думал — он просто хотел рисовать кривые уравнениями. Но координаты, придуманные для двух измерений, прекрасно дожили до эпохи, где измерений тысячи.
Вот, собственно, и всё: три идеи, разбросанные по четырём столетиям, сложились в то, что мы сегодня называем искусственным интеллектом.
Не History Channel, конечно, но тоже неплохо я считаю.
Продолжение — в следующих постах.
Возьмём квартиру. У неё есть площадь, этаж, расстояние до метро. Три числа — три координаты. Квартира — точка в трёхмерном пространстве. Добавьте ещё сто параметров — и это уже точка в стопятимерном пространстве, которое невозможно представить, но с которым прекрасно работает математика.
Товар в каталоге — тоже точка: цена, рейтинг, категория, CTR за последний месяц. Пользователь — тоже точка: история покупок, средний чек, устройство, регион.
И как только вы начинаете думать про данные как про точки в пространстве, почти все ключевые понятия машинного обучения превращаются в геометрию:
• Классификация → это проведение границы между двумя облаками точек, «купит» с одной стороны, «не купит» — с другой.
• Похожесть → расстояние между точками: два товара похожи, если их точки стоят рядом.
• Рекомендация → поиск ближайших точек к вам в этом пространстве.
• Экстраполяция → достраивание линии в ту область пространства, где точек никогда не было.
Это не метафора ради красоты. По сути именно так построены современные системы поиска и рекомендаций: товары и запросы превращают в векторы — наборы чисел, то есть координаты в пространстве, — и дальше вся система работает с геометрией этого пространства: ищет ближайшие точки, проводит между ними границы, группирует по кластерам.
Декарт, разумеется, ни о чём таком не думал — он просто хотел рисовать кривые уравнениями. Но координаты, придуманные для двух измерений, прекрасно дожили до эпохи, где измерений тысячи.
Вот, собственно, и всё: три идеи, разбросанные по четырём столетиям, сложились в то, что мы сегодня называем искусственным интеллектом.
Не History Channel, конечно, но тоже неплохо я считаю.
Продолжение — в следующих постах.