Случайный человек или случайный друг
Представим очень простую социальную сеть.
Есть один человек, который дружит со всеми остальными 100 людьми.
А каждый из этих 100 людей дружит только с ним.
Получается сеть-звезда.
У центрального человека 100 друзей.
У каждого из остальных — по 1 другу.
Сколько друзей у случайного человека в такой сети?
Среднее равно
(100+100·1)/101 ≈ 1,98.
То есть случайный человек имеет в среднем около 2 друзей.
Теперь выберем не случайного человека, а случайного друга.
Иначе говоря, выберем случайную дружескую связь и посмотрим на один из её концов.
Тогда центральный человек попадётся очень часто: к нему ведут 100 связей.
Каждый из остальных попадётся только по одной связи.
Среднее число друзей в такой выборке равно
(100²+100·1²)/(100+100)=50,5.
Получается резкий разрыв:
случайный человек имеет в среднем около 2 друзей;
случайный друг имеет в среднем 50,5 друзей.
Такой вот парадокс дружбы.
Он возникает не из-за психологии, а из-за способа выбора.
Если выбирать людей напрямую, каждый человек имеет одинаковый вес.
Если выбирать людей через дружеские связи, человек с k друзьями попадает в выборку в k раз чаще.
Поэтому более связные люди автоматически пере представлены.
В общем виде это записывается так.
Пусть D — число друзей у случайного человека.
Среднее число друзей у случайного человека равно
E(D).
А среднее число друзей у случайного друга равно
E(D²)/E(D).
Квадрат появляется потому, что человек с k друзьями имеет значение k и одновременно попадает в выборку в k раз чаще.
Так как E(D²) ≥ E(D)²,
получаем E(D²)/E(D) ≥ E(D).
Если число друзей не у всех одинаковое, неравенство строгое.
Поэтому средний друг имеет больше друзей, чем средний человек.
Популярная фраза «у большинства людей их друзья популярнее их самих» — более сильная версия этого эффекта. Она часто верна в реальных сетях, но универсальная математическая формулировка именно такая:
средний друг популярнее среднего человека.
Та же ошибка возникает в любой выборке, где мы выбираем объект не напрямую, а через его связи или появления.
Случайный ученик чаще окажется в большом классе.
Случайный пассажир чаще окажется в загруженном автобусе.
Случайная ссылка чаще приведёт на популярную страницу.
Это выборка, смещённая размером.
Чем больше у объекта связей, мест или появлений, тем чаще он попадает в наблюдение.
Представим очень простую социальную сеть.
Есть один человек, который дружит со всеми остальными 100 людьми.
А каждый из этих 100 людей дружит только с ним.
Получается сеть-звезда.
У центрального человека 100 друзей.
У каждого из остальных — по 1 другу.
Сколько друзей у случайного человека в такой сети?
Среднее равно
(100+100·1)/101 ≈ 1,98.
То есть случайный человек имеет в среднем около 2 друзей.
Теперь выберем не случайного человека, а случайного друга.
Иначе говоря, выберем случайную дружескую связь и посмотрим на один из её концов.
Тогда центральный человек попадётся очень часто: к нему ведут 100 связей.
Каждый из остальных попадётся только по одной связи.
Среднее число друзей в такой выборке равно
(100²+100·1²)/(100+100)=50,5.
Получается резкий разрыв:
случайный человек имеет в среднем около 2 друзей;
случайный друг имеет в среднем 50,5 друзей.
Такой вот парадокс дружбы.
Он возникает не из-за психологии, а из-за способа выбора.
Если выбирать людей напрямую, каждый человек имеет одинаковый вес.
Если выбирать людей через дружеские связи, человек с k друзьями попадает в выборку в k раз чаще.
Поэтому более связные люди автоматически пере представлены.
В общем виде это записывается так.
Пусть D — число друзей у случайного человека.
Среднее число друзей у случайного человека равно
E(D).
А среднее число друзей у случайного друга равно
E(D²)/E(D).
Квадрат появляется потому, что человек с k друзьями имеет значение k и одновременно попадает в выборку в k раз чаще.
Так как E(D²) ≥ E(D)²,
получаем E(D²)/E(D) ≥ E(D).
Если число друзей не у всех одинаковое, неравенство строгое.
Поэтому средний друг имеет больше друзей, чем средний человек.
Популярная фраза «у большинства людей их друзья популярнее их самих» — более сильная версия этого эффекта. Она часто верна в реальных сетях, но универсальная математическая формулировка именно такая:
средний друг популярнее среднего человека.
Та же ошибка возникает в любой выборке, где мы выбираем объект не напрямую, а через его связи или появления.
Случайный ученик чаще окажется в большом классе.
Случайный пассажир чаще окажется в загруженном автобусе.
Случайная ссылка чаще приведёт на популярную страницу.
Это выборка, смещённая размером.
Чем больше у объекта связей, мест или появлений, тем чаще он попадает в наблюдение.