Удерживаем ваше внимание, как можем, чтобы ответить на вчерашний вопрос и закрыть тему No Free Lunch...
⚡️Если теорема говорит, что универсального алгоритма не существует, почему современные нейросети всё чаще выглядят универсальными
Здесь стоит сделать важную оговорку. Сама теорема No Free Lunch требует усреднения по всем мыслимым задачам, взятым с равной вероятностью. Но что такое «случайно выбранная из всех возможных» задача?
✅ Тут нам пригодится понятие колмогоровской сложности
Если измерять сложность данных через колмогоровскую сложность — длину самой короткой программы, способной их породить, — то почти любой случайно сгенерированный набор данных окажется максимально сложным, несжимаемым шумом.
Реальные же задачи, с которыми работают люди и алгоритмы, — изображения, тексты, звук — как правило, прекрасно сжимаются, то есть обладают низкой колмогоровской сложностью.
Формально теорема остаётся верна для всего пространства задач, но интересующий нас угол этого пространства — крошечная и совсем не типичная его часть.
Это, по мнению авторов, отчасти объясняет происходящее сейчас в глубоком обучении: движение не в сторону зоопарка узкоспециализированных моделей, а в сторону всё более крупных и универсальных архитектур, построенных на всё меньшем числе принципов.
✅ У этой мысли есть старый философский родственник — бритва Оккама
В 2011 году Тор Латтимор и Маркус Хаттер поставили вопрос прямо: если No Free Lunch утверждает, что нельзя обойтись без знания конкретной предметной области, то как тогда вообще работает принцип «из двух объяснений выбирай более простое»? Ведь бритва Оккама претендует именно на универсальность — она не привязана к какой-то одной задаче.
Иначе говоря, бритва Оккама — это не эвристика в обход No Free Lunch, а минимально необходимый «бесплатный ланч»: единственное предположение, которое стоит сделать, если вы заранее не знаете, какая перед вами задача, но подозреваете, что она не абсолютно случайна.
Именно это предположение — пусть и в неявном виде — зашито в устройство современных нейросетей.
🕊 — если вы тоже привыкли не усложнять
#как_устроено
⚡️Если теорема говорит, что универсального алгоритма не существует, почему современные нейросети всё чаще выглядят универсальными
Здесь стоит сделать важную оговорку. Сама теорема No Free Lunch требует усреднения по всем мыслимым задачам, взятым с равной вероятностью. Но что такое «случайно выбранная из всех возможных» задача?
✅ Тут нам пригодится понятие колмогоровской сложности
Если измерять сложность данных через колмогоровскую сложность — длину самой короткой программы, способной их породить, — то почти любой случайно сгенерированный набор данных окажется максимально сложным, несжимаемым шумом.
Реальные же задачи, с которыми работают люди и алгоритмы, — изображения, тексты, звук — как правило, прекрасно сжимаются, то есть обладают низкой колмогоровской сложностью.
Формально теорема остаётся верна для всего пространства задач, но интересующий нас угол этого пространства — крошечная и совсем не типичная его часть.
В 2023–2024 годах исследователи показали, что нейронные сети — причём даже необученные, со случайной инициализацией — охотнее «производят» простые, сжимаемые последовательности. Более того, архитектура, спроектированная под одну область (например, компьютерное зрение), неожиданно хорошо сжимает данные из совсем других, на первый взгляд не связанных с ней областей.
Это, по мнению авторов, отчасти объясняет происходящее сейчас в глубоком обучении: движение не в сторону зоопарка узкоспециализированных моделей, а в сторону всё более крупных и универсальных архитектур, построенных на всё меньшем числе принципов.
✅ У этой мысли есть старый философский родственник — бритва Оккама
В 2011 году Тор Латтимор и Маркус Хаттер поставили вопрос прямо: если No Free Lunch утверждает, что нельзя обойтись без знания конкретной предметной области, то как тогда вообще работает принцип «из двух объяснений выбирай более простое»? Ведь бритва Оккама претендует именно на универсальность — она не привязана к какой-то одной задаче.
Их ответ: строгая версия теоремы верна лишь тогда, когда все мыслимые задачи (включая бесструктурный шум) считаются равновероятными.
Но стоит принять в качестве предположения о мире саму идею простоты — формализованную как универсальное априорное распределение в духе индукции Соломонова, где более «сжимаемые», просто устроенные гипотезы заранее считаются более вероятными, — и парадокс снимается.
Авторы показали, что алгоритм, основанный на таком единственном предположении (простота предпочтительнее сложности), способен успешно работать на любых структурированных, то есть сжимаемых, задачах, не требуя под каждую из них отдельной, специально скроенной модели.
Иначе говоря, бритва Оккама — это не эвристика в обход No Free Lunch, а минимально необходимый «бесплатный ланч»: единственное предположение, которое стоит сделать, если вы заранее не знаете, какая перед вами задача, но подозреваете, что она не абсолютно случайна.
Именно это предположение — пусть и в неявном виде — зашито в устройство современных нейросетей.
🕊 — если вы тоже привыкли не усложнять
#как_устроено