Аналогия с калькулятором и художником
MLP — это как калькулятор: у него есть одна кнопка «×», и он жмёт её миллиард раз в секунду. Грубо, но невероятно быстро, и все современные компьютеры заточены именно под это.
KAN — как художник, который для каждой связи рисует свою уникальную кривую вручную, с нуля. Даже если в итоге его рисунок точнее передаёт форму, сам процесс рисования (запомнить форму кривой, провести её через нужные точки) требует куда больше труда, чем просто «умножить на число».
И ещё один нюанс: точная теорема — только для 2 слоёв
Строгая теорема Колмогорова-Арнольда доказана только для сети с фиксированной, небольшой глубиной (по сути 2 слоя) и с теми самыми «дикими» функциями, которые на практике использовать нельзя — их невозможно нормально выучить или запомнить.
Поэтому реальные KAN-сети идут на компромисс: берут гладкие сплайны вместо диких функций и складывают несколько слоёв друг на друга, чтобы приблизить (а не точно воспроизвести) нужную зависимость. То есть на практике KAN тоже приближает, а не вычисляет «точную формулу» — просто приближает не грубыми одинаковыми кубиками, а гибкими кривыми. А гибкость всегда стоит дороже жёсткости — что в жизни, что в вычислениях.
MLP — это как калькулятор: у него есть одна кнопка «×», и он жмёт её миллиард раз в секунду. Грубо, но невероятно быстро, и все современные компьютеры заточены именно под это.
KAN — как художник, который для каждой связи рисует свою уникальную кривую вручную, с нуля. Даже если в итоге его рисунок точнее передаёт форму, сам процесс рисования (запомнить форму кривой, провести её через нужные точки) требует куда больше труда, чем просто «умножить на число».
И ещё один нюанс: точная теорема — только для 2 слоёв
Строгая теорема Колмогорова-Арнольда доказана только для сети с фиксированной, небольшой глубиной (по сути 2 слоя) и с теми самыми «дикими» функциями, которые на практике использовать нельзя — их невозможно нормально выучить или запомнить.
Поэтому реальные KAN-сети идут на компромисс: берут гладкие сплайны вместо диких функций и складывают несколько слоёв друг на друга, чтобы приблизить (а не точно воспроизвести) нужную зависимость. То есть на практике KAN тоже приближает, а не вычисляет «точную формулу» — просто приближает не грубыми одинаковыми кубиками, а гибкими кривыми. А гибкость всегда стоит дороже жёсткости — что в жизни, что в вычислениях.