Появился новый стартап, который ставит себя в один ряд с SSI Суцкевера и работает над альтернативой чистому масштабированию.
Компания называется Q Labs и среди ранних инвесторов, главный по науке Google Джефф Дин, Эмметт Шир (экс-CEO Twitch), Y Combinator.
Их цель - построить практическую аппроксимацию индукции Соломонова для нейросетей.
Чем это интересно?
Индукция Соломонова - это теоретически доказанный оптимальный способ предсказания. Проблема — это невычислимо. Но как ориентир для того, к чему должен стремиться ИИ — это золотой стандарт.
Q Labs хотят аппроксимировать этот идеал 2 путями:
1. Поиск вместо градиентного спуска. SGD сходится к одному минимуму и не исследует альтернативы. Q Labs используют эволюционный поиск в пространстве активаций нейросети, а затем загружают найденные представления через обычный градиентный спуск. Первая статья показала результаты в пределах 1% от стандартного обучения, при этом модели находят принципиально другие решения.
2. Compression-based prior. Приор Соломонова говорит - простые модели обобщают лучше. Q Labs обещают использовать меры на основе сжатия для отбора среди найденных моделей. Эту часть пока не показали.
И вот тут интересный контекст - параллельно над аппроксимацией Соломонова работает команда Маркуса Хаттера в Google DeepMind (автор AIXI, Hutter Prize). Его группа уже опубликовала серию работ — формализовали связь сжатия и обобщения для нейросетей (ICLR 2023), показали эквивалентность предсказания и сжатия для LLM (ICLR 2024), обучили трансформеры на данных от универсальных машин Тьюринга (ICML 2024).
Но есть принципиальное различие в подходах:
- DeepMind меняет данные, оставляя алгоритм стандартным.
- Q Labs меняет сам алгоритм, оставляя данные обычными.
DeepMind аппроксимирует приор Соломонова, Q Labs — его поиск. Полная аппроксимация требует обоих компонентов.
Пока Q Labs - proof of concept на маленьких архитектурах. Но сам факт, что Джефф Дин инвестирует в стартап, решающий проблему с другой стороны - сигнал того, что индустрия всерьёз смотрит на альтернативы чистому масштабированию.
Компания называется Q Labs и среди ранних инвесторов, главный по науке Google Джефф Дин, Эмметт Шир (экс-CEO Twitch), Y Combinator.
Их цель - построить практическую аппроксимацию индукции Соломонова для нейросетей.
Чем это интересно?
Индукция Соломонова - это теоретически доказанный оптимальный способ предсказания. Проблема — это невычислимо. Но как ориентир для того, к чему должен стремиться ИИ — это золотой стандарт.
Q Labs хотят аппроксимировать этот идеал 2 путями:
1. Поиск вместо градиентного спуска. SGD сходится к одному минимуму и не исследует альтернативы. Q Labs используют эволюционный поиск в пространстве активаций нейросети, а затем загружают найденные представления через обычный градиентный спуск. Первая статья показала результаты в пределах 1% от стандартного обучения, при этом модели находят принципиально другие решения.
2. Compression-based prior. Приор Соломонова говорит - простые модели обобщают лучше. Q Labs обещают использовать меры на основе сжатия для отбора среди найденных моделей. Эту часть пока не показали.
И вот тут интересный контекст - параллельно над аппроксимацией Соломонова работает команда Маркуса Хаттера в Google DeepMind (автор AIXI, Hutter Prize). Его группа уже опубликовала серию работ — формализовали связь сжатия и обобщения для нейросетей (ICLR 2023), показали эквивалентность предсказания и сжатия для LLM (ICLR 2024), обучили трансформеры на данных от универсальных машин Тьюринга (ICML 2024).
Но есть принципиальное различие в подходах:
- DeepMind меняет данные, оставляя алгоритм стандартным.
- Q Labs меняет сам алгоритм, оставляя данные обычными.
DeepMind аппроксимирует приор Соломонова, Q Labs — его поиск. Полная аппроксимация требует обоих компонентов.
Пока Q Labs - proof of concept на маленьких архитектурах. Но сам факт, что Джефф Дин инвестирует в стартап, решающий проблему с другой стороны - сигнал того, что индустрия всерьёз смотрит на альтернативы чистому масштабированию.