Саша делает стартап


Channel's geo and language: Russia, Russian
Category: Blogs



Channel's geo and language
Russia, Russian
Category
Blogs
Statistics
Posts filter


Провела выходные в горах и отмечала свой день рождения с невероятной компанией! Вот тут видос в последнем посте, зацените вайб))
https://x.com/aimalysheva

Если хотите сделать мне на ДР небольшой подарок, ретвитните пост про ДР или оставьте там коммент 😊


Video is unavailable for watching
Show in Telegram
компании уже пару лет как файнтюнят модели под конкретные задачи, и вся эта работа становится ненужной при смене базовой модели: с каждым новым фронтир-релизом приходится либо оставаться на старой базовой модели, либо апгрейдиться и терять всё, что было пост-трейнено раньше

поэтому за рисерчем про трансляцию моделей между друг другом сейчас особенно интересно следить: например, vec2vec научились переводить эмбеддинги между моделями, которые никогда не обучались вместе (они делают это за счет общей геометрии, к которой сходятся эти пространства)

если этот рисечр обобщается, то эмбеддинги могут стать артефактом, который переживает смену базовых моделей


за последние годы инференс моделей очень подешевел: в конце 2022 модели уровня GPT-3.5 стоили $20 за миллион токенов, а к концу 2024 уже $0.07 (по данным Stanford's AI Index), то есть за два года разница 280x!

так что сейчас поставить пять моделей на один запрос стоит примерно как одна модель совсем недавно, что сильно повышает привлекательность ансамблей для решения сложных задач

поэтому я думаю что следующий bottleneck, который нужно решать — это то, что эти пять моделей могут говорить друг с другом только текстом: сейчас каждый handoff между моделями в ансамбле выглядит как одна модель, которая пишет предложения, и следующая, которая их читает и снова запускает на этом инференс

как минимум это медленно, но еще важнее то, что почти всё, что посчитала первая модель, не переживает этот перенос, вторая модель получает только результат и вся остальная посчитанная инфа теряется

1k 0 10 3 22

Video is unavailable for watching
Show in Telegram
весь computing stack раньше был монолитным и потом разделялся на части, как только для этого появлялся интерфейс

AI при этом всё ещё на mainframe-стадии, то есть одна гигантская модель

мне кажется это все еще не декомпозировалось потому что интерфейс между моделями сейчас это текст, а текст это последнее, что производит модель, то есть summary всего, что она посчитала
и поэтому при каждой передаче от одной модели к другой почти вся настоящая работа, которая через них прошла, просто выбрасывается 🥲

вот например релевантный рисерч: Cache-to-Cache (Fu et al, ICLR 2026, arxiv.org/abs/2510.03215) — они дали двум моделям передавать друг другу KV-cache без текста и получили выше accuracy при 2x скорости на тех же двух моделях, но пока весь этот research direction исключительно попарный (две конкретные модели, руками соединённые каждый раз заново)

общего интерфейса, на котором могли бы коммуницировать модели, пока не существует, но как только он появится, то вниз по стеку изменится ОЧЕНЬ многое: например, кто вообще сможет строить мощные системы, требования к inference, будет ли capability накапливаться от поколения к поколению или каждый раз пересобираться с нуля и кастомизироваться

собираюсь в ближайшую неделю выкладывать больше примеров что и как поменяется :) это первая часть


витамины и био-добавки на кухнях в офисах были бы куда лучше чем снек-бары, м? 👀

849 0 0 12 27

Video is unavailable for watching
Show in Telegram
и если мы думаем про кривые на манифолдах, то следующий вопрос, который сразу возникает это "какая у этих топологий манифолдов?"

понимание формы (дыры, петли, может ещё какие-то сохраняющиеся структуры) говорит очень много о том, какие вообще кривые на них возможны

релевантная статья: Persistent Topological Features in LLMs (arxiv.org/pdf/2410.11042), где авторы используют zigzag persistence из topological data analysis, чтобы отследить, как топологичсекие фичи эволюционируют по слоям модели (не слой за слоем по отдельности, а весь evolutionary путь целиком)


Video is unavailable for watching
Show in Telegram
я довольно сильно уверена, что существует какой-то universal language manifold (= поверхность, образованная meaning-векторами), который может даже примерно общий и для людей, и для LLMок

но мы не тренируем LLM явно репрезентировать этот manifold, мы скорее тренируем их его аппроксимировать и двигаться по нему, строя на нём кривые

и эти кривые, это reasoning в геометрических терминах, типа reasoning trace — это кривая на low-dimensional manifold, вложенном в очень high-dimensional пространство

Linear Representation Hypothesis (http://arxiv.org/pdf/2311.03658) немного касается этого, но интересно, есть ли более свежие работы, которые развивают идею manifold дальше?

было бы круто послушать мнение людей с опытом в differential geometry на этот счёт :)

@aimalysheva


AI уже прямо повсюду, конечно


многие продукты сегодня рассчитаны на AI pricing, который вероятно не будет таким же низким всегда

и у части стартапов вообще нет плана Б, если экономика поменяется

вот основное, что может помочь в таких случаях:
(1) opensource модели,
(2) модели поменьше и подешевле,
(3) более умный model routing

на практике это значит:
• начинать использовать OSS уже сейчас, даже если он похуже
• для простых задач использовать маленькие модели
• для сложных использовать constellation of models

@aimalysheva


researcher mode: off




сравнивала для себя STAR и PARLA как интервью-фреймворки, и PARLA мне нравится намного больше

STAR всегда ощущался как corporate ops чек-лист, потому что "опиши задачу, которую ты выполнил" отлично работает, если у компании стабильные процессы и чётко определённые роли

но вот "Learned" и "Applied" в PARLA еще дают проверить, развивается ли человек и переносит ли заработанные инсайты дальше, и это гораздо лучше подходит для agile и high-growth компаний


мы тренируем модели в изоляции, совсем не так, как учатся люди, а потом удивляемся, почему они не генерализируют знания так же хорошо, как мы

но люди учатся сравнивая ответы, видя reasoning друг друга прямо посреди процесса, а еще соревнуясь и адаптируясь, и этого всего нет в стандартном training run

так что может следующий качественный переход в тренировке моделей будет какая-то AI-версия "социального" обучения, типа обучения моделей вместе


три вещи, на которые я смотрю при найме:
1/ сильное чувство ownership (лучший предиктор из всех)
2/ реально закрывает skill gap в команде
3/ очень приятный в общении (самая недооцененная фича, особенно в маленьких командах)

если у человека есть все три — остальное обычно само выравнивается, но если хоть одного не хватает, то почти всегда потом будет больно


мой первый подкаст в роли фаундера! лайк/шер/репост, раз уж я теперь блогер 😄

вообще мне кажется что получилось правда интересно, так что если у вас есть 10 минут, то можно посмотреть на х2
если останутся вопросы, задавайте в комментах к посту, постараюсь ответить!

отдельно очень приятно быть рядом с нобелевским лауреатом на страничке ютуба))

https://www.youtube.com/watch?v=EzwCeqpl2mY

@aimalysheva


Video is unavailable for watching
Show in Telegram
было бы круто найти способ переводить векторизацию внутреннего представления между моделями, сохраняя при этом meaning

в теории это могло бы работать так: берём два распределения над representation manifolds (те пространства векторов, которые выучивают модели) и ищем transport map, который минимизирует discrepancy по какому-то feature family (переносим массу из семантической геометрии одной модели в другую, не теряя структуру, которая и делает это чем-то осмысленным)

это все звучит довольно theory-heavy, так что я скоро пошерю еще технические базовые объяснения для основы всего этого

если вдруг знаете тех, кто этим занимается, напишите пожалуйста в комментах или в личку ("этим" = optimal transport для representation alignment, cross-model semantic transfer, или любая другая связанная математика) 🙂

@aimalysheva


кайфовая карьера))


совет начинающим фаундерам: если что-то не так с кандидатом на этапе найма, то скорее всего, это не "просто вам показалось" — стоит довериться этому чувству и перед тем как коммититься устроить стресс-тест именно на тот аспект, который вызывает опасения

trial weeks существуют как раз для вайбчека :)


cable management явно не самая сильная моя сторона))


почему так мало нормальных продуктов, использующих приватные модели? должна же быть куча людей, которые хотели бы поделиться всем своим цифровым следом с AI-ассистентом, но которые не сделают это с ChatGPT или Claude

не очень понимаю почему этот рынок privacy-preserving продуктов до сих пор такой небольшой — спрос же очевидный, или я что-то упускаю?

20 last posts shown.