Интересный случай продажи кота в мешке под соусом новой нац.модели.
Открываем неделю с поста рубрики #ИИзнанка 😜
Да, да, знаю, что вышел Kimi3, читаю техрепорт, обзор будет позже. 📦
Вышла итоговая правка закона о развитии и поддержке суверенного ИИ.
Максимально похудевший, где возможно, от фрейминга закон, дал почву бодрым кобанчикам для спекуляции в открытом поле. Теперь все пытаются залезть в нишу моделей среднего размера и назваться гордым именем "национальной" всея 🎉. При этом цимис понятен, b2g рынок (и бюджеты) - это золотая жила, прикоснуться хотят многие, однако можно случайно пойти по пути автоваза.
Расскажу замечательную свежую историю о том, как не попасться на пустые инвестиции бодрым кабанчикам и что проверять, если вам предлагают "аналоговнет" за ХХмлн енотов.
Кейс.
Приходят к вам ребята с просьбой посмотреть на интересный проект и оценить потенциал инвестиций. Вы открываете презентацию и КП. А там: предлагаются новые модели, заявляется отличие от всех типовых transformers архитектур на рынке (llama, Qwen, Saiga, Vikhr и тп). При этом, заявляются размеры 9b, 35b, 122b; размер контекста более К млн токенов 🚬 Модели первой волны уже прошли К этапа обучения из М, но уже сопоставимы результаты с Claude 😜, но требуют дополнительных ХХ млн руб. (не млрд) инвестиций, чтобы показать всем кузькину мать и таки выйти на М этапов 💪.
История собирательный образ, несёт образовательный смысл и все совпадения случайны.
Итак, что вы должны сделать, чтобы провести фаст аудит:
1. Проверить размеры открытых популярных моделей на обнимашках. Тут мы видим, подозрительные совпадения с семейством Qwen 😐. А нам заявляют, что аналогов нет. Задумались.
Ладно может совпадение и перед вами генИИ отрасли. Тогда идём к П2.
2. Просим тех.документы/добавить в репо/ссылку на патент или статью, или иную доказательную базу, естественно, под расписку, а лучше под NDA договор. Также важно запросить состав команды и их mindset, будет странно, если ребята делали раньше условный рексис, а сегодня они сами уже запилили грамотно К этапов обучения LLM, да так успешно, что аж на уровне Claude моделей.
Не дают? Очень странное, ну может решают перестраховаться и мы идём к П3.
3. Допустим, вы понимаете, что модели аналоги Qwen, тогда в соответствии с scaling laws вы должны понимать сколько нужно пролить токенов данных, а значит шагов моделей на GPU, чтобы получить оптимальную сходимость для 9b,35b,122b. Те ваша модель на выходе будет адекватно работать. Отсюда же, вы можете посчитать сколько надо 💸 - это самое важное. Тут и спросите за бюджет, сколько gpu нужно, чтобы модель прошла все оставшиеся фазы и была prod ready, ну хотя бы MVP/PoC. Сколько токенов, gpu часов и тп.
И увы если ХХХ млн не вписываются в создание заявленного числа параметров модели, gpu и gpu часов, то...
В общем, получив такой чеклист, далее решать вам. 👍
Уже не говорю о том, что если внезапно это Qwen или аналоги, зачастую в открытом доступе уже лежат full обученные модели, прошедшие все этапы обучения, и сделать ещё сверху серьезный posttrain, расширить словарь и ничего при этом не сломать, требует компетенций и ресурсов. 😐
Удачи и stay tuned. 🦾
#ЖизаДня, #ИИнфоцыганство, #ДоверяйНоПроверяй
А какие вы кейсы видели на своём опыте? Пишите в комментариях.
👇👇👇
Открываем неделю с поста рубрики #ИИзнанка 😜
Да, да, знаю, что вышел Kimi3, читаю техрепорт, обзор будет позже. 📦
Вышла итоговая правка закона о развитии и поддержке суверенного ИИ.
Максимально похудевший, где возможно, от фрейминга закон, дал почву бодрым кобанчикам для спекуляции в открытом поле. Теперь все пытаются залезть в нишу моделей среднего размера и назваться гордым именем "национальной" всея 🎉. При этом цимис понятен, b2g рынок (и бюджеты) - это золотая жила, прикоснуться хотят многие, однако можно случайно пойти по пути автоваза.
Расскажу замечательную свежую историю о том, как не попасться на пустые инвестиции бодрым кабанчикам и что проверять, если вам предлагают "аналоговнет" за ХХмлн енотов.
Кейс.
Приходят к вам ребята с просьбой посмотреть на интересный проект и оценить потенциал инвестиций. Вы открываете презентацию и КП. А там: предлагаются новые модели, заявляется отличие от всех типовых transformers архитектур на рынке (llama, Qwen, Saiga, Vikhr и тп). При этом, заявляются размеры 9b, 35b, 122b; размер контекста более К млн токенов 🚬 Модели первой волны уже прошли К этапа обучения из М, но уже сопоставимы результаты с Claude 😜, но требуют дополнительных ХХ млн руб. (не млрд) инвестиций, чтобы показать всем кузькину мать и таки выйти на М этапов 💪.
История собирательный образ, несёт образовательный смысл и все совпадения случайны.
Итак, что вы должны сделать, чтобы провести фаст аудит:
1. Проверить размеры открытых популярных моделей на обнимашках. Тут мы видим, подозрительные совпадения с семейством Qwen 😐. А нам заявляют, что аналогов нет. Задумались.
Ладно может совпадение и перед вами генИИ отрасли. Тогда идём к П2.
2. Просим тех.документы/добавить в репо/ссылку на патент или статью, или иную доказательную базу, естественно, под расписку, а лучше под NDA договор. Также важно запросить состав команды и их mindset, будет странно, если ребята делали раньше условный рексис, а сегодня они сами уже запилили грамотно К этапов обучения LLM, да так успешно, что аж на уровне Claude моделей.
Не дают? Очень странное, ну может решают перестраховаться и мы идём к П3.
3. Допустим, вы понимаете, что модели аналоги Qwen, тогда в соответствии с scaling laws вы должны понимать сколько нужно пролить токенов данных, а значит шагов моделей на GPU, чтобы получить оптимальную сходимость для 9b,35b,122b. Те ваша модель на выходе будет адекватно работать. Отсюда же, вы можете посчитать сколько надо 💸 - это самое важное. Тут и спросите за бюджет, сколько gpu нужно, чтобы модель прошла все оставшиеся фазы и была prod ready, ну хотя бы MVP/PoC. Сколько токенов, gpu часов и тп.
И увы если ХХХ млн не вписываются в создание заявленного числа параметров модели, gpu и gpu часов, то...
В общем, получив такой чеклист, далее решать вам. 👍
Уже не говорю о том, что если внезапно это Qwen или аналоги, зачастую в открытом доступе уже лежат full обученные модели, прошедшие все этапы обучения, и сделать ещё сверху серьезный posttrain, расширить словарь и ничего при этом не сломать, требует компетенций и ресурсов. 😐
Удачи и stay tuned. 🦾
#ЖизаДня, #ИИнфоцыганство, #ДоверяйНоПроверяй
А какие вы кейсы видели на своём опыте? Пишите в комментариях.
👇👇👇