Главная новость прошлой недели: DeepSeek R1 — новейшая рассуждающая LLM от китайской лаборатории Fire-Flyer — побила OpenAI на ее же поле. Круги еще расходятся, все переживают за фондовый рынок и упавшие акции Nvidia, а мы с вами давайте подумаем о технологических причинах и последствиях успеха китайских коллег.
Итак, какие особенности DeepSeek R1 обеспечили ей такой прорыв?
✅ Качество ответов модели сопоставимо с последними версиями ChatGPT и аналогов, а в некоторых бенчмарках превосходит их.
✅ При этом разработка DeepSeek R1 обошлась в сумму менее $6 миллионов, что значительно ниже затрат конкурентов. Для обучения модели использовалось около 2 тыс. графических процессоров Nvidia, что также существенно меньше по сравнению с другими компаниями. Более того, это были старые и дешевые чипы H800, а не новые и специализированные, как до сих пор было принято.
✅ Хотя количество параметров в модели DeepSeek R1 может достигать 671 млрд, эта LLM требует значительно меньше вычислительных мощностей и людских ресурсов для обучения. Ее можно запускать на обычных компьютерах, а не строить огромные дорогие дата-центры. Да и компьютеров для развертывания нужно гораздо меньше.
✅ Модель имеет открытый исходный код, т. е. любой разработчик может взять ее, доработать и адаптировать под свои нужды.
✅ Наконец, распространение «младших» версий DeepSeek полностью бесплатно, а «старшие» и API для разработчиков предлагаются по сути за символическую цену.
Что всё это означает для развития технологий?
1️⃣ Закрепляется общий тренд на удешевление разработки и эксплутации ИИ, о чем мы уже писали. Инференс высокоразвитых LLM-моделей и раньше постепенно дешевел. Теперь будет дешеветь быстрее. Начавшему было надуваться новому «сверхпузырю» на рынке IT не дали надуться, и это хорошо!
2️⃣ Резко снижаются требования к оборудованию. Во-первых, теперь ясно, что даже для модели с 670 млрд параметров не нужно покупать сверхсовременные и супердорогие графические чипы. Во-вторых, DeepSeek преддагает и сокращенные версии своей LLM с числом параметров от 1,5 до 70 млрд, подходящие для более скромных потребностей и слабых систем. Например, модель 7B может работать на GPU с объемом видеопамяти 6 ГБ или на CPU с объемом оперативной памяти около 4 ГБ для формата GGML/GGUF.
3️⃣ Остальным лидерам придется подстраиваться. Nvidia также рассматривает варианты с использованием небольших мощностей. Теперь этот процесс еще ускорится, к нему подключатся другие производители. OpenAI уже начала снижать стоимость подписки на ChatGPT.
👍 Это отличные новости для индустрии. ИИ становится доступнее. Раньше лишь мегакорпорации могли позволить себе заниматься разработкой рассуждающих LLM, поскольку для этого требовались сотни тысяч самых современных видеокарт, инфраструктура на миллиарды долларов и сверхвысокооплачиваемые спецы. Теперь появилась возможность для создания различных foundation models — базовых моделей использования, в рамках которых даже небольшие компании или госструктуры могут разрабатывать и обучать собственные LLM.
👉 В этом и заключается настоящий технологический (а не рыночный или PR) прорыв DeepSeek. Меняется парадигма развития. Если каждый может создать свой ИИ под конкретные задачи, то открываются очень интересные перспективы роботизации в тех сферах и отраслях, где раньше она казалась слишком сложной или слишком дорогой.
🚀 Подписывайтесь на ТехноТренды — самый экспертный канал об AI, IT и роботизации!
Итак, какие особенности DeepSeek R1 обеспечили ей такой прорыв?
✅ Качество ответов модели сопоставимо с последними версиями ChatGPT и аналогов, а в некоторых бенчмарках превосходит их.
✅ При этом разработка DeepSeek R1 обошлась в сумму менее $6 миллионов, что значительно ниже затрат конкурентов. Для обучения модели использовалось около 2 тыс. графических процессоров Nvidia, что также существенно меньше по сравнению с другими компаниями. Более того, это были старые и дешевые чипы H800, а не новые и специализированные, как до сих пор было принято.
✅ Хотя количество параметров в модели DeepSeek R1 может достигать 671 млрд, эта LLM требует значительно меньше вычислительных мощностей и людских ресурсов для обучения. Ее можно запускать на обычных компьютерах, а не строить огромные дорогие дата-центры. Да и компьютеров для развертывания нужно гораздо меньше.
✅ Модель имеет открытый исходный код, т. е. любой разработчик может взять ее, доработать и адаптировать под свои нужды.
✅ Наконец, распространение «младших» версий DeepSeek полностью бесплатно, а «старшие» и API для разработчиков предлагаются по сути за символическую цену.
Что всё это означает для развития технологий?
1️⃣ Закрепляется общий тренд на удешевление разработки и эксплутации ИИ, о чем мы уже писали. Инференс высокоразвитых LLM-моделей и раньше постепенно дешевел. Теперь будет дешеветь быстрее. Начавшему было надуваться новому «сверхпузырю» на рынке IT не дали надуться, и это хорошо!
2️⃣ Резко снижаются требования к оборудованию. Во-первых, теперь ясно, что даже для модели с 670 млрд параметров не нужно покупать сверхсовременные и супердорогие графические чипы. Во-вторых, DeepSeek преддагает и сокращенные версии своей LLM с числом параметров от 1,5 до 70 млрд, подходящие для более скромных потребностей и слабых систем. Например, модель 7B может работать на GPU с объемом видеопамяти 6 ГБ или на CPU с объемом оперативной памяти около 4 ГБ для формата GGML/GGUF.
3️⃣ Остальным лидерам придется подстраиваться. Nvidia также рассматривает варианты с использованием небольших мощностей. Теперь этот процесс еще ускорится, к нему подключатся другие производители. OpenAI уже начала снижать стоимость подписки на ChatGPT.
👍 Это отличные новости для индустрии. ИИ становится доступнее. Раньше лишь мегакорпорации могли позволить себе заниматься разработкой рассуждающих LLM, поскольку для этого требовались сотни тысяч самых современных видеокарт, инфраструктура на миллиарды долларов и сверхвысокооплачиваемые спецы. Теперь появилась возможность для создания различных foundation models — базовых моделей использования, в рамках которых даже небольшие компании или госструктуры могут разрабатывать и обучать собственные LLM.
👉 В этом и заключается настоящий технологический (а не рыночный или PR) прорыв DeepSeek. Меняется парадигма развития. Если каждый может создать свой ИИ под конкретные задачи, то открываются очень интересные перспективы роботизации в тех сферах и отраслях, где раньше она казалась слишком сложной или слишком дорогой.
🚀 Подписывайтесь на ТехноТренды — самый экспертный канал об AI, IT и роботизации!