На этой неделе Microsoft и Nvidia объявили, что обучили 1 из крупнейших и эффективных языковых моделей искусственного интеллекта(ИИ) на сегодняшний день - Megatron-Turing Natural Language Generation (MT-NLP).
MT-NLP содержит 530 миллиардов параметров, извлеченных из исторических данных и обеспечивают высокую точность в широком наборе задач, включая понимание прочитанного и выводы на естественном языке.
Обучение обошлось недёшево - процесс проходил на 560 серверах Nvidia DGX A100, каждый из которых содержал 8 графических процессоров Nvidia A100 80 ГБ. Их стоимость оценивается в миллионы долларов.
Как и другие большие языковые модели, MT-NLP поднимает вопросы о доступности передовых исследовательских подходов в машинном обучении. Затраты на обучение ИИ снизились в 100 раз с 2017 по 2019г., но общая сумма по-прежнему превышает бюджеты большинства стартапов, государств, некоммерческих организаций и тд.
Неравенство благоприятствует корпорациям и мировым сверхдержавам с исключительным доступом к ресурсам за счет более мелких игроков, укрепляя существующие преимущества.
Например, в начале октября исследователи Alibaba детализировали M6-10T - языковую модель, содержащую 10 триллионов параметров (примерно в 57 раз больше, чем GPT-3 OpenAI), обученную на 512 графических процессорах Nvidia V100 в течение 10 дней. Самый дешевый V100, доступный через Google Cloud Platform, стоит $2,28/час.
DeepMind потратила $35 млн на обучение системы китайской настольной игры Го. И когда исследователи компании разработали модель для игры в StarCraft II, они целенаправленно не использовали несколько способов создания ключевого компонента, потому что стоимость обучения была бы слишком высокой.
Точно так же OpenAI не исправила ошибку при создании GPT-3, потому что стоимость обучения сделала бы переобучение модели невозможным.
Важно отметить, что затраты на обучение могут быть завышены не только из-за технических аспектов алгоритма, но и из-за других факторов. Недавно Йоав Шохам, профессор Стэнфордского университета и сооснователь стартапа AI21 Labs, сказал, что личные и организационные факторы часто влияют на окончательную цену модели.
Тем не менее, рост стоимости обучения и хранения таких алгоритмов, как PanGu-Alpha от Huawei, HyperCLOVA от Naver и Wu Dao 2.0 Пекинской академии искусственного интеллекта, порождает целую индустрию стартапов, стремящихся оптимизировать модели без снижения точности.
На этой неделе бывший исполнительный директор Intel Навин Рао основал новую компанию MosaicML, которая предлагает услуги и методы обучения, которые повышают точность системы ИИ, одновременно, снижая затраты и экономя время. MosaicML привлек $37млн венчурного капитала, конкурирует с Codeplay Software, OctoML, Neural Magic, Deci, CoCoPie и NeuReality на рынке, который, как ожидается, будет расти экспоненциально в ближайшие годы.
Стоимость базовых операций машинного обучения за последние несколько лет снизилась. Опрос OpenAI 2020 года показал, что с 2012 года объем вычислений, необходимых для обучения модели той же производительности при классификации изображений в популярном тесте ImageNet, уменьшается в два раза каждые 16 месяцев.
Исследование Университета Массачусетса в Амхерсте показало, что с использованием подходов 2019г. обучение модели распознавания изображений с коэффициентом ошибок 5% будет стоить $100 млрд и производить столько же выбросов углерода, сколько Нью-Йорк за месяц.
Недавно издание Spectrum отлично сформулировали тренд, который нас ждёт: «Мы должны адаптировать методы глубокого обучения или столкнёмся с медленным прогрессом в будущем».
MT-NLP содержит 530 миллиардов параметров, извлеченных из исторических данных и обеспечивают высокую точность в широком наборе задач, включая понимание прочитанного и выводы на естественном языке.
Обучение обошлось недёшево - процесс проходил на 560 серверах Nvidia DGX A100, каждый из которых содержал 8 графических процессоров Nvidia A100 80 ГБ. Их стоимость оценивается в миллионы долларов.
Как и другие большие языковые модели, MT-NLP поднимает вопросы о доступности передовых исследовательских подходов в машинном обучении. Затраты на обучение ИИ снизились в 100 раз с 2017 по 2019г., но общая сумма по-прежнему превышает бюджеты большинства стартапов, государств, некоммерческих организаций и тд.
Неравенство благоприятствует корпорациям и мировым сверхдержавам с исключительным доступом к ресурсам за счет более мелких игроков, укрепляя существующие преимущества.
Например, в начале октября исследователи Alibaba детализировали M6-10T - языковую модель, содержащую 10 триллионов параметров (примерно в 57 раз больше, чем GPT-3 OpenAI), обученную на 512 графических процессорах Nvidia V100 в течение 10 дней. Самый дешевый V100, доступный через Google Cloud Platform, стоит $2,28/час.
DeepMind потратила $35 млн на обучение системы китайской настольной игры Го. И когда исследователи компании разработали модель для игры в StarCraft II, они целенаправленно не использовали несколько способов создания ключевого компонента, потому что стоимость обучения была бы слишком высокой.
Точно так же OpenAI не исправила ошибку при создании GPT-3, потому что стоимость обучения сделала бы переобучение модели невозможным.
Важно отметить, что затраты на обучение могут быть завышены не только из-за технических аспектов алгоритма, но и из-за других факторов. Недавно Йоав Шохам, профессор Стэнфордского университета и сооснователь стартапа AI21 Labs, сказал, что личные и организационные факторы часто влияют на окончательную цену модели.
Тем не менее, рост стоимости обучения и хранения таких алгоритмов, как PanGu-Alpha от Huawei, HyperCLOVA от Naver и Wu Dao 2.0 Пекинской академии искусственного интеллекта, порождает целую индустрию стартапов, стремящихся оптимизировать модели без снижения точности.
На этой неделе бывший исполнительный директор Intel Навин Рао основал новую компанию MosaicML, которая предлагает услуги и методы обучения, которые повышают точность системы ИИ, одновременно, снижая затраты и экономя время. MosaicML привлек $37млн венчурного капитала, конкурирует с Codeplay Software, OctoML, Neural Magic, Deci, CoCoPie и NeuReality на рынке, который, как ожидается, будет расти экспоненциально в ближайшие годы.
Стоимость базовых операций машинного обучения за последние несколько лет снизилась. Опрос OpenAI 2020 года показал, что с 2012 года объем вычислений, необходимых для обучения модели той же производительности при классификации изображений в популярном тесте ImageNet, уменьшается в два раза каждые 16 месяцев.
Исследование Университета Массачусетса в Амхерсте показало, что с использованием подходов 2019г. обучение модели распознавания изображений с коэффициентом ошибок 5% будет стоить $100 млрд и производить столько же выбросов углерода, сколько Нью-Йорк за месяц.
Недавно издание Spectrum отлично сформулировали тренд, который нас ждёт: «Мы должны адаптировать методы глубокого обучения или столкнёмся с медленным прогрессом в будущем».