Коллеги!
Развивая тему бенчмаркинга и измерения скорости прогресса.
У любых оценок есть bias и очень важно хорошо его понимать. В частности 400 раз за 6 лет у Карпаты получаются в том числе и потому, что обучение GPT-2 (в том числе с его подачи) стало забавным соревновательным видом спорта (достаточно посмотреть статистику пул-реквестов у него в репозитории).
Хорошо! Посмотрим оценки более современных моделей! NVIDIA в свое время опубликовала такие оценки затрат на тренировку GPT-4 MoE 1.8T (первая картинка):
* Затраты на тренировку модели, если делать ее на условных P100 в 2016 году — $210 миллиардов, на B100 в 2024 — $0,4 миллиарда. Уменьшение трат в 525 раз за 8 лет (2,18 раза в год). ☝️💪
* Прямые затраты на электричество при тренировке на условных P100 в 2016 году — $140 миллионов, на B100 в 2024 — $0,54 миллиона. Уменьшение трат в 260 раз за 8 лет (~2 раза в год). ☝️💪
Интересно, что сама карта выросла в цене с $5K до $37,5K (в 7,5 раз), но затраты электроэнергии на генерацию одного токена GPT в инференсе упали в чудовищные 42500 раз (!!!) за 8 лет —следствие программной и аппаратной оптимизаций, причем во многом потому, что под трансформеры в 2016 еще никто чипы не оптимизировал (они, на секундочку, только в 2017 появились). В табличке выше эта статистика подробнее, а на сайте The Next Platform в статье с роадмапом NVIDIA до 2027 года еще подробнее. 😲😲😲
Ключевым конкурентом NVIDIA в США является, видимо, Google с его TPU, 7 версию которого анонсировали недавно. Сложность с их линейкой в том, что Google их не продает (ибо тут же нарушит массу патентов), а сдает в аренду через облако. Поэтому часть характеристик Google TPU неизвестны, например, приходится догадываться (в том числе по количеству транзисторов на чипе и энергопотреблению чипа), что последний v7 (Ironwood) будет изготовлен по технологии 3 nm, а предыдущий v6e, выпущенный в 4 квартале прошлого года производится по технологии 4 nm.
Так вот. Если TPU v2 (2017, первый, который предложили в аренду в облаке) нес на борту 16 Gb оперативки с интерфейсом 700 Gb/sec, то v7 (2025) будет с 192 Gb на борту и интерфейсом 7372 Gb/sec (рост обеих характеристик более чем на порядок и они догнали NVIDIA по сути!). При этом рост пиковой производительности в BF16 планируется в 50 раз, а количество чипов, которые можно будет объединить в единую сеть (One Pod) вырастет с 256 до 9216.
Google уже обещают, что по пиковой мощности один Pod будет в 24 раза превышать сданный в эксплуатацию всего полгода суперкомпьютер №1 в США El Capitan (нижняя картинка).
В общем, наблюдаем необычную ситуацию: Google готовится создать самый мощный суперкомпьютер на своем собственном железе! 😲 Им точно будет на чем обучать новые модели! 😉
Но важнее для нас (вторая картинка) что цена за терафлоп FP16 у TPU v4 (2021) по сравнению с TPU v7 (2025) упадет с $227 до $21. Это 1.9 раза в год. ☝️💪
Резюмируя:
* Даже если прогресс в алгоритмах внезапно остановится, то только за счет улучшения железа мы с большой вероятностью будем наблюдать снижение стоимости вычислений примерно в 2 раза в год. Это 10+ раз за 4 года и 100+ раз за 8 лет. 🙂
* Деликатно напомню, что Ян Лекун (вице-президент запрещенной компании по ИИ) считает, что генеративные модели (вершина хайпа сегодня), завтра потеряют популярность ровно из-за своей склонности к галлюцинациям и будут заменены на более эффективные. А Андрей Карпаты (сооснователь OpenAI) довольно справедливо замечает, что текущий тренд, это обучение сети работы с тулами (поиск, питон, калькулятор и далее по списку), что непросто, но кардинально повышает их точность и надежность. Это огромные резервы алгоритмической эффективности.
* DeepSeek Moment (по аналогии с советским Sputnik moment) для американских компаний был в том, что китайцы умудрились оптимизировать LLM под железо лучше американских компаний, что вызвало рост инвестиций в ИИ в феврале-марте этого года на решение текущих и будущих проблем.
Следующие 8 лет обещают быть крайне интересны! 😁
#speed_of_progress
Развивая тему бенчмаркинга и измерения скорости прогресса.
У любых оценок есть bias и очень важно хорошо его понимать. В частности 400 раз за 6 лет у Карпаты получаются в том числе и потому, что обучение GPT-2 (в том числе с его подачи) стало забавным соревновательным видом спорта (достаточно посмотреть статистику пул-реквестов у него в репозитории).
Хорошо! Посмотрим оценки более современных моделей! NVIDIA в свое время опубликовала такие оценки затрат на тренировку GPT-4 MoE 1.8T (первая картинка):
* Затраты на тренировку модели, если делать ее на условных P100 в 2016 году — $210 миллиардов, на B100 в 2024 — $0,4 миллиарда. Уменьшение трат в 525 раз за 8 лет (2,18 раза в год). ☝️💪
* Прямые затраты на электричество при тренировке на условных P100 в 2016 году — $140 миллионов, на B100 в 2024 — $0,54 миллиона. Уменьшение трат в 260 раз за 8 лет (~2 раза в год). ☝️💪
Интересно, что сама карта выросла в цене с $5K до $37,5K (в 7,5 раз), но затраты электроэнергии на генерацию одного токена GPT в инференсе упали в чудовищные 42500 раз (!!!) за 8 лет —следствие программной и аппаратной оптимизаций, причем во многом потому, что под трансформеры в 2016 еще никто чипы не оптимизировал (они, на секундочку, только в 2017 появились). В табличке выше эта статистика подробнее, а на сайте The Next Platform в статье с роадмапом NVIDIA до 2027 года еще подробнее. 😲😲😲
Ключевым конкурентом NVIDIA в США является, видимо, Google с его TPU, 7 версию которого анонсировали недавно. Сложность с их линейкой в том, что Google их не продает (ибо тут же нарушит массу патентов), а сдает в аренду через облако. Поэтому часть характеристик Google TPU неизвестны, например, приходится догадываться (в том числе по количеству транзисторов на чипе и энергопотреблению чипа), что последний v7 (Ironwood) будет изготовлен по технологии 3 nm, а предыдущий v6e, выпущенный в 4 квартале прошлого года производится по технологии 4 nm.
Так вот. Если TPU v2 (2017, первый, который предложили в аренду в облаке) нес на борту 16 Gb оперативки с интерфейсом 700 Gb/sec, то v7 (2025) будет с 192 Gb на борту и интерфейсом 7372 Gb/sec (рост обеих характеристик более чем на порядок и они догнали NVIDIA по сути!). При этом рост пиковой производительности в BF16 планируется в 50 раз, а количество чипов, которые можно будет объединить в единую сеть (One Pod) вырастет с 256 до 9216.
Google уже обещают, что по пиковой мощности один Pod будет в 24 раза превышать сданный в эксплуатацию всего полгода суперкомпьютер №1 в США El Capitan (нижняя картинка).
В общем, наблюдаем необычную ситуацию: Google готовится создать самый мощный суперкомпьютер на своем собственном железе! 😲 Им точно будет на чем обучать новые модели! 😉
Но важнее для нас (вторая картинка) что цена за терафлоп FP16 у TPU v4 (2021) по сравнению с TPU v7 (2025) упадет с $227 до $21. Это 1.9 раза в год. ☝️💪
Резюмируя:
* Даже если прогресс в алгоритмах внезапно остановится, то только за счет улучшения железа мы с большой вероятностью будем наблюдать снижение стоимости вычислений примерно в 2 раза в год. Это 10+ раз за 4 года и 100+ раз за 8 лет. 🙂
* Деликатно напомню, что Ян Лекун (вице-президент запрещенной компании по ИИ) считает, что генеративные модели (вершина хайпа сегодня), завтра потеряют популярность ровно из-за своей склонности к галлюцинациям и будут заменены на более эффективные. А Андрей Карпаты (сооснователь OpenAI) довольно справедливо замечает, что текущий тренд, это обучение сети работы с тулами (поиск, питон, калькулятор и далее по списку), что непросто, но кардинально повышает их точность и надежность. Это огромные резервы алгоритмической эффективности.
* DeepSeek Moment (по аналогии с советским Sputnik moment) для американских компаний был в том, что китайцы умудрились оптимизировать LLM под железо лучше американских компаний, что вызвало рост инвестиций в ИИ в феврале-марте этого года на решение текущих и будущих проблем.
Следующие 8 лет обещают быть крайне интересны! 😁
#speed_of_progress