TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
📈 ТехноТренды: Технологии, Тренды, IT

29 Aug 2024, 17:03

Открыть в Telegram Поделиться Пожаловаться

ТехноТренд: Революция в инференсе LLM - от облаков к чипам

Последние годы стали свидетелями стремительного прогресса в сфере инференса больших языковых моделей (LLM). Давайте рассмотрим ключевые тенденции и новинки в этой области.

Недавно компания FuriosaAI представила свой новый ускоритель искусственного интеллекта RNGD, который обещает высокую производительность при инференсе LLM. По заявлениям компании, одна карта RNGD способна обрабатывать 2000-3000 токенов в секунду для моделей с примерно 10 миллиардами параметров. Это впечатляющий результат, особенно учитывая энергоэффективность устройства - TDP всего 150 Вт по сравнению с 1000+ Вт у ведущих GPU.

Еще одним интересным игроком на рынке стала компания Cerebras Systems со своим гигантским чипом Wafer Scale Engine. Они заявляют о возможности обработки до 1800 токенов в секунду для 8-миллиардной модели LLaMA 3.1, что значительно превышает показатели современных GPU. Ключевое преимущество их подхода - размещение всей модели непосредственно на чипе, что устраняет узкие места, связанные с передачей данных.

Нельзя не упомянуть и компанию Groq, которая недавно анонсировала впечатляющие результаты инференса - до 500 токенов в секунду на своем LPU Inference Engine.

Если сравнивать с облачными LLM решениями, то:

- OpenAI сообщает о производительности около 300 токенов/сек для GPT-4o
- Google достигает примерно 280 токенов/сек на TPU v4
- Microsoft Azure показывает около 260 токенов/сек

Что касается GPU NVIDIA, то различные бенчмарки сообщают:
- H100 обеспечивает до 300 токенов/сек
- A100 показывает около 150 токенов/сек


Интересно отметить динамику развития инференса за последние годы:

- В 2022 году типичная производительность составляла 100-200 токенов/сек
- К середине 2023 года она выросла до 300-500 токенов/сек
- Сейчас, в 2024 году, мы видим показатели в 1000+ токенов/сек у передовых решений

Выводы по технотрендам инференса LLM:

1. Специализированные аппаратные решения, оптимизированные под LLM
2. Увеличение объема on-chip памяти для хранения моделей
3. Новые архитектуры, минимизирующие перемещения данных
4. Оптимизация моделей для более эффективного инференса
5. Распределенные системы инференса для масштабирования производительности

В целом, мы наблюдаем захватывающую гонку за повышение эффективности инференса LLM. Это открывает новые возможности для применения ИИ в реальном времени и делает технологии все более доступными. Будущее за теми, кто сможет обеспечить максимальную производительность при минимальных затратах энергии и ресурсов.

@technologies_trends
FuriosaAI Unveils RNGD, A Leading AI Inference Chip
/PRNewswire/ -- FuriosaAI, an emerging leader in the AI semiconductor space, today announced the unveiling of RNGD (pronounced "Renegade"), a leading AI...

53 0 0
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot