NVIDIA включила метод Ozaki Scheme II в CUDA Toolkit 13.4
NVIDIA добавила в CUDA Toolkit 13.4 алгоритм Ozaki Scheme II, разработанный профессором Кацухиса Одзаки из Технологического университета Сибаура. Об этом университет объявил в сентябре 2026 года.
Метод решает задачу, актуальную для научных вычислений: современные GPU несут мощные низкоточные блоки, заточенные под ИИ, — и простаивают при классических задачах, требующих двойной точности (64-битной). Ozaki Scheme II математически комбинирует несколько операций низкой точности так, чтобы итоговый результат соответствовал стандарту двойной точности, но выполнялся значительно быстрее.
Дополнительных аппаратных изменений метод не требует и работает на любых GPU начиная с архитектуры Ampere.
Ozaki Scheme II — не первый алгоритм этой серии в CUDA: предыдущий, Ozaki Scheme I, попал в платформу ещё в 2025 году. Новый метод построен на иных математических принципах. Согласно документации NVIDIA, если Ozaki Scheme II быстрее первого варианта, система выбирает его автоматически.
Для GPU B200 метод обеспечивает до 175 ТФЛОПС при вещественном перемножении матриц двойной точности (DGEMM) и до 295 ТФЛОПС при комплексном (ZGEMM). Для следующего поколения GPU на архитектуре Rubin показатели составляют до 212 ТФЛОПС и до 301 ТФЛОПС соответственно.
Источник: EE Times Japan (🇯🇵)
#NVIDIA #CUDAToolkit #GPU #вычисления
NVIDIA добавила в CUDA Toolkit 13.4 алгоритм Ozaki Scheme II, разработанный профессором Кацухиса Одзаки из Технологического университета Сибаура. Об этом университет объявил в сентябре 2026 года.
Метод решает задачу, актуальную для научных вычислений: современные GPU несут мощные низкоточные блоки, заточенные под ИИ, — и простаивают при классических задачах, требующих двойной точности (64-битной). Ozaki Scheme II математически комбинирует несколько операций низкой точности так, чтобы итоговый результат соответствовал стандарту двойной точности, но выполнялся значительно быстрее.
Дополнительных аппаратных изменений метод не требует и работает на любых GPU начиная с архитектуры Ampere.
Ozaki Scheme II — не первый алгоритм этой серии в CUDA: предыдущий, Ozaki Scheme I, попал в платформу ещё в 2025 году. Новый метод построен на иных математических принципах. Согласно документации NVIDIA, если Ozaki Scheme II быстрее первого варианта, система выбирает его автоматически.
Для GPU B200 метод обеспечивает до 175 ТФЛОПС при вещественном перемножении матриц двойной точности (DGEMM) и до 295 ТФЛОПС при комплексном (ZGEMM). Для следующего поколения GPU на архитектуре Rubin показатели составляют до 212 ТФЛОПС и до 301 ТФЛОПС соответственно.
Источник: EE Times Japan (🇯🇵)
#NVIDIA #CUDAToolkit #GPU #вычисления