Привет! На этой неделе, 1 августа, в Москве будет проходить конференция Back to Back. Я с коллегой в 16:30-19:00 буду проводить воркшоп «Реализация CUDA-расширения для PyTorch: ускоряем работу LLM». Кто будет на конференции присоединяйтесь, участие бесплатное но надо зарегистрироваться, на офлайн часть это можно сделать до конца завтрашнего дня. На воркшопе участники на практике познакомятся созданием расширения для популярного фреймворка PyTorch использующего CUDA ядра. В качестве примера мы запустим локальную LLM и измерим её производительность в реальном тесте. Начнём с краткой теории GPU, узнаем немного про работу LLM и познакомимся с инфраструктурой PyTorch для создания расширений на С++ и связыванием их с Python API. После чего реализуем оптимизации для работы модели как расширение для PyTorch. Участники: - напишут CUDA-ядра для функции активации GeLU - познакомятся с реализацией матричного умножения для GPU - реализуют расширение для PyTorch на С++ с интегрированными CUDA ядрами - используют созданное расширение в реализации LLM модели GPT2 написанной на Python API В конце сравним производительность базовой и оптимизированной версии модели посчитав количество токенов в секунду. Требования: уверенное владение C++, CMake и понимание Python.