Полный текст
Flash Attention 2 на Triton: кросс-платформенность и поддержка Turing+Механизм внимания — ахиллесова пята трансформеров по памяти и скорости. Концепция Flash Attention (Tri Dao) изящна, но существующие реализации часто игнорируют «старое» железо или Windows, оставляя пользователей Colab и Kaggle без оптимизации.Представлено решение этой проблемы: первая опенсорсная реализация на Triton, работающая везде — от Linux до Windows, от Turing до Blackwell. Внутри — поддержка гетерогенных кластеров, опциональный детерминизм и ручная кастомизация ядер под специфику GPU.Декомпозируем архитектуру библиотеки и методы оптимизации.