Minimax Sparse Attention
Библиотека от MiniMax, внедряющая новый механизм внимания на основе GQA и блочного выбора.
Метод оптимизирует вычисления за счет группировки запросов и фильтрации ключей на уровне блоков, что снижает нагрузку при сохранении качества. Подходит для ускорения инференса больших языковых моделей без значительной потери точности.
Источник: @MiniMax_AI, 27-05-2026