← назад

minimax-sparse-attention

Minimax Sparse Attention

Библиотека от MiniMax, внедряющая новый механизм внимания на основе GQA и блочного выбора.

Метод оптимизирует вычисления за счет группировки запросов и фильтрации ключей на уровне блоков, что снижает нагрузку при сохранении качества. Подходит для ускорения инференса больших языковых моделей без значительной потери точности.

Источник: @MiniMax_AI, 27-05-2026