dropattention-models
Модели трансформеров с эффективным отсечением слоев внимания для снижения потребления памяти и вычислений.
Инструмент позволяет оптимизировать работу больших языковых моделей за счет динамического исключения лишних слоев внимания. Это снижает затраты ресурсов без существенной потери качества генерации. Подходит для развертывания в условиях ограниченных вычислительных мощностей.
Источник: @HuggingModels, 09-05-2026