Qwen3-4B-GRPO
Модель: компактная LLM от Alibaba с 4 млрд параметров, дообученная для улучшения логического мышления.
Использует метод GRPO для повышения точности рассуждений в узкоспециализированных задачах. Отлично подходит для развертывания на устройствах с ограниченными ресурсами без потери качества вывода.
Источник: @HuggingModels, 04-05-2026