← назад

qwen3-4b-grpo

Qwen3-4B-GRPO

Модель: компактная LLM от Alibaba с 4 млрд параметров, дообученная для улучшения логического мышления.

Использует метод GRPO для повышения точности рассуждений в узкоспециализированных задачах. Отлично подходит для развертывания на устройствах с ограниченными ресурсами без потери качества вывода.

Источник: @HuggingModels, 04-05-2026