Qwen 3B GRPO
Модель: Дообученная версия Qwen 2.5-3B-Instruct, оптимизированная методом GRPO для улучшения навыков рассуждения.
Модель демонстрирует значительный рост производительности в математике и логике по сравнению с базовой версией, оставаясь при этом компактной. Подходит для локального развертывания и задач, требующих точных выводов без использования крупных ресурсоемких моделей.
Источник: @HuggingModels, 10-05-2026