← назад

qwen-3b-grpo

Qwen 3B GRPO

Модель: Дообученная версия Qwen 2.5-3B-Instruct, оптимизированная методом GRPO для улучшения навыков рассуждения.

Модель демонстрирует значительный рост производительности в математике и логике по сравнению с базовой версией, оставаясь при этом компактной. Подходит для локального развертывания и задач, требующих точных выводов без использования крупных ресурсоемких моделей.

Источник: @HuggingModels, 10-05-2026