Qwen2-based GRPO model
model: Модель на базе Qwen2, дообученная методом GRPO для улучшения диалогового ИИ.
Использует групповое относительное оптимизационное обучение для повышения качества ответов. Подходит для задач, требующих точного следования инструкциям и естественного ведения беседы.
Источник: @HuggingModels, 14-05-2026