Qwen2 GRPO Model
Модель для генерации текста на базе Qwen2, обученная методом GRPO для улучшения диалоговых задач.
Использует Reinforcement Learning from AI Feedback для повышения качества ответов в чат-сценариях. Отличается оптимизацией под интерактивное взаимодействие и стабильность генерации.
Источник: @HuggingModels, 15-05-2026