Offline GRPO Reasoning Model
model: Модель с офлайн GRPO для улучшения математических рассуждений от Hugging Face.
Использует самообучение без онлайн-взаимодействия для повышения точности вывода. Оптимизирована для сложных задач, требующих логических шагов.
Источник: @HuggingModels, 09-05-2026