← назад

offline-grpo-reasoning-model

Offline GRPO Reasoning Model

model: Модель с офлайн GRPO для улучшения математических рассуждений от Hugging Face.

Использует самообучение без онлайн-взаимодействия для повышения точности вывода. Оптимизирована для сложных задач, требующих логических шагов.

Источник: @HuggingModels, 09-05-2026