
math-GRPO-Entropy-Qwen3-8B-Base
Модель: Qwen3 8B, дообученная для улучшения математического рассуждения.
Использует GRPO и энтропийную регуляризацию для повышения точности выводов. Подходит для задач, требующих строгой логики и сложных вычислений.
Источник: @HuggingModels, 02-05-2026