PRO-STEP-Policy-7B
7B-модель от HuggingFace, дообученная для многошагового QA и агентного RAG с использованием процессных наград.
Архитектура оптимизирована для сложных рассуждений, где важны промежуточные шаги, а не только финальный ответ. Отлично подходит для задач, требующих прозрачности логики и работы с внешними источниками данных.
Источник: @HuggingModels, 04-05-2026