← назад

pro-step-policy-7b

PRO-STEP-Policy-7B

7B-модель от HuggingFace, дообученная для многошагового QA и агентного RAG с использованием процессных наград.

Архитектура оптимизирована для сложных рассуждений, где важны промежуточные шаги, а не только финальный ответ. Отлично подходит для задач, требующих прозрачности логики и работы с внешними источниками данных.

Источник: @HuggingModels, 04-05-2026