Model Spec Midtraining
Метод обучения от Anthropic, улучшающий обобщение поведения моделей через явную спецификацию правил и ценностей.
Подход позволяет тонкой настройке лучше усваивать сложные этические и поведенческие рамки, снижая риск нежелательных отклонений. Отличается от стандартного RLHF фокусом на структурном задании «закона» модели на этапе промежуточного обучения.
Источник: @anthropicai, 06-05-2026