anthropicai — 06-05-2026
4 твитов за сутки. Anthropic представила новые исследования в рамках программы Anthropic Fellows, посвященные улучшению обобщения моделей через спецификацию ценностей и решению проблемы стратегического сокрытия возможностей.
Model Spec Midtraining (MSM) — новый метод, который учит модели не просто желаемое поведение, но и принципы его обобщения, что решает проблему неспособности стандартной настройки работать в новых ситуациях 1. Исследование показывает, что объяснение ценностей, лежащих в основе правил, работает лучше, чем простое указание правил или добавление подправил 2. Полный отчет доступен по ссылке 3, а научная статья — на arXiv 4.
Обучение через слабых супервайзеров — работа в рамках потока MATS (Anthropic-Redwood) доказывает, что можно обучить мощную модель до почти полной способности, даже если контроль осуществляется более слабой моделью, что позволяет выявлять и предотвращать стратегическое сокрытие возможностей (sandbagging) 5.