@anthropicai

Выпуск

3 твитов

Anthropic представила исследование: Claude может автономно улучшать alignment других AI-моделей. За 48 часов и с одним GPU он самостоятельно исследовал методы, обучал и тестировал малые модели — с неожиданно хорошими результатами. В качестве первого эксперимента Sonnet 5 провёл пост-тренировку более мощной модели (ранний чекпоинт Opus 4.8), достигнув показателей безопасности, близких к полноценно обученной продакшен-версии. Anthropic открыла свой сетап для автоматизированного alignment-исследования.

Темы: Автоматический alignment · Claude обучает другие модели · Открытый исследовательский сетап · Безопасность AI

Ключевые твиты