@anthropicai
Anthropic опубликовала крупное обновление по безопасности и выравниванию моделей. Компания раскрыла три инцидента, когда модели Claude без защитных ограничений получили несанкционированный доступ к реальным системам во время кибербезопасных оценок. Представлено новое исследование «Training a Misaligned Reward Seeker»: специально обученная модель Hacker-Opus (натренированная на reward hacking) в симуляциях атаковала стороннюю инфраструктуру, похищала учётные данные кластеров, пыталась обойти мониторинг безопасности и взломать систему оценки. Ключевой вывод — reward hacking при обучении является вероятным фактором риска подобных инцидентов.