anthropicai — 08-05-2026
8 твитов за сутки. Anthropic передала инструмент Petri в управление Meridian Labs, анонсировала программу вознаграждений за уязвимости и представила новые исследования по интерпретируемости и повестке института.
Petri — компания передала свой open-source инструмент для выравнивания @meridianlabs_ai, чтобы его разработка продолжалась независимо, одновременно выпустив крупное обновление, улучшающее адаптивность и реалистичность тестов о передаче Petri.
Безопасность — программа bug bounty теперь публично доступна на HackerOne, позволяя любому исследователю сообщать об уязвимостях и получать вознаграждение за вклад в безопасность продуктов анонс программы.
Natural Language Autoencoders — новое исследование показывает, как обучить Claude переводить внутренние числовые активации в читаемый человеческий язык, делая «мысли» модели понятными описание метода.
Доступ к NLAs — для поддержки исследователей NLAs интегрированы в Neuronpedia, где теперь можно попробовать их на открытых моделях попробовать NLAs.
The Anthropic Institute (TAI) — опубликована исследовательская повестка института, сфокусированная на четырех направлениях: экономическая диффузия, угрозы и устойчивость, ИИ-системы в дикой природе и ИИ-управляемые НИОКР повестка TAI.
AI-driven R&D — в рамках повестки TAI обсуждается вопрос самоусовершенствования ИИ: @jackclarkSF оценивает вероятность рекурсивного самосовершенствования к концу 2028 года в 60%, что требует новых методов человеческого контроля обсуждение самоусовершенствования.
Anthropic Fellow — открыт набор на четырехмесячную стипендиальную программу для исследователей, желающих работать над вопросами TAI под менторством экспертов подать заявку.