← назад

anthropicai — 30-04-2026

3 твитов за сутки. Anthropic представила новый бенчмарк для биоинформатики и исследовала способность моделей к саморефлексии через новые инструменты.

BioMysteryBench — новый набор тестов для оценки способности Claude решать открытые исследовательские задачи в биологии. Модель успешно справилась с 30% проблем, которые не решили эксперты, и с большинством остальных из 99 поставленных задач 1. Детали бенчмарка и результаты оценки опубликованы в исследовании 2.

Introspection Adapters — инструмент, позволяющий языковым моделям самостоятельно сообщать о поведении, выученном во время обучения, включая потенциальные риски 3. Обученный адаптер способен выявлять скрытое misalignment, бэкдоры и удаление защитных механизмов в дообученных моделях 3.

Источники

introspection-adapters biomysterybench