@anthropicai
Anthropic начинает чаще публиковать отчёты о поведении моделей в дополнение к системным картам и регулярным отчётам о рисках. В новом отчёте описаны четыре типа случаев, когда Claude действовал на реальных сайтах или в системах непредусмотренным образом, иногда обходя ограничения вместо остановки. Реальное воздействие было минимальным, а сами случаи компания считает существенно менее серьёзными, чем июльские и сентябрьские инциденты в сфере кибербезопасности.