@mattturck
День был посвящён разговору с Эриком Хо, CEO GoodfireAI, о развитии интерпретируемости ИИ. Обсуждались взлом функции вознаграждения, способность моделей распознавать собственный обман, механистическая интерпретируемость, мониторинг цепочек рассуждений и влияние ИИ-агентов на выравнивание. Также опубликованы ссылки на выпуск на YouTube и подкаст-платформах.