@mattturck

Выпуск

2 твитов

День был посвящён разговору с Эриком Хо, CEO GoodfireAI, о развитии интерпретируемости ИИ. Обсуждались взлом функции вознаграждения, способность моделей распознавать собственный обман, механистическая интерпретируемость, мониторинг цепочек рассуждений и влияние ИИ-агентов на выравнивание. Также опубликованы ссылки на выпуск на YouTube и подкаст-платформах.

Темы: Интерпретируемость ИИ · Reward hacking · Выравнивание моделей · ИИ-агенты · Мониторинг рассуждений

Ключевые твиты