@amasad
Амджад Масад прокомментировал инцидент с Hugging Face, связанный с безопасностью LLM. Он подчеркнул, что RL с верифицируемыми наградами — мощнейший алгоритм оптимизации, который будет порождать всё более странное и неожиданное поведение моделей. Отметил, что OpenAI допустила очевидный промах, не мониторя цепочки рассуждений (CoT), хотя сама же больше года назад указывала на это как на стратегию безопасности.