@realmadhuguru
Madhu Guru продолжает серию постов о построении качественных evals (оценок) для AI-систем. В 9-й части рассматривает проблему "дорожной карты eval": команды относятся к оценкам как к статичным артефактам, тогда как пользовательские сценарии неизбежно эволюционируют — от простых запросов к сложным многошаговым задачам. Также опубликовал сводный указатель всех 9 частей серии.