@realmadhuguru
Аккаунт продолжает серию о построении качественных эвалов (часть 8). В этом выпуске обсуждается дискриминирующее свойство эвалов — способность различать AI-системы, которые реально отличаются по качеству. Подчёркивается, что слишком лёгкие или слишком сложные тесты одинаково бесполезны: нужно находить «золотую середину», при которой eval действительно разделяет системы разного уровня.