@realmadhuguru

Выпуск

1 твитов

Аккаунт продолжает серию о построении качественных эвалов (часть 8). В этом выпуске обсуждается дискриминирующее свойство эвалов — способность различать AI-системы, которые реально отличаются по качеству. Подчёркивается, что слишком лёгкие или слишком сложные тесты одинаково бесполезны: нужно находить «золотую середину», при которой eval действительно разделяет системы разного уровня.

Темы: Дизайн эвалов · Дискриминирующая способность тестов · Оценка AI-систем

Ключевые твиты