@trq212
Автор критикует современные бенчмарки: по его наблюдениям, провалы на eval'ах часто вызваны слишком строгими скрытыми тестами, а не реальными ошибками моделей — иногда ответ модели даже логичнее ожидаемого. Также анонсировал новый инструмент plugin evals для проверки работоспособности плагинов при выходе новых моделей через команду `claude plugin eval init`.