@trq212

Выпуск

2 твитов

Автор критикует современные бенчмарки: по его наблюдениям, провалы на eval'ах часто вызваны слишком строгими скрытыми тестами, а не реальными ошибками моделей — иногда ответ модели даже логичнее ожидаемого. Также анонсировал новый инструмент plugin evals для проверки работоспособности плагинов при выходе новых моделей через команду `claude plugin eval init`.

Темы: Проблемы бенчмарков · Plugin evals · Claude CLI · Качество eval-тестов

Ключевые твиты