ProgramBench
Библиотека от Meta FAIR для оценки способности моделей писать код с нуля.
Бенчмарк фокусируется на генерации программного обеспечения без использования готовых шаблонов, проверяя способность ИИ создавать решения с чистого листа. Инструмент полезен для разработчиков и исследователей, стремящихся объективно измерить реальные навыки кодинда больших языковых моделей.
Источник: @aakashgupta, 07-05-2026