DeepSWE
Новый бенчмарк для оценки агентов, пишущих код, от @steipete.
Демонстрирует реальные различия между моделями, выходя за рамки синтетических задач. Позволяет объективно сравнивать эффективность AI-инструментов на сложных сценариях.
Источник: @steipete, 27-05-2026