← назад

deepswe

DeepSWE

Новый бенчмарк для оценки агентов, пишущих код, от @steipete.

Демонстрирует реальные различия между моделями, выходя за рамки синтетических задач. Позволяет объективно сравнивать эффективность AI-инструментов на сложных сценариях.

Источник: @steipete, 27-05-2026