steipete — 28-05-2026
2 твитов за сутки. Сравнение моделей для кодинга и автоматизация ревью через агентов.
DeepSWE vs SWE-Bench — бенчмарк DeepSWE показывает, что GPT-5.5 решает задачи на 70%, в то время как Claude Sonnet лишь на 32%. Это отражает реальный опыт разработки, где важно уметь найти нужный код по поведенческому промпту, в отличие от SWE-Bench, страдающего от загрязнения датасетов.
autoreview — навык для agent-skills, который автоматически проверяет код перед мёржем PR. Он находит множество граничных случаев, но иногда выполнение занимает несколько часов.