← назад

alexalbert__ — 09-05-2026

2 твитов за сутки. Модель Claude Mythos Preview демонстрирует выдающиеся результаты в задачах на длительность контекста и эффективность в кибербезопасности.

Длительность контекста — ранний снапшот модели показал временной горизонт более чем в 2 раза превышающий лучший результат среди конкурентов на бенчмарке METR, где 80% задач выполняются успешно оценка METR. При этом оценочный показатель 50%-time-horizon составил не менее 16 часов (95% CI от 8.5 до 55 часов) на тестовом наборе задач анонс METR.

Кибербезопасность — тестирования от Palo Alto Networks показали, что три недели анализа с помощью модели Mythos сопоставимы по объёму и широте покрытия с целым годом ручного пентестинга результаты Palo Alto Networks.

Источники

claude-mythos