@mattturck

Выпуск

2 твитов

Мэтт Тёрк обсуждает прорыв Astra на бенчмарке ARC-AGI-3: тест, специально созданный для противостояния парадигме масштабирования LLM, был полностью «насыщен» (solved) системой Astra с её нативным harness. Напомнил, что в 2024 году o1 набирал лишь 18% на оригинальном ARC-AGI, а на более сложном ARC-AGI-3 фронтирные модели показывали 0.5%. Также дал ссылку на выпуск подкаста, где это обсуждается подробнее.

Темы: ARC-AGI-3 прорыв · Astra AI · бенчмарки рассуждений · масштабирование LLM

Ключевые твиты