Yuchenj_UW — 24-04-2026
6 твитов за сутки. Автор анализирует прорывы в эффективности обучения LLM, новые возможности памяти для агентов и подчеркивает фундаментальную важность претрейнинга.
DeepSeek V4 — модель выпущена под MIT лицензией с архитектурой MoE (1.6T параметров, 49B активных) и демонстрирует производительность на уровне Opus-4.6 Max / GPT-5.4 xHigh. Успех достигается за счет новых архитектур внимания, позволяющих обучать мощные модели на ограниченных ресурсах, включая урезанные NVIDIA GPU и чипы Huawei, что вдохновляет на появление сильных американских open-source альтернатив 1.
Memory on Claude Managed Agents — функция памяти для агентов Claude перешла в публичную бету, предлагая слой памяти, оптимизированный по интеллекту для баланса между производительностью и гибкостью 2. Это решение призвано исправить распространенную проблему, когда современные агенты плохо справляются с сохранением контекста, сводя «память» лишь к обращению по имени 2.
Pretraining vs RL — примеры Spud и Mythos служат напоминанием о том, что претрейнинг остается критически важным этапом, тогда как RL (Reinforcement Learning) выступает лишь дополнительным улучшением («вишенкой на торте») 3.
Юмор и инструменты — шутка о том, что OpenAI поручили починить Wi-Fi через Claude в качестве инженера на дежурстве, пока они готовили запуск Spud 4. Также упоминается приложение, которое автор намерен никогда не удалять 5.