atomic_chat_hq — 08-05-2026
2 твитов за сутки. Atomic Chat представили патч для LLaMA.cpp с поддержкой Multi-Token Prediction, который ускоряет локальные модели Gemma 4.
Multi-Token Prediction — команда внедрила MTP в LLaMA.cpp, что позволило запустить локальную модель Gemma4 на 1.5x быстрее; на MacBook Pro M5Max квантованные модели Gemma 26B с черновыми токенами MTP работают на 40% быстрее источник.
Производительность — бенчмарки показывают рост скорости генерации с 97 до 138 токенов в секунду при написании кода на Python; доступны квантованные GGUF-модели, приложение для локальных AI-моделей и исходный код патча источник.