← назад

atomicbot_ai — 08-05-2026

1 твитов за сутки. Команда atomicbot_ai представила оптимизацию локального запуска моделей через технологию Multi-Token Prediction.

Оптимизация LLaMA.cpp — разработчики внесли патчи в LLaMA.cpp, что позволило ускорить запуск локальной модели Gemma4 в 1.5 раза.

Результаты тестов — после квантования ассистентных моделей Gemma в формат GGUF и запуска на MacBook Pro M5Max модель Gemma 26B со draft tokens показала прирост скорости на 40%.

Источники