atomic_chat_hq — 15-05-2026
2 твитов за сутки. Команда Atomic Chat представила оптимизацию LLaMA.cpp с поддержкой Multi-Token Prediction для модели Qwen 3.6, обеспечив значительный прирост скорости генерации текста на локальных устройствах.
Multi-Token Prediction (MTP) — разработчики внедрили поддержку MTP в LLaMA.cpp и квантовали модель Qwen 3.6 27B в формат GGUF с использованием TurboQuant, что позволило достичь 90% acceptance rate и ускорения на 40% при запуске на MacBook Pro M5 Max 64GB источник.
Сравнение производительности — бенчмарки показывают рост скорости генерации с 21 tokens/s до 34 tokens/s при использовании MTP на примере эссе об истории искусственного интеллекта, а также опубликованы ссылки на GGUF-модель, патченную версию LLaMA.cpp и Local AI Models Studio источник.