← назад

atomic_chat_hq — 15-05-2026

2 твитов за сутки. Команда Atomic Chat представила оптимизацию LLaMA.cpp с поддержкой Multi-Token Prediction для модели Qwen 3.6, обеспечив значительный прирост скорости генерации текста на локальных устройствах.

Multi-Token Prediction (MTP) — разработчики внедрили поддержку MTP в LLaMA.cpp и квантовали модель Qwen 3.6 27B в формат GGUF с использованием TurboQuant, что позволило достичь 90% acceptance rate и ускорения на 40% при запуске на MacBook Pro M5 Max 64GB источник.

Сравнение производительности — бенчмарки показывают рост скорости генерации с 21 tokens/s до 34 tokens/s при использовании MTP на примере эссе об истории искусственного интеллекта, а также опубликованы ссылки на GGUF-модель, патченную версию LLaMA.cpp и Local AI Models Studio источник.

Источники