ggerganov — 05-04-2026
2 твита за сутки.
Prompt-based speculative decoding в llama.cpp — Георги Гергanov показал демо спекулятивного декодирования через ngram-хэширование. Метод предлагает черновики до 64 токенов, отслеживая ngram'ы в наблюдаемых контекстах. Наиболее эффективен для задач программирования. Твит
300 токенов/сек на Mac Studio M2 Ultra — демонстрация запуска Gemma 4 26B A4B Q8_0 с полным качеством. Используется встроенный WebUI llama.cpp, поддержка MCP из коробки (веб-поиск, HuggingFace, GitHub) и prompt speculative decoding. Железо — Mac Studio M2 Ultra 2023 года. Твит
PR с параметрами спекулятивного декодирования — ссылка на pull request в репозитории llama.cpp, где описаны параметры, применявшиеся в демо. Твит · PR llama.cpp #19164