@ggerganov

Выпуск

3 твитов

@ggerganov показал команды запуска Qwen3.8-27B-GGUF через llama serve со speculative decoding типа draft-mtp. Отдельно привёл конфигурацию для DGX Spark с квантованными вариантами модели, reasoning-preserve и agent-режимом.

Темы: llama serve · Qwen3.8-27B · draft-mtp · DGX Spark · квантизация

Ключевые твиты