@ggerganov
@ggerganov показал команды запуска Qwen3.8-27B-GGUF через llama serve со speculative decoding типа draft-mtp. Отдельно привёл конфигурацию для DGX Spark с квантованными вариантами модели, reasoning-preserve и agent-режимом.
@ggerganov показал команды запуска Qwen3.8-27B-GGUF через llama serve со speculative decoding типа draft-mtp. Отдельно привёл конфигурацию для DGX Spark с квантованными вариантами модели, reasoning-preserve и agent-режимом.