
llama.cpp
CLI-инструмент от Georgi Gerganov для эффективного запуска LLM на CPU и GPU.
Позволяет запускать квантованные модели, включая Qwen3.5-397B-A17B, с использованием RPC и RDMA на кластерах DGX Sparks. Оптимизирован для высокой производительности и низкого потребления ресурсов без необходимости в мощных GPU.
Источник: @ggerganov, 28-04-2026