steipete — 20-04-2026
1 твитов за сутки. Автор тестирует инфраструктуру для локального запуска LLM на GPU через OpenClaw, сравнивая подходы к управлению моделями и форматам весов.
Управление моделями в OpenClaw — внедряется UX для переключения моделей в канале через команду /model vllm/gemma-e4b, при этом контроллер автоматически загружает модель в память или возвращает ошибку нехватки ресурсов, что позволяет запускать до 5 параллельных генераций на текущем железе с использованием unquantized safetensors источник.
Сравнение инструментов и форматов — планируется бенчмаркинг llama-swap, LM Studio и Ollama для улучшения выбора моделей; для тестирования выбран bf16 ggml-org/gemma-4-E4B-it-GGUF, так как квантование не имеет смысла, если железо способно держать несколько параллельных сессий в неоптимизированном виде источник.
Планы по публикации — результаты тестов и vibe reports будут опубликованы совместно с @mervenoyann в конце недели источник.