
TurboQuant GPU
Сжатие KV-кэша для LLM-инференса с коэффициентом 5.02x. Позволяет запускать модели с длинным контекстом на ограниченной GPU-памяти без значительной потери качества.
Ключевые возможности
- Коэффициент сжатия KV-кэша 5.02x
- CUDA-ускорение
- Совместимость с популярными LLM