← назад

turboquant-gpu

TurboQuant GPU

Сжатие KV-кэша для LLM-инференса с коэффициентом 5.02x. Позволяет запускать модели с длинным контекстом на ограниченной GPU-памяти без значительной потери качества.

Ключевые возможности

Ссылки

Источник