Guess-Verify-Refine
Библиотека от NVIDIA Research для оптимизации инференса LLM в TensorRT на архитектуре Blackwell.
Реализует алгоритм разреженного внимания, ускоряющий генерацию текста за счет сокращения вычислений. Инструмент ориентирован на разработчиков, работающих с высокопроизводительными LLM-сервисами.
Источник: @NVIDIAAI, 08-05-2026