Luce Megakernel Высокопроизводительный CUDA-кернел для LLM-инференса. На RTX 3090 (220W) достигает 413 tok/s decode и 1.87 tok/J для Qwen 3. Ключевые возможности 413 tok/s decode на RTX 3090 Энергоэффективность 1.87 tok/J Оптимизация для Qwen 3 Ссылки GitHub Источник Твит