@ornith_

Выпуск

3 твитов

Аккаунт Ornith посвятил день разбору механизма multi-token prediction (MTP) в своих моделях Ornith 1.5. MTP обеспечивает ускорение инференса без потери качества за счёт self-speculative decoding: модель использует собственную MTP-голову для генерации и верификации токенов за один forward pass. Обновлены MTP-веса для всех моделей 9B, 35B и 397B в форматах BF16, GGUF, FP8 и NVFP4.

Темы: Multi-token prediction · Ускорение инференса · Speculative decoding · Обновление весов моделей

Ключевые твиты