@atomic_chat_hq

Выпуск

2 твитов

Аккаунт представил бенчмарк технологии DFlash2, которая ускоряет инференс модели Qwen3.8 27B до 4 раз на одной RTX 6000. Сравнили четыре режима (baseline, MTP, DFlash, DFlash2): DFlash2 показал 140.6 tok/s против 47.4 tok/s у baseline с 56% acceptance rate. Объяснили ключевое отличие DFlash2 — анализ предыдущего и текущего токенов, генерация 16 кандидатов и их ранжирование. Также продвигали свой продукт Atomic Chat для локального запуска AI.

Темы: Ускорение инференса LLM · DFlash2 бенчмарк · Qwen3.8 27B · Локальный запуск AI

Ключевые твиты