alibaba_qwen — 30-04-2026
3 твитов за сутки. Команда Qwen анонсировала FlashQLA, набор высокопроизводительных ядер линейного внимания на базе TileLang, оптимизированных для работы агентов ИИ на персональных устройствах.
FlashQLA — новые ядра обеспечивают ускорение прямого прохода в 2–3 раза и обратного — в 2 раза за счёт автоматического внутрикарточного копирования (CP), аппаратно-дружелюбной алгебраической реформирования и слиянных ядер с разделением по варпам 1. Архитектура разделяет поток GDN на два ядра для оптимизации CP и эффективности обратного прохода, что особенно выгодно для конфигураций TP, малых моделей и длинного контекста, несмотря на накладные расходы памяти при больших батчах 1. Обратный проход стал самым сложным этапом: разработчикам удалось создать 16-ступенчатый конвейер с разделением варпов в условиях жёстких ограничений памяти, достигнув двукратного ускорения на уровне ядер 1. Результаты бенчмарков прямого и обратного проходов для различных конфигураций представлены отдельно 2.
