atomic_chat_hq — 21-05-2026
3 твитов за сутки. Команда Atomic Chat анонсировала значительное ускорение генерации текста за счёт оптимизации MTP и бесплатную раздачу доступа к новой модели от Google.
MTP speedup Qwen by 2.5x in Atomic Chat — внедрение механизма Multi-Token Prediction позволило ускорить работу моделей на 2x RTX 5090: для Dense Qwen3.6 27B прирост составил +137% (с 51 до 117 tps), а для MoE Qwen3.6 35B-A3B — +25% (с 218 до 267 tps). Оптимизация работает за счёт предварительного черновика токенов и их проверки за один проход, что критично для Dense-моделей, читающих все параметры, тогда как MoE уже имеет преимущество за счёт меньшего объёма перемещаемых данных. Решение обеспечивает ~80% принятия черновиков без потери точности, требуя всего ~1 GB дополнительного VRAM.
Open-source code and local AI app — исходный код оптимизации и сам локальный AI-приложение доступны для публичного использования.
free for 24hrs via our API — в честь релиза Gemini 3.5 Flash разработчики Atomic Chat предоставили бесплатный доступ к модели через свой API на 24 часа, опубликовав инструкции по настройке.