huggingface — 30-05-2026
9 твитов за сутки. В фокусе дня: запуск официального сайта для llama.cpp, оптимизация локального инференса через флаги llama.cpp, миграция CI на HuggingFace Jobs и разбор критических ошибок в обучении агентов.
llama.cpp — проект получил официальный сайт llama.app, где доступен кроссплатформенный установщик в одну строку. Новый унифицированный интерфейс llama позволяет запускать и обслуживать модели, а также интегрироваться с агентами (например, Pi), сохраняя совместимость с существующими GGUF моделями из кэша HuggingFace.
Локальный инференс — демонстрация показывает, что использование флага -ncmoe 15 в llama.cpp позволяет увеличить скорость генерации Qwen3.6 35B на GPU 4070 12GB с 21 до 70 токенов в секунду по сравнению с Ollama, устраняя разрыв в производительности без изменения модели HuggingFace.
HuggingFace Jobs — автор твита заменил стандартные GitHub CI runners на HuggingFace Jobs, что позволило запускать воркфлоу на более надежных CPU или serverless GPU со стоимостью менее цента за запуск, повышая надежность и снижая затраты HuggingFace.
Обучение агентов — в мульти-тирн RL-обучении агентов часто возникает скрытая ошибка: повторная токенизация ответа модели для следующего шага приводит к рассинхронизации градиентов. Решение — правило "Token-In, Token-Out", запрещающее перекодирование уже декодированных токенов, что предотвращает падение loss и ошибки согласования размеров HuggingFace.
Hardware и модели — анонсирована модель Step-3.7-Flash-GGUF от Stepfun AI, доступная для локального использования. Также отмечен робот Reachy Mini, цены на который повышаются, но сейчас доступна скидка в $100 HuggingFace.
Образование и инфраструктура — опубликован гайд по профилированию GPU/TPU kernel development, предлагающий начинать с профилирования базовых операций (GEMM) для понимания артефактов. Параллельно отмечается, что 50% моделей на HuggingFace являются приватными, что позволяет компаниям эффективно строить AI внутри организаций с использованием Buckets (аналог S3) HuggingFace.
Сообщество — пользователь Noah McLaughlin создал модель Noah-McLaughlin-7B, оформленную по аналогии с карточками моделей, демонстрируя креативный подход к представлению данных HuggingFace.
Источники
- llama.cpp получает официальный сайт и единый CLI
- Оптимизация llama.cpp: 70 tok/s против 21 tok/s у Ollama
- Миграция CI на HuggingFace Jobs для экономии и надежности
- Ошибка перекодирования токенов в мульти-тирн RL
- Скидка на Reachy Mini и анонс Step-3.7-Flash-GGUF
- Гайд по профилированию GPU kernel development
- 50% моделей на HuggingFace приватные
- Креативная карточка модели Noah-McLaughlin-7B
- Доступ к Step-3.7-Flash-GGUF
- Официальный сайт llama.app
- Профиль Noah-McLaughlin-7B