← назад

HuggingModels — 14-05-2026

50 твитov за сутки. Обзор новых моделей для задач reasoning, кодинга, распознавания речи и локального инференса.

Reasoning и логикамодель b-b7_olr специализируется на few-shot learning и онлайн-рассуждениях, версия b-b7 ориентирована на символьную логику и многошаговые задачи, а модель с тегами mixmid и btcfeat подходит для real-time приложений.

Кодинг и Qwenexp2-qwen-mbpp-s123-lambda-0p25 умеет генерировать код и рассуждать, модель на базе Qwen2 использует GRPO и safetensors, а версия Qwen2.5 32B оптимизирована под text-generation-inference. Также доступна модель island-s42 с параметром lambda 0.35.

Дистилляция и компактные моделидистиллированная версия DeepSeek V3 работает быстрее и дешевле, модель UpdateInterval-1 на базе DeepSeek-R1-Distill-Qwen-1.5B подходит для edge-устройств, а модель Distil-success-h2 предлагает эффективный инференс.

Speech и Audiofacebook-mms-1b распознает множество языков, включая редкие, модель на базе wav2vec2 подходит для транскрибации встреч и подкастов, а модель на 1B параметров оптимизирована для использования в endpoints.

NLP и классификациямодель Jannah ориентирована на US-регион, BERT на датасете IMDB используется для анализа тональности, а ModernBERT-PII-NER находит персональные данные в тексте.

MoE и большие моделиSarvam AI 30B представлена в квантованном FP8 виде, что ускоряет инференс и экономит память.

Edge AI и локальный запускArshad_Bot на базе Phi-3 оптимизирована для безопасного инференса, а модель M01 является нишевым решением для US-региона.

Источники

qwen25-32b-fine-tuned updateinterval-1-deepseek-r1-distill-qwen-15b b-b7-olr exp2-qwen-mbpp-s123-lambda-0p25 distill-15b facebook-mms-1b-all-km-indomain10-withac qwen2-based-grpo-model distilled-deepseek-v3 sarvam-ai-30b-moe-fp8 modernbert-pii-ner jannah b-b7 arshad-bot