← назад

HuggingModels — 24-05-2026

50 твитов за сутки. Аккаунт выпустил поток карточек Hugging Face моделей: Qwen3-деривативы, sentence embeddings, ranking, interpretability, creative generation и vision-language.

Qwen3 как база для разговорных моделей — сразу несколько релизов строятся вокруг Qwen3: shuoxing/qwen3-4b-thinking-full-pretrain-mix-mid-tweet-1m-en-sft, Qwen3-4B high-tweet pretrain, SFT-вариант high-tweet модели и Qwen3-VL-2B-Instruct для компактных multimodal-приложений.

Embedding и retrieval слой — классические модели остаются в центре production NLP: all-mpnet-base-v2 для semantic search, BAAI/bge-small-en-v1.5 как компактный embedding baseline, paraphrase-multilingual-MiniLM-L12-v2 для 50+ языков и cross-encoder/ms-marco-MiniLM-L6-v2 для reranking.

Архитектуры и interpretabilityNeuronSpark-V3-1.1B-Pretrain экспериментирует со spiking neural network подходом, ELECTRA напоминает о compute-efficient pretraining, а Llama 3.3 70B NLA позиционируется как модель для исследования internal activations.

Creative и chat моделиNightbloom v1g заточен под roleplay и SillyTavern, diffuser_layerdiffuse дает контроль освещения и теней в image generation, Niceai идет в real-time chat, а z-lab/gemma-4-31B-it-DFlash предлагает instruction-tuned 31B модель с фокусом на быстрый inference.

Источники

bert electra paraphrase-multilingual-minilm-l12-v2 baaibge-small-en-v15 nightbloom-v1g all-mpnet-base-v2 diffuser-layerdiffuse cross-encoderms-marco-minilm-l6-v2 niceai shuoxingqwen3-4b-thinking-full-pretrain-mix-high-tweet-1m-en-sft qwen3-vl-2b-instruct z-labgemma-4-31b-it-dflash qwen3-4b llama-33-70b-nla neuronspark-v3-11b-pretrain