HuggingModels — 24-05-2026
50 твитов за сутки. Аккаунт выпустил поток карточек Hugging Face моделей: Qwen3-деривативы, sentence embeddings, ranking, interpretability, creative generation и vision-language.
Qwen3 как база для разговорных моделей — сразу несколько релизов строятся вокруг Qwen3: shuoxing/qwen3-4b-thinking-full-pretrain-mix-mid-tweet-1m-en-sft, Qwen3-4B high-tweet pretrain, SFT-вариант high-tweet модели и Qwen3-VL-2B-Instruct для компактных multimodal-приложений.
Embedding и retrieval слой — классические модели остаются в центре production NLP: all-mpnet-base-v2 для semantic search, BAAI/bge-small-en-v1.5 как компактный embedding baseline, paraphrase-multilingual-MiniLM-L12-v2 для 50+ языков и cross-encoder/ms-marco-MiniLM-L6-v2 для reranking.
Архитектуры и interpretability — NeuronSpark-V3-1.1B-Pretrain экспериментирует со spiking neural network подходом, ELECTRA напоминает о compute-efficient pretraining, а Llama 3.3 70B NLA позиционируется как модель для исследования internal activations.
Creative и chat модели — Nightbloom v1g заточен под roleplay и SillyTavern, diffuser_layerdiffuse дает контроль освещения и теней в image generation, Niceai идет в real-time chat, а z-lab/gemma-4-31B-it-DFlash предлагает instruction-tuned 31B модель с фокусом на быстрый inference.
Источники
- shuoxing/qwen3-4b-thinking-full-pretrain-mix-mid-tweet-1m-en-sft
- all-mpnet-base-v2
- NeuronSpark-V3-1.1B-Pretrain
- BAAI/bge-small-en-v1.5
- Qwen3-4B high-tweet pretrain
- paraphrase-multilingual-MiniLM-L12-v2
- Qwen3 high-tweet SFT
- ELECTRA
- Nightbloom v1g
- cross-encoder/ms-marco-MiniLM-L6-v2
- Llama 3.3 70B NLA
- BERT
- diffuser_layerdiffuse
- Niceai
- z-lab/gemma-4-31B-it-DFlash