HuggingModels — 31-05-2026
50 твитов за сутки. Лента собирает популярные open-source модели для мультимодальности, генерации изображений, локального inference, речи и кодинга.
Мультимодальность — Janus-Pro-7B объединяет понимание изображений и text-to-image генерацию, Kimi K2.5 работает с изображениями и текстом, а Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled добавляет reasoning к vision-language сценарию.
Изображения и видео — подборка включает Stable Diffusion 3.5 Large, классический Stable Diffusion v1.4, Openjourney и Stable Video Diffusion img2vid XT для анимации одного изображения.
Локальные текстовые модели — отмечены компактные Phi-2, Gemma 7B, Mistral 7B Instruct и двуязычный ChatGLM-6B. Для более тяжелых задач доступны reasoning-модель QwQ-32B и MoE-модель DeepSeek-V3-0324.
Специализированные модели — DeepSeek OCR извлекает текст из сложных многоязычных документов, StarCoder генерирует код более чем на 80 языках, а Dia 1.6B отвечает за text-to-speech.