HuggingModels — 13-05-2026
50 твитов за сутки. Аккаунт снова выкатил плотный поток Hugging Face-чекпойнтов: небольшие языковые модели, OCR, TTS, RL/world-modeling и специализированные мультимодальные модели.
Видео и мультимодальность — Canine Video Generation Model подается как image-to-video pipeline для генерации коротких анимаций из статичных изображений, с акцентом на temporal coherence и нишевые motion-сценарии 1. Для японских документов вышел Qwen3.5 OCR JP 2B: компактная vision-language модель, которая извлекает японский текст из изображений и превращает его в структурированные данные 2.
Безопасность, alignment и text generation — Qwen 3B SafeBPO Flip Mu1.1 C40 описан как safety-tuned Qwen-модель с flip-механизмом для снижения вредных ответов без сильного роста false positives 3. Отдельно отмечены SmolLM2-360M-Khasi-CPT для языка Khasi 4, ретро-чатбот talkie-1930-13b-it-GGUF 5 и Qwen-based региональная модель shaybot-qwen-native 6.
RL, world models и специализированное обучение — eschaton-familiar-brain-v1 описан как reinforcement-learning модель на deep Q network для последовательных решений и адаптивных агентов 7. В той же линии идут helenant/simple_pointgoal2_worldmodel для простых point-goal world models 8, safetensors-модель b-b7_olr_ts10_base_sym5_2025_lossq_mixmid_ms100k для узких задач вроде time-series forecasting 9, и вариант с обучением на ошибочных направлениях для повышения надежности 10.
Речь и жесты — Yoruba VITS добавляет text-to-speech для йоруба и закрывает еще один low-resource language сценарий 11. SyncGesture синхронизирует жесты с речью для анимации и real-time персонажей 12.