← назад

HuggingModels — 13-05-2026

50 твитов за сутки. Аккаунт снова выкатил плотный поток Hugging Face-чекпойнтов: небольшие языковые модели, OCR, TTS, RL/world-modeling и специализированные мультимодальные модели.

Видео и мультимодальностьCanine Video Generation Model подается как image-to-video pipeline для генерации коротких анимаций из статичных изображений, с акцентом на temporal coherence и нишевые motion-сценарии 1. Для японских документов вышел Qwen3.5 OCR JP 2B: компактная vision-language модель, которая извлекает японский текст из изображений и превращает его в структурированные данные 2.

Безопасность, alignment и text generationQwen 3B SafeBPO Flip Mu1.1 C40 описан как safety-tuned Qwen-модель с flip-механизмом для снижения вредных ответов без сильного роста false positives 3. Отдельно отмечены SmolLM2-360M-Khasi-CPT для языка Khasi 4, ретро-чатбот talkie-1930-13b-it-GGUF 5 и Qwen-based региональная модель shaybot-qwen-native 6.

RL, world models и специализированное обучениеeschaton-familiar-brain-v1 описан как reinforcement-learning модель на deep Q network для последовательных решений и адаптивных агентов 7. В той же линии идут helenant/simple_pointgoal2_worldmodel для простых point-goal world models 8, safetensors-модель b-b7_olr_ts10_base_sym5_2025_lossq_mixmid_ms100k для узких задач вроде time-series forecasting 9, и вариант с обучением на ошибочных направлениях для повышения надежности 10.

Речь и жестыYoruba VITS добавляет text-to-speech для йоруба и закрывает еще один low-resource language сценарий 11. SyncGesture синхронизирует жесты с речью для анимации и real-time персонажей 12.

Источники

b-b7-olr-ts10-base-sym5-2025-lossq-mixmid-ms100k eschaton-familiar-brain-v1 smollm2-360m-khasi-cpt qwen35-ocr-jp-2b syncgesture qwen-3b-safebpo-flip-mu11-c40 yoruba-vits helenantsimple-pointgoal2-worldmodel canine-video-generation-model binu30test