
DFN5B-CLIP-ViT-H-14-378
model: Модель CLIP от Apple для точного сопоставления изображений и текста в задачах zero-shot.
Обеспечивает высокое качество семантического поиска и классификации без дообучения. Отличается улучшенной архитектурой Vision Transformer для работы с изображениями высокого разрешения.
Источник: @HuggingModels, 30-04-2026