STEP-sft-Qwen2.5-VL-7B-Instruct-rawimg-v1-action-cot
Модель: Зрительно-языковая модель Qwen2.5-VL с поддержкой цепочки рассуждений (CoT) от Hugging Face.
Инструмент предназначен для задач, требующих глубокой интерпретации визуальных данных через пошаговый анализ. Модель использует raw-изображения и обучена на данных с action-координатами для точного выполнения инструкций.
Источник: @HuggingModels, 29-05-2026