3B MLLM
Мультимодальная языковая модель на 3 млрд параметров, обнаруживающая объекты через предсказание точек.
Архитектура использует механизм точного локализации, что позволяет эффективно выявлять объекты на изображениях без необходимости в сложных детекторах. Модель сочетает понимание контекста с высокой точностью позиционирования, что делает её полезной для задач визуального поиска и анализа сцен.
Источник: @tom_doerr, 22-05-2026