← назад

3b-mllm

3B MLLM

Мультимодальная языковая модель на 3 млрд параметров, обнаруживающая объекты через предсказание точек.

Архитектура использует механизм точного локализации, что позволяет эффективно выявлять объекты на изображениях без необходимости в сложных детекторах. Модель сочетает понимание контекста с высокой точностью позиционирования, что делает её полезной для задач визуального поиска и анализа сцен.

Источник: @tom_doerr, 22-05-2026