
Nemotron-OCR-V2
Vision-language OCR-модель от NVIDIA. Идёт дальше чистого распознавания символов: понимает layout страницы, распознаёт объекты в контексте текста для лучшей интерпретации смысла.
Возможности: - Multilingual (в т.ч. English + Chinese) - Robust layout analysis для таблиц и форм - Понимание объектов на изображении вместе с текстом
Кейсы: автоматизация ввода из сканированных форм, оцифровка старых книг и рукописных заметок, индексация image-heavy документов, multilingual digitization.