Youtu-Parsing-OmniКомпактная омнимодальная парсинг-модель от Tencent: один 5B трансформер превращает в структурированный JSON почти что угодно — документ, картинку, график, чертеж, аудио и видео.
• Парсинг документов: лейаут, текст, таблицы, формулы, порядок чтения
• Картинки, графики, блок-схемы, геометрические фигуры
• Аудио: ASR, спикеры, сцены, акустические события
• Видео: кадры, OCR+ASR, отчёт о клипе
• Один унифицированный JSON-конверт для семи семейств задач
• Распознавание химструктур (ChemOCR) и нот (PDMX)
• 5B параметров, один энкодер на все модальности
• #SOTA на OmniDocBench v1.6 (96.96)
• Лучшая опенсорс на OmniParsingBench (75.08), после Gemini-3-Pro
• vLLM-плагин для быстрого сервинга
github.com/TencentCloudADP/youtu-parsinglearn2play.fun#omnimodal #multimodal #any2json #vlm #alm
MAX