Youtu-Parsing-Omni 以 5B 紧凑模型形式在 ModelScope 上线,用于统一结构化解析。OmniDocBench v1.6 得分 96.96,OmniParsingBench 得分 75.08,在后者开源权重模型中排名第一。
Youtu-Parsing-Omni is now available as a compact 5B model for unified structured parsing.
🤖 https://modelscope.ai/models/tencent-community/Youtu-Parsing-Omni
🏆 Reaches 96.96 on OmniDocBench v1.6 and 75.08 on OmniParsingBench, ranking first among open-weight models on the latter.
🧩 A shared omni encoder processes images, audio, and audio-visual video instead of relying on separate modality towers.
📄 OmniSchema unifies every task into structured JSON, covering text, tables, formulas, layouts, bounding boxes, timestamps, OCR, ASR, acoustic events, and camera motion.
🧠 Beyond extraction, it also produces captions, narratives, and structured reports for documents, natural images, charts, geometry, audio, and video.
🛠️ Model weights, a vLLM plugin, task prompts, serving settings, and inference examples are provided.
📜 Youtu-Parsing License; not intended for use within the European Union.
来源:ModelScope · x.com