chiprook
← AI
AIOctober 3, 2026, 16:33

TeleOCR: a 1.2B vision-language model for structured document parsing

XingChen-AGI released TeleOCR, an open-source ~1.2B-parameter vision-language model for parsing born-digital and camera-captured documents. It scored 96.87 on OmniDocBench v1.6 and 88.53 on Wild_OmniDocBench, and took first place in the ICDAR 2026 Sci-ImageMiner Challenge. It is licensed under Apache-2.0.

TeleOCR: a 1.2B vision-language model for structured document parsing
#TeleOCR#XingChen-AGI
Read next
AI

Raytron brings AI understanding to thermal imaging with new infrared vision-language model

AI

Sarvam Vision 2.1: OCR model built for Indian-language documents

AI

Jina AI Releases jina-ocr-v1: A 3.4B MoE Document Parser With Built-In Speculative Decoding for Low-Budget GPUs

AI

Nvidia and DeepMind open protein structures for 2,800 viruses via AlphaFold