Converting document images into markup-language representations before answering questions improves visual document understanding, and the released DocMark datasets enable an adaptive markup generation pipeline.
Scene text visual question answering
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding
Converting document images into markup-language representations before answering questions improves visual document understanding, and the released DocMark datasets enable an adaptive markup generation pipeline.