A new 355K-pair dataset and a domain-adapted multimodal model generate brief and detailed patent figure descriptions, outperforming existing captioning systems on n-gram metrics.
Prior works (Tang, Boggust, and Satyanarayan 2023; Mahin- pei, Kostic, and Tanner 2022; Masry et al
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
PatentLMM: Large Multimodal Model for Generating Descriptions for Patent Figures
A new 355K-pair dataset and a domain-adapted multimodal model generate brief and detailed patent figure descriptions, outperforming existing captioning systems on n-gram metrics.