A new 355K-pair dataset and a domain-adapted multimodal model generate brief and detailed patent figure descriptions, outperforming existing captioning systems on n-gram metrics.
brief” with “detailed
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
PatentLMM: Large Multimodal Model for Generating Descriptions for Patent Figures
A new 355K-pair dataset and a domain-adapted multimodal model generate brief and detailed patent figure descriptions, outperforming existing captioning systems on n-gram metrics.