A 103K-sample omni-modal video dataset with COT-generated factual, abstract, and intent text layers, plus a 3K benchmark showing foundation models fail at intent-level retrieval.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding
A 103K-sample omni-modal video dataset with COT-generated factual, abstract, and intent text layers, plus a 3K benchmark showing foundation models fail at intent-level retrieval.