T2VParser uses shared learnable decomposition tokens to parse video and text into multiview embeddings and align matching views, improving text-to-video retrieval on four benchmarks.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
T2VParser: Adaptive Decomposition Tokens for Partial Alignment in Text to Video Retrieval
T2VParser uses shared learnable decomposition tokens to parse video and text into multiview embeddings and align matching views, improving text-to-video retrieval on four benchmarks.