A multimodal evaluation framework that decouples inference from scoring and applies it to rank vision-language, text-to-image, and text-to-video models.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation
A multimodal evaluation framework that decouples inference from scoring and applies it to rank vision-language, text-to-image, and text-to-video models.