Pith. sign in

hub Baseline reference

Ovis: Structural embedding alignment for multimodal large language model

Baseline reference. 88% of citing Pith papers use this work as a benchmark or comparison.

27 Pith papers citing it
Baseline 88% of classified citations

hub tools

citation-role summary

baseline 7 background 1

citation-polarity summary

representative citing papers

MMGist: A Comprehensive Multimodal Benchmark for 2027

cs.CV · 2026-06-21 · unverdicted · novelty 6.0

MMGist filters 23,250 items from 18 benchmarks down to 7,262 using three-stage pipeline, preserving model rankings (Spearman ρ=0.98) while cutting items 69% and raising discrimination 78%.

LLaVA-CoT: Let Vision Language Models Reason Step-by-Step

cs.CV · 2024-11-15 · unverdicted · novelty 6.0

LLaVA-CoT adds autonomous multistage reasoning to vision-language models, delivering 9.4% gains over its base model and outperforming larger models like Gemini-1.5-pro on reasoning benchmarks via a 100k annotated dataset and SWIRES test-time scaling.

citing papers explorer

Showing 27 of 27 citing papers.