An embedding-based detector using DINOv2 patch features and instance segmentation detects and localizes semantic anomalies in simulated driving scenes at GPT-4o-level accuracy.
Masked autoencoders are scalable vision learners,
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Vision Foundation Model Embedding-Based Semantic Anomaly Detection
An embedding-based detector using DINOv2 patch features and instance segmentation detects and localizes semantic anomalies in simulated driving scenes at GPT-4o-level accuracy.