{"as_of":"2026-08-07T05:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e3b77ed928db288366751aac91af984596bf8d54333a162fbed127e7cc2a7524","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T15:16:36.659461Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24424/citation-record","integrity":"/paper/2607.24424/integrity","json":"/paper/2607.24424/citation-record.json","paper":"/paper/2607.24424"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.20688","last_updated":"2025-06-25T03:23:16Z","snapshot_observed_at":"2026-08-06T22:54:26.385173Z","submitted_at":"2025-06-25T03:23:16Z","title":"Building Lightweight Semantic Segmentation Models for Aerial Images Using Dual Relation Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20688","snapshot_observed_at":"2026-07-31T15:16:35.452784Z","title":"Global-local attention network for semantic segmentation in aerial images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.452784Z"},"links":{"cited_paper":"/paper/2506.20688","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:39a79df20dde00541ceca2e1988fedaee8caf4b3b57cc5f337c800d9dbee4e1f","observation_id":"265850aa-de40-408b-a3a6-99916840bc9e","resolution":{"observed_at":"2026-07-31T15:16:35.452784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:16:35.666344Z","title":"Yingen Liu, Fan Wu, Ruihui Li, Zhuo Tang, and Kenli Li","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.666344Z"},"links":{"citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:e003b7b6557200e3a02bf57967bff27879e083643ba9bbc42f21eb6fa00c5aa3","observation_id":"a40eecd5-d6ad-41c4-a083-8102051bed19","resolution":{"observed_at":"2026-07-31T15:16:35.666344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-07-31T15:16:35.713332Z","title":"MMBench: Is your multi-modal model an all-around player?arXiv preprint arXiv:2307.06281, 2023b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.713332Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:b220d01a7a86425dbe511ff23b74c8e502ee1341acfe10d80fb051ca4c459076","observation_id":"8d1b3508-6f4c-4e2b-8fb4-820f22c94017","resolution":{"observed_at":"2026-07-31T15:16:35.713332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:16:35.776370Z","title":"LLM-CoT enhanced graph neural recommendation with harmonized group policy optimization.arXiv preprint arXiv:2505.12396,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.776370Z"},"links":{"citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:0c1e7a2fb9768381dd183e1ee2b059e544bb841c8beb826ef9f9d7998abe1674","observation_id":"5c263949-b6bc-42f6-ba5f-88e8d9d2d287","resolution":{"observed_at":"2026-07-31T15:16:35.776370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07209","last_updated":"2025-03-10T11:48:26Z","snapshot_observed_at":"2026-08-06T01:55:46.333897Z","submitted_at":"2025-03-10T11:48:26Z","title":"Synthetic Lung X-ray Generation through Cross-Attention and Affinity Transformation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07209","snapshot_observed_at":"2026-07-31T15:16:35.827292Z","title":"Synthetic lung x-ray generation through cross-attention and affinity transformation.arXiv preprint arXiv:2503.07209,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.827292Z"},"links":{"cited_paper":"/paper/2503.07209","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:fdddd67da59bb90cfa6fed1f4da7d24507b29826ec95f94e3e56487ffc872d92","observation_id":"076e2494-6d70-4159-b50e-7c46c16574ee","resolution":{"observed_at":"2026-07-31T15:16:35.827292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17916","last_updated":"2024-05-28T07:37:44Z","snapshot_observed_at":"2026-07-06T18:21:05.410042Z","submitted_at":"2024-05-28T07:37:44Z","title":"Boosting General Trimap-free Matting in the Real-World Image","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17916","snapshot_observed_at":"2026-07-31T15:16:35.885573Z","title":"Boosting general trimap-free matting in the real-world image","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.885573Z"},"links":{"cited_paper":"/paper/2405.17916","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:d5352739ca76f494a8d77890f8fb498b1738f32eb11bd5d59033e6a26fe6c79e","observation_id":"2f5f2ab3-e589-4d00-a86b-9f6df844c650","resolution":{"observed_at":"2026-07-31T15:16:35.885573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18078","last_updated":"2024-05-28T11:39:36Z","snapshot_observed_at":"2026-08-06T16:02:37.332941Z","submitted_at":"2024-05-28T11:39:36Z","title":"Edge-guided and Class-balanced Active Learning for Semantic Segmentation of Aerial Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18078","snapshot_observed_at":"2026-07-31T15:16:35.961854Z","title":"Boosting semantic segmentation of aerial images via decoupled and multilevel compaction and dispersion.IEEE Transactions on Geoscience and Remote Sensing, 61:1–16, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.961854Z"},"links":{"cited_paper":"/paper/2405.18078","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:b53ac9d6c7701888cc0632c101d5663047caa303a0db89788119b2a91a91d7ef","observation_id":"2860f3ab-5cea-41f0-840f-f2d73964f7e7","resolution":{"observed_at":"2026-07-31T15:16:35.961854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:16:36.036325Z","title":"LLaV A-PruMerge: Adaptive token reduction for efficient large multimodal models.arXiv preprint arXiv:2403.15388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:36.036325Z"},"links":{"citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:66d887c90e61b0e8ba2d1160a418586e5b744ec914d802c880adae2a71ad57f0","observation_id":"5b72cc80-e18a-441d-bb84-bd50cac27d7f","resolution":{"observed_at":"2026-07-31T15:16:36.036325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-31T15:16:36.166786Z","title":"Qwen2-VL: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:36.166786Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:48b5882c1545768b6e53f149bb950c03b10f119df8b888f53f973dc3f39428de","observation_id":"615aaa49-0563-4914-a4ef-9059c1386717","resolution":{"observed_at":"2026-07-31T15:16:36.166786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00363","last_updated":"2025-07-01T01:29:31Z","snapshot_observed_at":"2026-08-07T00:25:59.881057Z","submitted_at":"2025-07-01T01:29:31Z","title":"GDGS: 3D Gaussian Splatting Via Geometry-Guided Initialization And Dynamic Density Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00363","snapshot_observed_at":"2026-07-31T15:16:36.231359Z","title":"GDGS: 3d gaussian splatting via geometry-guided initialization and dynamic density control.arXiv preprint arXiv:2507.00363,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:36.231359Z"},"links":{"cited_paper":"/paper/2507.00363","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:a935814c28cc3788d8a0778e86821d81fa4a69d4fcaa33e72199bd1653031685","observation_id":"aff33c9b-f53e-4232-b2ac-e8a09bce3b99","resolution":{"observed_at":"2026-07-31T15:16:36.231359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19235","snapshot_observed_at":"2026-07-31T15:16:36.284072Z","title":"RecLLM-R1: A two-stage training paradigm with reinforcement learning and chain-of-thought.arXiv preprint arXiv:2506.19235,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:36.284072Z"},"links":{"cited_paper":"/paper/2506.19235","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:a65a3d431cacd91040c50495dd640cb3b3cfe0134b99c2a38933e1bbaa7dccd9","observation_id":"256a2bc7-e757-49fd-98e6-8408da8096ee","resolution":{"observed_at":"2026-07-31T15:16:36.284072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-06T16:32:30.757011Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-07-31T15:16:36.341288Z","title":"LLaV A-UHD: An LMM perceiving any aspect ratio and high-resolution images.arXiv preprint arXiv:2403.11703,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:36.341288Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:53178ebda906117c4750aec44be5402cec59a607c95f353f2d6040e429f4665a","observation_id":"c955fe02-0de6-4385-83ac-b075f505bd63","resolution":{"observed_at":"2026-07-31T15:16:36.341288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:16:36.403095Z","title":"KV-Efficient VLA: A method to speed up vision language models with RNN-gated chunked KV cache.arXiv preprint arXiv:2509.21354,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:36.403095Z"},"links":{"citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:6267d4661d5f90803d38240d528f076f6e0eefff37524a6e6297aa2461235e5d","observation_id":"7df803d8-1062-441e-9490-50f8a674284e","resolution":{"observed_at":"2026-07-31T15:16:36.403095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19406","last_updated":"2025-06-24T08:20:08Z","snapshot_observed_at":"2026-08-06T23:05:02.113195Z","submitted_at":"2025-06-24T08:20:08Z","title":"A Global-Local Cross-Attention Network for Ultra-high Resolution Remote Sensing Image Semantic Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19406","snapshot_observed_at":"2026-07-31T15:16:36.496400Z","title":"A global-local cross-attention network for ultra-high resolution remote sensing image semantic segmentation.arXiv preprint arXiv:2506.19406, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:36.496400Z"},"links":{"cited_paper":"/paper/2506.19406","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:93a27d8cc9bb6ea5400b9651f9be6026c8026ac6a7623c876c1d48ff7beddb12","observation_id":"aa5ec07b-db4a-4d1c-b66a-904a0e21d061","resolution":{"observed_at":"2026-07-31T15:16:36.496400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:16:36.589098Z","title":"Asymmetric Mamba–CNN collaborative architecture for large-size remote sensing image semantic segmentation.IEEE Transactions on Geoscience and Remote Sensing, 63:2002419, 2025a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:36.589098Z"},"links":{"citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:50b186214bc6c402635e626e7f9519f388ff63cefaf5fa5ce6b779915b63ce59","observation_id":"b13f99e4-8ea2-4f11-961c-0038e2117e76","resolution":{"observed_at":"2026-07-31T15:16:36.589098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11265","last_updated":"2025-03-14T10:19:24Z","snapshot_observed_at":"2026-07-06T20:52:37.081347Z","submitted_at":"2025-03-14T10:19:24Z","title":"DynRsl-VLM: Enhancing Autonomous Driving Perception with Dynamic Resolution Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11265","snapshot_observed_at":"2026-07-31T15:16:36.659461Z","title":"DynRsl-VLM: Enhancing autonomous driving perception with dynamic resolution vision-language models.arXiv preprint arXiv:2503.11265,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:36.659461Z"},"links":{"cited_paper":"/paper/2503.11265","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:97475042aa6cf954ad19ab4dc0a86cc5c5cee3a53fd7dc7d3e51ea92d2877ff4","observation_id":"8485d1c8-2336-4c7e-ade7-65d6837eeaea","resolution":{"observed_at":"2026-07-31T15:16:36.659461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-06T13:47:59.371861Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20110","snapshot_observed_at":"2026-07-31T15:16:35.591649Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.591649Z"},"links":{"cited_paper":"/paper/2507.20110","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:25eba8818ad44e6cc29d090082fd955ef32070db65541079073dd7dc8c582a35","observation_id":"a33bd187-fc65-4803-86b4-289a43d4f062","resolution":{"observed_at":"2026-07-31T15:16:35.591649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13306","last_updated":"2025-05-19T16:25:55Z","snapshot_observed_at":"2026-07-06T21:26:25.429980Z","submitted_at":"2025-05-19T16:25:55Z","title":"GMM-Based Comprehensive Feature Extraction and Relative Distance Preservation For Few-Shot Cross-Modal Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13306","snapshot_observed_at":"2026-07-31T15:16:36.098226Z","title":"GMM-based comprehensive feature extraction and relative distance preservation for few-shot cross-modal retrieval.arXiv preprint arXiv:2505.13306,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:36.098226Z"},"links":{"cited_paper":"/paper/2505.13306","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:0e35f5a6f582ca1aa5aa633c66bfa45df35fa1c8ad29bcb90ad38ab12fa10e1b","observation_id":"1504ed36-23b4-4c05-9f33-67006ed22c3b","resolution":{"observed_at":"2026-07-31T15:16:36.098226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-31T15:16:35.257881Z","title":"Transform dual-branch attention net: Efficient semantic segmentation of ultra-high-resolution remote sensing images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.257881Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:70363bb6e9a1f3511be063dab98e216890cbac7e8aedc4673825b286186b3ccd","observation_id":"0c31cf5c-e39d-475f-a4b4-9f95d8461d36","resolution":{"observed_at":"2026-07-31T15:16:35.257881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-07-31T15:16:35.069570Z","title":"Qwen-VL: A versatile vision-language model for understanding, localization, text reading, and beyond.arXiv preprint arXiv:2308.12966,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.069570Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:d2500f78eb8b201643e6c0893bcad1a1f72de8796028ae95736538761149304e","observation_id":"f86ea83f-0f57-4ac1-88c1-8fa8535132cb","resolution":{"observed_at":"2026-07-31T15:16:35.069570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17776","last_updated":"2024-05-28T03:12:33Z","snapshot_observed_at":"2026-07-06T18:21:01.419111Z","submitted_at":"2024-05-28T03:12:33Z","title":"The Binary Quantized Neural Network for Dense Prediction via Specially Designed Upsampling and Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17776","snapshot_observed_at":"2026-07-31T15:16:35.157744Z","title":"The binary quantized neural network for dense prediction via specially designed upsampling and attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.157744Z"},"links":{"cited_paper":"/paper/2405.17776","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:9693b9e6784a915c86c2450bee580f9f99c2d4a26cfb9b6d71fe1d53e042916c","observation_id":"0fca96e3-fc26-49c9-a068-05d487e41777","resolution":{"observed_at":"2026-07-31T15:16:35.157744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-07-31T15:16:35.320995Z","title":"LLaV A-OneVision: Easy visual task transfer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.320995Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:344249ff7029d38167fb13ef6ebc109eb4e1119ec7cd304a555e8ba1cd90c633","observation_id":"37815ebb-7506-4f76-af7f-0b0ad3507636","resolution":{"observed_at":"2026-07-31T15:16:35.320995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-07-31T15:16:35.532712Z","title":"To- kenPacker: Efficient visual projector for multimodal LLM.arXiv preprint arXiv:2407.02392, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.532712Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:d8ce17af8c9714e1623cfe4b66ed6a69f0815b215182fbd373defb44054fc888","observation_id":"8f953d7f-c32b-4170-910c-9dc353963321","resolution":{"observed_at":"2026-07-31T15:16:35.532712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2607.24424."}