{"as_of":"2026-08-07T00:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:535783a3349254a1138d54472055c80c60b6ae8f3a840bb1235478f60c01d0e2","coverage":[{"denominator":113,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T14:58:32.303101Z","state":"measured"},{"denominator":179,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":179,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":79,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:11:49.330615Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T21:36:34.338168Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T12:12:14.613620Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2410.17247"},"observation_digest":"sha256:09e1c320db9c074abae4025a45e768b7c6d093bcc9154f29ead1a56380ca557c","observation_id":"713e1eb2-e512-46fc-a25b-15e954a44785","resolution":{"observed_at":"2026-05-15T14:58:32.742607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2503.14075","last_updated":"2026-04-10T01:08:12Z","snapshot_observed_at":"2026-07-06T20:54:36.522651Z","submitted_at":"2025-03-18T09:52:45Z","title":"Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-22T23:58:57.819555Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2503.14075"},"observation_digest":"sha256:12782f119344317ed02b1bca3882a3ffe9553aee13fe1c2d9c06db987052d7c4","observation_id":"412b627f-29b0-4e73-a2d6-7fb859981462","resolution":{"observed_at":"2026-05-23T00:02:17.816265Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-06T22:24:36.210714Z","title":"Sparsevlm: Visual token sparsification for efficient vision-language model inference.arXiv preprint arXiv:2410.04417, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21862","last_updated":"2025-06-27T02:29:58Z","snapshot_observed_at":"2026-08-06T22:14:54.253262Z","submitted_at":"2025-06-27T02:29:58Z","title":"LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-06T22:24:36.210714Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2506.21862"},"observation_digest":"sha256:74685741fa0411f810a8943d1b25eb96f3e018d81f59cc1fdd9bb8149c0f0135","observation_id":"b3e083c5-1c6a-4db0-97c7-cc8a709acd9a","resolution":{"observed_at":"2026-08-06T22:24:36.210714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-06T18:03:03.539721Z","title":"arXiv preprint arXiv:2410.04417 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.539721Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:adf05c527aafdf606759ebc8147f9eb1f44eaa93163ac3e5b3ec7f9b334c3a7f","observation_id":"098af109-893c-4b64-a642-5475658e6011","resolution":{"observed_at":"2026-08-06T18:03:03.539721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-06T16:34:01.354846Z","title":"Sparsevlm: Visual token sparsification for efficient vision-language model inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-06T16:22:14.738964Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:01.354846Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:6e74ea0d0c3d1aa6b30a469c4275ad12a63fc5804d5337a7346d18ae3ff976f1","observation_id":"c5d878cc-0c51-4125-9ef3-115bf8dd040d","resolution":{"observed_at":"2026-08-06T16:34:01.354846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-06T05:51:16.109546Z","title":"arXiv preprint arXiv:2410.04417 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01236","last_updated":"2025-08-02T07:22:08Z","snapshot_observed_at":"2026-08-06T05:51:15.223687Z","submitted_at":"2025-08-02T07:22:08Z","title":"Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T05:51:16.109546Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2508.01236"},"observation_digest":"sha256:f851a0aea8f09c3735cd832e3456d48fc2c0d53ee069ef9d0750008b743f8730","observation_id":"d467f645-8cd3-40f8-9f66-a00bf77f9081","resolution":{"observed_at":"2026-08-06T05:51:16.109546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-05T20:35:48.044552Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10257","last_updated":"2025-08-14T00:51:36Z","snapshot_observed_at":"2026-08-05T20:35:42.234950Z","submitted_at":"2025-08-14T00:51:36Z","title":"Source Component Shift Adaptation via Offline Decomposition and Online Mixing Approach","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T20:35:48.044552Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2508.10257"},"observation_digest":"sha256:21387a55cb4a8401a6d1ff126982a10f6903ef4a7f3ae511d13c8745f9d5ee5c","observation_id":"f5730463-af67-46f2-9b2d-3ce57c9be9e1","resolution":{"observed_at":"2026-08-05T20:35:48.044552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-05T20:38:45.767775Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10259","last_updated":"2025-08-14T00:57:58Z","snapshot_observed_at":"2026-08-05T20:38:36.897476Z","submitted_at":"2025-08-14T00:57:58Z","title":"Leveraging OS-Level Primitives for Robotic Action Management","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-05T20:38:45.767775Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2508.10259"},"observation_digest":"sha256:1426d6123c1d6c480411e22af1d5549174e913ca726fc3fca9beb7a1155f8a97","observation_id":"73899475-a3f9-4248-aae6-fe606603b262","resolution":{"observed_at":"2026-08-05T20:38:45.767775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-04T18:26:55.083957Z","title":"Sparsevlm: Visual token sparsification for efficient vision-language model inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09955","last_updated":"2025-09-12T04:11:59Z","snapshot_observed_at":"2026-08-04T18:26:54.376444Z","submitted_at":"2025-09-12T04:11:59Z","title":"Adaptive Token Merging for Efficient Transformer Semantic Communication at the Edge","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T18:26:55.083957Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2509.09955"},"observation_digest":"sha256:884e2fda241c1ef4152a40beebfbae84f0b004be3739a147d9776aaa1d033eda","observation_id":"d3ffd459-c0a8-4ae1-9314-4b28c2d20b69","resolution":{"observed_at":"2026-08-04T18:26:55.083957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-03T21:31:36.995321Z","title":"Sparsevlm: Vi- sual token sparsification for efficient vision-language model inference.arXiv preprint arXiv:2410.04417, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.15098","last_updated":"2026-06-21T15:38:16Z","snapshot_observed_at":"2026-08-03T21:31:33.690337Z","submitted_at":"2025-11-19T04:13:36Z","title":"A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T21:31:36.995321Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2511.15098"},"observation_digest":"sha256:5a09916494c9e0fa966aacec91cf2b4d50510f30b83c5e39829ed240822301c1","observation_id":"e97e06fd-23d2-496c-8b08-07dde644d45a","resolution":{"observed_at":"2026-08-03T21:31:36.995321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-03T21:14:01.887983Z","title":"Sparsevlm: Vi- sual token sparsification for efficient vision-language model inference.arXiv preprint arXiv:2410.04417, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:01.887983Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:602173a9542ca7f6b14e8fd2186224ecd2dc3ec495958ece418b7bcd5340d0a5","observation_id":"6a3ef22d-aed3-4c3e-a224-a53f6ea7211e","resolution":{"observed_at":"2026-08-03T21:14:01.887983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2511.18960","last_updated":"2026-04-10T05:31:27Z","snapshot_observed_at":"2026-08-05T07:51:27.008234Z","submitted_at":"2025-11-24T10:22:28Z","title":"AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-17T06:28:22.652509Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2511.18960"},"observation_digest":"sha256:513f1e5334218f2bf2c245a5eede5bf623af560b295bf303a448f085bbbb12f1","observation_id":"61e242bf-540c-4220-82f1-071e7282745e","resolution":{"observed_at":"2026-05-17T06:29:09.984286Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2511.22663","last_updated":"2026-05-12T09:31:31Z","snapshot_observed_at":"2026-07-06T22:37:12.421372Z","submitted_at":"2025-11-27T17:55:25Z","title":"AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-17T04:17:07.534291Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2511.22663"},"observation_digest":"sha256:f9de9bf2d8acf2c69abe94042da643ed1207c24d674e980abecc3a238c86866d","observation_id":"65c3f1c3-6151-4691-ade4-43c804cb5f76","resolution":{"observed_at":"2026-05-17T04:19:00.623483Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-03T17:16:43.164201Z","title":"Sparsevlm: Vi- sual token sparsification for efficient vision-language model inference.arXiv:2410.04417, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.10324","last_updated":"2026-06-22T06:41:41Z","snapshot_observed_at":"2026-08-03T17:16:35.340426Z","submitted_at":"2025-12-11T06:18:58Z","title":"EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T17:16:43.164201Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2512.10324"},"observation_digest":"sha256:9e262f21287cc6f0515736f7536442dd6b9f826f3784c040cbd0198103b0c216","observation_id":"b2a4a894-25fc-4cd2-aa43-f872688b19bc","resolution":{"observed_at":"2026-08-03T17:16:43.164201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2512.19219","last_updated":"2026-05-11T05:06:06Z","snapshot_observed_at":"2026-07-06T22:39:48.048525Z","submitted_at":"2025-12-22T10:02:10Z","title":"Selective LoRA for Visual Tokens and Attention Heads","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T20:17:07.884892Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2512.19219"},"observation_digest":"sha256:f33823f8e70395ad76104703f352894ac56a256ace2aa58ae76e0e415656a9dc","observation_id":"04b546e9-49f7-49cd-81bc-2c5d19cb03eb","resolution":{"observed_at":"2026-05-16T20:18:23.671109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2601.01322","last_updated":"2026-05-03T05:35:23Z","snapshot_observed_at":"2026-08-02T23:32:22.443147Z","submitted_at":"2026-01-04T01:17:36Z","title":"LinMU: Multimodal Understanding Made Linear","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T18:32:23.951566Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2601.01322"},"observation_digest":"sha256:dfa2d4827601d0040ec5256daa74185897d98754b753442a32155d70940df1d1","observation_id":"5cf2c86d-e2b8-450e-8eed-a61145211edf","resolution":{"observed_at":"2026-05-16T18:33:15.158927Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:5efb6c33789ce882a6099721c108a5794abad973d1e8152523a4f04365dbe5d7","observation_id":"6d510b01-19d4-4d2f-8829-9cf4b29286e2","resolution":{"observed_at":"2026-05-15T18:26:27.029877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2603.22911","last_updated":"2026-04-12T14:01:49Z","snapshot_observed_at":"2026-08-03T01:43:21.251112Z","submitted_at":"2026-03-24T08:01:16Z","title":"ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-15T00:56:47.841355Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2603.22911"},"observation_digest":"sha256:36b7d35fbc3362b6a0f7e6782ed886ed20812a7738719fc16a6b623aad80c7ea","observation_id":"086f0fae-5e5d-4141-b654-1a80b552f07c","resolution":{"observed_at":"2026-05-15T14:58:32.742607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2603.27960","last_updated":"2026-04-11T06:07:02Z","snapshot_observed_at":"2026-07-06T22:51:00.579062Z","submitted_at":"2026-03-30T02:23:37Z","title":"Towards Efficient Large Vision-Language Models: A Comprehensive Survey on Inference Strategies","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-14T21:40:55.343169Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2603.27960"},"observation_digest":"sha256:21021640c9915e96bec7013460df355ba893dbbeea9ce29ddb57d3dd057f06f6","observation_id":"af3f1071-10f5-430e-8db7-95601dffa92a","resolution":{"observed_at":"2026-05-15T14:58:32.742607Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2604.04055","last_updated":"2026-04-05T10:59:48Z","snapshot_observed_at":"2026-07-06T22:53:06.517678Z","submitted_at":"2026-04-05T10:59:48Z","title":"DINO-VO: Learning Where to Focus for Enhanced State Estimation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-13T17:05:52.493660Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2604.04055"},"observation_digest":"sha256:9ca6a3dc39737e28fa31a8af7eabe300032ca8dc5d5627e77b5b226e6a0169df","observation_id":"735cf995-5c67-4147-b990-2d8d30107ffb","resolution":{"observed_at":"2026-05-15T14:58:32.742607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2604.09425","last_updated":"2026-04-10T15:38:00Z","snapshot_observed_at":"2026-07-06T22:58:17.167367Z","submitted_at":"2026-04-10T15:38:00Z","title":"Do Vision Language Models Need to Process Image Tokens?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T18:26:37.371488Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2604.09425"},"observation_digest":"sha256:0cd088f5c1e9f616abd053b4355b03a908c87fe95ed13f44731d1d70dc97115e","observation_id":"dd444398-ac9c-420d-b0e3-919fc72a05d0","resolution":{"observed_at":"2026-05-15T14:58:32.742607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2604.11122","last_updated":"2026-04-13T07:36:02Z","snapshot_observed_at":"2026-07-06T22:59:36.571641Z","submitted_at":"2026-04-13T07:36:02Z","title":"Semantic-Geometric Dual Compression: Training-Free Visual Token Reduction for Ultra-High-Resolution Remote Sensing Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:49.681399Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2604.11122"},"observation_digest":"sha256:7520632aa8dff2550f41c0f2438fdca3c49f9598e2fe830e6f9e7b435f4de4d7","observation_id":"a1fb4d6a-f906-41c9-87a0-b760b9169ac0","resolution":{"observed_at":"2026-05-15T14:58:32.742607Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2604.11240","last_updated":"2026-04-13T09:44:52Z","snapshot_observed_at":"2026-08-02T05:19:31.992123Z","submitted_at":"2026-04-13T09:44:52Z","title":"Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T15:15:04.261855Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2604.11240"},"observation_digest":"sha256:1253e48fd7adab1ba81d8f9074661a13d3508ca6b145687bdaab23e6e759c6de","observation_id":"320c0715-28f5-4777-9509-f4ee8fa70cc1","resolution":{"observed_at":"2026-05-15T14:58:32.742607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2604.11627","last_updated":"2026-04-13T15:38:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T15:38:22Z","title":"POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs","version":1},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:08.671342Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2604.11627"},"observation_digest":"sha256:d83934bec1bf2de93a968099a989375bfff367976a85677a1fc8e9969ecad88c","observation_id":"bc3789bb-c4a6-4641-b63b-6f2628f92e74","resolution":{"observed_at":"2026-05-15T14:58:32.742607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2604.12358","last_updated":"2026-04-15T17:43:53Z","snapshot_observed_at":"2026-07-06T23:00:32.607699Z","submitted_at":"2026-04-14T06:48:31Z","title":"Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T14:50:37.022338Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2604.12358"},"observation_digest":"sha256:1914b263042d5f4303d12d1a38e5a878760e5ea735fabe3b2b86c025f1bd67da","observation_id":"134db799-d7df-4f55-8a5f-579f23486f11","resolution":{"observed_at":"2026-05-15T14:58:32.742607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2604.15188","last_updated":"2026-04-16T16:21:05Z","snapshot_observed_at":"2026-07-06T23:02:49.302337Z","submitted_at":"2026-04-16T16:21:05Z","title":"VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-10T11:28:44.565497Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2604.15188"},"observation_digest":"sha256:0fcab32e5ac4562a0fe8f0089f7db9a7d9755d131940fe7aa40ae11471e23495","observation_id":"f837c46d-02e0-434c-9567-753c4fcfbe8d","resolution":{"observed_at":"2026-05-15T14:58:32.742607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2604.18260","last_updated":"2026-04-20T13:33:50Z","snapshot_observed_at":"2026-08-02T12:21:23.079653Z","submitted_at":"2026-04-20T13:33:50Z","title":"Geometry-Guided 3D Visual Token Pruning for Video-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T05:49:38.346274Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2604.18260"},"observation_digest":"sha256:72180d5b89ba3e6fb9e9dcceacc9dc4cd771feaacf337739104324002b352cf1","observation_id":"754973df-c953-4670-8a06-12fe6d8d8439","resolution":{"observed_at":"2026-05-15T14:58:32.742607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2604.24447","last_updated":"2026-04-27T13:12:16Z","snapshot_observed_at":"2026-08-02T20:38:02.984524Z","submitted_at":"2026-04-27T13:12:16Z","title":"Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T03:04:46.460069Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2604.24447"},"observation_digest":"sha256:fb109260551ab222cfa142990756938c90dc0bd3cff641665595cfd77f4ce01b","observation_id":"e7ef7a39-2192-43b5-9fb8-8c64b9d114ec","resolution":{"observed_at":"2026-05-15T14:58:32.742607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2605.00392","last_updated":"2026-05-21T12:40:15Z","snapshot_observed_at":"2026-08-02T11:25:36.071129Z","submitted_at":"2026-05-01T04:30:16Z","title":"RTPrune: Reading-Twice Inspired Token Pruning for Efficient DeepSeek-OCR Inference","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-09T19:49:28.591419Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2605.00392"},"observation_digest":"sha256:bd31ff80f8ed8812fe28f92aeed7bb8a9b502ab50bf797a86f87ccb1e6402788","observation_id":"d4e97c48-e2d8-48f7-8b7b-5bf39c6e6403","resolution":{"observed_at":"2026-05-15T14:58:32.742607Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2605.03351","last_updated":"2026-05-05T04:13:32Z","snapshot_observed_at":"2026-07-06T23:16:15.509235Z","submitted_at":"2026-05-05T04:13:32Z","title":"VLMaxxing through FrameMogging Training-Free Anti-Recomputation for Video Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T01:30:15.463051Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2605.03351"},"observation_digest":"sha256:dd7d88dd3d72866a10e556a09cb1a9e1966823dfc5bacbb92fcc9f7bbb413449","observation_id":"9697ceca-8532-4cdb-8746-e0026decc93b","resolution":{"observed_at":"2026-05-15T14:58:32.742607Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2605.04227","last_updated":"2026-08-01T20:12:35Z","snapshot_observed_at":"2026-08-06T23:24:38.697717Z","submitted_at":"2026-05-05T19:12:11Z","title":"Pro$^2$Assist: Continuous Step-aware Proactive Assistance with Multi-modal Egocentric Perception for Long-horizon Procedural Tasks","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-08T17:16:31.820718Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2605.04227"},"observation_digest":"sha256:d752f4c8f687a760db47944a86225682b3909b85973c1cfeb9b0c31ad6f56e33","observation_id":"3ac9958a-fddc-4ea2-9fe8-a387932cee44","resolution":{"observed_at":"2026-05-15T14:58:32.742607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-04T05:19:56.337244Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.04227","last_updated":"2026-08-01T20:12:35Z","snapshot_observed_at":"2026-08-06T23:24:38.697717Z","submitted_at":"2026-05-05T19:12:11Z","title":"Pro$^2$Assist: Continuous Step-aware Proactive Assistance with Multi-modal Egocentric Perception for Long-horizon Procedural Tasks","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-04T05:19:56.337244Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2605.04227"},"observation_digest":"sha256:b244425db213037234f5798aded21ad5e8b67ca6e38d8302279affb59b532213","observation_id":"4ad340de-855a-4f43-aa49-0b316c4f93ba","resolution":{"observed_at":"2026-08-04T05:19:56.337244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2605.05848","last_updated":"2026-05-08T13:46:44Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:23:27Z","title":"VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:39.444933Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2605.05848"},"observation_digest":"sha256:847bd7e19f58783f24a09f80350ba3471a2b4864da75ac9b45e8a701e2a89ca4","observation_id":"1084ac3a-e8bf-44b0-a80e-b48a1701b455","resolution":{"observed_at":"2026-05-15T14:58:32.742607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2605.05848","last_updated":"2026-05-08T13:46:44Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:23:27Z","title":"VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T01:57:42.822121Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2605.05848"},"observation_digest":"sha256:cb32489c07ea4716fffa8b07dfe1bd90025be619d26c88d3177b7bc75f559d7e","observation_id":"57c41584-e60e-4225-aeee-465649f1db51","resolution":{"observed_at":"2026-05-15T14:58:32.742607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2605.08985","last_updated":"2026-05-09T15:10:26Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T15:10:26Z","title":"LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs?","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-12T02:06:45.858231Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2605.08985"},"observation_digest":"sha256:f0b353e6b4fbd5c37b557c5862c5e7dd5eac857aab5408125e18c488a3381c4a","observation_id":"334343cb-bb53-4a99-99d3-68afa25870c6","resolution":{"observed_at":"2026-05-15T14:58:32.742607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2605.09649","last_updated":"2026-05-10T16:47:50Z","snapshot_observed_at":"2026-07-06T23:21:44.900680Z","submitted_at":"2026-05-10T16:47:50Z","title":"Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T05:02:25.513351Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2605.09649"},"observation_digest":"sha256:0ae1b58ca1140e73e32a8d608995ccb88c224b3578707fa3748382ce2c074387","observation_id":"14a8b709-b2b2-40bd-a491-717c9768bcae","resolution":{"observed_at":"2026-05-15T14:58:32.742607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2605.13548","last_updated":"2026-06-01T10:46:32Z","snapshot_observed_at":"2026-08-01T14:26:50.736804Z","submitted_at":"2026-05-13T13:55:37Z","title":"AttenA+: Rectifying Action Inequality in Robotic Foundation Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T18:43:08.029165Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2605.13548"},"observation_digest":"sha256:9f463d07a51316175aa796fe5f822db388ad8adcbafa4cbcfa988d31a8f33c4b","observation_id":"d24a6c1c-2161-45ac-a059-0ae1af1dccff","resolution":{"observed_at":"2026-05-15T14:58:32.742607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2605.13548","last_updated":"2026-06-01T10:46:32Z","snapshot_observed_at":"2026-08-01T14:26:50.736804Z","submitted_at":"2026-05-13T13:55:37Z","title":"AttenA+: Rectifying Action Inequality in Robotic Foundation Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T21:42:05.592911Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2605.13548"},"observation_digest":"sha256:2972d9a1ab985b50f58224a32ea534efe55b2ae3614f97203bb8598168aa7a59","observation_id":"3893fcc5-32df-4f4f-8ed2-997afa4ca99f","resolution":{"observed_at":"2026-06-30T21:45:05.706588Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2605.15621","last_updated":"2026-05-15T05:09:15Z","snapshot_observed_at":"2026-08-02T06:28:30.704142Z","submitted_at":"2026-05-15T05:09:15Z","title":"LRCP: Low-Rank Compressibility Guided Visual Token Pruning for Efficient LVLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T19:04:15.273932Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2605.15621"},"observation_digest":"sha256:be45b0a87113c71691c81b53caa90f9b66d6565b6641cd2712e87250a8634c22","observation_id":"c78ba4e1-e20f-44b1-8ce3-30f301c0c87d","resolution":{"observed_at":"2026-05-20T19:08:54.511241Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2605.19218","last_updated":"2026-05-19T00:45:00Z","snapshot_observed_at":"2026-07-06T23:29:57.003383Z","submitted_at":"2026-05-19T00:45:00Z","title":"Rotation-Aligned Key Channel Pruning for Efficient Vision-Language Model Inference","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T07:43:18.828740Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2605.19218"},"observation_digest":"sha256:7261b695398a0d04bae53c2a36d1a723b4d5379471323e2e171a36e640bacd8f","observation_id":"ac6f9ec6-0c85-4544-bbca-76559b1fc031","resolution":{"observed_at":"2026-05-20T07:43:23.787783Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2605.19322","last_updated":"2026-05-19T04:02:01Z","snapshot_observed_at":"2026-08-02T06:11:11.606278Z","submitted_at":"2026-05-19T04:02:01Z","title":"DynaTok: Temporally Adaptive and Positional Bias-Aware Token Compression for Video-LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T06:55:01.619441Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2605.19322"},"observation_digest":"sha256:e894d4d47a09d318c277ceb2bcb1e473306c7facc214c8866b3e4562dd18525d","observation_id":"266c9dd0-45cd-4d21-958f-87e6bdc2d019","resolution":{"observed_at":"2026-05-20T06:58:05.980263Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2605.20950","last_updated":"2026-05-20T09:37:53Z","snapshot_observed_at":"2026-07-06T23:31:27.989406Z","submitted_at":"2026-05-20T09:37:53Z","title":"Focus-then-Context: Subject-Centric Progressive Visual Token Reduction for Vision-Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-21T05:20:55.448430Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2605.20950"},"observation_digest":"sha256:70c315424a9917b1e980a6efa45fc9560e7a119d70248ab3a949e20cc886583d","observation_id":"6b45e725-3b0f-45c1-9897-3a46cd7eaad8","resolution":{"observed_at":"2026-05-21T05:23:58.599149Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2605.22372","last_updated":"2026-05-21T12:04:49Z","snapshot_observed_at":"2026-08-02T09:32:53.002256Z","submitted_at":"2026-05-21T12:04:49Z","title":"ASAP: Attention Sink Anchored Pruning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T08:12:13.451406Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2605.22372"},"observation_digest":"sha256:e19434122c1b3520d62d44431ba8e20f4ea9bcb2fb8b015d2d8fe0d513c1f7c9","observation_id":"bfd0ed5f-dd96-457d-bf19-e09a8301c35f","resolution":{"observed_at":"2026-05-22T08:14:45.587099Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2605.24154","last_updated":"2026-05-22T19:22:17Z","snapshot_observed_at":"2026-07-06T23:34:13.859813Z","submitted_at":"2026-05-22T19:22:17Z","title":"Palette: A Modular, Controllable, and Efficient Framework for On-demand Authorized Safety Alignment Relaxation in LLMs","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-30T16:03:12.728352Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2605.24154"},"observation_digest":"sha256:a00dfa67712ad0736f8566580e07184af486975999cc3b69a46b993ddbd41daf","observation_id":"ba0f3934-791d-4b2f-8526-3ec3a0a4f16e","resolution":{"observed_at":"2026-06-30T16:04:52.633378Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":203,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:2c7154b0673cb048db44b7e608e974fceeb090cdb83868d4e63883b1ed162848","observation_id":"776a3956-fbb5-403c-b2de-79f7e62b6484","resolution":{"observed_at":"2026-06-29T23:04:01.697865Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2605.29535","last_updated":"2026-05-28T07:49:45Z","snapshot_observed_at":"2026-07-06T23:38:56.014434Z","submitted_at":"2026-05-28T07:49:45Z","title":"AsymVLM: Asymmetric Token Pruning for Efficient Vision-Language Model Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T08:48:58.583657Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2605.29535"},"observation_digest":"sha256:a270e94ee41d35e4a5efc27f409f30084d0fca711a431cfcca4c125eb9132233","observation_id":"7826f094-5a2a-4f23-a81e-3986287b16e0","resolution":{"observed_at":"2026-06-29T08:53:15.983445Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2605.29662","last_updated":"2026-07-24T01:54:48Z","snapshot_observed_at":"2026-08-02T12:54:38.753199Z","submitted_at":"2026-05-28T09:23:08Z","title":"SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T08:40:10.152344Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2605.29662"},"observation_digest":"sha256:333f4916ece5abd6a5e711e841bf5dea7e4e08241e76b081bc96a5b4e098d69d","observation_id":"b63ea36c-b162-49fd-890f-cdc457fa99c5","resolution":{"observed_at":"2026-06-29T08:43:14.963744Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-02T12:54:43.337210Z","title":"arXiv preprint arXiv:2410.04417 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.29662","last_updated":"2026-07-24T01:54:48Z","snapshot_observed_at":"2026-08-02T12:54:38.753199Z","submitted_at":"2026-05-28T09:23:08Z","title":"SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T12:54:43.337210Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2605.29662"},"observation_digest":"sha256:8b64fbf2c9e4235635896c0262cb9562bd694ba2dff866e8d208ae45e847b423","observation_id":"10bbd4fd-3501-4b67-ab9c-d96639cccf2d","resolution":{"observed_at":"2026-08-02T12:54:43.337210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2606.05232","last_updated":"2026-06-03T00:58:21Z","snapshot_observed_at":"2026-07-06T23:45:11.627867Z","submitted_at":"2026-06-03T00:58:21Z","title":"Differentiable Efficient Operator Search","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T07:30:30.355657Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2606.05232"},"observation_digest":"sha256:108c19a25ab4f7fa04db951a1ffef1fe3cfa717921c26043046786d2a8c8bf1f","observation_id":"f2657672-9bc6-45fe-b72b-356543277b0f","resolution":{"observed_at":"2026-07-02T06:06:41.789534Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2606.12412","last_updated":"2026-06-10T17:59:57Z","snapshot_observed_at":"2026-08-03T05:45:43.148184Z","submitted_at":"2026-06-10T17:59:57Z","title":"Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-27T09:35:24.118536Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2606.12412"},"observation_digest":"sha256:c9b575fe7f450dd36570c549ad9f763c63ab40e974cd9f49497fcef302437519","observation_id":"328daec8-ed63-4a77-b572-2251d15884ec","resolution":{"observed_at":"2026-07-03T11:28:04.130474Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-06T15:40:32.013079Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:2b9b513ad1cdb02e6c1ae16d68e5beb31546cf9b161a08b8a3eb054c60ff5c89","observation_id":"6774e7e9-bbe3-41a6-ae2a-da04a729711b","resolution":{"observed_at":"2026-07-04T03:19:29.929448Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2606.27161","last_updated":"2026-06-25T15:29:37Z","snapshot_observed_at":"2026-08-04T02:05:59.242279Z","submitted_at":"2026-06-25T15:29:37Z","title":"TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-26T04:24:38.917137Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2606.27161"},"observation_digest":"sha256:3c502ea9ee8784403ec946107137f9616e153fba0340900efe002e54b0e5bf57","observation_id":"af33357b-3b81-403b-b59b-c9fa619735b7","resolution":{"observed_at":"2026-07-04T14:09:53.801383Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2606.27660","last_updated":"2026-07-01T13:33:39Z","snapshot_observed_at":"2026-07-07T00:01:49.598947Z","submitted_at":"2026-06-26T02:33:20Z","title":"MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T05:08:46.145616Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2606.27660"},"observation_digest":"sha256:987bb0a8387d76d6ab118a59ad71c9362ed4d30299d0ec45111813b773f9b889","observation_id":"9b66dbaa-2730-4f61-bf2a-4af54dbdbe83","resolution":{"observed_at":"2026-06-29T18:23:51.150255Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2606.27660","last_updated":"2026-07-01T13:33:39Z","snapshot_observed_at":"2026-07-07T00:01:49.598947Z","submitted_at":"2026-06-26T02:33:20Z","title":"MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-02T21:35:33.280591Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2606.27660"},"observation_digest":"sha256:918084849d8fca97b10928acb56b413c0ea6b3bd79a3a76f39c243d17cccbc5f","observation_id":"ef58a4c4-f0bc-40ca-8c83-d40a021c1849","resolution":{"observed_at":"2026-07-02T21:37:24.219111Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2606.31383","last_updated":"2026-06-30T09:11:50Z","snapshot_observed_at":"2026-07-07T00:05:07.912609Z","submitted_at":"2026-06-30T09:11:50Z","title":"MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-01T05:41:04.184461Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2606.31383"},"observation_digest":"sha256:7dff2b09f14dcb0e5f78b05026c193ff2826800e478a1c44b8603bc544496237","observation_id":"728ac82e-1ddb-43be-a05f-01f81d20643b","resolution":{"observed_at":"2026-07-01T10:15:44.599724Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2606.31599","last_updated":"2026-06-30T12:47:30Z","snapshot_observed_at":"2026-07-07T00:05:17.259491Z","submitted_at":"2026-06-30T12:47:30Z","title":"Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-01T05:36:43.609602Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2606.31599"},"observation_digest":"sha256:dc3a7c4368720799a1db83fe384fd5eaee6ca079da0c1b34bbf00636d1c8baa8","observation_id":"e141fd5b-5c54-4ece-bf48-58ff3d61c78c","resolution":{"observed_at":"2026-07-01T10:15:45.204019Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2607.02484","last_updated":"2026-07-02T17:50:57Z","snapshot_observed_at":"2026-07-07T00:07:56.573640Z","submitted_at":"2026-07-02T17:50:57Z","title":"Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-03T14:47:35.377391Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2607.02484"},"observation_digest":"sha256:19a45738f6410aba42aca91fa783ba835cd9432e5d3ca8509e46d1295eb50be0","observation_id":"393c4af5-5d93-4b98-8030-a697617cb543","resolution":{"observed_at":"2026-07-03T14:48:32.367832Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"Sparsevlm: Visual token sparsification for effi- cient vision-language model inference.arXiv preprint arXiv:2410.04417,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:793c16f871cd0082943a3233acfab322e6ee06dc4ca08477e6e325434dcb7860","observation_id":"18157f53-17f8-435c-8620-248a523d780a","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-03T18:08:47.153431Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:1d123f6a9be3c77ec593e0933f8b5d5da2b4397adb066f6dcad4fc4c13ac382f","observation_id":"f908bd59-8cb1-41b8-b779-8b2e0a937fef","resolution":{"observed_at":"2026-07-08T22:35:40.598163Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2607.07033","last_updated":"2026-07-23T04:28:03Z","snapshot_observed_at":"2026-08-06T04:40:37.790333Z","submitted_at":"2026-07-08T06:07:06Z","title":"AnchorPrune: Relevance-Anchored Contextual Expansion for Visual Token Pruning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-09T21:28:27.693908Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2607.07033"},"observation_digest":"sha256:00d9a116133e5a82227e8d626276f336a5e9a81a379fb639d705b4658992de18","observation_id":"f7f7c72c-5c6a-4234-a012-70093eb9f5d6","resolution":{"observed_at":"2026-07-09T21:36:34.339662Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-14T15:54:18.404613Z","title":"arXiv preprint arXiv:2410.04417 (2024) 18 K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07033","last_updated":"2026-07-23T04:28:03Z","snapshot_observed_at":"2026-08-06T04:40:37.790333Z","submitted_at":"2026-07-08T06:07:06Z","title":"AnchorPrune: Relevance-Anchored Contextual Expansion for Visual Token Pruning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T15:54:18.404613Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2607.07033"},"observation_digest":"sha256:9659f4afdcd60d2f92c41a619c43a7f984b2abf4a47b748b778fffedcb2dbd21","observation_id":"b1469d2f-cd50-4194-8faa-eb3157bf131a","resolution":{"observed_at":"2026-07-14T15:54:18.404613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-02T08:12:31.386718Z","title":"arXiv preprint arXiv:2410.04417 (2024) 18 K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07033","last_updated":"2026-07-23T04:28:03Z","snapshot_observed_at":"2026-08-06T04:40:37.790333Z","submitted_at":"2026-07-08T06:07:06Z","title":"AnchorPrune: Relevance-Anchored Contextual Expansion for Visual Token Pruning","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T08:12:31.386718Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2607.07033"},"observation_digest":"sha256:18d6ad17d770d095204c6735e707320db76f62959cb922a4cf8f86f39df95d05","observation_id":"483171d1-7c26-4052-b98e-86a3922af1af","resolution":{"observed_at":"2026-08-02T08:12:31.386718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-14T10:17:43.230980Z","title":"Sparsevlm: Visual token sparsification for effi- cient vision-language model inference.arXiv preprint arXiv:2410.04417, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10640","last_updated":"2026-07-18T07:25:10Z","snapshot_observed_at":"2026-08-02T07:15:22.539318Z","submitted_at":"2026-07-12T08:12:45Z","title":"Spectral Heat Flow for Conservative Token Condensation in Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T10:17:43.230980Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2607.10640"},"observation_digest":"sha256:fdb28fce8a95248e546d4dfe9d001118694dfaa3239817c24a5c90d71ca4ea80","observation_id":"96b53720-c364-4532-aaf9-35cc61dc0c44","resolution":{"observed_at":"2026-07-14T10:17:43.230980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-02T07:15:25.071270Z","title":"Sparsevlm: Visual token sparsification for effi- cient vision-language model inference.arXiv preprint arXiv:2410.04417, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10640","last_updated":"2026-07-18T07:25:10Z","snapshot_observed_at":"2026-08-02T07:15:22.539318Z","submitted_at":"2026-07-12T08:12:45Z","title":"Spectral Heat Flow for Conservative Token Condensation in Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T07:15:25.071270Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2607.10640"},"observation_digest":"sha256:a098e6b6083d968b74d774298f12532bc402eda8498d03b913058f7756383b58","observation_id":"3f50efab-5fd9-46a0-8cee-eeeba7b76617","resolution":{"observed_at":"2026-08-02T07:15:25.071270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-02T01:48:57.761577Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14557","last_updated":"2026-07-16T04:37:02Z","snapshot_observed_at":"2026-08-03T19:01:15.705968Z","submitted_at":"2026-07-16T04:37:02Z","title":"Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T01:48:57.761577Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2607.14557"},"observation_digest":"sha256:e5eed05e344f924996045915886930c063edf1fce039a65de9984d36adc55a4f","observation_id":"c428b69e-f27f-497b-8076-78de25232b7b","resolution":{"observed_at":"2026-08-02T01:48:57.761577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-01T19:13:28.370100Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17052","last_updated":"2026-07-19T03:43:26Z","snapshot_observed_at":"2026-08-05T07:39:00.370147Z","submitted_at":"2026-07-19T03:43:26Z","title":"Searching for Task-Specific Vision Paths: Evolutionary Block Pruning Across Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T19:13:28.370100Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2607.17052"},"observation_digest":"sha256:4299ac36623d216407743b9f9816fba159bcebb441912a1bb2423f7326e39b0e","observation_id":"f31faea6-6422-447e-ae2f-ab364101c218","resolution":{"observed_at":"2026-08-01T19:13:28.370100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-01T13:10:37.711024Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22716","last_updated":"2026-07-21T15:52:30Z","snapshot_observed_at":"2026-08-06T12:10:57.542923Z","submitted_at":"2026-07-21T15:52:30Z","title":"Visual Token Compression Enhances Robustness of MLLMs","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-01T13:10:37.711024Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2607.22716"},"observation_digest":"sha256:32f8d3578c3878f5f9488eb7fae2b3263ec330f933b476a0605608b859989b3f","observation_id":"bdc79aab-85ee-45c5-9f0b-ac6b65b5dca2","resolution":{"observed_at":"2026-08-01T13:10:37.711024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-01T03:25:31.650756Z","title":"Sparsevlm: Visual token sparsification for efficient vision-language model inference.arXiv preprint arXiv:2410.04417, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-06T23:24:50.766792Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T03:25:31.650756Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:bde9c554bb65b266752d740fe5ad1d2330450e4531c34f2bbece65d58f50be07","observation_id":"647515c7-7869-4297-9099-aa17db97fb8b","resolution":{"observed_at":"2026-08-01T03:25:31.650756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-04T04:02:54.522646Z","title":"Sparsevlm: Visual token sparsification for efficient vision-language model inference.arXiv preprint arXiv:2410.04417, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-06T23:24:50.766792Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.522646Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:6d153b2027dd3416eab10502a980c5158917358d01c2ed5f2c4bdc4c6b6ddbf2","observation_id":"dd4ec0f3-2ddf-4830-b903-7a0a7a708e1a","resolution":{"observed_at":"2026-08-04T04:02:54.522646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-31T00:01:39.654463Z","title":"arXiv preprint arXiv:2410.04417 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-01T17:10:45.801228Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:39.654463Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:3b11d5d044d671588e4f360ffe7bcb81a7804caa2ce89994f1f0fac383632296","observation_id":"3814d9e8-3e61-434a-a671-c35ad689f654","resolution":{"observed_at":"2026-07-31T00:01:39.654463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-01T01:54:22.000078Z","title":"Yuan Zhang, Chun-Kai Fan, Junpeng Ma, Wenzhao Zheng, Tao Huang, Kuan Cheng, Denis Gudovskiy, Tomoyuki Okuno, Yohei Nakata, Kurt Keutzer, and Shanghang Zhang","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25669","last_updated":"2026-07-28T12:50:31Z","snapshot_observed_at":"2026-08-03T02:38:33.262683Z","submitted_at":"2026-07-28T12:50:31Z","title":"OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs","version":1},"reference_index":1057,"source":"pdf_text","source_observed_at":"2026-08-01T01:54:22.000078Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2607.25669"},"observation_digest":"sha256:4c89240b00ccf45680d1f005164cc1dfedf8871bb8bdd5251598e3d1f3dd7a57","observation_id":"e305149a-9e40-4727-a2fa-94e72f60e8c1","resolution":{"observed_at":"2026-08-01T01:54:22.000078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-01T01:26:50.499048Z","title":"SparseVLM: Visual token sparsifi- cation for efficient vision-language model inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25818","last_updated":"2026-07-28T15:01:02Z","snapshot_observed_at":"2026-08-02T18:28:59.293276Z","submitted_at":"2026-07-28T15:01:02Z","title":"SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T01:26:50.499048Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2607.25818"},"observation_digest":"sha256:fefb1ee3f021bc9d0e76ebf614b31819e96fa29fd2e60489b7d71947877aea51","observation_id":"f836949a-bf70-4340-a192-55de70e61a77","resolution":{"observed_at":"2026-08-01T01:26:50.499048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-01T13:31:50.031383Z","title":"Zhao, Z.; Wang, S.; Gu, J.; Zhu, Y.; Mei, L.; Zhuang, Z.; Cui, Z.; Wang, Q.; and Shen, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26554","last_updated":"2026-07-29T07:27:09Z","snapshot_observed_at":"2026-08-04T05:13:12.088260Z","submitted_at":"2026-07-29T07:27:09Z","title":"MedARC: Training-Free Adaptive Redundancy Compression of Visual Tokens for 3D Medical Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T13:31:50.031383Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2607.26554"},"observation_digest":"sha256:4e818ea293e4c65242bc2aea3bfba8895c36fd6c4cc85500acc7268ef9811a1d","observation_id":"b76c417c-7df6-4cef-976a-4adddbfb8e78","resolution":{"observed_at":"2026-08-01T13:31:50.031383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-31T22:24:19.216556Z","title":"arXiv preprint arXiv:2410.04417 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27952","last_updated":"2026-07-30T09:59:25Z","snapshot_observed_at":"2026-08-02T23:47:50.629868Z","submitted_at":"2026-07-30T09:59:25Z","title":"LAST: The Last Query Token Guides Visual Token Pruning for Edge-Cloud Collaborative MLLM Inference","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-31T22:24:19.216556Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2607.27952"},"observation_digest":"sha256:4a3d0aa28604f8ab518d8bb14db5f7d1d887dfc54eda31831358661140c30561","observation_id":"a85a632c-e75e-472f-bcc1-42eb7aecc286","resolution":{"observed_at":"2026-07-31T22:24:19.216556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-04T23:46:51.635563Z","title":"International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-06T23:32:52.420159Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.635563Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:5270e55036c5e96bc4ff50087729aa5174f2059142818acb574b7b2da50cae6f","observation_id":"a7fe473c-2c51-41f6-9fe4-6c91d74d1e75","resolution":{"observed_at":"2026-08-04T23:46:51.635563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-04T13:44:00.303154Z","title":"arXiv preprint arXiv:2410.04417 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02150","last_updated":"2026-08-05T06:57:37Z","snapshot_observed_at":"2026-08-07T00:33:01.387447Z","submitted_at":"2026-08-03T12:34:31Z","title":"PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs","version":1},"reference_index":126,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:00.303154Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2608.02150"},"observation_digest":"sha256:7b1bd0b42ddbcefffb0d63c2e5b47c414b6110b94b4d79d051d854a9cdda247b","observation_id":"9fce38af-f563-4acc-9a48-9305c6f2779f","resolution":{"observed_at":"2026-08-04T13:44:00.303154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-07T00:11:49.330615Z","title":"arXiv preprint arXiv:2410.04417 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02150","last_updated":"2026-08-05T06:57:37Z","snapshot_observed_at":"2026-08-07T00:33:01.387447Z","submitted_at":"2026-08-03T12:34:31Z","title":"PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs","version":3},"reference_index":126,"source":"arxiv_source","source_observed_at":"2026-08-07T00:11:49.330615Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2608.02150"},"observation_digest":"sha256:d4ced6e1d527c4636aa00f8d09468ef7d5073aab452177a737ec57c87b755fea","observation_id":"d90d2f09-80b8-4317-9a7c-8dd086e32d4c","resolution":{"observed_at":"2026-08-07T00:11:49.330615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-05T15:19:02.848690Z","title":"SparseVLM : Visual token sparsification for efficient vision-language model inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03649","last_updated":"2026-08-04T13:33:11Z","snapshot_observed_at":"2026-08-07T00:26:34.130807Z","submitted_at":"2026-08-04T13:33:11Z","title":"When Do Fewer Visual Tokens Accelerate Multimodal Inference? A Break-Even Study Across Decision Locations and Hardware","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:02.848690Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2608.03649"},"observation_digest":"sha256:10e86c710b468f5f11e32f3ee6f89a32fae9ca015379c3a4159e2017d4620f4e","observation_id":"4a8e9594-1b6f-4d93-94d8-584de078c6d5","resolution":{"observed_at":"2026-08-05T15:19:02.848690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-06T20:51:55.628743Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04610","last_updated":"2026-08-05T09:15:43Z","snapshot_observed_at":"2026-08-07T00:40:02.631875Z","submitted_at":"2026-08-05T09:15:43Z","title":"HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T20:51:55.628743Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2608.04610"},"observation_digest":"sha256:f60ff458e64030e26131a6878f6bb59ece7c068529857d287b9164e9c6a89d7d","observation_id":"f2d000b7-99be-459f-bbe9-761c964d9e12","resolution":{"observed_at":"2026-08-06T20:51:55.628743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.04417/citation-record","integrity":"/paper/2410.04417/integrity","json":"/paper/2410.04417/citation-record.json","paper":"/paper/2410.04417"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"fa381b5e-5991-4bbf-a49a-2e90138d814f","year":2022},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:28cc67b1f459d11f05a8f871d6ee173a5a303a43bee89c5d91cea781df130c1b","observation_id":"bbe4c423-ab03-42f4-b5e2-fe252c8a6b48","resolution":{"observed_at":"2026-05-15T14:58:32.688841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:44e4224b5fd1131247aad12f278cfafb93a80fd6153337f2567659fd5ffea462","observation_id":"cd787a66-e539-4c2f-8b84-95613a1b46eb","resolution":{"observed_at":"2026-05-15T14:58:32.371498Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token merging: Your vit but faster","venue":null,"work_id":"671514fa-294d-462f-b530-bd25a0b38101","year":2023},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:b11137f9966c1c73ebf91c27c19957039b0ee10eb772417f11f6c740f2dda678","observation_id":"1a401b2f-33b0-4831-b485-4e2b6f5922a8","resolution":{"observed_at":"2026-05-15T14:58:32.694311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":"9c4d1f20-8715-4aaa-9bb1-9420a625a69d","year":2020},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:8c2ac19f759b21488f345f4ec7babdba79ea9ad73fc3a273a469dde8b2715eb1","observation_id":"1bf9eeb3-61b2-475b-9457-47bfafa855c9","resolution":{"observed_at":"2026-05-15T14:58:32.697775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9dedb931-d4a0-4bbe-8674-ef4b4d38a5ed","year":2025},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:1bc791fe637107df35f5db157451233480b9903b6ced7dcdec6a36b45359c80a","observation_id":"cafe519d-cde9-4316-b842-b24e6df4374e","resolution":{"observed_at":"2026-05-15T14:58:32.701238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":"91357f62-18f7-46bd-bb59-ff97a013427e","year":2024},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:983aa05d9f060b50fb9ee763ced6e6fe14157a54d85fb1a3fdb7aa86e7498ff4","observation_id":"7f725070-82e0-43cf-8883-b6dc3f650174","resolution":{"observed_at":"2026-05-15T14:58:32.704832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"78dd8457-6eb3-4ab2-a08d-27112df769f7","year":2024},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:5a69baf3e20e8fa01c486fc7d6c1128157045386dd7ce95136d6eb11361ce101","observation_id":"4b3d7932-8a27-4b6e-a91b-f19c9a050d7e","resolution":{"observed_at":"2026-05-15T14:58:32.708547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"63fcd57f-124a-4eda-929a-ffe2b70acda9","year":2024},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:cf7d27d9a444431f600635d68835f96ef8e556efdd0dc8bfdc9199d6e8378cb2","observation_id":"76c7ad83-e08f-4570-a827-5f62e76e5301","resolution":{"observed_at":"2026-05-15T14:58:32.711855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instruct BLIP : Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"b6eeb0e6-a108-483c-b9fa-2ed57a043376","year":2023},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:9610dabe0bf77cc6549c2cd4deaf9c84c9ddbb7fda6d5b351cc058c7290a3a43","observation_id":"a57b32f8-ea2a-4b29-b11b-3d09a8ca36f4","resolution":{"observed_at":"2026-05-15T14:58:32.714936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flash A ttention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":"ae95e931-20ae-44a0-a118-3f8aa3c71747","year":2022},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:3d3b7d5a182f8cb45c81828af64703c51e2968449fdd539968464b5e3f3e30ee","observation_id":"254cd483-b4ca-46a6-847b-d0ff915f4d1b","resolution":{"observed_at":"2026-05-15T14:58:32.718501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glm: General language model pretraining with autoregressive blank infilling","venue":null,"work_id":"27e2fa62-4c33-4402-8893-5b4fc96c5786","year":2022},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:cfaeac1b9c9ad2c141781f3a972b2bc11fd7f67bc36f18bb6db5af8065252988","observation_id":"ff3b4942-7816-4ee2-a132-6ac3117703a5","resolution":{"observed_at":"2026-05-15T14:58:32.722087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:2831837b6b59e841a30307e16c1d2f0db462ddf0d40ccc41e97c7be2d3c1dfbd","observation_id":"92526777-bc9e-47d2-a87d-a1b12af27062","resolution":{"observed_at":"2026-05-15T14:58:32.395041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"88039080-6bbe-4c86-b159-dc14ab6d0e82","year":2017},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:c05cf08798ca0311636e42a1f771d895f9be69137dad0653ddf516e73b8927db","observation_id":"f9c66094-2fab-4ff3-a26d-645bd5c45850","resolution":{"observed_at":"2026-05-15T14:58:32.725577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f576b6da-0227-4731-92d3-ff1b895e80c0","year":2019},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:d9eff412eaef5db665664a22328138b6709cc70180ed3ac4f3bb5bc98e199115","observation_id":"8aa3d3cc-adde-4128-b499-10de1ef2cafa","resolution":{"observed_at":"2026-05-15T14:58:32.728853Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tgif-qa: Toward spatio-temporal reasoning in visual question answering","venue":null,"work_id":"028e79f3-54bd-4761-bfec-bdc9b59172cb","year":2017},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:e123e8ad3ca8d6ec6067078159a577fe1143ef15e38eb2679e7016de235b7790","observation_id":"f4a288f2-9cfa-4c01-b2c2-7f927990e616","resolution":{"observed_at":"2026-05-15T14:58:32.732110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videopoet: A large language model for zero-shot video generation","venue":null,"work_id":"e74700ba-a44e-4a63-ae19-4af784de3bdd","year":2024},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:dbaa3cb463897a5dea33010039ad775c89eddb85b8317c729ba42663ec04725c","observation_id":"641ea025-3580-4247-ad2e-b03e7e3498d5","resolution":{"observed_at":"2026-05-15T14:58:32.735220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Seed-bench: Benchmarking multimodal large language models","venue":null,"work_id":"f5dfabf0-bd64-4ebf-8885-d7396dcb95e4","year":2024},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:7faf733b22e3243df59566b3bead5ee6385ac146127494018e4e4e967878faa8","observation_id":"c5880045-832e-43ec-8c78-0c13e6d2cb5b","resolution":{"observed_at":"2026-05-15T14:58:32.738307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"b21ce429-ad2f-4712-bfe4-614db7cdc9fc","year":2023},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:d2857fb4ca9c446bd016540c6b1c5e1f20d89f125ff1f677e5c718512d379dcd","observation_id":"52163e20-d853-4853-b04c-3f3b9d4b32b8","resolution":{"observed_at":"2026-05-15T14:58:32.741445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X., and Wen, J.-R","venue":null,"work_id":"0b962668-4e15-4897-aca4-f8742b871b6e","year":2023},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:9be187697d233280dabfd18227e682f446f0d218c781643464ff68c5c52122d2","observation_id":"04fb6005-a86e-4d52-8934-9e354e6c6090","resolution":{"observed_at":"2026-05-15T14:58:32.411376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLaMA-VID : An image is worth 2 tokens in large language models","venue":null,"work_id":"69178687-3481-4c0e-8632-1721c302f381","year":2024},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:722b73e1c2225b0fbce37b8a2a7ea91c13110eba23d6d11e6397209bed62c6d4","observation_id":"546aa8b8-bc21-4b7b-ba8b-9a0e60644508","resolution":{"observed_at":"2026-05-15T14:58:32.414752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":"58502426-0a05-4888-9a19-14831eac3dd2","year":2024},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:8c84159b943268cf32270555eab9c76969acbb7afd00b0e238b4590e78b4cbc9","observation_id":"fc677043-36e8-499e-b951-f40ebe3202d3","resolution":{"observed_at":"2026-05-15T14:58:32.418273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f9606897-ea83-4110-b46e-515341084ff7","year":2024},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:64aa0b287c13f488552b408cddeab7d3ee1592dc49177cbbe3be64c26d775afd","observation_id":"1e1169e2-7dc8-4c42-977e-28830054fe61","resolution":{"observed_at":"2026-05-15T14:58:32.421767Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"86cc42ad-a8cc-4263-ae59-88df8403708b","year":2024},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:48d6feaf0dd5a118522fc49bfe12bfcf334d972536040ce98288818e13920b0c","observation_id":"1670af51-a156-45e5-a905-798c7dd2a347","resolution":{"observed_at":"2026-05-15T14:58:32.425288Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmbench: Is your multi-modal model an all-around player? In Proceedings of the European Conference on Computer Vision, 2024 c","venue":null,"work_id":"f9c56c28-95b4-4be3-815c-d05070e97d84","year":2024},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:dd38d4f4939f349c78044c24f0359bd6901b0d7f36887cc4488f47ed46d5bda3","observation_id":"e716eee0-0727-4e68-8209-d2badfe2593d","resolution":{"observed_at":"2026-05-15T14:58:32.429539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A convnet for the 2020s","venue":null,"work_id":"d8d67414-910e-4163-bcdf-89b2391c8eee","year":2022},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:6f2491ed2b117e5d3bfdce8f0795f70a752f47e6012b92f3ce3c687922e61ed5","observation_id":"0b880c23-be0f-497e-8c54-10518daf84cd","resolution":{"observed_at":"2026-05-15T14:58:32.433274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"0aeae8a9-d21d-4fbf-bbf8-bd596f98ce76","year":2022},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:9eb71bc0611190eb24fe8507c4a025551346ca71e6a56c038d215f5347ab4e11","observation_id":"1384f337-b89e-4f90-b802-c3f1b397ba53","resolution":{"observed_at":"2026-05-15T14:58:32.436749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"9e4b30d4-be41-4ea0-91be-09ac103a6b69","year":2024},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:ec95bfac8a08d6f1bff453142349836c1aa4d101ba831e0abfa6b1723d906918","observation_id":"96097744-1bae-417d-bb5c-5b618c1f49ba","resolution":{"observed_at":"2026-05-15T14:58:32.440476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision: A computational investigation into the human representation and processing of visual information","venue":null,"work_id":"3768e4dd-460c-4453-a247-7fd6418a1819","year":2010},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:ed78f14412465e1ca0330da23e05cfd2de4db14e0c67fe23275d84c563b66eb2","observation_id":"40912adb-d435-4732-b824-833bcb3049bf","resolution":{"observed_at":"2026-05-15T14:58:32.444161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"a1401ce7-2d99-476f-af56-3ff9a2f01d1b","year":2019},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:35ac02e76c7b57d724d6bf2302b67a3e37bdfda66b11299a8c9f5380b7bbb7e5","observation_id":"1324da50-7d94-4321-afd7-6cebe2d1146e","resolution":{"observed_at":"2026-05-15T14:58:32.447691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clustering by fast search and find of density peaks","venue":null,"work_id":"9ef13263-8305-4ee1-943b-d255884c653e","year":2014},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:ef106b1f2e65477d7e0da58f6067992faa9cb0b7aafa383998f41bbd73c9e350","observation_id":"39cbe1d0-fb5e-4aa6-a2a0-fe81294ae6bc","resolution":{"observed_at":"2026-05-15T14:58:32.450803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards VQA models that can read","venue":null,"work_id":"bab50b3d-9985-47b1-baf2-3832d6fb2fc7","year":2019},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:23c30152670560487a42618b7ba626a60a4ee87ed4aa4f04f819eb16c58cf37c","observation_id":"4cf49f61-7616-452a-ac68-1acacc84ba21","resolution":{"observed_at":"2026-05-15T14:58:32.454218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5b0b61f4-6fef-498d-97eb-c5e2e4ad84bd","year":1993},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:4b300bf4643c8c497df8f815740fd7d55abd637a31f6c83a2087a23b4b160e3e","observation_id":"ab59e97b-3e02-4df7-bc2a-78daf15a3f6c","resolution":{"observed_at":"2026-05-15T14:58:32.457610Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"N., Kaiser, ., and Polosukhin, I","venue":null,"work_id":"4c81b32a-d46a-4326-ac9d-e23b7c2fb64c","year":2017},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:ea765ebceb0aa1e185a94595de07b3e4bdc0515d31354bb572945d76a7aac059","observation_id":"0f25f953-2a84-4b5d-8723-49d9b3ec9fe5","resolution":{"observed_at":"2026-05-15T14:58:32.461069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Q., Wang, Q., Gao, Y., Xu, Q., Xu, T., Hu, Y., Chen, E., and Shou, M","venue":null,"work_id":"32708d09-20fa-4bcc-aa2e-98c00a905959","year":2024},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:22fb83b4a135a29b1ce23a49a86b3ebc71bd1065a964fb8f50e4ddab321de009","observation_id":"1a0f098d-100b-4a31-bd7a-cf6bd86f49b7","resolution":{"observed_at":"2026-05-15T14:58:32.465147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyramid visual redundancy reduction","venue":null,"work_id":"ea7aa37e-6d04-46c3-9c3b-1911cce13d45","year":2025},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:6c6739836f4e0f47fc231cc27400c5ec62bc7dafcee247394f6436ee1bb90c40","observation_id":"edc6858b-c696-4eaa-b4eb-28514079b42b","resolution":{"observed_at":"2026-05-15T14:58:32.469235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video question answering via gradually refined attention over appearance and motion","venue":null,"work_id":"7c0d424f-8db6-42c4-8ba3-8e82b5c7bbcf","year":2017},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:6e23403895b4b783c6f62a3c999c043c9efe37acda3ae1e34ec4cbc91740be8d","observation_id":"4c61b5a2-368f-4dc9-8d3a-ac6c510359b5","resolution":{"observed_at":"2026-05-15T14:58:32.472826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-04T13:01:39.904947Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2405.20985","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-07-04T16:39:57.301173Z","title":"Deco: Decoupling token compression from semantic abstraction in multimodal large language models","venue":null,"work_id":"72b8bcdd-c399-4415-a8e7-ca6f24d31b48","year":2024},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:d907bfb1ea7995df1312531d4d9d1d29e695791c2fdd70cf585fcbef444cf1aa","observation_id":"139efa7c-ec3a-43f4-b657-741794c2b013","resolution":{"observed_at":"2026-05-15T14:58:32.399310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VoCo-LLaMA : Towards vision compression with large language models","venue":null,"work_id":"9e9cda22-4f32-4ddc-95e3-3c07f906104f","year":2025},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:072adf7ef9a47979d8702063f1577c0a56277519347295c7487f32ba1a53dbcd","observation_id":"20e3e900-2492-4fc6-94a2-4a48e6faa88a","resolution":{"observed_at":"2026-05-15T14:58:32.477231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":"c5b1c123-dfad-481c-a418-1d8819b1d58e","year":2024},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:30f74fa189c21bd7e6d186a0bf1bf8b336892846dedb35f5ffa44b41ba0756a0","observation_id":"cf1e51f3-4088-4d9c-a1ea-a29d20ea99b3","resolution":{"observed_at":"2026-05-15T14:58:32.482247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":"b39f105a-c980-46a3-9e5b-06967cebeff8","year":2019},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:f662f1db19720834da130ae39a2da99353aa81553201d089115da5359ecb5066","observation_id":"9d820b12-87ab-4189-8888-df4f77de4dea","resolution":{"observed_at":"2026-05-15T14:58:32.487154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unveiling the tapestry of consistency in large vision-language models","venue":null,"work_id":"8fcd4beb-d393-4fe8-9d3d-8c4e27c0aac8","year":2024},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:bc5001b212e4c5710d972cd0e14266c3d4d7d5e064e6d33a5b796d0ae10de3ca","observation_id":"afc66c46-bd6b-40b2-9fda-f8f806fd62b7","resolution":{"observed_at":"2026-05-15T14:58:32.492153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Freekd: Knowledge distillation via semantic frequency prompt","venue":null,"work_id":"d59fac89-18c6-42a5-ae29-ac8545b8c83b","year":2024},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:40fd8aeee06cc30bbaf78bdd7aa2cd888e27cb6183f2ea2841f53a4edbb4a0f7","observation_id":"e7e7e5a1-7f14-4504-905d-66405628a671","resolution":{"observed_at":"2026-05-15T14:58:32.496612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Languagebind: Extending video-language pretraining to n-modality by language-based semantic alignment","venue":null,"work_id":"cb1da458-7f92-493a-970c-7ce082b15aa1","year":2024},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:eeefacd3505068f8aef80c52b213ce67e6460c6ce65ab367eb1f414bd6ef45e9","observation_id":"b6b3b280-f33c-47d6-ba60-6b2a9b2c8f5c","resolution":{"observed_at":"2026-05-15T14:58:32.500572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":"7c62250c-240f-4d84-9d55-f6b739817029","year":2024},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:b6836dd4f2e847d645e3ee3a97ddab014c66e900edf2ceaf65c8a37f0fbf020b","observation_id":"9dbea14a-1625-433b-94d0-474443087fb7","resolution":{"observed_at":"2026-05-15T14:58:32.504948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:07:05.804778Z","title":"Scaling Learning Algorithms Towards","venue":null,"work_id":"bb2761cc-98d0-411b-92f6-803773d64460","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:2afb831d248f3f732bad44a4f925cde2191e8a02ff7ee1dbedd20cbe9c7a48ea","observation_id":"62c34109-145b-421b-aafc-86aa2e22a468","resolution":{"observed_at":"2026-05-15T14:58:32.509259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Osindero, Simon and Teh, Yee Whye , journal =","venue":null,"work_id":"2b0bb424-b7ac-466a-8277-22300abca223","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:066bf3d42b5d79e0346f91ab8140597815c0f17a9742620e49ee8874c1052bde","observation_id":"9ecf8bcc-c241-4b63-814a-1dbe9498f065","resolution":{"observed_at":"2026-05-15T14:58:32.516390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T21:57:45.913036Z","title":"2016 , publisher=","venue":null,"work_id":"cf0899e0-53ee-4591-aae4-f38fa5ac12ad","year":2016},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:2b750134e29a607a735cadf25b59e32721d7ff5b71a63bb63afd7f44ece2c40a","observation_id":"185d2150-c75a-4db9-9081-0ac4aa0fffc2","resolution":{"observed_at":"2026-05-15T14:58:32.520258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Computer Vision--ECCV 2016: 14th European Conference, Amsterdam, The Netherlands, October 11--14, 2016, Proceedings, Part IV 14 , pages=","venue":null,"work_id":"252e1d5f-d98c-40b7-a6f7-0bbeb79686b9","year":2016},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:956ef2e073510767e6275a64aa101e75948b44fcde9a78f6712cea127a82b84d","observation_id":"1d4ce623-25d2-4c26-b28d-886bfc5eaeab","resolution":{"observed_at":"2026-05-15T14:58:32.523886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Machine Learning , year=","venue":null,"work_id":"f00d7153-b268-4e8b-be73-92fed6a7b3e6","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:162cd60bd06c1ba49c470b3e5160b5d0e73784ef29690855ea8dedb08d78f1af","observation_id":"d402cc9e-6924-48d8-9f7c-268614322812","resolution":{"observed_at":"2026-05-15T14:58:32.527701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition , year=","venue":null,"work_id":"8a7bdf43-dc09-4211-8676-975b89f17dc0","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:81dd943e0ecac31cbd27a7dccce591ee5673956a11fdbcbd62e010af0efcc082","observation_id":"27a38d1e-fb27-4d06-aa45-86c2f34827d4","resolution":{"observed_at":"2026-05-15T14:58:32.530801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T00:04:22.812551Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":"67e4b783-63c9-42ea-a880-61daa03e53b0","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:bc0ca1d32667f70e4284b4f36dc837344a369dad674e11bb0eed0164d1044d24","observation_id":"f56280d5-867e-4094-8128-348abe91a2a6","resolution":{"observed_at":"2026-05-15T14:58:32.534089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:57:07.641327Z","title":"OpenAI blog , year=","venue":null,"work_id":"e9205f00-c9f5-49ab-a6d6-29c54de4d990","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:db66c8db8f2ed4e3072340712aa4159e43d9b4c8df27b481095bbe26e9f68b15","observation_id":"c5973323-64d2-4a50-9985-f79741b4a740","resolution":{"observed_at":"2026-05-15T14:58:32.537061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:2c2d04c22f641dde1b4f0bf020c1fb36608303cb962438b4a8df3994897048e8","observation_id":"3c1983c8-290a-4a6f-80c5-10ed6eea9450","resolution":{"observed_at":"2026-05-15T14:58:32.344640Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepseek","venue":null,"work_id":"b860d555-f5aa-42cf-b5c2-3a389b1ef8eb","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:0bc1aa870a3fa4d930efc03690513ba50797b8189609a12c019528492b0de041","observation_id":"82166124-1841-4514-8bd9-a1f346978f1a","resolution":{"observed_at":"2026-05-15T14:58:32.540566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:c9901a2ab1aec51923282d5ab97ac905e01398838660091a7c0baa94c4a7fc7e","observation_id":"cb085220-253d-4d0f-9c7f-a94f8ee1f1a9","resolution":{"observed_at":"2026-05-15T14:58:32.375873Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":"2304.03277","doi":"10.48550/arxiv.2304.03277","metadata_source":"pith","pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Instruction Tuning with GPT-4","venue":"cs.CL","work_id":"fd515477-f9f1-48aa-9feb-a3308e7656bb","year":2023},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:5b0dae62fa1fef48f71ca2a4593e5301ebc3cf17b23a02a2eddd8e3c67430741","observation_id":"73df4974-5e08-46fb-bc36-d5f822fb6dbe","resolution":{"observed_at":"2026-05-15T14:58:32.379830Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":"2b6d88b4-3a15-41cc-a4c1-0f128fcc535b","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:c77f0ec7aad8be5f4340ab293abb8370f21871ab1f8540a1477569efc1e87e0a","observation_id":"38f1d31b-8b4f-45ca-a2cf-465ef4bdd60d","resolution":{"observed_at":"2026-05-15T14:58:32.543823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition , year=","venue":null,"work_id":"b937742d-2804-4f68-a889-c2bba5ddd17a","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:2343988315c6a0979cfbfd038291fe5912f626723b944c8525f4f1723bfc65cf","observation_id":"d9bc5d36-7143-40cb-95ea-5256385aa9a7","resolution":{"observed_at":"2026-05-15T14:58:32.547628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":"53cef6f9-aa4d-4622-9326-3786e2376913","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:258c3ebe25a4789cb5dcf085416651c50746585371a65cd397fa18f874dc299f","observation_id":"bd1f434b-ac0a-4523-83c1-3a224f41f5ed","resolution":{"observed_at":"2026-05-15T14:58:32.552587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":"2403.18814","doi":"10.48550/arxiv.2403.18814","metadata_source":"pith","pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","venue":"cs.CV","work_id":"70d699a8-f265-4862-b60f-3b62ca85f6d8","year":2024},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:a2ee4d2ff846c297af5f952d94c7dee4255e4efb18d80489da93b735973ee029","observation_id":"f358fb2f-dda9-4cc7-86cc-12fe91e0de39","resolution":{"observed_at":"2026-05-17T07:44:47.683285Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:07.759194+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:07.759194+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the Annual Meeting of the Association for Computational Linguistics , year=","venue":null,"work_id":"abd8a171-0ad3-4a79-b9fe-cce52898ec98","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:c41ec540bd9d82d2d7e4d4e42cce9290958da061030df07eeaf453412e5931fd","observation_id":"9a415b51-90f2-4a9c-a614-397ca336a455","resolution":{"observed_at":"2026-05-15T14:58:32.556362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"489ed2cb-a9e0-44b6-b413-37a077c4e9bb","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:caa8cc036a19ddd605848ed56a8840bd069ca0b4afa08d5304d99c0f0b7dfe13","observation_id":"392c2795-8ad4-402a-9ede-dffd78bbd27b","resolution":{"observed_at":"2026-05-15T14:58:32.559685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the Conference on Empirical Methods in Natural Language Processing , year=","venue":null,"work_id":"617d9c2b-a3ad-4e9b-88a6-80e2c53f04e8","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:ffa0a0586c3084836d2d3efb9daa9b51b26c15d17b84ef5847b86cc5e7c414e6","observation_id":"3a6be316-e1a7-4ae3-b40e-c1f41febb8f5","resolution":{"observed_at":"2026-05-15T14:58:32.563762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:925590a9e553368c93b597c207cd65d14183c3d0279dbbe46433f1e5e3a7caea","observation_id":"e06f6570-92e6-4b4b-88b7-f28a537fbc80","resolution":{"observed_at":"2026-05-15T14:58:32.384055Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:47f826b41253d098227e03e66303a7680eaac85636b4703bf074e8fbcc57c0ea","observation_id":"a160a8a3-5b59-41a7-ad44-a867a787e175","resolution":{"observed_at":"2026-05-15T14:58:32.391559Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T20:52:55.287956Z","title":"LLaVA-NeXT: Improved reasoning, OCR, and world knowledge , url=","venue":null,"work_id":"e71d9099-0256-41d4-aa32-5c68d9b02eb8","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:5e1d8a7935ca21d33fb180c8ae9d8430001d22aa37ec277f1b9d460d9ebd6fb4","observation_id":"360ab59c-956e-4d05-8d77-280c5bdab154","resolution":{"observed_at":"2026-05-15T14:58:32.566826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition , year=","venue":null,"work_id":"2694ad62-a5ec-4eb1-9a6e-daa4826a31a2","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:674eefcdc3e6670b02128aae0db75f5317695dad6575789fba9d50f5a6cdefe2","observation_id":"8dea3b02-ea03-421a-8155-ebd80b743fa2","resolution":{"observed_at":"2026-05-15T14:58:32.569559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":"2311.12793","doi":"10.48550/arxiv.2311.12793","metadata_source":"pith","pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","venue":"cs.CV","work_id":"90e2b26a-3d27-4567-86b5-929b582a8034","year":2023},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:6dd1d78cff40fd677cc1df3b7232b7e05b6c8fccbe4b286dbe27b4e0d00b029e","observation_id":"da95dcf1-1602-4433-8d9e-d8128bcd57fa","resolution":{"observed_at":"2026-05-15T14:58:32.403358Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:85754c89016eaa6f40cbcd523b69c2190f9ba46c5cfb73e1a9c0a1e08aebf0f4","observation_id":"724ddaa9-7e39-4b2a-adf6-984c04aa1b4f","resolution":{"observed_at":"2026-05-15T15:46:06.589810Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7c07f4b9-9d03-47e7-90b3-35633b5e5f0f","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:d049ec97b911f459f5500fef38872a1f8c38a6a334cd271b4cd51de63fe99627","observation_id":"cbee58ce-9561-45fb-8ed3-bd9709de813d","resolution":{"observed_at":"2026-05-15T14:58:32.572136Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition , year=","venue":null,"work_id":"c6ca7529-fb2c-4775-8286-e5500fc4392b","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:40f4ab59ed7dbde55fb743597d440123b24f8bb6a1705e6b84cc8dc475601c8a","observation_id":"824b2051-9475-457d-bb27-6fbce43df43d","resolution":{"observed_at":"2026-05-15T14:58:32.575118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":"2304.14178","doi":"10.48550/arxiv.2304.14178","metadata_source":"pith","pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","venue":"cs.CL","work_id":"74a7deb6-48be-4132-9d35-882cc5870ebd","year":2023},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:34388f926ae36e4459e95af06cddf44b45cd9f3e535c201ea81b07267705f1d5","observation_id":"dca7e261-89ab-422a-802c-6b3872e4f7e1","resolution":{"observed_at":"2026-05-15T14:58:32.359216Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":"2404.16821","doi":"10.48550/arxiv.2404.16821","metadata_source":"pith","pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","venue":"cs.CV","work_id":"3714835e-c5a6-4d7e-950c-be44670ed9e6","year":2024},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:a7229ea500f138d8f95f7d81bf57df2056a46c160d763bc494039ecba07cc715","observation_id":"cc6fb78a-8f51-4d87-a3fd-bbabd8d802cd","resolution":{"observed_at":"2026-05-15T14:58:32.367631Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Machine Learning , year=","venue":null,"work_id":"a4402204-e462-4755-b4d4-fb7cef07acf7","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:10bbae398c86df80cd217ef0d84f75256ceb3c93a8a62ab64476bb756dd7cb3f","observation_id":"25168446-00a5-41c8-a819-b503e95ef52e","resolution":{"observed_at":"2026-05-15T14:58:32.578134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:57:21.325337Z","title":"International conference on machine learning , year=","venue":null,"work_id":"8121171c-5285-402a-9371-97bd8a54e0cf","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:2183066ee1c3d5a94c3c4159d44ec8943ab8dca5f172a47e7a334a08bf254226","observation_id":"ed1294c9-16a7-4cdb-b083-74ffbc8090bc","resolution":{"observed_at":"2026-05-15T14:58:32.581052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Machine Learning , year=","venue":null,"work_id":"21c1d939-35a9-45bd-be2a-f68feffc4914","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:86b48c11ddc3ee513588b01220f0016cf55b2ded0ac1becf37bdf30279b53a60","observation_id":"65b3a6bd-ec2e-448a-84a5-253ae723cf52","resolution":{"observed_at":"2026-05-15T14:58:32.583629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":"91989c07-3a68-46f5-a447-da73fb6e64cb","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:49289d5fe8ab5f3ae00c46cf36f6931b0520e829817ac1507228d7d9a95e3078","observation_id":"092dafaa-0a0c-4637-8314-1f7a742092b9","resolution":{"observed_at":"2026-05-15T14:58:32.586511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2403.15388","doi":"10.48550/arxiv.2403.15388","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":"6da9a077-fa9e-4020-bdb4-f30c9ebb0fc8","year":2026},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:3bec2e9b23b714d0a80f6d58efc6d50d18449c75eb9f293b0ad0a376e6810df2","observation_id":"727270f8-54fb-486b-99bd-d1865ebaef68","resolution":{"observed_at":"2026-05-15T14:58:32.387959Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c4a89d2c-e28d-4fea-8f39-3f3ec8294d47","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:84e51fee8d4419a0fe85530d57a248f1816c7567c54fd0573e808713bfa8fe07","observation_id":"af9b45bb-16e3-4637-92a1-c2a7ddcd15c2","resolution":{"observed_at":"2026-05-15T14:58:32.589099Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cd7430e1-7b55-4aa9-be37-7a6e6e85eacf","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:962225bf96caf44ad4fe8aef510488d36b37b7b3722d43ca0d84a5563aca9087","observation_id":"c9aefdaf-9374-44ea-ac70-d913f6aca89f","resolution":{"observed_at":"2026-05-15T14:58:32.592158Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instruct","venue":null,"work_id":"72f1b6e9-8ef2-4122-92c5-0e1822c9c06e","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:18d7e3499b06bfb51de6452fba936f52a394020510d6f29723daafe7272b490b","observation_id":"a4415560-5b8b-4497-8b74-8ea0dab43bd4","resolution":{"observed_at":"2026-05-15T14:58:32.595080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":"8c96e59d-8a80-45ef-9402-06f22baf7048","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:327a9adcf8330401f3ee58ac1f30c282028abc77b026cca580b979282fce7e08","observation_id":"579f9052-de24-4511-85f3-737e6c5bd333","resolution":{"observed_at":"2026-05-15T14:58:32.598133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition , year=","venue":null,"work_id":"b7370743-6e0b-4fa5-bc56-037f5655327b","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:b2fbd32428dd7cbe26c42bf8ac1a06152d50386adf5012ca2ac61f91c868e5f9","observation_id":"c9388f0e-fb0a-42db-a212-7db617d249d8","resolution":{"observed_at":"2026-05-15T14:58:32.601739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fc83bd85-b602-4fa1-849c-e99db88e7538","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:3994c0898d19f35bdf4ad5dc9cdda98c49aed7a526eeee53b3f732698fdd3523","observation_id":"f6c79a3c-e83d-433f-9635-e69183b1a5a9","resolution":{"observed_at":"2026-05-15T14:58:32.604473Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the European Conference on Computer Vision , year=","venue":null,"work_id":"03823574-de0b-480a-a2c4-4c0528fcf130","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:07b0b64b9069c9190bd3c909da78b41f87fd0d16a742e46a3c05108e0516542e","observation_id":"67fd3450-cbfa-43b7-af75-589f7ceba8e8","resolution":{"observed_at":"2026-05-15T14:58:32.608289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"4dfa2e54-ebec-4e56-b540-2f23a97ba8f1","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:89806ea24a75475bbca2e688b889438c5a99d42a715f0caa34b83e9c1d77452c","observation_id":"2f5b6e13-0fb0-4797-a9b3-5570608c0b17","resolution":{"observed_at":"2026-05-15T14:58:32.611928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6963eb1d-c6da-4f4c-84f7-06d8f00b305f","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:3f1d3e7aa2ff2dc92185955a05e032c3be7deacd1a3738aba3f4723ee5f3563b","observation_id":"5bb5baf0-fa3a-4890-9701-37e117997244","resolution":{"observed_at":"2026-05-15T14:58:32.614793Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the European Conference on Computer Vision , year=","venue":null,"work_id":"fc59a7dc-cc27-4ac9-8560-60a0276c2102","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:a527092f39ec1bb9c598cc2a4909ee6c0f812517e7ecf15410b27263b8b12006","observation_id":"895ebd9d-7261-4327-8059-dbe2325b8ad9","resolution":{"observed_at":"2026-05-15T14:58:32.618542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0391ef88-3e1a-413f-974b-b1971785c45c","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:75437cd4a25413cbb16837fd4ffb41f56daa95e6dca595b9a407ee67b02bf96f","observation_id":"971c3880-3323-4c27-989e-90a383869f70","resolution":{"observed_at":"2026-05-15T14:58:32.622366Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the Conference on Empirical Methods in Natural Language Processing , year=","venue":null,"work_id":"3e7b7ca6-4dcf-41f1-b416-49d23cf4bdc0","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:6598e0c4f2063aee3a2e421e1488a50531501ffb7e98106eabf8d0ebf706fdae","observation_id":"443542ba-84bf-4bca-b0ba-2782d17ca12b","resolution":{"observed_at":"2026-05-15T14:58:32.626015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f2c8dcca-d07a-4ef5-b76c-472f1eb7b0ce","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:db42fab6d20227f044eca68fd96e804ab1fc913dd044cb3de2054d943cb21e6b","observation_id":"b92328e1-e9ed-4a72-9a21-0705373d1543","resolution":{"observed_at":"2026-05-15T14:58:32.629510Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE conference on computer vision and pattern recognition , pages=","venue":null,"work_id":"5d2f4e94-3656-42da-a179-55874b9e61b3","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:b27ad9e2933110ec375641520e9cf0d5cccd29778605e2c8e5027e756cd28091","observation_id":"23da06c3-f225-4ac8-8525-454173a2408f","resolution":{"observed_at":"2026-05-15T14:58:32.633110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition , year=","venue":null,"work_id":"43ce427f-5e80-497e-9fe7-346b673b8a3a","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:c5817c178434612539e79ad84b0da986b676069df2793055f1a06850a2cd428a","observation_id":"c4dd97ed-1855-49f1-99ba-c2b2ee2db692","resolution":{"observed_at":"2026-05-15T14:58:32.636166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:57:21.273875Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":"aa071447-42d4-4e6c-a01c-0fd0cbdb3e25","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:2b19f573711d8f42c167f55b4330bfcfe1d838ccab4de1ad85190087f9a98f4c","observation_id":"ff772063-fda5-404e-9a10-ffd34664517d","resolution":{"observed_at":"2026-05-15T14:58:32.639498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Journal of econometrics , year=","venue":null,"work_id":"726a2341-3699-4dbf-9b38-a3172f5487d1","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:474685c49eae8644835ecbd0a195caf1cd2c187e96e825f3d6961d5195ec3322","observation_id":"297c5267-576c-4530-b850-20752a3401d7","resolution":{"observed_at":"2026-05-15T14:58:32.643002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Knowledge-Based Systems , volume=","venue":null,"work_id":"ee1b4115-f0d2-409a-a623-38bca5cdd95e","year":2016},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:396cd05312148e447e6d1053ce26d253d94a863b1079818d5d8e19d510b4a80c","observation_id":"422cef44-6284-4bbe-93fa-ab0c24ddb7a6","resolution":{"observed_at":"2026-05-15T14:58:32.646219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Science , year=","venue":null,"work_id":"fc521ec6-eec7-4292-a090-5e4ae6232a59","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:e0230b0b89f1be397819d6849de54fdfa498097a4f784842af8a9669654b6dae","observation_id":"27e989b9-fb16-4f46-937d-0c8a7a92436d","resolution":{"observed_at":"2026-05-15T14:58:32.649741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2010 , publisher=","venue":null,"work_id":"8dc546c7-4c67-4ccc-aa2c-5a4baa42ba17","year":2010},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:058d76785e12347d407c72c47440256742587e459f1a09d6ec15d8186ae3d892","observation_id":"580920e4-29cd-4e00-9ad2-2b577764e17e","resolution":{"observed_at":"2026-05-15T14:58:32.653084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:22:58.626220Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"4f89185b-9286-4634-ad31-94fe270981dd","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:10fb42a0102a5792c253ed076b2e2a2e7d5084590a8e57ac47ef3e0c007851d8","observation_id":"35c8eff8-72f2-4ac6-bb04-8381b3b7f6f7","resolution":{"observed_at":"2026-05-15T14:58:32.656479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15219","last_updated":"2025-07-20T05:09:39Z","snapshot_observed_at":"2026-08-06T04:10:43.541431Z","submitted_at":"2024-07-21T17:09:19Z","title":"Efficient Visual Transformer by Learnable Token Merging","version":2},"cited_work":{"arxiv_id":"2407.15219","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15219","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2407.15219 , year=","venue":null,"work_id":"9415e684-7966-4663-92b7-45fbbef2f025","year":null},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"cited_paper":"/paper/2407.15219","citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:fdbb0e197b9bdb898c76e2039b6fb857545c1c0c48d8b5b039dd75e3aa0f3a22","observation_id":"cddc2a3c-ddc3-4838-9aa0-49b43fdb7468","resolution":{"observed_at":"2026-05-15T14:58:32.354566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":11,"parse_uncertain":0,"unresolved":12,"verified_exact":4,"verified_fuzzy":73},"total_outbound_references":113},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 113 outbound references and 79 inbound Pith citation observations for arXiv:2410.04417."}