{"as_of":"2026-08-18T20:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:56a5ef5f45fc4a479ccb4db96112f43561d7907c4ae13ecd50ef7fc1292cbf25","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":68,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:37:07.124097Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T01:44:26.264568Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-12T14:22:07.396842Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganiza- tions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-16T10:36:50.256297Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.396842Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:133b49e93f047d5723d10ad46337530337924e0d11bdc394e888b2709a4b6e5d","observation_id":"ea32277f-f74c-4b96-8501-641d1f696574","resolution":{"observed_at":"2026-08-12T14:22:07.396842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-12T14:24:43.505088Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganizations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16720","last_updated":"2025-04-24T21:37:00Z","snapshot_observed_at":"2026-08-17T13:41:18.242726Z","submitted_at":"2024-11-23T02:01:49Z","title":"Importance-Based Token Merging for Efficient Image and Video Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:43.505088Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2411.16720"},"observation_digest":"sha256:0938bb744b61518b0f98c57f55d862481e0e8d64c074735f6180edb29741e3dd","observation_id":"f40f2a9e-832e-417a-b5ed-3c029dbbfce2","resolution":{"observed_at":"2026-08-12T14:24:43.505088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-12T11:37:55.494689Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganizations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18092","last_updated":"2025-03-14T16:12:10Z","snapshot_observed_at":"2026-08-16T21:07:40.286111Z","submitted_at":"2024-11-27T07:04:00Z","title":"Training Noise Token Pruning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:37:55.494689Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2411.18092"},"observation_digest":"sha256:2fb303ae945bf49e78d852ef8b4c48fbbdeea9c54634dc9d781fcb0906fb0d5c","observation_id":"57d6bcf7-97de-47df-af2e-fe5c3a0cbd10","resolution":{"observed_at":"2026-08-12T11:37:55.494689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-11T22:35:24.251928Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganizations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-14T05:32:38.302823Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.251928Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:4ef2a3551aaa610023e44c2d23117b55469766dd38d5f284f4b7219d70078d79","observation_id":"37753420-09e9-4d16-b5a4-4b970e057cb1","resolution":{"observed_at":"2026-08-11T22:35:24.251928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-11T20:23:18.586120Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganiza- tions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05819","last_updated":"2024-12-08T05:29:39Z","snapshot_observed_at":"2026-08-14T23:05:28.608576Z","submitted_at":"2024-12-08T05:29:39Z","title":"[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T20:23:18.586120Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2412.05819"},"observation_digest":"sha256:a86ee4b00a4e83cb867460e6c511320ed95b5c8ed8b52a885d342af255fc15b1","observation_id":"506f0483-8b85-402b-8cbf-aa427a9dc19e","resolution":{"observed_at":"2026-08-11T20:23:18.586120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-10T22:20:45.721762Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02268","last_updated":"2025-01-04T12:14:42Z","snapshot_observed_at":"2026-08-14T14:50:18.945344Z","submitted_at":"2025-01-04T12:14:42Z","title":"What Kind of Visual Tokens Do We Need? Training-free Visual Token Pruning for Multi-modal Large Language Models from the Perspective of Graph","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T22:20:45.721762Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2501.02268"},"observation_digest":"sha256:da6ac165197d98d561772f39ce2f91a73612f5a0b0bee984db5a080864fdc826","observation_id":"d85d81fc-e697-42bd-84a4-8f63983b56d9","resolution":{"observed_at":"2026-08-10T22:20:45.721762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-10T20:13:14.582960Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganizations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.09410","last_updated":"2025-01-16T09:36:32Z","snapshot_observed_at":"2026-08-16T11:16:46.908376Z","submitted_at":"2025-01-16T09:36:32Z","title":"MoE$^2$: Optimizing Collaborative Inference for Edge Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:14.582960Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2501.09410"},"observation_digest":"sha256:00822f02f5b632f8b4e45094e10805d9270e772e3ca9cf0c8147b21647862446","observation_id":"91915679-b38e-4d0b-8eeb-1c4860918a1d","resolution":{"observed_at":"2026-08-10T20:13:14.582960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-10T15:50:03.922240Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13652","last_updated":"2025-03-09T21:32:52Z","snapshot_observed_at":"2026-08-16T17:43:41.789087Z","submitted_at":"2025-01-23T13:31:51Z","title":"LVPruning: An Effective yet Simple Language-Guided Vision Token Pruning Approach for Multi-modal Large Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T15:50:03.922240Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2501.13652"},"observation_digest":"sha256:aabd98e1859c4416664bf249d82953947d77b334ca0020556408da4dc377f0ea","observation_id":"570304b3-610d-413f-90f6-ae1b3a19bfff","resolution":{"observed_at":"2026-08-10T15:50:03.922240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-09T18:28:47.872619Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganiza- tions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-15T13:01:41.037649Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.872619Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:4991153d5d9b1df2689c79af897912b9f672184132524ebf3f9457b8841800de","observation_id":"e85b7bc2-e70f-4390-900b-f2e2245e06e0","resolution":{"observed_at":"2026-08-09T18:28:47.872619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-16T10:37:07.124097Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganizations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.17996","last_updated":"2025-04-25T00:43:20Z","snapshot_observed_at":"2026-08-18T12:14:55.349249Z","submitted_at":"2025-04-25T00:43:20Z","title":"Back to Fundamentals: Low-Level Visual Features Guided Progressive Token Pruning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T10:37:07.124097Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2504.17996"},"observation_digest":"sha256:44cab4830787b4420a2a826b5f75f22b574b702dd4a4696b9481ce8de7b2ce17","observation_id":"5e4cb527-517b-4265-9458-47b6e52d121e","resolution":{"observed_at":"2026-08-16T10:37:07.124097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-16T05:53:23.210832Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganizations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19627","last_updated":"2025-05-19T13:44:04Z","snapshot_observed_at":"2026-08-18T19:54:04.181549Z","submitted_at":"2025-04-28T09:39:07Z","title":"VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T05:53:23.210832Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2504.19627"},"observation_digest":"sha256:37d3b70900b9cefdc6edf1279400521efd4bb4103690607a09ffa823a21f8734","observation_id":"65787873-357b-40aa-86f2-0de5a299b0ab","resolution":{"observed_at":"2026-08-16T05:53:23.210832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-16T04:40:07.791930Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganizations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00630","last_updated":"2025-05-03T09:38:12Z","snapshot_observed_at":"2026-08-17T01:11:36.527426Z","submitted_at":"2025-05-01T16:07:51Z","title":"Vision Mamba in Remote Sensing: A Comprehensive Survey of Techniques, Applications and Outlook","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:07.791930Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2505.00630"},"observation_digest":"sha256:b9b409733e0a0b478d62c3b070ec7318d0d7854ae47d1328246cd3dacad48311","observation_id":"5ac41ef7-ed8b-4720-a9fe-96c7b757fedd","resolution":{"observed_at":"2026-08-16T04:40:07.791930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-15T20:42:41.737294Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganizations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12359","last_updated":"2025-05-18T10:44:45Z","snapshot_observed_at":"2026-08-15T20:33:15.654059Z","submitted_at":"2025-05-18T10:44:45Z","title":"STAR: Stage-Wise Attention-Guided Token Reduction for Efficient Large Vision-Language Models Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:42:41.737294Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2505.12359"},"observation_digest":"sha256:33f6b2d6b95feda1ef0b6e0ab1720befa95037483fec0b548b97727b5d3cc22d","observation_id":"fa1e6a57-f155-47d0-b020-47e66d4a603b","resolution":{"observed_at":"2026-08-15T20:42:41.737294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-07T14:08:08.089865Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-15T00:34:08.333930Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:08.089865Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:600e405d221977b2b59a812e84bd73458fff4c55a1441b92635ecf096bd67766","observation_id":"534f4d18-7d34-49ee-85ae-c58f6212dcc6","resolution":{"observed_at":"2026-08-07T14:08:08.089865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-07T13:54:45.870665Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganizations.arXiv preprint arXiv:2202.07800,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20698","last_updated":"2025-05-27T04:07:23Z","snapshot_observed_at":"2026-08-18T07:31:51.244341Z","submitted_at":"2025-05-27T04:07:23Z","title":"Sparsified State-Space Models are Efficient Highway Networks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:54:45.870665Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2505.20698"},"observation_digest":"sha256:a11332ec82cfcae929cf78fabe096e92dbe5de49d1c1af360202cd845ce18472","observation_id":"e8b292fc-de0a-451e-bd87-69d8a80c2088","resolution":{"observed_at":"2026-08-07T13:54:45.870665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2505.23617","last_updated":"2026-05-10T04:23:42Z","snapshot_observed_at":"2026-08-13T14:53:53.679447Z","submitted_at":"2025-05-29T16:25:35Z","title":"One Trajectory, One Token: Grounded Video Tokenization via Panoptic Sub-object Trajectory","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:31.765909Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2505.23617"},"observation_digest":"sha256:7e54c5f8f69ab1d04905975a57789d132ce6828af70d8852e547f91ac602af08","observation_id":"c122fa6e-153e-4d26-a697-61bf9e76d380","resolution":{"observed_at":"2026-05-19T12:57:17.898197Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-07T10:34:48.952540Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04997","last_updated":"2025-06-05T13:06:01Z","snapshot_observed_at":"2026-08-17T01:01:48.139433Z","submitted_at":"2025-06-05T13:06:01Z","title":"Towards Storage-Efficient Visual Document Retrieval: An Empirical Study on Reducing Patch-Level Embeddings","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:48.952540Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2506.04997"},"observation_digest":"sha256:150044b8fea123ba2ebcb201af1319e49051703f91de7051071ce9111e534f87","observation_id":"fd4a96a3-e744-4317-88b6-1a3852736fd3","resolution":{"observed_at":"2026-08-07T10:34:48.952540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-07T10:29:06.229026Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganiza- tions.arXiv preprint arXiv:2202.07800, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-15T03:16:21.055091Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.229026Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:c5bd0245145055dbb4d428481e709f98a34a744eb1ad2d2cf6984f5a3845f310","observation_id":"4ea22053-9204-4db7-8171-e2f7f4ebb9c3","resolution":{"observed_at":"2026-08-07T10:29:06.229026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-06T22:24:28.245119Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganizations.arXiv preprint arXiv:2202.07800, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21862","last_updated":"2025-06-27T02:29:58Z","snapshot_observed_at":"2026-08-13T09:08:08.645501Z","submitted_at":"2025-06-27T02:29:58Z","title":"LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:24:28.245119Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2506.21862"},"observation_digest":"sha256:ea401e73d7d2160fd58016a8b95302414e3f7f1d1b4a2f779058d9b6d9cdf93a","observation_id":"ee770358-a870-48f5-b5e5-9ec070135720","resolution":{"observed_at":"2026-08-06T22:24:28.245119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-06T18:03:01.459589Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-15T18:44:58.192236Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:01.459589Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:94014241b92511619d13ff617890e2adb9d73762a91329ba49f6fce820421f5c","observation_id":"ba871690-ba73-4293-b9cb-ef2c964ae505","resolution":{"observed_at":"2026-08-06T18:03:01.459589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-06T17:39:59.361077Z","title":"Liang, C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10283","last_updated":"2025-07-14T13:49:47Z","snapshot_observed_at":"2026-08-17T22:28:46.212706Z","submitted_at":"2025-07-14T13:49:47Z","title":"FTCFormer: Fuzzy Token Clustering Transformer for Image Classification","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:59.361077Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2507.10283"},"observation_digest":"sha256:8fa8a54b1dde55ec8326a46bcc2181d347a6733f15adcf689c29d26d2dff4e96","observation_id":"c5199860-0e89-4d3b-8de7-60e50dee72d5","resolution":{"observed_at":"2026-08-06T17:39:59.361077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-06T17:00:14.047818Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganiza- tions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12125","last_updated":"2025-07-16T10:48:56Z","snapshot_observed_at":"2026-08-17T07:20:29.845154Z","submitted_at":"2025-07-16T10:48:56Z","title":"Block-based Symmetric Pruning and Fusion for Efficient Vision Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:00:14.047818Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2507.12125"},"observation_digest":"sha256:a8c7d0bc357124e7d00f3ae067198053e52eabe738cb2c3ffb3c2bc76726ecfe","observation_id":"34bbf730-10a7-4fc6-9855-722f268c3662","resolution":{"observed_at":"2026-08-06T17:00:14.047818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-06T16:41:46.326936Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganizations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-17T06:49:15.581589Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.326936Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:26d61b50f59b4f442a2cb512687b60300e3c57811bafcce700bd5cffc8fe9409","observation_id":"fa967624-1162-48ec-92f1-0ca80caea4f8","resolution":{"observed_at":"2026-08-06T16:41:46.326936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-06T16:16:49.316349Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14042","last_updated":"2025-07-18T16:11:28Z","snapshot_observed_at":"2026-08-15T19:53:29.104020Z","submitted_at":"2025-07-18T16:11:28Z","title":"Training-free Token Reduction for Vision Mamba","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T16:16:49.316349Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2507.14042"},"observation_digest":"sha256:5f51c0c21bb7b00f5044b590b98b086e932ba95fbbc3209e48a67a5fc40d0b09","observation_id":"1f4dc3d8-4237-486d-a913-30bd5eb582de","resolution":{"observed_at":"2026-08-06T16:16:49.316349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-06T15:19:58.923885Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganizations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16260","last_updated":"2025-07-22T06:17:44Z","snapshot_observed_at":"2026-08-14T23:42:55.660740Z","submitted_at":"2025-07-22T06:17:44Z","title":"ToFe: Lagged Token Freezing and Reusing for Efficient Vision Transformer Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:58.923885Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2507.16260"},"observation_digest":"sha256:3573c48760092a9947718ff9ec51ff9ebca088a85e6a358c4661b0ce03d2cba0","observation_id":"87a9b2e3-3c2f-46d2-94f8-a85bd043f075","resolution":{"observed_at":"2026-08-06T15:19:58.923885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-15T18:05:12.154637Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganiza- tions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19131","last_updated":"2025-07-25T10:13:14Z","snapshot_observed_at":"2026-08-15T17:58:00.604994Z","submitted_at":"2025-07-25T10:13:14Z","title":"MixA-Q: Revisiting Activation Sparsity for Vision Transformers from a Mixed-Precision Quantization Perspective","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T18:05:12.154637Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2507.19131"},"observation_digest":"sha256:ee0760efb817cb648cac0f667c26ea1381ab8423f683bfe8f4c479558d6c8df0","observation_id":"9e74e16b-7f40-4407-bf36-e6fa0098a6fd","resolution":{"observed_at":"2026-08-15T18:05:12.154637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-05T23:36:20.258033Z","title":"arXiv preprint arXiv:2202.07800 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05111","last_updated":"2025-08-07T07:44:27Z","snapshot_observed_at":"2026-08-13T17:56:44.053849Z","submitted_at":"2025-08-07T07:44:27Z","title":"Toroidal area-preserving parameterizations of genus-one closed surfaces","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T23:36:20.258033Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2508.05111"},"observation_digest":"sha256:b6ce6fbff3cc00c34bc4c85f94e067592f5ae6014435738f462210d6307daef8","observation_id":"eea70726-d90f-4818-a205-c5dd4d7668f2","resolution":{"observed_at":"2026-08-05T23:36:20.258033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-05T13:19:13.602616Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganizations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00745","last_updated":"2025-08-31T08:36:51Z","snapshot_observed_at":"2026-08-17T19:33:05.188269Z","submitted_at":"2025-08-31T08:36:51Z","title":"Enhancing Fairness in Skin Lesion Classification for Medical Diagnosis Using Prune Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T13:19:13.602616Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2509.00745"},"observation_digest":"sha256:79e2578ecd3da43d3169cf2dab59e4d894bf20828278a20bd4a0b84ed7381464","observation_id":"dc572715-ba87-4965-8e26-67d65c612fae","resolution":{"observed_at":"2026-08-05T13:19:13.602616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2510.18091","last_updated":"2026-04-22T23:53:00Z","snapshot_observed_at":"2026-08-15T02:20:41.356233Z","submitted_at":"2025-10-20T20:37:11Z","title":"Accelerating Vision Transformers with Adaptive Patch Sizes","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T05:41:48.429067Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2510.18091"},"observation_digest":"sha256:c0d1c0b3d7cdb2b655f69ca281097091f3d98916a019c61d1235237e86e4ea7e","observation_id":"e6b405dd-1448-4dad-ab22-f1b0b2fd4fd9","resolution":{"observed_at":"2026-05-18T05:42:24.467790Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-04T08:44:41.395151Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.19496","last_updated":"2026-05-31T09:39:34Z","snapshot_observed_at":"2026-08-12T10:37:52.743367Z","submitted_at":"2025-10-22T11:44:31Z","title":"CARES: Context-Aware Resolution Selector for VLMs","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T08:44:41.395151Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2510.19496"},"observation_digest":"sha256:4d0aa5a811dddc45b4d60ae1f59f4054f17055dc0ec2eaaa26deff238321292e","observation_id":"9758eb87-7908-442e-a7b7-6fe739988f79","resolution":{"observed_at":"2026-08-04T08:44:41.395151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-03T21:31:34.339829Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganiza- tions.arXiv preprint arXiv:2202.07800, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.15098","last_updated":"2026-06-21T15:38:16Z","snapshot_observed_at":"2026-08-14T07:24:20.183029Z","submitted_at":"2025-11-19T04:13:36Z","title":"A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T21:31:34.339829Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2511.15098"},"observation_digest":"sha256:a1c935e575e4f64b580f93a0ac0b7c8fd34df78f8580641e05291510f2ef12b5","observation_id":"752e0f15-f391-4fd6-9d5c-8d2fe1f74215","resolution":{"observed_at":"2026-08-03T21:31:34.339829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-13T21:45:59.210064Z","title":"arXiv preprint arXiv:2202.07800 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.19964","last_updated":"2026-06-24T14:47:21Z","snapshot_observed_at":"2026-08-13T20:05:04.059027Z","submitted_at":"2026-03-20T14:05:44Z","title":"2K Retrofit: Entropy-Guided Efficient Sparse Refinement for High-Resolution 3D Geometry Prediction","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T21:45:59.210064Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2603.19964"},"observation_digest":"sha256:455b23f548fdd4062e1da708d8807c3744263b5e34347487a29747ff3f66199c","observation_id":"b91a355f-aa99-4406-8069-57d1bb8f047c","resolution":{"observed_at":"2026-07-13T21:45:59.210064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2604.13432","last_updated":"2026-04-15T03:06:24Z","snapshot_observed_at":"2026-08-14T03:48:41.929598Z","submitted_at":"2026-04-15T03:06:24Z","title":"MaMe & MaRe: Matrix-Based Token Merging and Restoration for Efficient Visual Perception and Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T13:06:09.392876Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2604.13432"},"observation_digest":"sha256:9c6ecb310632875aae21a9ae8ce68dc9acdf0527a0a6de8073f2f343f77e9b11","observation_id":"005f7602-7301-46f4-986e-e7d9c21751d8","resolution":{"observed_at":"2026-05-10T13:20:26.679364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2604.14563","last_updated":"2026-04-16T02:46:53Z","snapshot_observed_at":"2026-08-18T20:52:30.928494Z","submitted_at":"2026-04-16T02:46:53Z","title":"Revisiting Token Compression for Accelerating ViT-based Sparse Multi-View 3D Object Detectors","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T11:31:52.126027Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2604.14563"},"observation_digest":"sha256:d7eb91a884204c41c29d8376b6b0e1f780f892e95f7d9600071ff38a4ad569bf","observation_id":"93d595dc-3d09-4168-9618-0b45a90d5af8","resolution":{"observed_at":"2026-05-10T11:35:18.948889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2604.16745","last_updated":"2026-04-17T23:26:27Z","snapshot_observed_at":"2026-08-11T13:05:31.523900Z","submitted_at":"2026-04-17T23:26:27Z","title":"Why Training-Free Token Reduction Collapses: The Inherent Instability of Pairwise Scoring Signals","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-10T07:59:10.678150Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2604.16745"},"observation_digest":"sha256:57c47bc9cd0ac8d46ead38519046e6c1df9561fdd9a7e3a6f539234e078d63cb","observation_id":"fd2aa10d-05d7-4a64-89c9-656b6d240758","resolution":{"observed_at":"2026-05-10T08:02:25.401712Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2604.16854","last_updated":"2026-08-08T08:23:59Z","snapshot_observed_at":"2026-08-13T23:16:20.198686Z","submitted_at":"2026-04-18T06:03:18Z","title":"Certainty Is Redundant: Token Sparsification for Efficient Camouflaged Object Detection with Vision Foundation Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T06:53:38.910940Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2604.16854"},"observation_digest":"sha256:74c9f3cef508a946f0c88173a0e624055dffc4a1ef4e8db6af7443511a23284d","observation_id":"2bec1d64-9656-42c4-98ab-5524bfae3f48","resolution":{"observed_at":"2026-05-10T06:56:47.595741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2605.05848","last_updated":"2026-05-08T13:46:44Z","snapshot_observed_at":"2026-08-14T06:12:09.644545Z","submitted_at":"2026-05-07T08:23:27Z","title":"VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:39.444933Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2605.05848"},"observation_digest":"sha256:63c05377d527cccb4653eb49028419399e159050cadbc26c2ade0889ab2027ee","observation_id":"367591f9-21dd-4963-a629-6e72dedd35ce","resolution":{"observed_at":"2026-05-11T18:41:09.898505Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2605.05848","last_updated":"2026-05-08T13:46:44Z","snapshot_observed_at":"2026-08-14T06:12:09.644545Z","submitted_at":"2026-05-07T08:23:27Z","title":"VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T01:57:42.822121Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2605.05848"},"observation_digest":"sha256:8230063202e5149350a62c71dcb83330bdc952a689ec7846174a2b65aeae451a","observation_id":"b7ecdcd3-1f2e-4305-8bb9-f0cd1b555499","resolution":{"observed_at":"2026-05-11T04:05:56.508992Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2605.10748","last_updated":"2026-05-11T15:49:08Z","snapshot_observed_at":"2026-08-16T21:43:29.095016Z","submitted_at":"2026-05-11T15:49:08Z","title":"Provable Sparse Inversion and Token Relabel Enhanced One-shot Federated Learning with ViTs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T04:42:46.426796Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2605.10748"},"observation_digest":"sha256:498d188e62cfd8626740fb6135653247b3cb57c6f7e209abf812ec2111ef0b3c","observation_id":"574f26e7-24a0-4026-b00f-1a007c7ad922","resolution":{"observed_at":"2026-05-12T06:01:23.619747Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2605.14110","last_updated":"2026-05-13T20:53:03Z","snapshot_observed_at":"2026-08-16T11:58:25.944843Z","submitted_at":"2026-05-13T20:53:03Z","title":"SToRe3D: Sparse Token Relevance in ViTs for Efficient Multi-View 3D Object Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T05:15:14.709039Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2605.14110"},"observation_digest":"sha256:f97b132fdecc2246d1ba45ee5280826cf6e1f6299956bafefcaab8f1248ad0e8","observation_id":"13046e92-a3ef-4e03-b096-242cb3ce3270","resolution":{"observed_at":"2026-05-15T05:19:46.754614Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2605.14191","last_updated":"2026-05-13T23:13:29Z","snapshot_observed_at":"2026-08-16T21:48:00.151391Z","submitted_at":"2026-05-13T23:13:29Z","title":"CoReDiT: Spatial Coherence-Guided Token Pruning and Reconstruction for Efficient Diffusion Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T04:47:32.476614Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2605.14191"},"observation_digest":"sha256:1c57c746d166ceee84ea172f8ccab5c7aee1c082c43eab79c98dbb8300876ad6","observation_id":"e59b3921-5bb4-44cd-8460-14ac6d3082fa","resolution":{"observed_at":"2026-05-15T04:49:44.427609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2605.17837","last_updated":"2026-05-20T21:18:13Z","snapshot_observed_at":"2026-08-17T04:25:20.516313Z","submitted_at":"2026-05-18T04:18:24Z","title":"Temporal Aware Pruning for Efficient Diffusion-based Video Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-20T12:10:34.514379Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2605.17837"},"observation_digest":"sha256:fe870446ab0df688c3f2f966d833b5da8a4bb1e20be9724e14e3be20434eb457","observation_id":"1fb73584-cfc2-41b2-bafb-f3f7922dfc26","resolution":{"observed_at":"2026-05-20T12:13:16.420936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2605.17837","last_updated":"2026-05-20T21:18:13Z","snapshot_observed_at":"2026-08-17T04:25:20.516313Z","submitted_at":"2026-05-18T04:18:24Z","title":"Temporal Aware Pruning for Efficient Diffusion-based Video Generation","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-22T10:21:33.661344Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2605.17837"},"observation_digest":"sha256:0777f46e8944a5e9cdac706f2836671b41a4a949f7c3f214caa2284474bcb327","observation_id":"3adeaa16-3b1a-4b44-b845-bee5f3901850","resolution":{"observed_at":"2026-05-22T10:24:47.229230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2605.22372","last_updated":"2026-05-21T12:04:49Z","snapshot_observed_at":"2026-08-17T13:29:22.894267Z","submitted_at":"2026-05-21T12:04:49Z","title":"ASAP: Attention Sink Anchored Pruning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T08:12:13.451406Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2605.22372"},"observation_digest":"sha256:cc0da6b6ea0cf222c074e7ff0fa77e6715c04bbb511f1d39cedfe97142c5754a","observation_id":"ed70e5b1-9a6e-4d5d-aaf9-957de1035a65","resolution":{"observed_at":"2026-05-22T08:14:45.578068Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:4ff0cd433422bd2e7a32e6220711fb19ba957821199050affcd0626b06263774","observation_id":"c000258d-a7ff-47ae-9c8c-a15336907d71","resolution":{"observed_at":"2026-06-29T00:12:50.564283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2606.02735","last_updated":"2026-06-08T17:19:24Z","snapshot_observed_at":"2026-08-14T03:18:34.152640Z","submitted_at":"2026-06-01T18:02:07Z","title":"See Less, Specify More: Visual Evidence Budgets for Generalizable VLAs","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-28T14:04:43.270155Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2606.02735"},"observation_digest":"sha256:bae02777780b0d7af41d08b35c1114fd0e1ac56954146aac9f98f6cd3de97697","observation_id":"4a7fdeb5-1f9e-4db2-9eab-4b86fdb1bba3","resolution":{"observed_at":"2026-07-01T23:36:23.993353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2606.03569","last_updated":"2026-06-02T12:36:24Z","snapshot_observed_at":"2026-08-15T05:36:49.314849Z","submitted_at":"2026-06-02T12:36:24Z","title":"When Attention Collapses: Stage-Aware Visual Token Pruning from Structure to Semantics","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T10:51:38.455604Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2606.03569"},"observation_digest":"sha256:7cace8e9af23e1134d21c2069617865282c89eefcf911cdeab38e22152d3c1c1","observation_id":"d4d0482d-06ca-4366-bf7e-ca34fda925f6","resolution":{"observed_at":"2026-07-02T02:36:26.553035Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2606.12023","last_updated":"2026-06-10T12:46:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-10T12:46:39Z","title":"ViT-FREE: Efficient Face Recognition via Early Exiting and Synthetic Adaptation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T09:51:12.925516Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2606.12023"},"observation_digest":"sha256:be09e3d1f7fdc857984c3a848db39274b270af654f98419c5bba75a83efcc1be","observation_id":"5ddded6f-8c6f-42f1-99b8-d36db6864dc4","resolution":{"observed_at":"2026-07-03T10:48:02.340927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2606.12412","last_updated":"2026-06-10T17:59:57Z","snapshot_observed_at":"2026-08-03T05:45:43.148184Z","submitted_at":"2026-06-10T17:59:57Z","title":"Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T09:35:24.118536Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2606.12412"},"observation_digest":"sha256:a72581331deb7a833da783557bcd0ed75b5063d40cad600506c27eb0c7a1c665","observation_id":"3cd9c700-b2f0-4049-b0b9-ca0340c72906","resolution":{"observed_at":"2026-07-03T11:28:04.143302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2606.18439","last_updated":"2026-06-16T19:41:23Z","snapshot_observed_at":"2026-08-13T06:27:52.612009Z","submitted_at":"2026-06-16T19:41:23Z","title":"RegimeVGGT: Layer-Wise Spatially Preserving Redundancy Removal for Visual Geometry Grounded Transformer","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T01:07:08.415112Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2606.18439"},"observation_digest":"sha256:4567f2df93b2246c009f671eca4eb92e42e0a25ccc3d51e5797a57eb5b08b0eb","observation_id":"6f086724-dd59-4066-8a9e-e557bed72864","resolution":{"observed_at":"2026-07-03T20:48:56.500170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2606.19932","last_updated":"2026-06-18T08:31:11Z","snapshot_observed_at":"2026-08-16T02:44:30.244332Z","submitted_at":"2026-06-18T08:31:11Z","title":"Spatial-Aware Reduction Framework: Towards Efficient and Faithful Visual State Space Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-26T17:53:38.503877Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2606.19932"},"observation_digest":"sha256:cbb80a0f4dc3040a93bd7f6617d17fc03e8b25df3ce57d1469f2d9ae57436de0","observation_id":"4aaff8d7-9e24-4700-a912-00dfbf7d7742","resolution":{"observed_at":"2026-07-04T03:39:29.536795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2606.27161","last_updated":"2026-06-25T15:29:37Z","snapshot_observed_at":"2026-08-14T01:11:06.133256Z","submitted_at":"2026-06-25T15:29:37Z","title":"TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-06-26T04:24:38.917137Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2606.27161"},"observation_digest":"sha256:f6c794562c2075d6b87a640bed22826ed0df2ff2fbdcc011b58505e04c794775","observation_id":"2622c95b-65e3-487f-a0ba-adea836b4f23","resolution":{"observed_at":"2026-07-04T14:09:53.843556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2606.27660","last_updated":"2026-07-01T13:33:39Z","snapshot_observed_at":"2026-08-16T16:13:02.154121Z","submitted_at":"2026-06-26T02:33:20Z","title":"MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T05:08:46.145616Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2606.27660"},"observation_digest":"sha256:0b12fe035299cbddfdad9985b43b9516387b67ff8030ff240285051fe1080873","observation_id":"23c82d59-5379-412a-9c2b-7a4a6d5481b7","resolution":{"observed_at":"2026-06-29T18:23:51.162586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2606.27660","last_updated":"2026-07-01T13:33:39Z","snapshot_observed_at":"2026-08-16T16:13:02.154121Z","submitted_at":"2026-06-26T02:33:20Z","title":"MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-02T21:35:33.280591Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2606.27660"},"observation_digest":"sha256:31e1802b406c46b4bf8b416536b6f06bfd8350d7b020432e687143b37bcb6d49","observation_id":"25b0db98-b7a3-4dc8-879c-1858e7ebbd93","resolution":{"observed_at":"2026-07-02T21:37:24.196752Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-12T06:46:52.331932Z","title":"arXiv preprint arXiv:2202.07800 (2022) 2, 4","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02829","last_updated":"2026-07-02T23:43:01Z","snapshot_observed_at":"2026-08-17T17:54:46.997876Z","submitted_at":"2026-07-02T23:43:01Z","title":"Less Tokens, Better Forecasts: Sparse Residual Routing for Efficient Weather Prediction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T06:46:52.331932Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2607.02829"},"observation_digest":"sha256:3fe410b34ee771f20361e2a3f4d06369adedf875f0b9de8d86f08bd6b9f0dc2e","observation_id":"5d1ec76a-8544-408c-982c-ca6efdde66c4","resolution":{"observed_at":"2026-07-12T06:46:52.331932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-11T23:58:47.097757Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganizations, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03784","last_updated":"2026-07-04T09:17:25Z","snapshot_observed_at":"2026-08-06T21:45:38.793670Z","submitted_at":"2026-07-04T09:17:25Z","title":"Rethinking Depth Pruning for Vision Transformers: A Heterogeneity-Aware Perspective","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-11T23:58:47.097757Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2607.03784"},"observation_digest":"sha256:11128b64a62e0b8bd57abfe59c67216b374996c1ea841399cde990d2e14dcc78","observation_id":"4df548e4-465b-4e2d-ae53-08007170b7ce","resolution":{"observed_at":"2026-07-11T23:58:47.097757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2607.06565","last_updated":"2026-07-07T17:59:50Z","snapshot_observed_at":"2026-08-12T23:58:05.299670Z","submitted_at":"2026-07-07T17:59:50Z","title":"ELSA3D: Elastic Semantic Anchoring for Unified 3D Understanding and Generation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-08T01:40:40.690020Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2607.06565"},"observation_digest":"sha256:caece9b5eeaaafcf65dc20819d089b97d20c6dec02977fa3b9dbae4ab403d374","observation_id":"e4afd6eb-1b9d-403b-bffd-2efcf65fc499","resolution":{"observed_at":"2026-07-08T01:44:26.266232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-01T11:43:15.551554Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganizations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19811","last_updated":"2026-07-22T06:42:27Z","snapshot_observed_at":"2026-08-15T13:15:09.881095Z","submitted_at":"2026-07-22T06:42:27Z","title":"Lean-SAM2: Target-Anchored Memory and Encoder Acceleration for SAM2","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T11:43:15.551554Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2607.19811"},"observation_digest":"sha256:34dac2725a92d6c369699f017889ce04884b57c732410f9f3c55e969d7af5a43","observation_id":"8a736969-6d7f-457e-936d-76c9fe19ab07","resolution":{"observed_at":"2026-08-01T11:43:15.551554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-02T13:42:25.353013Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganizations.arXiv preprint arXiv:2202.07800,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20467","last_updated":"2026-05-19T06:27:58Z","snapshot_observed_at":"2026-08-18T12:17:49.444133Z","submitted_at":"2026-05-19T06:27:58Z","title":"DC-Leap: Training-Free Acceleration of dLLMs via Draft-Guided Contiguous Leaping Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T13:42:25.353013Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2607.20467"},"observation_digest":"sha256:712f87c5c06e2ed7f970161a96e540a7ad9dec175bf9c0262f0aa1fd3db63b07","observation_id":"2a02f626-1fca-44ae-bedd-8c23a35f2520","resolution":{"observed_at":"2026-08-02T13:42:25.353013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-04T23:46:51.538242Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-15T14:21:17.838676Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.538242Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:5fa3976db0ef80c1ad6197b95102b8e2fa6fd50858f38b5f2e12e204941c14e2","observation_id":"a5070a4e-c3c1-4be8-9a28-ba259dfc7587","resolution":{"observed_at":"2026-08-04T23:46:51.538242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-04T23:43:53.556103Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01646","last_updated":"2026-08-03T03:33:21Z","snapshot_observed_at":"2026-08-16T15:37:00.521353Z","submitted_at":"2026-08-03T03:33:21Z","title":"Spike-HTR: Spiking Neural Transformer for Handwritten Text Recognition","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T23:43:53.556103Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2608.01646"},"observation_digest":"sha256:93a3fc6828ab68bd4430384f78a1bef18e8fb16e0c18d4cadb137659474c2a17","observation_id":"f9a9699a-cb7b-4588-904f-74544af22fc9","resolution":{"observed_at":"2026-08-04T23:43:53.556103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-15T14:57:56.388709Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03083","last_updated":"2026-08-04T03:51:46Z","snapshot_observed_at":"2026-08-16T10:12:30.610679Z","submitted_at":"2026-08-04T03:51:46Z","title":"GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:56.388709Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2608.03083"},"observation_digest":"sha256:6ea903c22b6b3a31e81512c949845e9998fe4606303c608c57636a8e02c4ca8a","observation_id":"775cee6d-21f0-400f-b0e0-ce21db608cea","resolution":{"observed_at":"2026-08-15T14:57:56.388709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-15T14:41:24.493252Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04515","last_updated":"2026-08-05T06:49:49Z","snapshot_observed_at":"2026-08-18T17:22:33.241667Z","submitted_at":"2026-08-05T06:49:49Z","title":"CARVE: Cross-Slice Anisotropic Reallocation of Visual Evidence for Efficient 3D Medical Volume Understanding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T14:41:24.493252Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2608.04515"},"observation_digest":"sha256:3b760664daafc692be229d8bfb00d44631d1cd2a8c53f02ce3fafee26430234d","observation_id":"63438658-5667-4035-b48c-a3ab1dcdf818","resolution":{"observed_at":"2026-08-15T14:41:24.493252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-10T04:30:14.241516Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-17T01:20:08.163345Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.241516Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:0f904f0692a15f815874b9578e6969fdbd20485475e4e5012e9787e07ee7fbf3","observation_id":"daddbc57-a323-435e-9fb5-7d783b1be326","resolution":{"observed_at":"2026-08-10T04:30:14.241516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-12T00:11:16.239944Z","title":"Not all patches are what you need: Expediting vision transformers via token reorgani- zations, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08374","last_updated":"2026-08-12T19:21:05Z","snapshot_observed_at":"2026-08-18T18:27:24.513177Z","submitted_at":"2026-08-08T23:59:10Z","title":"Gated Spatial Redundancy Projection for Pathology Transformer Attentions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T00:11:16.239944Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2608.08374"},"observation_digest":"sha256:faf7bf2cf218c21f8fefbd94f03c0b273e25646640d8472959c5013b9da5e74a","observation_id":"e144e591-fb6e-45a7-b2aa-11708ba23227","resolution":{"observed_at":"2026-08-12T00:11:16.239944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-14T04:42:11.045058Z","title":"Not all patches are what you need: Expediting vision transformers via token reorgani- zations, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08374","last_updated":"2026-08-12T19:21:05Z","snapshot_observed_at":"2026-08-18T18:27:24.513177Z","submitted_at":"2026-08-08T23:59:10Z","title":"Gated Spatial Redundancy Projection for Pathology Transformer Attentions","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T04:42:11.045058Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2608.08374"},"observation_digest":"sha256:5d8a7f8576c2a7d798a48ee28c5d895b2128ab37658c9af2794c900a26bcf647","observation_id":"fa5b4ddb-4ea0-4671-a9ef-2684849bd992","resolution":{"observed_at":"2026-08-14T04:42:11.045058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-15T23:50:02.411396Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12766","last_updated":"2026-08-13T03:17:57Z","snapshot_observed_at":"2026-08-18T17:41:55.844924Z","submitted_at":"2026-08-13T03:17:57Z","title":"PatchGen: Learning Soft Intra-Image Predictive Subsets for Visual Generalization","version":1},"reference_index":236,"source":"arxiv_source","source_observed_at":"2026-08-15T23:50:02.411396Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2608.12766"},"observation_digest":"sha256:6efb81ce9ffeaea1ebfc14203bb477e7d5d1b61ecead3ddd6cc07609c91b3754","observation_id":"77136efc-db54-4adf-97ea-dea6e5571303","resolution":{"observed_at":"2026-08-15T23:50:02.411396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-15T15:54:53.713205Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.13141","last_updated":"2026-08-13T12:15:10Z","snapshot_observed_at":"2026-08-18T18:29:09.968894Z","submitted_at":"2026-08-13T12:15:10Z","title":"MergeOver: Post-Training Token Merging for Recursive Vision Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:54:53.713205Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2608.13141"},"observation_digest":"sha256:0e9756b4a12717a49ab7e79e37b791787a0d2aae48904aadd006b6b9caa599cc","observation_id":"ef6d8008-e34b-4ddc-adeb-5c6602ca7678","resolution":{"observed_at":"2026-08-15T15:54:53.713205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2202.07800/citation-record","integrity":"/paper/2202.07800/integrity","json":"/paper/2202.07800/citation-record.json","paper":"/paper/2202.07800"},"outbound":[],"paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 68 inbound Pith citation observations for arXiv:2202.07800."}