{"as_of":"2026-08-10T10:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1d0dd857d00b1c3338d0bf333bfec6f940840c997de71918410e92d7a86c65d8","coverage":[{"denominator":94,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":94,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T18:28:48.679484Z","state":"measured"},{"denominator":94,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":94,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.00594/citation-record","integrity":"/paper/2502.00594/integrity","json":"/paper/2502.00594/citation-record.json","paper":"/paper/2502.00594"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:47.027458Z","title":"Hiervl: Learning hierarchical video- language embeddings","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.027458Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:bb24ca86e88114c2a9fac9605c4d8900ebed2ff6449b4cbb466289f10a67c140","observation_id":"5bbf912a-01ae-4e9d-bd57-95fc243458a6","resolution":{"observed_at":"2026-08-09T18:28:47.027458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-09T18:28:47.077510Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.077510Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:e091b1dd4cc5d93f0f079ae1fd3f8b9d38d0722970bf19524d8722bb4e861299","observation_id":"9949af15-89e3-4f4a-b3af-6d505aaabfab","resolution":{"observed_at":"2026-08-09T18:28:47.077510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16108","last_updated":"2024-04-19T02:05:02Z","snapshot_observed_at":"2026-07-06T16:24:42.336000Z","submitted_at":"2023-09-28T02:20:59Z","title":"Channel Vision Transformers: An Image Is Worth 1 x 16 x 16 Words","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16108","snapshot_observed_at":"2026-08-09T18:28:47.206021Z","title":"Channel vision transformers: An image is worth c x 16 x 16 words","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.206021Z"},"links":{"cited_paper":"/paper/2309.16108","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:b90b2be640a4c5dc9b2bac9c9f78ad6b0adba840fd148a9077aab95177f3d33d","observation_id":"f3c30f5f-6149-4898-bfc4-b0c156b7a00d","resolution":{"observed_at":"2026-08-09T18:28:47.206021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:47.211633Z","title":"Hypermae: Modulating implicit neural representations for mae training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.211633Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:dc3c1ab9f85ba4fc5657da1412144086b06487f558a070430ef2340b278638a5","observation_id":"97edd187-1858-446e-9b68-f4f24fc8d4f8","resolution":{"observed_at":"2026-08-09T18:28:47.211633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:47.216579Z","title":"Prefix sums and their applications","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.216579Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:7b3d8f0b82b4be2308d930d0dcd2d8261165c8e05389e2a830d9a7450e85cd65","observation_id":"ca69a3bd-37c7-4b68-9b87-5d6042ae02dd","resolution":{"observed_at":"2026-08-09T18:28:47.216579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-09T18:28:47.221551Z","title":"To- ken merging: Your vit but faster","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.221551Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:da3a3c4fcc456e0ce26a9775bb640d1a182f9f3cd328ac027727bfaf9ff4cb7c","observation_id":"54ff10f1-55c4-4078-84ea-6e34e694eb1f","resolution":{"observed_at":"2026-08-09T18:28:47.221551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:47.227627Z","title":"High-performance large-scale image recognition without normalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.227627Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:fb23bc8ef9aa5423d79917197770feb75656f02dd4d624b579f11860cae65fcd","observation_id":"efa9f274-ff20-437b-8586-5f06a6265aff","resolution":{"observed_at":"2026-08-09T18:28:47.227627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:47.232305Z","title":"Jump cell painting dataset: morphological im- pact of 136,000 chemical and genetic perturbations.BioRxiv, pages 2023–03, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.232305Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:5d34fe667197370f2c75ec3dcee2cd0e86209ae6b60125eb87155ac043500988","observation_id":"1d1a7761-c3ff-4c41-8174-c5885e3f8f46","resolution":{"observed_at":"2026-08-09T18:28:47.232305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:47.236234Z","title":"Towards a general-purpose foundation model for computational pathology","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.236234Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:d680b3322887cedd6e534fbe2230f2cfc1a2f163ff6eb7db890ad47d27210385","observation_id":"12b4d707-183f-45f4-8c74-18a95e8010e6","resolution":{"observed_at":"2026-08-09T18:28:47.236234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:47.240362Z","title":"Openmmlab semantic seg- mentation toolbox and benchmark, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.240362Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:4c4f2005255748ff9657b6807bd470ae44e8a93ba4bcf4aa0530bdf161a56ffe","observation_id":"f2d18df4-8a15-4d62-8759-a14a1e8fac3f","resolution":{"observed_at":"2026-08-09T18:28:47.240362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:47.244496Z","title":"Randaugment: Practical automated data augmen- tation with a reduced search space","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.244496Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:536b55eb1b1b86047df841e02ca37e55cbc4ae8aec44b3edbd814a3a0cd15207","observation_id":"3d490cf1-c8f7-47eb-90a5-b3c89bde4360","resolution":{"observed_at":"2026-08-09T18:28:47.244496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-09T18:28:47.248751Z","title":"Flashattention-2: Faster attention with bet- ter parallelism and work partitioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.248751Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:5bc553e8a42dd5bc42a32127de590bbf4b2fd5c46238206107cfc24a92cdec33","observation_id":"d0efb87a-c2bb-4a91-998d-2266d105f783","resolution":{"observed_at":"2026-08-09T18:28:47.248751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-09T18:28:47.253626Z","title":"Transformers are ssms: General- ized models and efficient algorithms through structured state space duality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.253626Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:739b9cd87dfd875007a229d861460cbdeeea9bfa2780098897e631655bb1d3a3","observation_id":"172ea684-c459-409f-b2d5-d3328d2b95e3","resolution":{"observed_at":"2026-08-09T18:28:47.253626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:47.258168Z","title":"Flashattention: Fast and memory-efficient exact at- tention with io-awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.258168Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:595ca359a49a8048a508ebaac628c11c1affcfdba458daf12776a63907619f2e","observation_id":"e7b47e4f-9d2c-4748-959a-22054eaad46b","resolution":{"observed_at":"2026-08-09T18:28:47.258168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:47.262466Z","title":"Vpn++: Rethinking video-pose embeddings for understand- ing activities of daily living","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.262466Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:0af5a3fb72d96b03ce7b2409a2b9ff893231eb09fd86b1d4e480bde5ccd7df5d","observation_id":"48660da0-bd72-47a3-84cb-2b8a395f45e5","resolution":{"observed_at":"2026-08-09T18:28:47.262466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:47.266716Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.266716Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:de63f02d185b0bd3443e1c71317ad1849f98484e963110f961d42de23063a4f6","observation_id":"17fe9fe6-b38e-44e3-80d9-36814e67a872","resolution":{"observed_at":"2026-08-09T18:28:47.266716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-09T18:28:47.270938Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.270938Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:40080be3d2205b0525193b816bc70f45250af480b3cff1df4f234a89f3334be5","observation_id":"70ee05b0-8083-43ca-9169-8ed344a96e05","resolution":{"observed_at":"2026-08-09T18:28:47.270938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:47.275280Z","title":"Learned representation-guided diffusion models for large-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.275280Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:82d3f6f667090ead1a66e98daab1a61363728e1cc06f9520f2ff2b79ac74db5b","observation_id":"9c06baab-2d78-4e7f-bd16-95b9cdfbed3c","resolution":{"observed_at":"2026-08-09T18:28:47.275280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-09T18:28:47.279120Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.279120Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:994e38059d97e0d274b5749ae92a8e832817e10c0e06bd92c2faab7aa87a4fdd","observation_id":"b063ed24-cb3b-4042-bbb5-adc8cbbbc8de","resolution":{"observed_at":"2026-08-09T18:28:47.279120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-09T18:28:47.284095Z","title":"Efficiently modeling long sequences with structured state spaces","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.284095Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:12ec9574b254b72f0c8387da713a154d81650aa0a6ca0dcff93478d0ea116cdc","observation_id":"92f2adb6-0584-4bc7-992e-f56b1a030687","resolution":{"observed_at":"2026-08-09T18:28:47.284095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:47.288506Z","title":"Combining recurrent, convolutional, and continuous-time models with linear state space layers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.288506Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:8182653feaf62bb8b555af6e9eaf9f1899b2a2c2ffef2b470b9f03649bcffa77","observation_id":"252e95e9-9f57-4325-942f-f948285a6cf3","resolution":{"observed_at":"2026-08-09T18:28:47.288506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08083","last_updated":"2025-03-25T17:54:37Z","snapshot_observed_at":"2026-08-06T23:38:21.068023Z","submitted_at":"2024-07-10T23:02:45Z","title":"MambaVision: A Hybrid Mamba-Transformer Vision Backbone","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08083","snapshot_observed_at":"2026-08-09T18:28:47.292793Z","title":"Mambavision: A hy- brid mamba-transformer vision backbone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.292793Z"},"links":{"cited_paper":"/paper/2407.08083","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:1dccbd8825a306628dd23bfcf3f47d4766ff62f444e66026a26b546d62d3b567","observation_id":"e8d547f6-8544-434a-bc7f-4b19283ac95a","resolution":{"observed_at":"2026-08-09T18:28:47.292793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:47.320508Z","title":"Mask r-cnn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.320508Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:79967a9f227036ab04dee3b791da3449a7b97887f1af4d1d236138c46d52a5ee","observation_id":"cf9d9376-a084-4029-ba2b-c7041c8873c6","resolution":{"observed_at":"2026-08-09T18:28:47.320508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.751333Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"7cc85e1f-4df9-4d5f-b4e9-20ba6cd6506f","year":2022},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.357924Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:7df98a6afeefa822bdf5d33428dd935497b035e4e5e5177528ad18f1796d2f6d","observation_id":"2e6616fc-4a8e-4411-acb1-f2c9ead3feb3","resolution":{"observed_at":"2026-08-09T18:28:49.755200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13240","last_updated":"2022-03-24T17:50:46Z","snapshot_observed_at":"2026-08-05T17:57:08.560725Z","submitted_at":"2022-03-24T17:50:46Z","title":"Token Dropping for Efficient BERT Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13240","snapshot_observed_at":"2026-08-09T18:28:47.481444Z","title":"To- ken dropping for efficient bert pretraining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.481444Z"},"links":{"cited_paper":"/paper/2203.13240","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:8aafb2febc7493a3928a2daf8633b04c869347f0cf235abf9cabd632ebf5bb6b","observation_id":"dc1375a1-1019-4157-b9d7-7d69177970f7","resolution":{"observed_at":"2026-08-09T18:28:47.481444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.737656Z","title":"Deep networks with stochastic depth","venue":null,"work_id":"5fd83224-e2e7-4a26-8022-033d9f1b6f88","year":2016},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.604768Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:d34293655d511f3b2cfea0e9825bc5cb6c8c3a38bc5a2296803b0c2bdc1374ab","observation_id":"e4b05f06-9583-4134-a255-f0ec0367cd15","resolution":{"observed_at":"2026-08-09T18:28:49.742341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09338","last_updated":"2024-03-14T12:32:40Z","snapshot_observed_at":"2026-08-06T04:08:34.950441Z","submitted_at":"2024-03-14T12:32:40Z","title":"LocalMamba: Visual State Space Model with Windowed Selective Scan","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09338","snapshot_observed_at":"2026-08-09T18:28:47.687930Z","title":"Localmamba: Visual state space model with windowed selective scan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.687930Z"},"links":{"cited_paper":"/paper/2403.09338","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:f5b21f352b1efc338439526ecfc3792b335e6f53b78598629bc0d245e50c8f92","observation_id":"8fbfdd15-08c5-46b7-b7c2-432a62d6e3a7","resolution":{"observed_at":"2026-08-09T18:28:47.687930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.723611Z","title":"Attention-based deep multiple instance learning","venue":null,"work_id":"a6f59172-4e3d-4025-8610-d8ea3dceec73","year":2018},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.770585Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:04f2b16ddddb64e12c73941168f4cfaa8fd87aaf3d0b341ebb24010f29362803","observation_id":"55be8f63-ba7c-474e-93a3-01840838a081","resolution":{"observed_at":"2026-08-09T18:28:49.727992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.708877Z","title":"Object- centric diffusion for efficient video editing","venue":null,"work_id":"e54ebd5b-08ab-46ba-8898-ecaceec29dfe","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.845460Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:5e57f443e527ce246c2785bc58d11babc4802c91b08675b45c20939468f88bdf","observation_id":"90af7577-2010-4dae-b329-7255e9435e9c","resolution":{"observed_at":"2026-08-09T18:28:49.713373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.695006Z","title":"Si-mil: Taming deep mil for self-interpretability in gigapixel histopathology","venue":null,"work_id":"ed344718-8c8b-40ea-951b-3b39b7685fa3","year":2024},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.850118Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:5b6f91697986396d6dbdf133b015dfdceded75d409b846bd13f48733c012744e","observation_id":"0ca161cb-2a31-4368-b9ce-fc702d91c444","resolution":{"observed_at":"2026-08-09T18:28:49.699665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.681053Z","title":"Vision transformers inference acceleration based on adaptive layer normalization","venue":null,"work_id":"b24277e9-4655-460b-b55c-4988e848f2d5","year":2024},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.854197Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:417706b5f9371a0925203e7f0972e17039512af07ad9dd1f3ff3632fcacd25a3","observation_id":"eb207fd1-522b-433d-a3c4-4da3bb37feb3","resolution":{"observed_at":"2026-08-09T18:28:49.685429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02572","last_updated":"2025-07-16T14:52:58Z","snapshot_observed_at":"2026-08-04T11:03:45.065628Z","submitted_at":"2024-11-04T20:09:51Z","title":"ViTally Consistent: Scaling Biological Representation Learning for Cell Microscopy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02572","snapshot_observed_at":"2026-08-09T18:28:47.858959Z","title":"Vitally consistent: Scaling biological representation learning for cell microscopy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.858959Z"},"links":{"cited_paper":"/paper/2411.02572","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:f2d2f6a34b80b9d4cfd5306f0c86b728da576ab897e54a17aedb280e539c8354","observation_id":"52b4b24a-9282-4863-8fa7-31496ac14be5","resolution":{"observed_at":"2026-08-09T18:28:47.858959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.667522Z","title":"Videomamba: State space model for efficient video understanding","venue":null,"work_id":"0c41ed9e-d8ae-4199-9f8c-0a9ef2cf4d81","year":2025},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.863752Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:0fff92e695e2ffc8cf89eff6eb2b6ddff327849016773bd0268fafd1777f628b","observation_id":"bb4e11b9-62b6-41ff-923d-59c9faa70eaf","resolution":{"observed_at":"2026-08-09T18:28:49.671858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.653395Z","title":"Exploring plain vision transformer backbones for object de- tection","venue":null,"work_id":"ba9cb8e8-ae90-4b71-bb0d-833d3a6ba26b","year":2022},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.868392Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:00636b63f37eb568e9653c635ca7cab1bab7963d6f1cf8a2c88f6d57b0e0d77a","observation_id":"30e19c5a-3904-4601-9d9e-797afdcd7e50","resolution":{"observed_at":"2026-08-09T18:28:49.658326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-03T03:15:29.208149Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-09T18:28:47.872619Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganiza- tions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.872619Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:24a29b0c10e8e4a0dab6b0e01a77111b0048beff461b6515475de25043e3c9f0","observation_id":"e85b7bc2-e70f-4390-900b-f2e2245e06e0","resolution":{"observed_at":"2026-08-09T18:28:47.872619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-09T18:28:47.876559Z","title":"Jamba: A hybrid transformer-mamba language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.876559Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:6e5557b4330a36a120c00430ddc63d980279b64cdcfd689b8e1a4858356c3019","observation_id":"ee700de7-5fba-4293-9e27-74809cc3c35b","resolution":{"observed_at":"2026-08-09T18:28:47.876559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:47.880926Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.880926Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:afb8ce90ced9ba7550e38a433c67fbeb24f201b3e932c4bbc271cd01f8dbc346","observation_id":"d19f7cfd-63ad-491c-8bf9-137d9672bfce","resolution":{"observed_at":"2026-08-09T18:28:47.880926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00871","last_updated":"2025-05-23T06:42:28Z","snapshot_observed_at":"2026-08-08T19:12:56.499244Z","submitted_at":"2024-10-01T17:05:08Z","title":"MAP: Unleashing Hybrid Mamba-Transformer Vision Backbone's Potential with Masked Autoregressive Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00871","snapshot_observed_at":"2026-08-09T18:28:47.885072Z","title":"Map: Unleashing hybrid mamba- transformer vision backbone’s potential with masked au- toregressive pretraining","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.885072Z"},"links":{"cited_paper":"/paper/2410.00871","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:68902ad5ddd633bacc3b6cca0159529e00765a06770d6e1437a389aaefd8f5fc","observation_id":"04f8b42e-6bcc-496c-ab62-829b83a80fa2","resolution":{"observed_at":"2026-08-09T18:28:47.885072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.631360Z","title":"Vmamba: Visual state space model, 2024","venue":null,"work_id":"c036eef1-b1cc-4106-b147-f0372f093409","year":2024},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.889120Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:e255241b447d66eacdd8c0d09963314bf6367982477e884102c5a17c409daf0a","observation_id":"c6c6fce7-36c3-4bf9-a647-0536860090b1","resolution":{"observed_at":"2026-08-09T18:28:49.635675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.617311Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"efd7a89c-0e96-4c7b-bedb-92f3af92f7cc","year":2021},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.893304Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:a82ed218db0276b4218cb2eb07ef1f6e7773453552ae17158ccdaf904d14f531","observation_id":"17a66bfa-ac0e-4496-b97d-42150f36b6b1","resolution":{"observed_at":"2026-08-09T18:28:49.621712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:47.897538Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.897538Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:d42f2319625dbe3ad9f3603041ff158db4c8e65359a7b32feeabb45dd4b5eb91","observation_id":"d50d473c-ba14-4b20-9645-d6b1ab339f06","resolution":{"observed_at":"2026-08-09T18:28:47.897538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-09T18:28:47.902445Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.902445Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:15fd9818ccaeba4e617146b8645af86e7312067c16179b60270ba6842a44e993","observation_id":"e754c47b-9635-44b9-b063-72f22461b372","resolution":{"observed_at":"2026-08-09T18:28:47.902445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-09T18:28:47.906753Z","title":"Sgdr: Stochas- tic gradient descent with warm restarts","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.906753Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:25247e4a3d654f77cfa67e37ca8e560560471d8617f85f7d4b6edfef9174c976","observation_id":"fcaadab1-e1bc-4f30-9712-e984aaa06989","resolution":{"observed_at":"2026-08-09T18:28:47.906753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.595512Z","title":"Vim4path: Self-supervised vi- sion mamba for histopathology images","venue":null,"work_id":"43aa15fb-9839-4eba-b668-369a887b340f","year":2024},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.912064Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:3c29ecf8b3b2bd70b216ed11b6d45466095bcb3e971f39b2e95960b0453ca90f","observation_id":"ce124bbb-00ac-4f99-b4bf-7bc51b946de2","resolution":{"observed_at":"2026-08-09T18:28:49.600004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09415","last_updated":"2025-03-13T19:12:25Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:58Z","title":"An Image is Worth More Than 16x16 Patches: Exploring Transformers on Individual Pixels","version":2},"cited_work":{"arxiv_id":"2406.09415","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09415","snapshot_observed_at":"2026-08-09T18:28:48.923630Z","title":"An Image is Worth More Than 16x16 Patches: Exploring Transformers on Individual Pixels","venue":"cs.CV","work_id":"fb57e470-85e6-470d-ae58-ad30063424c5","year":2024},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.916243Z"},"links":{"cited_paper":"/paper/2406.09415","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:57eb99c78aba3528df7b240e44f41ba424b2d1c104b61e9c32198bfd100eb507","observation_id":"2c515de7-6d4b-4e9e-9a9f-aae9157eb3e0","resolution":{"observed_at":"2026-08-09T18:28:48.927713Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-09T18:28:47.920635Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.920635Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:1ecd31d8cf56ec0dc3808d9fe14acea147e9d38da3974d4e9c9cff92c2c7fdff","observation_id":"7674ff40-4336-4b96-b777-0747e089fdad","resolution":{"observed_at":"2026-08-09T18:28:47.920635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09977","last_updated":"2024-03-15T02:48:47Z","snapshot_observed_at":"2026-08-06T17:16:43.748086Z","submitted_at":"2024-03-15T02:48:47Z","title":"EfficientVMamba: Atrous Selective Scan for Light Weight Visual Mamba","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09977","snapshot_observed_at":"2026-08-09T18:28:47.924619Z","title":"Efficientvmamba: Atrous selective scan for light weight visual mamba","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.924619Z"},"links":{"cited_paper":"/paper/2403.09977","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:01beae47a256f13e3298a0a60feb5e9c803109a3b5ff2890e648de6242ab40fe","observation_id":"7d0a776c-ba42-44fe-8301-06be5fcc2179","resolution":{"observed_at":"2026-08-09T18:28:47.924619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16419","last_updated":"2024-10-28T13:07:20Z","snapshot_observed_at":"2026-07-06T18:20:01.382394Z","submitted_at":"2024-05-26T03:41:40Z","title":"Enhancing Feature Diversity Boosts Channel-Adaptive Vision Transformers","version":2},"cited_work":{"arxiv_id":"2405.16419","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.16419","snapshot_observed_at":"2026-08-09T18:28:48.876511Z","title":"Enhancing Feature Diversity Boosts Channel-Adaptive Vision Transformers","venue":"cs.CV","work_id":"b6b58081-3b29-4a77-8e1e-e799c14659f5","year":2024},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:47.967988Z"},"links":{"cited_paper":"/paper/2405.16419","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:322f2dee9253f25534d8216c6e265615b736d1587fb52dad06779c7a3c036223","observation_id":"60f0f329-f820-4457-a0e5-1a6e6f75fbde","resolution":{"observed_at":"2026-08-09T18:28:48.882474Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.581729Z","title":"Per- ceptual grouping in contrastive vision-language models","venue":null,"work_id":"a33b2c7c-772f-4e6b-833d-e3e0bbc100b0","year":2023},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.088516Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:d1cf4824790cdd610ecd0a34deb7d7e91e1eb47d1084eef5afe6228155e25701","observation_id":"a70e1692-5ba0-477e-b8d7-3bc54dbbdb4c","resolution":{"observed_at":"2026-08-09T18:28:49.586010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:48.163481Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.163481Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:e29d58eb07549f2b41b99c3e856f60e177f7af29e0a188c377dd1a0f7a2c79b3","observation_id":"e7a8dcf1-097f-4d6f-8684-b5ec1cb6717c","resolution":{"observed_at":"2026-08-09T18:28:48.163481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07537","last_updated":"2024-06-11T17:58:34Z","snapshot_observed_at":"2026-08-06T22:50:16.013788Z","submitted_at":"2024-06-11T17:58:34Z","title":"Autoregressive Pretraining with Mamba in Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07537","snapshot_observed_at":"2026-08-09T18:28:48.358953Z","title":"Autoregressive pretraining with mamba in vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.358953Z"},"links":{"cited_paper":"/paper/2406.07537","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:fb681c5780580b877c2c5ac6bd02aa3aae69979af0ec9aaffd34d8950c438331","observation_id":"9c461ef3-cc6e-4b92-8c8a-3db74e1e26ab","resolution":{"observed_at":"2026-08-09T18:28:48.358953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12015","last_updated":"2022-02-24T10:56:17Z","snapshot_observed_at":"2026-08-06T14:20:02.767018Z","submitted_at":"2022-02-24T10:56:17Z","title":"Learning to Merge Tokens in Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.12015","snapshot_observed_at":"2026-08-09T18:28:48.402338Z","title":"Learn- ing to merge tokens in vision transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.402338Z"},"links":{"cited_paper":"/paper/2202.12015","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:b00b924beb3a265e3ddea05d418c23ff6ac9cc7ff1f8f3d69f1bba4e215b3a43","observation_id":"1912697c-1ac6-4bc8-98ed-0c468cee33b2","resolution":{"observed_at":"2026-08-09T18:28:48.402338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-08-09T18:28:48.407448Z","title":"Tokenlearner: What can 8 learned tokens do for images and videos? arXiv preprint arXiv:2106.11297, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.407448Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:d0a2d9c5399e90ebcca4af161692a0e00dfc17d075a758fd4d080b72e449d75d","observation_id":"c39a0be2-f050-43b9-b048-64ff5f04c902","resolution":{"observed_at":"2026-08-09T18:28:48.407448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13772","last_updated":"2025-03-28T23:38:22Z","snapshot_observed_at":"2026-08-04T21:17:03.297277Z","submitted_at":"2024-07-18T17:59:58Z","title":"GroupMamba: Efficient Group-Based Visual State Space Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13772","snapshot_observed_at":"2026-08-09T18:28:48.412132Z","title":"Groupmamba: Parameter-efficient and accurate group visual state space model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.412132Z"},"links":{"cited_paper":"/paper/2407.13772","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:876653b121b3223743a451309fccde79092625c8ae0c7272ac4e8a033b823480","observation_id":"125869ff-5f78-417d-9af6-bbc9383231a2","resolution":{"observed_at":"2026-08-09T18:28:48.412132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09808","last_updated":"2024-10-06T16:34:48Z","snapshot_observed_at":"2026-08-09T16:09:24.244680Z","submitted_at":"2024-09-15T18:02:26Z","title":"Famba-V: Fast Vision Mamba with Cross-Layer Token Fusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09808","snapshot_observed_at":"2026-08-09T18:28:48.416470Z","title":"Famba-v: Fast vision mamba with cross-layer token fusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.416470Z"},"links":{"cited_paper":"/paper/2409.09808","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:03f9f671cbed1d59299a57d0bf36b9719ab6e47291a9347b1fea241e94eed1bd","observation_id":"6f7e0aaa-3890-4453-82e8-089756588429","resolution":{"observed_at":"2026-08-09T18:28:48.416470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04933","last_updated":"2023-03-03T18:35:28Z","snapshot_observed_at":"2026-07-06T13:40:19.948018Z","submitted_at":"2022-08-09T17:57:43Z","title":"Simplified State Space Layers for Sequence Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.04933","snapshot_observed_at":"2026-08-09T18:28:48.421026Z","title":"Simplified state space layers for sequence modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.421026Z"},"links":{"cited_paper":"/paper/2208.04933","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:af4382e527cabed2bf38a344c8986534e880246f4d4df676ef092abec4e0d352","observation_id":"ea069a7f-a15e-43ce-abfb-7f3d17f8f959","resolution":{"observed_at":"2026-08-09T18:28:48.421026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.560919Z","title":"Training data-efficient image transformers & distillation through at- tention","venue":null,"work_id":"81b4e717-1cd2-401a-85e6-4138e50ea231","year":2021},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.425538Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:1629cba7b3f563d4b92b481d3a841892c9788e6985ee6763117700530f0fce0c","observation_id":"20c497cc-ecff-45ad-8e6c-d991d351b855","resolution":{"observed_at":"2026-08-09T18:28:49.565122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.548794Z","title":"Training data-efficient image transformers & distillation through at- tention","venue":null,"work_id":"105a2344-06c8-4c3c-9cca-450d0bd921a2","year":2021},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.429965Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:4b7bb1dc024a92aed2e129a5892cadaaa51e4061d1acb77e6d4450b892a8c235","observation_id":"f0c6ea6a-bdb4-423d-a2db-e4c906d18f08","resolution":{"observed_at":"2026-08-09T18:28:49.552685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:48.434842Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.434842Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:5bd7a8c0f61ab2e054d01c1d6f0e851fa0e362917f9813650d685f70c5050a04","observation_id":"991bd086-c06d-4792-8654-b728adc15798","resolution":{"observed_at":"2026-08-09T18:28:48.434842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14858","last_updated":"2025-05-30T00:13:05Z","snapshot_observed_at":"2026-08-03T14:30:52.105832Z","submitted_at":"2024-05-23T17:58:43Z","title":"Mamba-R: Vision Mamba ALSO Needs Registers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14858","snapshot_observed_at":"2026-08-09T18:28:48.438869Z","title":"Mamba-r: Vision mamba also needs registers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.438869Z"},"links":{"cited_paper":"/paper/2405.14858","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:061af0d5c3a61e6550dd831c0385814590187399954522a3256b6e686a49713a","observation_id":"0ad339ca-3122-4447-8af3-47c93253a370","resolution":{"observed_at":"2026-08-09T18:28:48.438869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:48.489438Z","title":"Unified perceptual parsing for scene understand- ing","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.489438Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:83f498dc11422d80b2c457788d846f7840d4ba4dc8c986593ef3e57866e5a384","observation_id":"2875a687-c8b4-475a-a1d0-892dae9ef6b2","resolution":{"observed_at":"2026-08-09T18:28:48.489438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.519359Z","title":"A whole-slide foundation model for digital pathology from real-world data","venue":null,"work_id":"892837db-3796-4c1b-ba0d-2693b71d36b2","year":2024},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.537921Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:80a57db328f5ac6edb5c40127928633dbc58889ad6a291db14e1be3673418993","observation_id":"5e042235-bfed-423c-8b9e-1ff59bf6d8c8","resolution":{"observed_at":"2026-08-09T18:28:49.523234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17695","last_updated":"2024-08-15T14:30:02Z","snapshot_observed_at":"2026-08-08T14:30:13.287782Z","submitted_at":"2024-03-26T13:35:10Z","title":"PlainMamba: Improving Non-Hierarchical Mamba in Visual Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17695","snapshot_observed_at":"2026-08-09T18:28:48.541812Z","title":"Plainmamba: Improving non-hierarchical mamba in visual recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.541812Z"},"links":{"cited_paper":"/paper/2403.17695","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:94fb3323d559eeb7b65e770f11c8a990f41441f42a24743407ae592b40c71ee0","observation_id":"097394c1-05c2-46b5-b550-ebb2bcf64845","resolution":{"observed_at":"2026-08-09T18:28:48.541812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.506683Z","title":"Cutmix: Regu- larization strategy to train strong classifiers with localizable features","venue":null,"work_id":"0bfd71d4-dee1-4ccd-b18f-2ecbd8787e33","year":2019},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.545751Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:b1a2d4a7b1f6972a4aa6c23092aea452d2bb2cf88b3dd1269843ff9174c7ba3d","observation_id":"d3a3a8bc-6e17-443d-9c8a-d14953886b67","resolution":{"observed_at":"2026-08-09T18:28:49.510913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18962","last_updated":"2024-09-27T17:59:50Z","snapshot_observed_at":"2026-07-06T19:23:33.343982Z","submitted_at":"2024-09-27T17:59:50Z","title":"Exploring Token Pruning in Vision State Space Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18962","snapshot_observed_at":"2026-08-09T18:28:48.549618Z","title":"Exploring token pruning in vision state space models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.549618Z"},"links":{"cited_paper":"/paper/2409.18962","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:d8263d1df0094eee0a046de76f7751a3a5c3481ef8b555382dc4197fa7bbc6ce","observation_id":"db50be05-09c9-4811-abbe-72743fcfd13d","resolution":{"observed_at":"2026-08-09T18:28:48.549618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14725","last_updated":"2024-10-16T00:06:13Z","snapshot_observed_at":"2026-07-06T19:36:10.759412Z","submitted_at":"2024-10-16T00:06:13Z","title":"Rethinking Token Reduction for State Space Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14725","snapshot_observed_at":"2026-08-09T18:28:48.553647Z","title":"Rethinking token reduction for state space models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.553647Z"},"links":{"cited_paper":"/paper/2410.14725","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:dd5100f6c3b77a49ea79578e02958b5699328ef820bf809b8585f2965a0198e1","observation_id":"2a9c3ef6-1368-4ee3-a3e7-26beef0231d8","resolution":{"observed_at":"2026-08-09T18:28:48.553647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-08-08T10:28:19.597631Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-09T18:28:48.557693Z","title":"mixup: Beyond empirical risk minimization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.557693Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:d384453f993bcf1adb947985e5ca23cce58be9a6de9ffa208e6ec96f08a87ee1","observation_id":"c4ab4d19-b994-4c85-914d-a0b7f7315ca9","resolution":{"observed_at":"2026-08-09T18:28:48.557693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:48.562442Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.562442Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:49ae9950d9e869c301f20e367d74d7aa5ae3f3ac83c89e435f12c27158a5b7f2","observation_id":"96bd558b-6d88-40ff-8ea6-66a3befa02c5","resolution":{"observed_at":"2026-08-09T18:28:48.562442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09417","last_updated":"2024-11-14T02:00:33Z","snapshot_observed_at":"2026-07-06T17:16:59.193820Z","submitted_at":"2024-01-17T18:56:18Z","title":"Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09417","snapshot_observed_at":"2026-08-09T18:28:48.567077Z","title":"Vision mamba: Efficient visual representation learning with bidirectional state space model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.567077Z"},"links":{"cited_paper":"/paper/2401.09417","citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:b747879ad07664ad0f17edc51cd83f32a4d5dddd7315d423472fc150b212e5cf","observation_id":"884c7d76-4d70-46bb-a65f-9ada91e8cea6","resolution":{"observed_at":"2026-08-09T18:28:48.567077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.484594Z","title":"We closely followed the pre- training (Table 9), fine-tuning (Table 10), and linear- probing (Table 11) settings from the Masked Autoen- coders [24] codebase","venue":null,"work_id":"a470f42e-8ea8-4a2c-bf64-875bb374adc0","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.571996Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:5f17f3b0592a18b7aaebcc88b60737cc33abb8df04f5706d8cb7de7db0036e42","observation_id":"72815423-f091-4727-9707-331e6092ac0c","resolution":{"observed_at":"2026-08-09T18:28:49.488891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.471521Z","title":"2) We applied a scaling factor of 1 − mask ratio (75% masking by default) during fine-tuning and linear probing when pooling tokens before the SSM block","venue":null,"work_id":"f45e9882-765f-4ba4-8b9e-2915a28bb6e0","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.576472Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:b41dfb1715d7cc4d658a57e908696eceecd5cc3d3dbac1e359f8b79a3c032394","observation_id":"c1b391d4-647e-48ef-952c-b126e0fae6c3","resolution":{"observed_at":"2026-08-09T18:28:49.476026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.458415Z","title":"mean pool in Fast- MaskVim","venue":null,"work_id":"99d0c008-b72a-486d-8683-6b2ea235f078","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.580967Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:8f13ab76860c0dd0a685498097681d8fe8cf74c649f06622ebb8ab7d7d403b57","observation_id":"8f2b76bc-12f2-4a91-9726-bed24d7e4d83","resolution":{"observed_at":"2026-08-09T18:28:49.462686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.445319Z","title":"In Table 13, we compare the performance of fine-tuning pre-trained FastMaskVim using alternate layer learning rate decay instead of per-layer decay as in the MAE codebase","venue":null,"work_id":"6e6a8178-9205-49a5-ad3b-3921869c4b8a","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.585616Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:fe26c619d580c1d5adabe20da0288a4901a769deed95060ae2d4ba3ef3fdd916","observation_id":"3677531d-e374-4dd1-a2af-83dfa366a714","resolution":{"observed_at":"2026-08-09T18:28:49.449688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.431987Z","title":"Apply- ing the scaling factor results in an improvement of 0.3% compared to the default mean pooling in fine-tuning without multiplying by the scaling factor","venue":null,"work_id":"60219e84-8a9d-417e-b807-6e060f30a913","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.590168Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:9c450bd059b2823567b1cbd5b3c1c6c530289e80d5387259b09ea738f0d45920","observation_id":"cad2c0ed-963b-4fdd-a011-b288a5b87dea","resolution":{"observed_at":"2026-08-09T18:28:49.436446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.418953Z","title":"In Table 15, we compare the linear probing performance of Fast- MaskVim with and without the scaling factor (0.25)","venue":null,"work_id":"653a57a0-b3ad-4e21-808e-a891c00bc804","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.594871Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:5e645cd02e58667af721aa8eabc59515a782596e30e102e9d5447a2529169cf7","observation_id":"d008e347-c57b-4761-90cf-014178075cef","resolution":{"observed_at":"2026-08-09T18:28:49.423402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.405866Z","title":null,"venue":null,"work_id":"aaeb1b72-124c-4dfb-9a3c-061a050e2903","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.599168Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:19c94b7b9b0efb99fb813c7b9b3022d6cb06e915327897d6c5b4863aaa6429e5","observation_id":"f5ae686b-e2e5-4250-86f0-02299296d374","resolution":{"observed_at":"2026-08-09T18:28:49.410087Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.392587Z","title":"In Table 16, we compare the performance of FastVim-S with a class token versus without a class token (default)","venue":null,"work_id":"a47d0f68-ce39-4bcc-9c53-e77882adfe28","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.603670Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:84bf0bf32c1d5080828a16eb9261986d4d4206d11207efff74416d6e78dd4337","observation_id":"0066557f-f833-4bb4-aa90-bd5f325eafc7","resolution":{"observed_at":"2026-08-09T18:28:49.396909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.379555Z","title":"In Table 17, we empir- ically demonstrate the performance of FastVim trained with different combinations of input normalization and post-SSM normalization","venue":null,"work_id":"d54f3e59-86ca-4524-a616-72cc7556651a","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.608160Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:0a8fda9380efa7827745042555405437a04f5bc5dca38341f9bf393444e8bf84","observation_id":"39f5c2a8-6f78-4cfd-8eca-46fb7e5670d3","resolution":{"observed_at":"2026-08-09T18:28:49.383837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.366723Z","title":"In Table 18, we explore whether in Fig","venue":null,"work_id":"13202346-c2c0-4e8a-947e-66be394a3cb3","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.612618Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:246e3649d04b2f37778ceee98f8b96313be3d32a9ee07ce7920309fa417de141","observation_id":"ea6d773f-6309-4c77-a392-188473668fe5","resolution":{"observed_at":"2026-08-09T18:28:49.371044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.354491Z","title":"We followed the implementation details primarily from ChannelViT [3]","venue":null,"work_id":"3fe9f8bc-6bc8-489c-bf43-287f711050ef","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.616956Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:535c5e3800ded9a5c5f579ba2cbdd7843663f011e5a730fe61f8cb202f32a357","observation_id":"f578d65f-0c8d-4930-a71f-173773202692","resolution":{"observed_at":"2026-08-09T18:28:49.358146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.342735Z","title":"Channel- First with and without sorted HCS","venue":null,"work_id":"d1eabf0a-1919-4e2e-ab06-cdc91e916276","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.621528Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:fc5936922104397125a6fdc0e7df92eba0ae132f7dbbd065c8d8682514e2010a","observation_id":"3f58022d-ad0b-4c3c-83e0-9e36a20bc279","resolution":{"observed_at":"2026-08-09T18:28:49.346395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.330380Z","title":"We then explore the effect of different pooling methods, such as max pooling [49] and attention pooling [28], as detailed in Table 20 on the JUMP-CP dataset","venue":null,"work_id":"9bf2c501-0dd4-42d1-899c-b65c3e2865c5","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.625803Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:adb0909dbc69cd1796ba9cbd4a3defc9826954e956aa0468400e953d024dbeab","observation_id":"c8d43edc-e6aa-41b9-9d7a-bf12f540d892","resolution":{"observed_at":"2026-08-09T18:28:49.334222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.318614Z","title":"Now, we preliminarily explore pooling along two dimen- Table 20","venue":null,"work_id":"97fb4f4b-4a39-4474-b4ff-fa049440b097","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.630185Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:8cf1061e08e4c5f8e5326d3da069da8fe4c04eabc1a1f774d6f62ca1023961be","observation_id":"dad8146f-16ab-4f56-bb46-027a6f2d510c","resolution":{"observed_at":"2026-08-09T18:28:49.322383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.305664Z","title":null,"venue":null,"work_id":"9b7c279b-58d7-4dd5-8107-a30d3fd4401e","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.634655Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:9ec28aa25b7a6ac9da686ac2bf0f31498597759346931898d680217be4502e69","observation_id":"bee2db5a-7fec-4ea4-a149-9b62938f443a","resolution":{"observed_at":"2026-08-09T18:28:49.309789Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.292174Z","title":null,"venue":null,"work_id":"e870bc78-3aa6-43ed-be3e-db9b812d143d","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.639100Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:79ac235eb3fdf2393374df896b3e43ff8065bb4bfab9cd959b316ea3360fda20","observation_id":"8d1121a7-1742-4580-adb0-a6c5775f1b32","resolution":{"observed_at":"2026-08-09T18:28:49.296577Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.278948Z","title":null,"venue":null,"work_id":"5b291f6a-335f-4256-b3f0-9b53414274f0","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.643509Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:cde05e71ae4989a1b0423b45e8374fc0c37a1fe42f729f6d8d31f4157873862f","observation_id":"90da51ca-3337-4716-b396-7567125093c1","resolution":{"observed_at":"2026-08-09T18:28:49.283163Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.264900Z","title":null,"venue":null,"work_id":"080430d3-682a-4f9f-8f26-9434157ccc14","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.647976Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:42848f1685632f692ef8b361e5ee183f7b79c6d72dc03071b12e49a6cc35eca8","observation_id":"cc8fc2a1-58e6-4821-8667-8a2fd380a361","resolution":{"observed_at":"2026-08-09T18:28:49.269793Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.251860Z","title":null,"venue":null,"work_id":"d437d1b2-b3c4-4c40-88c9-af7d270a2846","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.652421Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:e042c7744f7e3f6f8cdef9971ac775879eaf116e5a25e61b1aafd91c1141ac5e","observation_id":"b675a518-fb63-429c-a27c-fe1de2209a42","resolution":{"observed_at":"2026-08-09T18:28:49.256152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.237491Z","title":"In Table 22, we demonstrate the throughput improvement in FastChannelVim compared to ChannelVim","venue":null,"work_id":"14070a45-858d-4042-8786-21f71831623f","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.656847Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:f9ab86b2f6778002f017d20bddafae2c35358265b8a9f094a46034ffa47f7c1a","observation_id":"68b26e95-cc81-4cbd-b083-05aa12fc2641","resolution":{"observed_at":"2026-08-09T18:28:49.242420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.222866Z","title":"Here, we calcu- late the processing time for Forward SSM + Backward SSM in only one block (see Fig","venue":null,"work_id":"74282be6-6af8-48b7-95b9-0c6fb622d122","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.661339Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:34a7b2c058b32a07ddb0146698eb79c93c54f1d611fbfa7ebc658b468819c7cc","observation_id":"505fef0c-ccf5-4083-b4f1-83bf717a8875","resolution":{"observed_at":"2026-08-09T18:28:49.227388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.208920Z","title":"We employed the AdamW optimizer with a weight decay of 0.01","venue":null,"work_id":"c1bd3ef8-8e04-48fb-8bcb-19a2fcc7a886","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.665879Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:7c8f0c5db4e23fec9d0dc3e48fc5f223de6842c79131b1802d9734b78a1d4ff1","observation_id":"b83603b0-749f-4159-8994-013e7e0e667d","resolution":{"observed_at":"2026-08-09T18:28:49.213392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.194754Z","title":"We employed the AdamW optimizer with a weight decay of 0.05, with a total batch size of 64","venue":null,"work_id":"546b84c9-0ab1-4cd9-9644-b882c70921a2","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.670445Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:7ad328f2526c3457dcbf8e0507d1fc65d5b24dedd6ff2a3d37edac2ec4701dca","observation_id":"23b235ad-6ca2-48f2-bd7d-6068e50fbb1c","resolution":{"observed_at":"2026-08-09T18:28:49.199418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.180481Z","title":"2), we apply mean pooling to the tokens before performing the SSM scan","venue":null,"work_id":"5fb3d1fd-4dd4-4576-a2b4-f7f1b16c4564","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.674860Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:ae7510fc9dde61a9390828dcf066936dc313bbf01c7378abf28bb7351813beca","observation_id":"9e16d200-e858-4ce7-9c97-469ad51776c9","resolution":{"observed_at":"2026-08-09T18:28:49.185072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:28:49.165879Z","title":"Model configurations for FastVim Model Layers Embedding dim","venue":null,"work_id":"12964caf-1a16-4de0-8e67-ab5f7aaa159e","year":null},"citing_paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-09T18:28:48.679484Z"},"links":{"citing_paper":"/paper/2502.00594"},"observation_digest":"sha256:c288ff59d7d296bf69075103e74bb3cfd2949dd878d12feb2254a662df71a3d7","observation_id":"63e740a5-14e1-4335-82eb-dd8fe6848f19","resolution":{"observed_at":"2026-08-09T18:28:49.170789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.00594","last_updated":"2025-02-01T23:35:20Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T18:21:39.932683Z","submitted_at":"2025-02-01T23:35:20Z","title":"Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing"},"reference_resolution":{"displayed":94,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":56,"verified_exact":2,"verified_fuzzy":35},"total_outbound_references":94},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 94 of 94 outbound references and 0 inbound Pith citation observations for arXiv:2502.00594."}