{"as_of":"2026-08-17T07:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8be534c5781b6ad714e2b4f40f55fde81401c910fdc22359438bcafe2d8e2ba1","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T13:41:54.684747Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T21:45:51.507382Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T14:25:45.811889Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"cited_work":{"arxiv_id":"2501.16182","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16182","snapshot_observed_at":"2026-07-01T14:25:45.811889Z","title":"The linear attention resurrection in vision transformer","venue":null,"work_id":"fdc16a5b-95c8-42f6-820b-cea815751051","year":2025},"citing_paper":{"arxiv_id":"2604.23798","last_updated":"2026-04-26T16:41:30Z","snapshot_observed_at":"2026-08-14T20:44:48.289813Z","submitted_at":"2026-04-26T16:41:30Z","title":"ELSA: Exact Linear-Scan Attention for Fast and Memory-Light Vision Transformers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-08T06:33:10.730973Z"},"links":{"cited_paper":"/paper/2501.16182","citing_paper":"/paper/2604.23798"},"observation_digest":"sha256:0b021ab3a84d140f00fdf88a9d535f8d86c9637b0ee9bea52a48de13afdd66b8","observation_id":"5d99074f-0a10-4a38-839c-62788197f37c","resolution":{"observed_at":"2026-05-11T21:11:17.683547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"cited_work":{"arxiv_id":"2501.16182","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16182","snapshot_observed_at":"2026-07-01T14:25:45.811889Z","title":"The linear attention resurrection in vision transformer","venue":null,"work_id":"fdc16a5b-95c8-42f6-820b-cea815751051","year":2025},"citing_paper":{"arxiv_id":"2605.18848","last_updated":"2026-06-04T09:09:51Z","snapshot_observed_at":"2026-08-16T19:26:00.907177Z","submitted_at":"2026-05-13T08:06:48Z","title":"Exact Linear Attention","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T08:44:58.108341Z"},"links":{"cited_paper":"/paper/2501.16182","citing_paper":"/paper/2605.18848"},"observation_digest":"sha256:07bcc6f4fef339eb05393ec96a68402ab4723221c1dd33c085d63aba82214972","observation_id":"cbc314fb-f538-4f79-bf58-2462437e06a6","resolution":{"observed_at":"2026-05-21T08:49:53.929183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"cited_work":{"arxiv_id":"2501.16182","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16182","snapshot_observed_at":"2026-07-01T14:25:45.811889Z","title":"The linear attention resurrection in vision transformer","venue":null,"work_id":"fdc16a5b-95c8-42f6-820b-cea815751051","year":2025},"citing_paper":{"arxiv_id":"2605.18848","last_updated":"2026-06-04T09:09:51Z","snapshot_observed_at":"2026-08-16T19:26:00.907177Z","submitted_at":"2026-05-13T08:06:48Z","title":"Exact Linear Attention","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T21:45:51.507382Z"},"links":{"cited_paper":"/paper/2501.16182","citing_paper":"/paper/2605.18848"},"observation_digest":"sha256:61182c54804ba006ec5c7082192d7ccc0f928300a86f72c004e811c2b6c1501d","observation_id":"640ef7b2-4772-491a-9207-b4d7caf76afa","resolution":{"observed_at":"2026-07-01T14:25:45.814038Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"cited_work":{"arxiv_id":"2501.16182","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16182","snapshot_observed_at":"2026-07-01T14:25:45.811889Z","title":"The linear attention resurrection in vision transformer","venue":null,"work_id":"fdc16a5b-95c8-42f6-820b-cea815751051","year":2025},"citing_paper":{"arxiv_id":"2605.25365","last_updated":"2026-05-25T02:44:13Z","snapshot_observed_at":"2026-08-16T02:32:35.340520Z","submitted_at":"2026-05-25T02:44:13Z","title":"Quantum Parameterized Self-Attention Network for Image Classification","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T22:02:43.573430Z"},"links":{"cited_paper":"/paper/2501.16182","citing_paper":"/paper/2605.25365"},"observation_digest":"sha256:4da901c78dd953c950bae88f4f21a8cde9659ff1aec8fc5a20f1b3e7106c140e","observation_id":"561fabb7-9448-498d-83f5-02e55a67378b","resolution":{"observed_at":"2026-06-29T22:04:00.001735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.16182/citation-record","integrity":"/paper/2501.16182/integrity","json":"/paper/2501.16182/citation-record.json","paper":"/paper/2501.16182"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.460647Z","title":"Xcit: Cross-covariance image transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.460647Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:d2dc741a341386d0fb24bcc647dcbd7528530103ed5ef66a521fb8fedb9d5d39","observation_id":"53703317-4cbe-4592-a0b2-666ebf72107c","resolution":{"observed_at":"2026-08-10T13:41:54.460647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-10T13:41:54.464364Z","title":"Long- former: The long-document transformer","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.464364Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:01b8278ff446ae2bfaee93af85c43d844e89b3feb16bc6ec195e74b5ed30c26c","observation_id":"39256775-ef11-41f9-bf77-f96edde37a0d","resolution":{"observed_at":"2026-08-10T13:41:54.464364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.468855Z","title":"Efficientvit: Lightweight multi-scale attention for high- resolution dense prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.468855Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:e4f4f9b1f95777828d3a8ceb1354bc0975baf0209208c6a4972f3aaf61e2a029","observation_id":"0cf6e4a6-a599-408f-a098-ee1eefffab6c","resolution":{"observed_at":"2026-08-10T13:41:54.468855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.07155","last_updated":"2019-06-17T17:58:12Z","snapshot_observed_at":"2026-08-16T03:32:25.570081Z","submitted_at":"2019-06-17T17:58:12Z","title":"MMDetection: Open MMLab Detection Toolbox and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.07155","snapshot_observed_at":"2026-08-10T13:41:54.472432Z","title":"MMDetection: Open mmlab detection tool- box and benchmark","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.472432Z"},"links":{"cited_paper":"/paper/1906.07155","citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:21fa7e927a1711f745bbbe6518b12ca36a64838fac3e9fa93f9a1fe235c09316","observation_id":"dbdaa291-6273-4862-87c1-a329f6d9c787","resolution":{"observed_at":"2026-08-10T13:41:54.472432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.475956Z","title":"Region- vit: Regional-to-local attention for vision transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.475956Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:500081297574ce651691a35097c3160bcc3ee37b6ad0f4a8bfff5bb71ff53929","observation_id":"e5b7277a-5860-4d95-ae2c-ba5a79aefcf6","resolution":{"observed_at":"2026-08-10T13:41:54.475956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-16T10:03:03.268538Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-10T13:41:54.479011Z","title":"Generating long sequences with sparse transformers","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.479011Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:d9fbcef6653507ec89d0ac77aeb16a7cdca431539904146d3b4623e3da5144d0","observation_id":"ca343d34-7b53-4fab-be1f-5fc3a1108413","resolution":{"observed_at":"2026-08-10T13:41:54.479011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.482109Z","title":"Rethinking attention with performers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.482109Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:d7072f0d78109a18eeb591e5ba4bddb56544dcfac5b20b8d2b719560d3fa8520","observation_id":"0bb3f15f-cf17-41db-800a-6557d9842fc3","resolution":{"observed_at":"2026-08-10T13:41:54.482109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.485541Z","title":"Twins: Revisiting the design of spatial attention in vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.485541Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:46351d325afc550253d9f642d252d4220738324d71e4da408ef47c313848d347","observation_id":"aeabe998-5f2e-48e6-b8d2-948c9130826e","resolution":{"observed_at":"2026-08-10T13:41:54.485541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-16T18:43:58.639735Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-08-10T13:41:54.488315Z","title":"Conditional po- sitional encodings for vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.488315Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:70ab5c253aa23aaccc3eb1daccdab0d8733b8c909aa06bddb070b0037b0b09d9","observation_id":"33b66a31-4a46-487a-928c-512e655ca41c","resolution":{"observed_at":"2026-08-10T13:41:54.488315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.490572Z","title":"MMSegmentation: Openmmlab semantic segmentation toolbox and benchmark","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.490572Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:a94ae32d905c89229584582cd203e98e523a0396fec3c66db289a05ca76c12d1","observation_id":"0b8cbbfd-69a7-4b85-bf7d-3a8fc0b20c59","resolution":{"observed_at":"2026-08-10T13:41:54.490572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.280330Z","title":"Randaugment: Practical automated data augmentation with a reduced search space","venue":null,"work_id":"4f0369c0-e4e0-4c02-8fa6-6f2577253d4d","year":null},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.492880Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:40e4efc07931fd30f0932a82bbb236eea30060bb734d651e1319e8625d271356","observation_id":"ce39a538-06e2-4029-84ed-ae0225964dfd","resolution":{"observed_at":"2026-08-10T13:41:55.283106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.273017Z","title":"Coatnet: Marrying convolution and attention for all data sizes","venue":null,"work_id":"0b7e2810-d634-4234-9a63-a5087cfb6627","year":2021},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.494875Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:8307f60c5ab4ee1ebfe4e510862814361b7f1998b8159cedacc449c4015ded4c","observation_id":"3e4d2130-7923-4071-92a1-676f24a78560","resolution":{"observed_at":"2026-08-10T13:41:55.276190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.264359Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"72f22900-d774-49d3-bf9f-fb3031d7f7c3","year":2009},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.496840Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:b8ea46a619d11ed45ba657d761c6ab8f6ab154aebbcdc711303d2c395d4e0478","observation_id":"24e0e125-0762-49eb-b7ea-59b42081a03c","resolution":{"observed_at":"2026-08-10T13:41:55.267592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03645","last_updated":"2022-04-07T17:59:32Z","snapshot_observed_at":"2026-08-16T17:08:29.364775Z","submitted_at":"2022-04-07T17:59:32Z","title":"DaViT: Dual Attention Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03645","snapshot_observed_at":"2026-08-10T13:41:54.499114Z","title":"Davit: Dual attention vision transform- ers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.499114Z"},"links":{"cited_paper":"/paper/2204.03645","citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:a64500abaee5201603288769fc3eb280fb6d10948633735d8f2ec57a5c8e5cef","observation_id":"2df0ee9b-d1c5-4754-b585-1d2d86ba2fa3","resolution":{"observed_at":"2026-08-10T13:41:54.499114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.255565Z","title":"Scaling up your kernels to 31x31: Revisiting large kernel design in cnns","venue":null,"work_id":"d1eca01b-dd23-4240-ab76-e0088810b119","year":2022},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.501681Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:b21d8b0ca24e2e95732dd9787c5f9e291cdfaad4a560116f1cdd636187a30cfd","observation_id":"49ea40d0-400b-4123-960d-31fd35cb8900","resolution":{"observed_at":"2026-08-10T13:41:55.258909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.246639Z","title":"Cswin transformer: A general vision transformer backbone with cross-shaped windows","venue":null,"work_id":"fc9605a4-c54e-4edf-b87d-650b247dfe2f","year":null},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.503683Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:1c49500cebcdf93534b5bec65cac5f39c4c6b12ba6a06bb817bf823e9dc16afb","observation_id":"f8f4c90b-4369-4fea-af96-325f690a7628","resolution":{"observed_at":"2026-08-10T13:41:55.250381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.237697Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":"cb23acef-25b6-4c92-b03b-7265d8b1818d","year":2020},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.505897Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:72a21930b6075b6d9aa25f70666279177cefb28ae6a95bceaceca5a90754114f","observation_id":"a99b16dd-96b1-47e7-8620-9f3dd794a9c6","resolution":{"observed_at":"2026-08-10T13:41:55.240701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.230171Z","title":"Multiscale vision transformers","venue":null,"work_id":"3b202ee6-278c-4999-b15e-e0b32ae6b532","year":null},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.507959Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:8fe9c2e250da8dec05505f990c98eb03c27841a4f351452c11316cf09c002f5d","observation_id":"cdb75960-9efc-49c4-9943-2463a69ba0ff","resolution":{"observed_at":"2026-08-10T13:41:55.233079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.223854Z","title":"Cmt: Convolutional neural networks meet vision transformers","venue":null,"work_id":"0c0a63c8-a7ec-4615-9dd0-3d5a14429c17","year":2022},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.510220Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:054de7d010de142ebf8bcfc85b61c8f7d77b01d24f89de6bad4f0664256f336f","observation_id":"c6c60a2a-33aa-4292-9a9b-2e99575eeaeb","resolution":{"observed_at":"2026-08-10T13:41:55.226073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.218330Z","title":"Flatten transformer: Vision transformer using fo- cused linear attention","venue":null,"work_id":"f3fcda31-784c-4236-9634-28f3c6ec7652","year":2023},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.512447Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:549dcd18bf183733b5dafbb1ad782e12d3f12fa3177e37be80544065b45129f2","observation_id":"cd2183b1-38ef-4550-b5fa-374bc45fcb86","resolution":{"observed_at":"2026-08-10T13:41:55.220427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08874","last_updated":"2024-07-15T09:42:48Z","snapshot_observed_at":"2026-08-16T14:34:42.160375Z","submitted_at":"2023-12-14T16:26:29Z","title":"Agent Attention: On the Integration of Softmax and Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08874","snapshot_observed_at":"2026-08-10T13:41:54.514452Z","title":"Agent attention: On the in- tegration of softmax and linear attention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.514452Z"},"links":{"cited_paper":"/paper/2312.08874","citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:74180a627b954f96cbb31e73184f84455a5a71cd4b2eeb5fc3ef222a78cac64d","observation_id":"659ce1f6-e444-4b39-b056-472b2df311a2","resolution":{"observed_at":"2026-08-10T13:41:54.514452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06189","last_updated":"2024-04-01T19:14:25Z","snapshot_observed_at":"2026-08-16T15:25:02.964381Z","submitted_at":"2023-06-09T18:41:37Z","title":"FasterViT: Fast Vision Transformers with Hierarchical Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06189","snapshot_observed_at":"2026-08-10T13:41:54.517245Z","title":"Fastervit: Fast vision transformers with hierarchical attention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.517245Z"},"links":{"cited_paper":"/paper/2306.06189","citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:cef72b9f2e821f618469d2fc0bdeb0f949521f5d0c1f794cdaeef33b6fdf1ee2","observation_id":"9905e0dc-dbbd-4f97-9da7-471277c87176","resolution":{"observed_at":"2026-08-10T13:41:54.517245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.212507Z","title":"Mask r-cnn","venue":null,"work_id":"7a202064-2dfe-4020-bcf2-56d5e02d6bb9","year":2017},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.519421Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:0a0dc34ab4f5cd621ecc1ee3d6daa18c3e10a94fd5595d887ce064d77617865e","observation_id":"b67f19e9-b2ab-45ce-80cb-9ef437fc4c8f","resolution":{"observed_at":"2026-08-10T13:41:55.214428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.206488Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"1f40793e-9b30-4b61-a96d-f31761e23b80","year":2016},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.521166Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:90568dc7524e27253bc65e78402de2031fbbcf37b1489eafc7aa61cd25ab2611","observation_id":"54915517-0e49-4f84-928d-fc75368ed735","resolution":{"observed_at":"2026-08-10T13:41:55.208590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00244","last_updated":"2022-06-01T06:00:13Z","snapshot_observed_at":"2026-08-16T16:56:07.255227Z","submitted_at":"2022-06-01T06:00:13Z","title":"Fair Comparison between Efficient Attentions","version":1},"cited_work":{"arxiv_id":"2206.00244","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.00244","snapshot_observed_at":"2026-08-10T13:41:54.799200Z","title":"Fair Comparison between Efficient Attentions","venue":"cs.CV","work_id":"7d2c2f5c-c693-4f31-89fd-0dfbf325cfef","year":2022},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.523028Z"},"links":{"cited_paper":"/paper/2206.00244","citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:7d43fa6713b7bba48aefc7554c24dc8991975c065930215b76497005aeb6d315","observation_id":"43342e25-08cc-43ae-a245-e2aade7dbeb6","resolution":{"observed_at":"2026-08-10T13:41:54.802553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.200378Z","title":"Deep networks with stochastic depth","venue":null,"work_id":"ddee5c23-a05a-4653-be0a-7b37d088e109","year":2016},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.526596Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:b297c826e8bb697de4e6d2876b7e102ff39fc2e469d3b702301bc8ace16e34b5","observation_id":"0b150885-ca32-47b3-8c01-a2431e4b870d","resolution":{"observed_at":"2026-08-10T13:41:55.202753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14795","last_updated":"2022-03-15T22:37:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-30T17:53:34Z","title":"Perceiver IO: A General Architecture for Structured Inputs & Outputs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14795","snapshot_observed_at":"2026-08-10T13:41:54.530911Z","title":"Perceiver io: A general architecture for structured inputs & outputs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.530911Z"},"links":{"cited_paper":"/paper/2107.14795","citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:4361b7f943433c6645919765d2f938b8b6b074ba8947e3891b5ffa5daf2b935f","observation_id":"dbe210f3-af68-467e-9dbe-6fd453481fff","resolution":{"observed_at":"2026-08-10T13:41:54.530911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.193990Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":"3d76de87-e37c-46cd-a67b-039960cab638","year":null},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.533639Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:13c8526c70f9a6d762bd5610bf3d3766e9f275db9fe1210d3b90c23a51751e5a","observation_id":"f319842a-fc72-409d-abe7-ee3f97147935","resolution":{"observed_at":"2026-08-10T13:41:55.196396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08898","last_updated":"2024-03-23T06:43:47Z","snapshot_observed_at":"2026-08-16T16:52:11.655931Z","submitted_at":"2022-06-17T17:15:01Z","title":"SimA: Simple Softmax-free Attention for Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08898","snapshot_observed_at":"2026-08-10T13:41:54.536567Z","title":"Sima: Simple softmax-free attention for vision transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.536567Z"},"links":{"cited_paper":"/paper/2206.08898","citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:9f6a561b23a57f4b00785715441a63ad057a2610727f58afd4b0858ef24894c6","observation_id":"498c3ad6-a224-4e65-973a-8a5a0a722963","resolution":{"observed_at":"2026-08-10T13:41:54.536567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.187043Z","title":"Imagenet classification with deep convolutional neural net- works","venue":null,"work_id":"5b803399-9546-4f10-9ef4-040a8484f7de","year":2012},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.539487Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:8b1beccab9adaea43c9e8a64311220cfa5b077c8f80c13f74ee6f3721181cbe7","observation_id":"f53ff697-b55d-42d4-b795-e7f0ae1f6ebd","resolution":{"observed_at":"2026-08-10T13:41:55.189731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.180209Z","title":"Set transformer: A frame- work for attention-based permutation-invariant neural net- works","venue":null,"work_id":"21cef3d0-475d-451e-8610-73b00cc7f0eb","year":2019},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.542127Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:8ed25949610746fbf2eeff305865031085daf36152f7018c6a26a6df5c7d506c","observation_id":"667ad20d-5f34-4533-83a3-a6121f39d9fd","resolution":{"observed_at":"2026-08-10T13:41:55.182762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.172774Z","title":"Mpvit: Multi-path vision transformer for dense pre- diction","venue":null,"work_id":"d6b9fc00-bb97-4065-a36c-1c3acc004a99","year":2022},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.545136Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:b522d4e7165dab4a0263fa417cf2177b81f9cb2e34568166c4795fd45302e6e6","observation_id":"74e26e97-924e-44fb-88e0-c79f5004ae24","resolution":{"observed_at":"2026-08-10T13:41:55.175382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.166235Z","title":"Focal loss for dense object detection","venue":null,"work_id":"9acf4e03-582b-48ec-b99c-67b6c0238201","year":2017},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.547889Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:ec935bdf54437ad6b7410a0551de715df1cbd1784fd2a9513e8cab696a777711","observation_id":"608cf3a1-2885-4fa8-aca2-824f9335ae84","resolution":{"observed_at":"2026-08-10T13:41:55.168818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.159361Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"40b34153-3dbc-4260-a0a4-03a642749606","year":2014},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.550900Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:15ae99386a1071afbc119eb91b6cd7acb1cd325e2aa313e3ecd1f9564b654a06","observation_id":"9c551716-9a48-4aed-9996-99987ad869c6","resolution":{"observed_at":"2026-08-10T13:41:55.161988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.151026Z","title":"Dynamic group transformer: A general vision transformer backbone with dynamic group attention","venue":null,"work_id":"bfe21342-5184-4c88-84c8-11a377566013","year":2022},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.553913Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:c25d9dccdf0f7b64e9b72669db4843a2e53567f858e7bbd5d3f745408bd465c3","observation_id":"dce7776b-9f0f-4d48-8f65-7c522a6a9583","resolution":{"observed_at":"2026-08-10T13:41:55.153729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.143912Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"4337899d-57d0-4827-8725-fe6fb55694fd","year":2021},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.556443Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:80459d3efd3c9c63dcb557354715289fa06f0b3dec5adffc6cfb1fa195985dba","observation_id":"2eacca5a-81c3-49e0-848d-bcf614fa3224","resolution":{"observed_at":"2026-08-10T13:41:55.146783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.137631Z","title":"A convnet for the 2020s","venue":null,"work_id":"2d3a27d9-de4b-404b-8f99-0a27ad3feb55","year":2022},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.559194Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:6b525950241f6d38c814d9dd46d0bf5987a13f5a489133d6e19bcce0768b14c9","observation_id":"0cc4e467-c168-40c2-a016-23f75fca6a3f","resolution":{"observed_at":"2026-08-10T13:41:55.139678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-10T13:41:54.562034Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.562034Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:75332be3f1142f840d06ddf36ab8915cf560f756100264edef9ef04aa7d840a2","observation_id":"1787b545-6413-48c2-8eaa-89a6c63124ab","resolution":{"observed_at":"2026-08-10T13:41:54.562034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.131483Z","title":"How do vision transformers work? In ICLR, 2022","venue":null,"work_id":"8f61b485-791d-4f9c-90a2-de8499b7f143","year":2022},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.564801Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:ec3934f3e62ae99bb3d6c8b95b3c04cf769d5286ca5e729de7f69568da18e354","observation_id":"2cf21be2-4f0d-44d6-8dbd-b0735a7376bd","resolution":{"observed_at":"2026-08-10T13:41:55.133744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.123867Z","title":"Random feature attention","venue":null,"work_id":"98000757-04bf-44fc-b2b8-ef012924cd6c","year":2021},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.567076Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:fbbc017ef85838342e473c8c81ef7e0662b0e86212192c2bb47cdfba7dbb072a","observation_id":"f361c433-cd01-480d-b4e4-0216223ec8dd","resolution":{"observed_at":"2026-08-10T13:41:55.126870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.117470Z","title":"Acceleration of stochastic approximation by averaging","venue":null,"work_id":"9d441e07-18ee-4287-8353-b4cdf50f7e5c","year":1992},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.569775Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:ce9a90dc2ef336d41147eb5bef270988d4a192dc4ca5722796349179ca93b9ef","observation_id":"1f7dad0d-dc52-47c5-b996-8d21b654fc74","resolution":{"observed_at":"2026-08-10T13:41:55.119848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.111139Z","title":"cosformer: Rethinking softmax in attention","venue":null,"work_id":"6febcf3b-91c3-420c-b0e2-2d9a9a3968eb","year":2022},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.571645Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:8add24bbe96c4f85af3e22bf6c66058e765bda2a01d96abd488e23691ba9ab79","observation_id":"dccae38d-9b8a-46e3-bd55-4b0c685e6731","resolution":{"observed_at":"2026-08-10T13:41:55.113461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.104035Z","title":"Amixer: Adaptive weight mixing for self-attention free vi- sion transformers","venue":null,"work_id":"37cba096-7553-4edc-b0ef-71903a8985b4","year":2022},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.573645Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:90a2ec23e003f82a696da4b762893e286920bc24bd8e3dc47ada4da0581cbf08","observation_id":"f4d76945-09d5-4d2f-8fd4-86236f627b68","resolution":{"observed_at":"2026-08-10T13:41:55.106648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.097113Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization","venue":null,"work_id":"7cb5a3e9-6295-427f-a1ba-18771dbeda25","year":2017},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.575889Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:f40f673c3f10a380ce29def617b02cd132beafce9c5f6fc4252b8e8548ef3777","observation_id":"188a6295-32d4-4d39-80d8-1e6fcc6b585c","resolution":{"observed_at":"2026-08-10T13:41:55.099492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.088549Z","title":"Efficient attention: Attention with linear complexities","venue":null,"work_id":"2af46a7f-dea6-424c-9255-d4eeab116fb6","year":2021},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.577858Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:3288792a66b776ca03b733b94dc7adddac9d5cee6d0fe45e906e7b3e62d38297","observation_id":"5b481d09-7545-4826-8ead-aa8284e7a1b3","resolution":{"observed_at":"2026-08-10T13:41:55.092305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12956","last_updated":"2022-05-26T17:18:32Z","snapshot_observed_at":"2026-08-17T03:43:43.603683Z","submitted_at":"2022-05-25T17:59:54Z","title":"Inception Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12956","snapshot_observed_at":"2026-08-10T13:41:54.579790Z","title":"Inception transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.579790Z"},"links":{"cited_paper":"/paper/2205.12956","citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:d3759855f5c6449cd2b71d48f70b80de1551f357ee953a64a6e15ce34a94ed56","observation_id":"bef7f0c8-6da9-45de-a6a4-91a51f8f9091","resolution":{"observed_at":"2026-08-10T13:41:54.579790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.582492Z","title":"Segmenter: Transformer for semantic segmenta- tion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.582492Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:5a616bcb1726a18a86d66dbb935b9d1b0e1ced6eebc8acbe19bd9a9c5061cc6f","observation_id":"50627eae-2b43-4737-8fb9-6c0a46b34cc0","resolution":{"observed_at":"2026-08-10T13:41:54.582492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.01470","last_updated":"2019-07-02T15:56:20Z","snapshot_observed_at":"2026-08-13T11:06:33.334750Z","submitted_at":"2019-07-02T15:56:20Z","title":"Augmenting Self-attention with Persistent Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.01470","snapshot_observed_at":"2026-08-10T13:41:54.584553Z","title":"Augmenting self-attention with persistent memory","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.584553Z"},"links":{"cited_paper":"/paper/1907.01470","citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:652181b367c74d86884f821bf53ab94ae8325a477626f6a1c1bd8c189f6332aa","observation_id":"f2fa1c0e-714b-4244-b938-80269fea5f11","resolution":{"observed_at":"2026-08-10T13:41:54.584553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.586985Z","title":"Rethinking the inception ar- chitecture for computer vision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.586985Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:e5bb57dd8bf7b992d859a4c9f3d4ac4633b3dc3d92e6a72bb30f6d67f28966f1","observation_id":"c7fa73b3-9b7b-4799-861c-67b6dbc844f5","resolution":{"observed_at":"2026-08-10T13:41:54.586985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.072742Z","title":"Efficientnet: Rethinking model scaling for convolutional neural networks","venue":null,"work_id":"4f302d25-6ab8-4640-a198-5501bbed28a5","year":2019},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.589626Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:7fe1dd92e06b136dfe8e0fdef9e121058cd1d29f18fd38a0b06d6df7014905e1","observation_id":"d4008416-7398-4085-9574-2d2da4dd5213","resolution":{"observed_at":"2026-08-10T13:41:55.075890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.064476Z","title":"Efficient transformers: A survey","venue":null,"work_id":"b02e8a35-81ba-4516-bad9-917871cfca17","year":2022},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.592514Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:b050cb738bec27bec1e6aa4c27bed2fc67b35db5141da9033eabd76a17191017","observation_id":"0317fcbe-6499-4e9e-9bb8-1e703e88224f","resolution":{"observed_at":"2026-08-10T13:41:55.067443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.056475Z","title":"Training data-efficient image transformers & distillation through at- tention","venue":null,"work_id":"a46346d0-ca44-40cc-b446-2f9f8578ee29","year":2021},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.594452Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:cf1da2e3692cfb9a9c5fa292492252f46b7151e13629262ca93817e45b4b1de5","observation_id":"7ce4c454-ed5d-4a27-9a95-2c48bf176266","resolution":{"observed_at":"2026-08-10T13:41:55.059611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.07197","last_updated":"2021-07-01T11:55:07Z","snapshot_observed_at":"2026-08-16T18:24:32.548314Z","submitted_at":"2021-05-15T10:33:35Z","title":"Are Convolutional Neural Networks or Transformers more like human vision?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.07197","snapshot_observed_at":"2026-08-10T13:41:54.596558Z","title":"Are convolutional neural networks or transformers more like human vision? arXiv preprint arXiv:2105.07197,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.596558Z"},"links":{"cited_paper":"/paper/2105.07197","citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:08204f2ceaf5ffc952b09c0681fb443b2376c9e259ddd73ee391307fbcc18799","observation_id":"cfa3323d-b45e-4a49-af3a-ef616dcf0755","resolution":{"observed_at":"2026-08-10T13:41:54.596558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.047964Z","title":"Attention is all you need","venue":null,"work_id":"24a69035-8636-4f71-9172-513268651fd7","year":2017},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.598852Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:599cb7f3d4d1f3f1b80faa678e8856ab8ab7d0889a27a13f66a08b1f23606c73","observation_id":"c04b02fa-b8ea-4f46-a5f8-a5bf04e6c35f","resolution":{"observed_at":"2026-08-10T13:41:55.051071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.040486Z","title":"Repvit: Revisiting mobile cnn from vit perspective","venue":null,"work_id":"12829193-ba56-46bd-926c-7b1a5d954153","year":2024},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.601252Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:92c804cb58aa34850ce628ffc06ab9d0192e208c8f9c7bf301f318e74a2df940","observation_id":"80c01e02-0a26-4bd0-98cc-b1c564dbe15e","resolution":{"observed_at":"2026-08-10T13:41:55.043224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.13317","last_updated":"2022-08-01T06:13:52Z","snapshot_observed_at":"2026-08-16T16:43:04.063769Z","submitted_at":"2022-07-27T06:36:36Z","title":"Convolutional Embedding Makes Hierarchical Vision Transformer Stronger","version":2},"cited_work":{"arxiv_id":"2207.13317","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.13317","snapshot_observed_at":"2026-08-10T13:41:54.746655Z","title":"Convolutional Embedding Makes Hierarchical Vision Transformer Stronger","venue":"cs.CV","work_id":"f2b86cf2-3058-4b68-83b6-d3a73cf170d8","year":2022},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.603813Z"},"links":{"cited_paper":"/paper/2207.13317","citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:ea330e9c183e4646b156a7ce68efb79bcf2c879a6c0894cac9b9646769664646","observation_id":"6570c2a8-1fc1-4668-be33-bb8c617bce0c","resolution":{"observed_at":"2026-08-10T13:41:54.750311Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.030948Z","title":"Scaled relu matters for training vision transformers","venue":null,"work_id":"14262855-e3c6-4b64-aaf6-e8d24b542c29","year":2022},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.606461Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:ebbe4679b129b94123737338c159349ad9d175b8b4c457f29230db5cb3db7d63","observation_id":"04811f4b-de6c-44e1-bac8-2a185ba97dc5","resolution":{"observed_at":"2026-08-10T13:41:55.034447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-10T13:41:54.609560Z","title":"Linformer: Self-attention with linear complexity","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.609560Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:345a7b33a82f0866f5e25675853e763b0ba5ad668aa37ec512316cdae0d07aa9","observation_id":"834ecf1b-2767-4701-841e-89a33622e4f2","resolution":{"observed_at":"2026-08-10T13:41:54.609560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.613210Z","title":"Pyramid vision transformer: A versatile backbone for dense prediction without convolutions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.613210Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:768dfa9a419e29b4158a154041f1c6e5fd055a13afb9ccca348e7a073c21fa2a","observation_id":"859760b1-426f-4d72-9613-96915e7a82cf","resolution":{"observed_at":"2026-08-10T13:41:54.613210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.018592Z","title":"Pvt v2: Improved baselines with pyramid vision transformer","venue":null,"work_id":"fe29ed52-00d2-47d4-a9b1-8ee83a75f9c7","year":2022},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.615602Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:89717f45feb40cc3ffdf59a89aab1783c8a20a3c97db249d9e2d4b60abbf39c5","observation_id":"c079d26e-444c-466c-aeb7-f066ab8b6e4a","resolution":{"observed_at":"2026-08-10T13:41:55.021780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.010975Z","title":"Crossformer: A versatile vision transformer hinging on cross-scale attention","venue":null,"work_id":"c8296063-cf2e-4323-ac2f-8fb872e2f67c","year":2022},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.619314Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:3c253c6a5641ef0fd25870838cb1cc77fbda717b17f2db2396c33e8629e6798a","observation_id":"4f8bc03d-2dcf-4036-bcbf-01419997f057","resolution":{"observed_at":"2026-08-10T13:41:55.013229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:55.004544Z","title":"Cvt: Introducing convolutions to vision transformers","venue":null,"work_id":"a98cce13-879e-4462-bafa-a3bf1daeb950","year":null},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.623293Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:bd480f0c46ccf6f0002681fa402e579c975fc6ba559c6bbe971ed3034973a39b","observation_id":"2aac9602-def6-48d7-a2ae-108d5cea60b5","resolution":{"observed_at":"2026-08-10T13:41:55.007134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.998142Z","title":"Pale transformer: A general vision transformer backbone with pale-shaped attention","venue":null,"work_id":"5539772e-4d72-4acc-8542-168b3899a54e","year":2022},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.625811Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:2dc952963b6f5d031394555b95545cd3ae6d7dfee6ab73949e49e989a64d0d23","observation_id":"129fba07-ef5a-4fb1-9525-867ce9bd9e4b","resolution":{"observed_at":"2026-08-10T13:41:55.000498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.990815Z","title":"Unified perceptual parsing for scene understand- ing","venue":null,"work_id":"0be1ec51-680a-4627-bb5c-f33e0c028d32","year":2018},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.629116Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:5fe1ea09545a049ad33ed0f6128bf7abcc9ad81d8ebb26402cbcf5c7bda79049","observation_id":"49dece36-a2d2-4f3d-922f-0dd84050cb6d","resolution":{"observed_at":"2026-08-10T13:41:54.993336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.983588Z","title":"Aggregated residual transformations for deep neural networks","venue":null,"work_id":"dc8fdc8e-926d-45ee-bda2-2096e1bffbd0","year":2017},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.632197Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:b14c2f90fd5f959a76ece829449b044921fe28dba48bceeb361308eb15ac201a","observation_id":"65326ba6-0fc5-4794-bb68-f7bf27f457e1","resolution":{"observed_at":"2026-08-10T13:41:54.986716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.976558Z","title":"Nystr¨omformer: A nystr¨om-based algorithm for approximat- ing self-attention","venue":null,"work_id":"7bbdce17-1757-4290-b165-99818c22f57e","year":null},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.634779Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:41724c267479850732c15f51cde13e41528570211e17149117aac538bafda63a","observation_id":"5c0e3033-a4b7-4d4b-a182-aff0b78b290f","resolution":{"observed_at":"2026-08-10T13:41:54.979235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01820","last_updated":"2023-01-30T22:12:11Z","snapshot_observed_at":"2026-08-16T16:26:56.293061Z","submitted_at":"2022-10-04T18:00:06Z","title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","version":2},"cited_work":{"arxiv_id":"2210.01820","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.01820","snapshot_observed_at":"2026-08-10T13:41:54.726619Z","title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","venue":"cs.CV","work_id":"dfe0fedd-48f8-459a-b6f2-72883946e4bd","year":2022},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.637457Z"},"links":{"cited_paper":"/paper/2210.01820","citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:482197899addd490065df834fa3170fcff29ec4528f9d303ef2087038370ccb1","observation_id":"2c553c67-1ad3-4e6d-8058-6848e1e39132","resolution":{"observed_at":"2026-08-10T13:41:54.730837Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.968930Z","title":"Focal attention for long-range interactions in vision transformers","venue":null,"work_id":"b5376cc9-1c8d-4451-bcc2-4674659b5f78","year":2021},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.640474Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:f53d8126140c93178f1d7b7252dd58c580fc4dd6dbeec445c469652b4f0ed4b2","observation_id":"b09c4d58-dfe3-4a53-8a7f-66656b0bb54b","resolution":{"observed_at":"2026-08-10T13:41:54.972414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13452","last_updated":"2024-12-01T05:55:44Z","snapshot_observed_at":"2026-08-16T16:21:33.097774Z","submitted_at":"2022-10-24T17:59:57Z","title":"MetaFormer Baselines for Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13452","snapshot_observed_at":"2026-08-10T13:41:54.642727Z","title":"Metaformer baselines for vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.642727Z"},"links":{"cited_paper":"/paper/2210.13452","citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:cf8817959ea6ec3cfe2c40b3867394d962e2cb860f49b9d33859c7b5d8aabd55","observation_id":"bdddb86f-80d0-4e73-88e6-61f78e2aa32e","resolution":{"observed_at":"2026-08-10T13:41:54.642727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.961339Z","title":"Cutmix: Regu- larization strategy to train strong classifiers with localizable features","venue":null,"work_id":"0a620960-72a5-470f-aac8-45d9fc95eeb1","year":2019},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.645421Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:1a5fe4a567c628d81938622a2beb2546469ee9a5c919879aa5baa1f380198a93","observation_id":"7f3003e8-f2df-463f-97da-a617546d1bc9","resolution":{"observed_at":"2026-08-10T13:41:54.964345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.950710Z","title":"Shvit: Single-head vision transformer with memory efficient macro design","venue":null,"work_id":"5572390e-b3b4-4622-a4dd-ecca00648997","year":2024},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.647380Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:ce1eac26f3b6386e16e0242d483bc5779300d2adc1589bc51f5f83b0db00eee6","observation_id":"bd128eb7-c02e-4ffb-bde4-15812275094e","resolution":{"observed_at":"2026-08-10T13:41:54.954231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.941374Z","title":"Big bird: Transformers for longer sequences","venue":null,"work_id":"4a9114de-1e19-4e5f-86fc-9ae47b0b12cc","year":2020},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.649320Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:8720ca8190d17946f33a7a146e1b7ccd78ed62c36342efd84af536e1745c7dce","observation_id":"af5cc667-9c1f-4d35-9c6e-b1086646134b","resolution":{"observed_at":"2026-08-10T13:41:54.944515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-08-08T10:28:19.597631Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-10T13:41:54.651246Z","title":"mixup: Beyond empirical risk minimiza- tion","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.651246Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:63b8629609731887a555593dd21e5fbf9383703bb72037e39e4ce94356283fb5","observation_id":"978ac9f7-5421-42df-b3c9-f33194e6de93","resolution":{"observed_at":"2026-08-10T13:41:54.651246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.933321Z","title":"Poolingformer: Long document modeling with pooling attention","venue":null,"work_id":"c3c28c3f-0a9b-4e97-90f3-20e8cd155df3","year":2021},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.653425Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:fd9254144995235cfabab3aaafbf24016ca69906f3a1f168e8c01bea19c48281","observation_id":"e0cdd8e0-5d83-4bdc-9b85-56fe77a8d6a4","resolution":{"observed_at":"2026-08-10T13:41:54.936358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.655424Z","title":"Multi-scale vision long- former: A new vision transformer for high-resolution image encoding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.655424Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:cbd99ce3a53597331a25ea0d49bdd2248d5e63a936656476647526a490064a76","observation_id":"6d7e9fb4-ef25-481c-b6d8-23f1cbc388da","resolution":{"observed_at":"2026-08-10T13:41:54.655424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.07366","last_updated":"2022-09-27T07:01:18Z","snapshot_observed_at":"2026-08-16T17:06:45.873669Z","submitted_at":"2022-04-15T07:57:40Z","title":"ResT V2: Simpler, Faster and Stronger","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.07366","snapshot_observed_at":"2026-08-10T13:41:54.658436Z","title":"Rest v2: Simpler, faster and stronger","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.658436Z"},"links":{"cited_paper":"/paper/2204.07366","citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:2fb91bace8864d0805c4b77b0532c1d4730b428db0a0730c600ec69e6ba611a2","observation_id":"14f3b03c-b0c8-48f8-a72b-4689136af9da","resolution":{"observed_at":"2026-08-10T13:41:54.658436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.921109Z","title":"Random erasing data augmentation","venue":null,"work_id":"2cd397a5-2fd1-417f-a68f-ecb72ac87091","year":2020},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.661338Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:fca9fe8bb5c56a2cf194f8065d8c382aff21eb5eab47ccad053ddc1b4c758ef8","observation_id":"40e3b34e-c3b2-4b06-a4ec-a6fbc96b0e23","resolution":{"observed_at":"2026-08-10T13:41:54.923515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.913245Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":"2da54beb-bb05-4dd8-873f-5f22a60ddb39","year":2017},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.664163Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:68281e012191053fd52c54026bb03743b1a98b7064aa35cf2b57f2e449609720","observation_id":"68ba0622-2d50-431a-ba76-3644a306287d","resolution":{"observed_at":"2026-08-10T13:41:54.915800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.904935Z","title":"Long-short transformer: Efficient transformers for language and vision","venue":null,"work_id":"40cf080d-67bb-48c0-bd05-f7cc779f2c68","year":2021},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.666947Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:f6715eb58b7cfc38731538086c9b433243d81382053a85c2f0b9e6112ce6fd8f","observation_id":"c66b08be-7f29-4988-9a03-e4b4ad987537","resolution":{"observed_at":"2026-08-10T13:41:54.908606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.897086Z","title":null,"venue":null,"work_id":"84774862-5795-438a-87c3-c2259064d6f8","year":null},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.670609Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:07f16e5f131a0e3f59fb2d5a5d4493372887b184275b0a6f02532215ac2553f0","observation_id":"618a4871-b231-4769-9da6-5879aa2ea8a1","resolution":{"observed_at":"2026-08-10T13:41:54.900197Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.888566Z","title":"Comparison of different lower-bound Cmin when clamping the denominator of linear attention into the range [Cmin, +∞)","venue":null,"work_id":"d32c35f2-beee-456a-9b13-c395fadae78a","year":null},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.673164Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:c2092c9cd08660096de4edb8e1887fc4b959fd380a968d6d294a8dd8eccba507","observation_id":"d05fb27a-9529-4353-8334-e1ee393b0ec9","resolution":{"observed_at":"2026-08-10T13:41:54.891804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.880496Z","title":"Apply our proposed enhanced linear attention on the plain ViT architectures","venue":null,"work_id":"26bbc264-8adf-492d-b3df-56668b15c912","year":null},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.675553Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:dcb660eb4a654d474bc3ca9b3edf916c6e9e0ed22a905f72e46702b2ecd73560","observation_id":"331bac28-e3f1-4998-8870-1d2d8ee6965c","resolution":{"observed_at":"2026-08-10T13:41:54.883366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.872309Z","title":null,"venue":null,"work_id":"0dd0d0d9-d99e-439c-84e6-bc0c199b606f","year":null},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.678758Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:0a52bd2031dbec906717b069d72ad2ed6ee2220b1a9d3439c4befdf5aa5964a3","observation_id":"d0c83913-23af-42bb-8f40-a676136e5579","resolution":{"observed_at":"2026-08-10T13:41:54.875117Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.863940Z","title":"may not be compensated by convolution since they show global patterns instead of local patterns","venue":null,"work_id":"d47594e6-ab5b-4fb2-8b89-676ffb78b7ad","year":null},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.681334Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:26d72b161008df249c386f90fcfd50aae1c0656c60f7faf0cfc18dc3f698a77e","observation_id":"6652b9b3-7183-4684-ab69-620d80f68a6c","resolution":{"observed_at":"2026-08-10T13:41:54.866494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:41:54.856497Z","title":"Unlike the non-overlapping patchify stem in Swin [36], we adopt a two-layer convolu- tional stem to extract more important local structure infor- mation for each patch","venue":null,"work_id":"0f993752-32ad-41d7-99f9-d3e46a5330fe","year":null},"citing_paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T13:41:54.684747Z"},"links":{"citing_paper":"/paper/2501.16182"},"observation_digest":"sha256:44a3eb3b94da07a9c31efce5e5862374a68e3d9346fd40a4d0e95cd2f08dcfc2","observation_id":"591e8058-89b5-46bc-9230-9f434e78c76c","resolution":{"observed_at":"2026-08-10T13:41:54.859414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.16182","last_updated":"2025-01-27T16:29:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T03:49:27.923238Z","submitted_at":"2025-01-27T16:29:17Z","title":"The Linear Attention Resurrection in Vision Transformer"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":3,"verified_fuzzy":53},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 4 inbound Pith citation observations for arXiv:2501.16182."}