{"as_of":"2026-08-22T20:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:30fe321c0e3f5fbb8d897c561b350e89611a64c252bc7afd52ca47899ab940ee","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:00:16.123817Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":204,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-12T19:00:16.123817Z","title":"How do vision transformers work?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11087","last_updated":"2024-11-17T14:30:50Z","snapshot_observed_at":"2026-08-16T06:52:44.294958Z","submitted_at":"2024-11-17T14:30:50Z","title":"D-Cube: Exploiting Hyper-Features of Diffusion Model for Robust Medical Classification","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T19:00:16.123817Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2411.11087"},"observation_digest":"sha256:ab120083cbed95fe3fdfee8d02bf54e0a889a34bf3f36e3de0c43993d05254e6","observation_id":"1e2d7390-831f-40a1-a33d-2091a0f01ffd","resolution":{"observed_at":"2026-08-12T19:00:16.123817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-12T12:41:01.233642Z","title":"How do vision transformers work? arXiv preprint arXiv:2202.06709, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17000","last_updated":"2024-11-26T00:08:00Z","snapshot_observed_at":"2026-08-21T12:38:50.739376Z","submitted_at":"2024-11-26T00:08:00Z","title":"SatVision-TOA: A Geospatial Foundation Model for Coarse-Resolution All-Sky Remote Sensing Imagery","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T12:41:01.233642Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2411.17000"},"observation_digest":"sha256:d19423c20e9eb0967f8e5324f6d0dc1a48b52983a7b994f757bda9c373b356cf","observation_id":"7650f84e-c0e3-44f3-b0a4-4ba29f4e6669","resolution":{"observed_at":"2026-08-12T12:41:01.233642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-12T10:24:01.262851Z","title":"How do vision transformers work? arXiv preprint arXiv:2202.06709, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19297","last_updated":"2024-11-28T18:09:49Z","snapshot_observed_at":"2026-08-15T10:45:30.242944Z","submitted_at":"2024-11-28T18:09:49Z","title":"Enhancing Parameter-Efficient Fine-Tuning of Vision Transformers through Frequency-Based Adaptation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:01.262851Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2411.19297"},"observation_digest":"sha256:5bf97d96b95e11749fbe83ee6b3672c8db902981580de5fdfc42cd660a2625f3","observation_id":"f48bb99c-1587-4458-8070-ccf9bf6eabf2","resolution":{"observed_at":"2026-08-12T10:24:01.262851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-12T04:21:34.702751Z","title":"How do vision transformers work? arXiv preprint arXiv:2202.06709, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01559","last_updated":"2024-12-02T14:47:27Z","snapshot_observed_at":"2026-08-20T17:07:15.742791Z","submitted_at":"2024-12-02T14:47:27Z","title":"Adaptive High-Pass Kernel Prediction for Efficient Video Deblurring","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T04:21:34.702751Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2412.01559"},"observation_digest":"sha256:121363efdf8dc649e45cde90bea45f062a118d7c9ac499c831d09eaa36281113","observation_id":"19b47c2d-2810-4f1b-a698-59836a879e85","resolution":{"observed_at":"2026-08-12T04:21:34.702751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-11T19:39:39.182545Z","title":"How Do Vision Transformers Work ?, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06534","last_updated":"2025-08-13T18:10:14Z","snapshot_observed_at":"2026-08-16T16:31:13.516505Z","submitted_at":"2024-12-09T14:43:06Z","title":"Understanding Transformer-based Vision Models through Inversion","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T19:39:39.182545Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2412.06534"},"observation_digest":"sha256:6be5c5d0774e6c9df168a8d2228ebc296e811a74d3ebf53bc4c0cd8f126dfaa8","observation_id":"b2ca3d00-ea22-4df4-ab9f-b0f2c8ec27b2","resolution":{"observed_at":"2026-08-11T19:39:39.182545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-11T15:42:00.556711Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10776","last_updated":"2024-12-14T10:03:08Z","snapshot_observed_at":"2026-08-18T21:39:32.805319Z","submitted_at":"2024-12-14T10:03:08Z","title":"Boosting ViT-based MRI Reconstruction from the Perspectives of Frequency Modulation, Spatial Purification, and Scale Diversification","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T15:42:00.556711Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2412.10776"},"observation_digest":"sha256:0a363699ed5883070bb2bb8035ea3a4988cb9fa7dac65ea2c2ac04e7100ecc60","observation_id":"72bb7e87-3ac8-41ff-b091-1070b4e882a2","resolution":{"observed_at":"2026-08-11T15:42:00.556711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-11T14:53:36.321211Z","title":"How do vision transformers work? arXiv preprint arXiv:2202.06709, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11540","last_updated":"2025-07-11T10:38:22Z","snapshot_observed_at":"2026-08-20T10:49:17.790529Z","submitted_at":"2024-12-16T08:21:09Z","title":"SP$^2$T: Sparse Proxy Attention for Dual-stream Point Transformer","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T14:53:36.321211Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2412.11540"},"observation_digest":"sha256:d9056ae5dd181e445f022d17cbde6278d0437469d724b8373d2005d03f180ba3","observation_id":"4a6a50fc-4cfb-4b32-bc6b-ad6063d83578","resolution":{"observed_at":"2026-08-11T14:53:36.321211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-10T20:33:05.702588Z","title":"How do vision transformers work?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.08163","last_updated":"2025-03-31T13:41:34Z","snapshot_observed_at":"2026-08-14T03:11:01.027012Z","submitted_at":"2025-01-14T14:41:51Z","title":"DH-Mamba: Exploring Dual-domain Hierarchical State Space Models for MRI Reconstruction","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:33:05.702588Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2501.08163"},"observation_digest":"sha256:bff215cbf5a817a062ee5c3ce30b6b30fc4e7aed86d4de2352c954b3a6314ecc","observation_id":"adc93ca0-f0bd-419c-bb9f-691a76683825","resolution":{"observed_at":"2026-08-10T20:33:05.702588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-10T14:25:11.982373Z","title":"How do vision transformers work?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16389","last_updated":"2025-09-07T01:22:45Z","snapshot_observed_at":"2026-08-15T14:51:30.448066Z","submitted_at":"2025-01-26T00:27:04Z","title":"Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:11.982373Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2501.16389"},"observation_digest":"sha256:c29bd73fdb86aab9809b4515cc76bfa278747873b43601c0bf85aec781868ceb","observation_id":"50ead4e3-8886-4ec9-9447-d9d80d9ae90e","resolution":{"observed_at":"2026-08-10T14:25:11.982373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-09T19:44:20.891764Z","title":"and Kim, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00264","last_updated":"2025-05-28T20:23:12Z","snapshot_observed_at":"2026-08-16T00:01:51.337050Z","submitted_at":"2025-02-01T01:44:55Z","title":"Beyond the Permutation Symmetry of Transformers: The Role of Rotation for Model Fusion","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-09T19:44:20.891764Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2502.00264"},"observation_digest":"sha256:2029a8f762165ce8e07b5ce672a017c9ae8c4654b215d1b1b2fd5fae0f57cad1","observation_id":"5aa6e507-018f-42ba-b478-ca5a1f3a2ebd","resolution":{"observed_at":"2026-08-09T19:44:20.891764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":"2202.06709","doi":"10.48550/arxiv.2202.06709","metadata_source":"pith","pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How do vision transformers work?","venue":"cs.CV","work_id":"38d11e0d-ea9d-49ec-8fe3-e9e95d6379c1","year":2022},"citing_paper":{"arxiv_id":"2504.16455","last_updated":"2026-04-16T11:55:50Z","snapshot_observed_at":"2026-08-15T10:45:28.166252Z","submitted_at":"2025-04-23T06:44:46Z","title":"Cross Paradigm Representation and Alignment Transformer for Image Deraining","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T17:57:05.010694Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2504.16455"},"observation_digest":"sha256:8ccff2771742cd5386b2657608b653a026c8ea12fecdca0a5795ca24a0eeadc3","observation_id":"bda6bfa4-05b9-49aa-ae3c-9d989db58cf9","resolution":{"observed_at":"2026-05-22T18:01:54.628626Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-06T22:12:12.005496Z","title":"How do vision transformers work? arXiv preprint arXiv:2202.06709, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02939","last_updated":"2025-07-20T17:02:56Z","snapshot_observed_at":"2026-08-18T03:38:56.819580Z","submitted_at":"2025-06-27T14:24:37Z","title":"Frequency-Aligned Knowledge Distillation for Lightweight Spatiotemporal Forecasting","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:12:12.005496Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2507.02939"},"observation_digest":"sha256:bce077dfe7fb2b770062039b893da2bd77c5de6eb089a4ffdb702050716f35ac","observation_id":"dd66d163-2f4f-417e-804b-e63a0360b37e","resolution":{"observed_at":"2026-08-06T22:12:12.005496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":"2202.06709","doi":"10.48550/arxiv.2202.06709","metadata_source":"pith","pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How do vision transformers work?","venue":"cs.CV","work_id":"38d11e0d-ea9d-49ec-8fe3-e9e95d6379c1","year":2022},"citing_paper":{"arxiv_id":"2604.06783","last_updated":"2026-04-08T07:52:28Z","snapshot_observed_at":"2026-08-15T10:45:27.083624Z","submitted_at":"2026-04-08T07:52:28Z","title":"Insights from Visual Cognition: Understanding Human Action Dynamics with Overall Glance and Refined Gaze Transformer","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T18:07:41.426142Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2604.06783"},"observation_digest":"sha256:a58bd4e91eef551597621162a259529c5c3f9700b294a0e186edbcb5ae092e48","observation_id":"544ab5a6-473d-431d-97d0-72d8e1bee1bd","resolution":{"observed_at":"2026-05-11T05:26:01.490975Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":"2202.06709","doi":"10.48550/arxiv.2202.06709","metadata_source":"pith","pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How do vision transformers work?","venue":"cs.CV","work_id":"38d11e0d-ea9d-49ec-8fe3-e9e95d6379c1","year":2022},"citing_paper":{"arxiv_id":"2604.14526","last_updated":"2026-04-16T01:47:22Z","snapshot_observed_at":"2026-08-15T10:44:46.077048Z","submitted_at":"2026-04-16T01:47:22Z","title":"FreqTrack: Frequency Learning based Vision Transformer for RGB-Event Object Tracking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T12:01:05.411686Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2604.14526"},"observation_digest":"sha256:49f415a0454796b11584450547ca954d117ba91d820825a65c3ce54037f171d3","observation_id":"440e064b-0a4d-49e3-b3f9-30365f4aedd3","resolution":{"observed_at":"2026-05-10T12:05:22.452546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":"2202.06709","doi":"10.48550/arxiv.2202.06709","metadata_source":"pith","pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How do vision transformers work?","venue":"cs.CV","work_id":"38d11e0d-ea9d-49ec-8fe3-e9e95d6379c1","year":2022},"citing_paper":{"arxiv_id":"2605.00510","last_updated":"2026-05-01T08:36:52Z","snapshot_observed_at":"2026-08-13T06:02:42.341417Z","submitted_at":"2026-05-01T08:36:52Z","title":"Scale-Aware Adversarial Analysis: A Diagnostic for Generative AI in Multiscale Complex Systems","version":1},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:13.911743Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2605.00510"},"observation_digest":"sha256:ba8c05b42dc1620badba05543e97d5fa512011d6e8cbc12f994f00af720a8600","observation_id":"4692f353-432d-49d6-9805-1adb7080aac9","resolution":{"observed_at":"2026-05-09T19:56:16.519623Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":"2202.06709","doi":"10.48550/arxiv.2202.06709","metadata_source":"pith","pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How do vision transformers work?","venue":"cs.CV","work_id":"38d11e0d-ea9d-49ec-8fe3-e9e95d6379c1","year":2022},"citing_paper":{"arxiv_id":"2605.08935","last_updated":"2026-06-02T09:05:25Z","snapshot_observed_at":"2026-08-12T15:37:01.717901Z","submitted_at":"2026-05-09T13:12:33Z","title":"PnP-Corrector: A Universal Correction Framework for Coupled Spatiotemporal Forecasting","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-12T03:27:14.464987Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2605.08935"},"observation_digest":"sha256:88f384378ccc478610eb8751c95d5c7529c40db979da3307c99a85ddf61c2007","observation_id":"220c00fd-10c2-4456-9652-d5b28448e968","resolution":{"observed_at":"2026-05-12T07:21:26.219648Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":"2202.06709","doi":"10.48550/arxiv.2202.06709","metadata_source":"pith","pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How do vision transformers work?","venue":"cs.CV","work_id":"38d11e0d-ea9d-49ec-8fe3-e9e95d6379c1","year":2022},"citing_paper":{"arxiv_id":"2605.08935","last_updated":"2026-06-02T09:05:25Z","snapshot_observed_at":"2026-08-12T15:37:01.717901Z","submitted_at":"2026-05-09T13:12:33Z","title":"PnP-Corrector: A Universal Correction Framework for Coupled Spatiotemporal Forecasting","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-14T21:21:32.256476Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2605.08935"},"observation_digest":"sha256:ddbedbd558c1a64ea162734ce030921ef4c7d62d94ab47b0ed696301d8c36655","observation_id":"299616c6-00ad-440c-9001-f93df9d438dd","resolution":{"observed_at":"2026-05-14T21:22:59.182144Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":"2202.06709","doi":"10.48550/arxiv.2202.06709","metadata_source":"pith","pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How do vision transformers work?","venue":"cs.CV","work_id":"38d11e0d-ea9d-49ec-8fe3-e9e95d6379c1","year":2022},"citing_paper":{"arxiv_id":"2605.09905","last_updated":"2026-05-11T02:48:06Z","snapshot_observed_at":"2026-08-13T13:13:20.522469Z","submitted_at":"2026-05-11T02:48:06Z","title":"Rethinking Random Transformers as Adaptive Sequence Smoothers for Sleep Staging","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-12T04:41:48.085125Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2605.09905"},"observation_digest":"sha256:2a8c180f9fd7e5df43442c601ccbeaf7b3d18fb902f439766ab378f7f1f8864e","observation_id":"09948d8c-3c39-45c1-bc5c-3fc16827ce0a","resolution":{"observed_at":"2026-05-12T06:01:24.200349Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":"2202.06709","doi":"10.48550/arxiv.2202.06709","metadata_source":"pith","pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How do vision transformers work?","venue":"cs.CV","work_id":"38d11e0d-ea9d-49ec-8fe3-e9e95d6379c1","year":2022},"citing_paper":{"arxiv_id":"2605.12491","last_updated":"2026-05-12T17:59:26Z","snapshot_observed_at":"2026-08-11T07:31:36.341334Z","submitted_at":"2026-05-12T17:59:26Z","title":"Elastic Attention Cores for Scalable Vision Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T06:02:40.158866Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2605.12491"},"observation_digest":"sha256:4b07adaafa9dbdb4d018b2ee0017a3e20a1ddfe795686693ea19d5ffe24f381e","observation_id":"27a182b0-741e-4648-8420-d61fea2a778e","resolution":{"observed_at":"2026-05-13T06:07:22.512019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":"2202.06709","doi":"10.48550/arxiv.2202.06709","metadata_source":"pith","pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How do vision transformers work?","venue":"cs.CV","work_id":"38d11e0d-ea9d-49ec-8fe3-e9e95d6379c1","year":2022},"citing_paper":{"arxiv_id":"2605.18328","last_updated":"2026-05-18T12:45:27Z","snapshot_observed_at":"2026-08-15T10:34:37.082283Z","submitted_at":"2026-05-18T12:45:27Z","title":"CineMatte: Background Matting for Virtual Production and Beyond","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T11:34:37.193510Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2605.18328"},"observation_digest":"sha256:dffd68cabcb449cabca179992bba8b83877384b11cae26a160f52f6efe15d91e","observation_id":"a0764c37-b79e-4187-8c10-b8f5152f1a1d","resolution":{"observed_at":"2026-05-20T11:38:14.674704Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":"2202.06709","doi":"10.48550/arxiv.2202.06709","metadata_source":"pith","pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How do vision transformers work?","venue":"cs.CV","work_id":"38d11e0d-ea9d-49ec-8fe3-e9e95d6379c1","year":2022},"citing_paper":{"arxiv_id":"2606.20044","last_updated":"2026-06-18T10:21:32Z","snapshot_observed_at":"2026-08-15T10:45:31.268591Z","submitted_at":"2026-06-18T10:21:32Z","title":"FUSE: Frequency-domain Unification and Spectral Energy Alignment for Multi-modal Object Re-Identification","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-26T18:18:27.816492Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2606.20044"},"observation_digest":"sha256:b0fb317adeb4ece4d226c62f45249fbe135ad4b9cbf5180c92a2bdda5477a331","observation_id":"836ebc44-a2f0-4a56-9f51-331eefa78b30","resolution":{"observed_at":"2026-07-04T03:09:30.617056Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":"2202.06709","doi":"10.48550/arxiv.2202.06709","metadata_source":"pith","pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How do vision transformers work?","venue":"cs.CV","work_id":"38d11e0d-ea9d-49ec-8fe3-e9e95d6379c1","year":2022},"citing_paper":{"arxiv_id":"2606.20077","last_updated":"2026-08-13T16:20:55Z","snapshot_observed_at":"2026-08-16T23:12:09.626355Z","submitted_at":"2026-06-18T10:52:49Z","title":"The Hidden Evolution of Disguised Visual Context inside the VLM","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-26T18:08:56.044278Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2606.20077"},"observation_digest":"sha256:63aa761d11b918af6776fc408e42540a75962248cbba766abf88c44a8f9a4733","observation_id":"d67ecfaa-d20f-41f2-a3bd-060dbb4a3c22","resolution":{"observed_at":"2026-07-04T03:29:29.182535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":"2202.06709","doi":"10.48550/arxiv.2202.06709","metadata_source":"pith","pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How do vision transformers work?","venue":"cs.CV","work_id":"38d11e0d-ea9d-49ec-8fe3-e9e95d6379c1","year":2022},"citing_paper":{"arxiv_id":"2606.21072","last_updated":"2026-07-31T06:41:43Z","snapshot_observed_at":"2026-08-05T23:10:56.530617Z","submitted_at":"2026-06-19T03:41:12Z","title":"SqLinear: Balanced Square Partitioning Makes Linear Interaction Sufficient for Large-Scale Traffic Forecasting","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-26T14:55:59.023533Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2606.21072"},"observation_digest":"sha256:cc1f3e7f2c8a6b88aa2822702cdb05dfbd6041faa321930a0552a1a28c19d279","observation_id":"e5c4ed93-bac7-4d17-8a6b-41ae496d217b","resolution":{"observed_at":"2026-07-04T05:59:38.406344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-03T02:09:39.904070Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21072","last_updated":"2026-07-31T06:41:43Z","snapshot_observed_at":"2026-08-05T23:10:56.530617Z","submitted_at":"2026-06-19T03:41:12Z","title":"SqLinear: Balanced Square Partitioning Makes Linear Interaction Sufficient for Large-Scale Traffic Forecasting","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T02:09:39.904070Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2606.21072"},"observation_digest":"sha256:6b451849173a3ef3bf9a5c462885c61d0bd038918fe00a240ea3e0c7a51c7107","observation_id":"86da79d6-8736-4b29-840d-ebccddcce57f","resolution":{"observed_at":"2026-08-03T02:09:39.904070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":"2202.06709","doi":"10.48550/arxiv.2202.06709","metadata_source":"pith","pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How do vision transformers work?","venue":"cs.CV","work_id":"38d11e0d-ea9d-49ec-8fe3-e9e95d6379c1","year":2022},"citing_paper":{"arxiv_id":"2607.00223","last_updated":"2026-06-30T22:02:12Z","snapshot_observed_at":"2026-08-15T03:13:02.818595Z","submitted_at":"2026-06-30T22:02:12Z","title":"Does Your ViT Still Need U-Net for Segmentation?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-02T19:15:07.611358Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2607.00223"},"observation_digest":"sha256:c8d496307a4b0107a41ace77387288c088aa80f6e4693f451262ac9601daed89","observation_id":"cdbb24d2-c8f0-42a3-b67d-3fc0868c7e87","resolution":{"observed_at":"2026-07-02T19:17:17.696415Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":"2202.06709","doi":"10.48550/arxiv.2202.06709","metadata_source":"pith","pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How do vision transformers work?","venue":"cs.CV","work_id":"38d11e0d-ea9d-49ec-8fe3-e9e95d6379c1","year":2022},"citing_paper":{"arxiv_id":"2607.00620","last_updated":"2026-07-01T08:40:46Z","snapshot_observed_at":"2026-08-15T16:51:24.720951Z","submitted_at":"2026-07-01T08:40:46Z","title":"Identifying Latent Concepts and Structures for Generalized Category Discovery","version":1},"reference_index":213,"source":"arxiv_source","source_observed_at":"2026-07-02T14:42:01.334822Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2607.00620"},"observation_digest":"sha256:c885a24592899cab09c8294970b632fbe4e6d0bbcaa3f816c164d825333b757d","observation_id":"0b647541-45ed-4121-bd76-6999407e8728","resolution":{"observed_at":"2026-07-02T14:47:03.332595Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":"2202.06709","doi":"10.48550/arxiv.2202.06709","metadata_source":"pith","pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How do vision transformers work?","venue":"cs.CV","work_id":"38d11e0d-ea9d-49ec-8fe3-e9e95d6379c1","year":2022},"citing_paper":{"arxiv_id":"2607.01906","last_updated":"2026-07-02T09:05:38Z","snapshot_observed_at":"2026-08-14T21:58:37.053353Z","submitted_at":"2026-07-02T09:05:38Z","title":"SFKD: Spatial--Frequency Joint-Aware Heterogeneous Knowledge Distillation via Multi-Level Wavelet Spectral Interaction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-03T16:02:36.425762Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2607.01906"},"observation_digest":"sha256:596a87bf3c247aa24dad0b838924b5dcf293a0d40e0f03f22717a6a64c0a438c","observation_id":"31affc47-fa6f-4d0a-b944-70e6e0874057","resolution":{"observed_at":"2026-07-03T16:08:36.800516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-07-12T05:17:21.435075Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03038","last_updated":"2026-07-03T07:31:20Z","snapshot_observed_at":"2026-08-17T05:43:47.852323Z","submitted_at":"2026-07-03T07:31:20Z","title":"OmniDS: Dual-Stream Context Fusion for Omnidirectional Depth from Fisheye Cameras","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T05:17:21.435075Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2607.03038"},"observation_digest":"sha256:ed6107908dbc963349009fef98f3f4333fe16c4305b2b9c57a18c5f5e793cc51","observation_id":"8770de0d-8ddd-477e-8fb7-dcb13f6b0beb","resolution":{"observed_at":"2026-07-12T05:17:21.435075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-07-12T00:08:46.276767Z","title":"How do vision transformers work?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03760","last_updated":"2026-07-04T08:20:36Z","snapshot_observed_at":"2026-08-19T07:14:04.152492Z","submitted_at":"2026-07-04T08:20:36Z","title":"GeoSAM-Lite: A Lightweight Foundation Model for Onboard Remote Sensing Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T00:08:46.276767Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2607.03760"},"observation_digest":"sha256:fd6cced0afdcd4139aaf185e23374249d96f163c5e3bbc200f94a30c63f21aaf","observation_id":"a12d4c63-85c2-490e-9b1b-ccbb096033d8","resolution":{"observed_at":"2026-07-12T00:08:46.276767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":"2202.06709","doi":"10.48550/arxiv.2202.06709","metadata_source":"pith","pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How do vision transformers work?","venue":"cs.CV","work_id":"38d11e0d-ea9d-49ec-8fe3-e9e95d6379c1","year":2022},"citing_paper":{"arxiv_id":"2607.05176","last_updated":"2026-07-07T08:16:00Z","snapshot_observed_at":"2026-08-19T18:58:13.691437Z","submitted_at":"2026-07-06T14:57:33Z","title":"FSDC-DETR: A Frequency-Spatial Domain Collaborative DETR for Small Object Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-08T01:13:05.253777Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2607.05176"},"observation_digest":"sha256:0900a17d45992dd398cef9c631dbdc5f1e3a3bbf4313aa7aec50645d99368c81","observation_id":"d25ae062-4547-449f-9a14-bbad2cd86fac","resolution":{"observed_at":"2026-07-08T01:14:27.482739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-07-11T07:49:40.867148Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05176","last_updated":"2026-07-07T08:16:00Z","snapshot_observed_at":"2026-08-19T18:58:13.691437Z","submitted_at":"2026-07-06T14:57:33Z","title":"FSDC-DETR: A Frequency-Spatial Domain Collaborative DETR for Small Object Detection","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T07:49:40.867148Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2607.05176"},"observation_digest":"sha256:702273a71cf3f594a9fdb889084728a70932c6228c37ead719a8b92f71064252","observation_id":"d75ce1ee-b0e0-4468-97f1-3096d6b11345","resolution":{"observed_at":"2026-07-11T07:49:40.867148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06709","snapshot_observed_at":"2026-08-12T00:48:45.229506Z","title":"arXiv preprint arXiv:2202.06709 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07870","last_updated":"2026-08-08T02:44:43Z","snapshot_observed_at":"2026-08-15T15:49:08.325082Z","submitted_at":"2026-08-08T02:44:43Z","title":"V-Simba: Unleashing the Architectural Potential of RL in Visual Continuous Control","version":1},"reference_index":140,"source":"arxiv_source","source_observed_at":"2026-08-12T00:48:45.229506Z"},"links":{"cited_paper":"/paper/2202.06709","citing_paper":"/paper/2608.07870"},"observation_digest":"sha256:15a77f535390b2c7c1b50b743fc44f235461adca851176a61f5e1da1e4d851d1","observation_id":"8b5802a2-59e6-42b1-8124-ef089b4dca47","resolution":{"observed_at":"2026-08-12T00:48:45.229506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2202.06709/citation-record","integrity":"/paper/2202.06709/integrity","json":"/paper/2202.06709/citation-record.json","paper":"/paper/2202.06709"},"outbound":[],"paper":{"arxiv_id":"2202.06709","last_updated":"2022-06-08T12:41:38Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T22:51:18.812654Z","submitted_at":"2022-02-14T13:58:43Z","title":"How Do Vision Transformers Work?"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 32 inbound Pith citation observations for arXiv:2202.06709."}