{"as_of":"2026-08-09T13:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:36084bca129bd53b276d681b3f3a1fe3d916bc241482ecabef072bae7e289bea","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:58:23.640265Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T16:59:10.670721Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"cited_work":{"arxiv_id":"2509.08959","doi":"10.48550/arxiv.2509.08959","metadata_source":"pith","pith_arxiv_id":"2509.08959","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","venue":"cs.CV","work_id":"a7c329cc-226d-4a81-963d-e2f7509883c1","year":2025},"citing_paper":{"arxiv_id":"2605.12168","last_updated":"2026-05-12T14:16:05Z","snapshot_observed_at":"2026-07-06T23:23:54.142937Z","submitted_at":"2026-05-12T14:16:05Z","title":"On What We Can Learn from Low-Resolution Data","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-13T05:28:50.993737Z"},"links":{"cited_paper":"/paper/2509.08959","citing_paper":"/paper/2605.12168"},"observation_digest":"sha256:dbc845561bd3733c49ede380ba005fb32ff16089ceaba73b1d1084ffffd3fbfc","observation_id":"a09d9311-4512-4275-bea1-ee236fc6dca1","resolution":{"observed_at":"2026-05-13T05:32:19.003732Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08959","snapshot_observed_at":"2026-07-11T17:32:24.547251Z","title":"Coswin: Convolu- tion enhanced hierarchical shifted window attention for small-scale vision.arXiv preprint arXiv:2509.08959, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04548","last_updated":"2026-07-05T23:36:36Z","snapshot_observed_at":"2026-08-08T03:02:23.476662Z","submitted_at":"2026-07-05T23:36:36Z","title":"Explainable Novel Category Discovery in Semantic Concept Space","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T17:32:24.547251Z"},"links":{"cited_paper":"/paper/2509.08959","citing_paper":"/paper/2607.04548"},"observation_digest":"sha256:ee0f87189887f3f55347cbfd48eed664f4cef5ada461a8314aa8f0335e86c94c","observation_id":"50677973-488d-40d3-8a22-3ceaa014c91a","resolution":{"observed_at":"2026-07-11T17:32:24.547251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"cited_work":{"arxiv_id":"2509.08959","doi":"10.48550/arxiv.2509.08959","metadata_source":"pith","pith_arxiv_id":"2509.08959","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","venue":"cs.CV","work_id":"a7c329cc-226d-4a81-963d-e2f7509883c1","year":2025},"citing_paper":{"arxiv_id":"2607.07903","last_updated":"2026-07-08T20:31:06Z","snapshot_observed_at":"2026-08-07T02:48:01.295589Z","submitted_at":"2026-07-08T20:31:06Z","title":"Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-10T15:42:46.392593Z"},"links":{"cited_paper":"/paper/2509.08959","citing_paper":"/paper/2607.07903"},"observation_digest":"sha256:f5d62f45bdd168158cef513968546a8f66acbf86a7b9069056ac985ec1d69ba0","observation_id":"9826756c-7d04-4d67-abcb-0816e0db9894","resolution":{"observed_at":"2026-07-10T15:47:23.210188Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08959","snapshot_observed_at":"2026-08-01T12:21:52.686084Z","title":"Coswin: Convolution enhanced hierarchical shifted window attention for small-scale vision,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19590","last_updated":"2026-07-21T21:31:14Z","snapshot_observed_at":"2026-08-07T02:48:37.599640Z","submitted_at":"2026-07-21T21:31:14Z","title":"Learning to Transmit: Volatility-Aware Predictive Communication for Energy-Efficient IoT Networks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T12:21:52.686084Z"},"links":{"cited_paper":"/paper/2509.08959","citing_paper":"/paper/2607.19590"},"observation_digest":"sha256:40c4c849a6d5cdaccd5030453e1bd4b6212402a89d529bffea43574345e8b3c8","observation_id":"2b8d50db-955d-4846-9f4e-c242f59dad95","resolution":{"observed_at":"2026-08-01T12:21:52.686084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08959","snapshot_observed_at":"2026-08-08T16:59:10.670721Z","title":"Coswin: Convolution enhanced hierarchical shifted win- dow attention for small-scale vision,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T13:09:54.346269Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.670721Z"},"links":{"cited_paper":"/paper/2509.08959","citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:e45830b5068e1eb5649484c11d5be18b46f95c413cb3b9734fa8fc1bd7bdc200","observation_id":"17e6e87b-f390-4c29-88ef-d4a356b0cd8e","resolution":{"observed_at":"2026-08-08T16:59:10.670721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.08959/citation-record","integrity":"/paper/2509.08959/integrity","json":"/paper/2509.08959/citation-record.json","paper":"/paper/2509.08959"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:19.255808Z","title":"Gradient-based learning applied to document recognition,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:19.255808Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:e9417b9063716357c3df2f4f5ce8ccaa89da852b6362ecd0df4950d2a8be195e","observation_id":"7b6cb07b-8ec2-4f1f-8404-cae2df7425d1","resolution":{"observed_at":"2026-08-04T19:58:19.255808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:19.330381Z","title":"You only look once: Unified, real-time object detection,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:19.330381Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:0512cd71544c3459b328aa8cc009cb50fce51458c7655fd7fa47e2b3278341ac","observation_id":"ae41014f-b0fe-4d1b-9509-51f6ff42bd5f","resolution":{"observed_at":"2026-08-04T19:58:19.330381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:19.371850Z","title":"Fully convolutional net- works for semantic segmentation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:19.371850Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:c11ea7642c629aff2aa8d586630498d204a61544641a70a6a1345838ac1a4a30","observation_id":"38eda33b-4bd1-4e7a-876e-a32da7f61e8e","resolution":{"observed_at":"2026-08-04T19:58:19.371850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:19.447595Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:19.447595Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:6e0e8518e6c263da170348b79be7bce9e7eb62021be0d6ecf52167f9aad770aa","observation_id":"2ab2c3c4-d64a-4763-8937-0a9102f9aa72","resolution":{"observed_at":"2026-08-04T19:58:19.447595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:19.527808Z","title":"Densely connected convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:19.527808Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:b526e838b78189d02e8de01b8cadfe6ace2737f53608703b035fcb3dbbdf47da","observation_id":"011244c0-1a9f-42d2-8a4e-acd96c75ac11","resolution":{"observed_at":"2026-08-04T19:58:19.527808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:19.600677Z","title":"Xception: Deep learning with depthwise separable convolutions,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:19.600677Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:de10e094a617c730e1fb5b13454ea57582b8b9fb4a1399500f2839d5d50fc74a","observation_id":"e8318e24-16cb-4644-b411-fb9c9f2d7a45","resolution":{"observed_at":"2026-08-04T19:58:19.600677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:19.677480Z","title":"Aggregated resid- ual transformations for deep neural networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:19.677480Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:719d75365f0ba85cd58b215f321ee70b40a43eb6fc801a8895fb42c5bcd3414b","observation_id":"d5132a38-0f1e-452d-9289-e4dc8f37b167","resolution":{"observed_at":"2026-08-04T19:58:19.677480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:19.754796Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:19.754796Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:e6a2d2a140f991a0a279983a1418033c824074876d6ec1f8554e5d7d0a9a4d8d","observation_id":"ef5fbdb6-cb8c-404b-981e-24fa05e96d78","resolution":{"observed_at":"2026-08-04T19:58:19.754796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:19.846958Z","title":"Bert: Pre- training of deep bidirectional transformers for language un- derstanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:19.846958Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:c5ea55ffdb206f11b4377498e7cfc9241f0ec7b6059f8ac1a35036b49b896b95","observation_id":"06474b49-8cdf-423f-9272-1e856de123a7","resolution":{"observed_at":"2026-08-04T19:58:19.846958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:19.962687Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:19.962687Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:78b2037d1525751a05068bd9a76a48d0ce2cf8d01deea337c01d094eec905a21","observation_id":"370fda7b-97ed-40c6-b0ca-18d8ce88a26e","resolution":{"observed_at":"2026-08-04T19:58:19.962687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-04T19:58:20.095214Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:20.095214Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:4328e407d3b14a7e76d87b6e6a3f440771344b534b7093fffd9ed2bedff49384","observation_id":"8df30c06-ea15-40a7-ba71-6a64bbfd3f37","resolution":{"observed_at":"2026-08-04T19:58:20.095214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:20.207832Z","title":"Atten- tion augmented convolutional networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:20.207832Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:6da8a507f311e2aefae71bfb265910afc1c62108f821077d19ae781ecc80ff77","observation_id":"6ece51b2-4642-4a8a-b4de-09af37958658","resolution":{"observed_at":"2026-08-04T19:58:20.207832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:20.270129Z","title":"Exploring self-attention for image recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:20.270129Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:13c0955cdd6d13183dadd5b2290bad810998aa1054e8127917d410b83261bb72","observation_id":"4cfe69b0-0088-499c-aa26-63320b1ec7e3","resolution":{"observed_at":"2026-08-04T19:58:20.270129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:20.407792Z","title":"Bottleneck transformers for visual recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:20.407792Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:cb9d8970796d249f5edf64336999bbff6a1146880102c716df7aef1df41d8bd8","observation_id":"f6947403-24c8-4a08-91c6-89a330ce96c4","resolution":{"observed_at":"2026-08-04T19:58:20.407792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:20.483094Z","title":"Pyramid vision transformer: A versatile backbone for dense prediction without convolutions,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:20.483094Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:b3de132fb795b72bf4fe69e2de023b236814ea9f9b10cb1394003e0298bb1204","observation_id":"45127c65-f3c9-49ea-94cc-64a5fc1b7cdf","resolution":{"observed_at":"2026-08-04T19:58:20.483094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:20.597971Z","title":"An image is 11 worth 16x16 words: Transformers for image recognition atscale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:20.597971Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:a913dae474e75277aaf20ec145546771471ee033e183e1a06610f24428968131","observation_id":"32ed51ce-4f01-4c91-83cf-e7abdcdc1a5d","resolution":{"observed_at":"2026-08-04T19:58:20.597971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:20.716271Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:20.716271Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:b5ef8b5bdde35f72c2ddae5559b66b119f01bd1664cc36359b81ecf8bf2b1509","observation_id":"3272b451-cf02-447a-a243-c6ee251d4a0c","resolution":{"observed_at":"2026-08-04T19:58:20.716271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:20.845230Z","title":"Transformers in vision: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:20.845230Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:691b5d260631a2ac00d8a0f896299c0c6e41b92e9925d24d8af05bedb542a062","observation_id":"aad4f33b-b6ae-47a5-85f9-0f9c0649db78","resolution":{"observed_at":"2026-08-04T19:58:20.845230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:20.967888Z","title":"Learning multiple layers of features from tiny images,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:20.967888Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:c0300dcfa2ff9345d3de4da57454aa2282ba6feddee828b0d6f3391b54bf68be","observation_id":"8b285519-a0d8-4c86-ad40-09fcf4a2bd1d","resolution":{"observed_at":"2026-08-04T19:58:20.967888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.043477Z","title":"Mnist hand- written digit database,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.043477Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:54ffd8a3827d457606ad937916b4480a7b7253b8c91d3d28e31d7b59a67409b9","observation_id":"c00656e8-4966-489a-89f2-142f39f9c22f","resolution":{"observed_at":"2026-08-04T19:58:21.043477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.098298Z","title":"Reading digits in natural images with unsupervised fea- ture learning,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.098298Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:c214b2611be87f6f53083c5ca00e0ff45a6a6f0b8c5c90480d2e50e059edd623","observation_id":"ba0a7cc1-b58f-41fc-9e50-ed22450ebab6","resolution":{"observed_at":"2026-08-04T19:58:21.098298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.186955Z","title":"Imagenet classifi- cation with deep convolutional neural networks,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.186955Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:967217f9663af0df566c6ec58e3154cf7988e86e771c5379fab51afe05de024d","observation_id":"7bde9a5d-778e-4352-bb9f-f33afddafd29","resolution":{"observed_at":"2026-08-04T19:58:21.186955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.320164Z","title":"Very deep convolutional net- works for large-scale image recognition,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.320164Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:527fbf47037a7b39b62b873da125bb180745d83b8c0a54a86d02d33bca4c9a7e","observation_id":"893092e9-68dc-4353-848c-9881718dd95f","resolution":{"observed_at":"2026-08-04T19:58:21.320164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.368564Z","title":"Multi-scale context aggregation by dilated convolutions,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.368564Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:02ab82b915eb63087a6e347e7975b56a1af4749588132c061d1550c5aba3c6ec","observation_id":"416b5520-827e-4a3d-b008-8cb088c5b147","resolution":{"observed_at":"2026-08-04T19:58:21.368564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.443513Z","title":"Multiscale vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.443513Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:eeb1e5ebcb20b63606b9ec08192cbff14bf2455d3fc258d75891a47ca4ef3e11","observation_id":"e50e7dd3-8744-491c-89e9-70b37aea3375","resolution":{"observed_at":"2026-08-04T19:58:21.443513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.499469Z","title":"Mobilevit: Light-weight, general- purpose, and mobile-friendly vision transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.499469Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:3c1cba00a429e3c6b659b4a176ea914c9f242c570a3e546f140b756ddf3b161a","observation_id":"d3949608-e4b7-4331-8136-059e7f506163","resolution":{"observed_at":"2026-08-04T19:58:21.499469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.620221Z","title":"Flexivit: One model for all patch sizes,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.620221Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:84a1009c484061a035bdd575cc2303446387c9f4cfc4070616c08cd55525b8e2","observation_id":"5dc68c13-07a7-4c5d-ad9a-9c9ec5b7aec7","resolution":{"observed_at":"2026-08-04T19:58:21.620221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.714747Z","title":"Tokens-to-token vit: Training vision transformers from scratch on imagenet,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.714747Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:ae392920ada2f997f223653889d34727bd25dc0ede5a015c153de10bd247ab8c","observation_id":"0e433f89-acf9-4f75-9556-2eb423a8d439","resolution":{"observed_at":"2026-08-04T19:58:21.714747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.813606Z","title":"Gradient- based learning applied to document recognition,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.813606Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:e5f6e89d775565e36efad292d06e5d783e973e27af188032119629e0179fbcc7","observation_id":"85984bfa-e74b-45b3-837f-5cab33336a8d","resolution":{"observed_at":"2026-08-04T19:58:21.813606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.885306Z","title":"Training data-efficient image transformers & distil- lation through attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.885306Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:f45c05e4c8bfe4d361983e1d79ea5c66e23bfb9fb8e81e645c574e4b981e1fa2","observation_id":"b2ce3c73-afee-4d6d-b70e-cd059d51779a","resolution":{"observed_at":"2026-08-04T19:58:21.885306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:21.980272Z","title":"Patchrot: Self- supervised training of vision transformers by rotation predic- tion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:21.980272Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:30e7c2cd46a108e2ba03a422b013953d92fa5a45b44012d934e55f68ec498a8a","observation_id":"19ae81bd-b7d7-4711-9dc6-7a9c320cc921","resolution":{"observed_at":"2026-08-04T19:58:21.980272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.13492","last_updated":"2021-12-27T03:24:03Z","snapshot_observed_at":"2026-07-06T12:22:32.240903Z","submitted_at":"2021-12-27T03:24:03Z","title":"Vision Transformer for Small-Size Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.13492","snapshot_observed_at":"2026-08-04T19:58:22.062214Z","title":"Vision transformer for small- size datasets,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:22.062214Z"},"links":{"cited_paper":"/paper/2112.13492","citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:c8e9c5533511f6bb7f67c05108c809c38f15be58e0981827dc0f2f865e40e8c2","observation_id":"aeed180e-77d6-41d9-8f85-4a90dcdc669e","resolution":{"observed_at":"2026-08-04T19:58:22.062214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:22.202524Z","title":"How to train vision trans- former on small-scale datasets?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:22.202524Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:ec509961903f11583b82b779f98a2aba09d8ac2ff337a0651758c9e1ff05c7ed","observation_id":"bbd8b998-3c38-43dd-bcd7-499de343fb7f","resolution":{"observed_at":"2026-08-04T19:58:22.202524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:22.300958Z","title":"Efficient training of visual transformers with small datasets,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:22.300958Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:0bffaaf789db41b03eefffa7ee48bbcc5a6de9f43b0bb6e87ff9325edf674b8b","observation_id":"d9be1163-4efc-43c1-820b-0fad9d7dc0ac","resolution":{"observed_at":"2026-08-04T19:58:22.300958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-04T19:58:22.419337Z","title":"Layer normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:22.419337Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:c4557c17fc69c458615ab7e2f6189d4c29c7981461cd7ecb4f0642ccda59c4f3","observation_id":"b8dbb594-52d7-4d51-a6da-8a5506b71ad4","resolution":{"observed_at":"2026-08-04T19:58:22.419337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:22.593770Z","title":"Mobilenetv2: Inverted residuals and linear bottlenecks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:22.593770Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:801ab227c4fec41c2baeba20f39e9fa803233c96766ff63e708bfb6efc935c75","observation_id":"4f0c6291-6b6c-471b-b9da-40339f12a734","resolution":{"observed_at":"2026-08-04T19:58:22.593770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:22.751786Z","title":"Tiny imagenet visual recognition chal- lenge,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:22.751786Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:1640b83c15ad604d2ca5e182f147913cd9031069e01b9c2d12cb1f7ddefd76ad","observation_id":"ae49ad02-f846-4d9d-bc03-1567cab1e627","resolution":{"observed_at":"2026-08-04T19:58:22.751786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:22.962355Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:22.962355Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:48079f1b1ae827b79453c42d6892783f046398b95d8e74ee24c1f4e03df3a8d2","observation_id":"86f89e18-d072-4d9b-9fb1-70b81e15860d","resolution":{"observed_at":"2026-08-04T19:58:22.962355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-08-08T10:28:19.597631Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-04T19:58:23.022019Z","title":"mixup: Beyond empirical risk minimization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:23.022019Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:2edc986b1d01a446bc1f460978d630fe2a72509ab39de8c99d36e6265343ab8f","observation_id":"55d6adfb-4e5e-4e59-9cd7-acf2c3b361af","resolution":{"observed_at":"2026-08-04T19:58:23.022019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:23.159849Z","title":"Cutmix: Regularization strategy to train strong classifiers with localizable features,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:23.159849Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:a5d5a9730b550447f43fb8e62d38756d7874377c86e45f7ea7b92247509611fb","observation_id":"0fbfd41e-d463-4c0c-b2bd-27125e2c1095","resolution":{"observed_at":"2026-08-04T19:58:23.159849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:23.275838Z","title":"Random erasing data augmentation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:23.275838Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:da81fee05734ce0dc9663236118a44c8a6e998a1c0af92eadf7af8d238420e24","observation_id":"190dfc2c-b50b-4fe8-9995-632a8fb63886","resolution":{"observed_at":"2026-08-04T19:58:23.275838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:23.352348Z","title":"Randaugment: Practical automated data augmentation with a reduced search space,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:23.352348Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:50afdb063561e70a33cd7350dc73deea6e3ef0ce5c8e980d1c3e7541534342a6","observation_id":"87f19779-afce-4dd8-8e80-b386dd3815a2","resolution":{"observed_at":"2026-08-04T19:58:23.352348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:23.433983Z","title":"Autoaugment: Learning augmentation policies from data,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:23.433983Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:e407bc1691cec7c9319de8e27a45e7398fa0117f85a269827f48dda66a6bd91e","observation_id":"4cd92304-1b43-4771-9991-524098f08d9a","resolution":{"observed_at":"2026-08-04T19:58:23.433983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:23.523857Z","title":"Deep networks with stochastic depth,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:23.523857Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:488633420998bd4448338c6355fc94db9f6d0e8b1632c2e21ed05fb8c7cabad6","observation_id":"88dc4d4d-34da-4b66-9ed9-14e34b0c6f28","resolution":{"observed_at":"2026-08-04T19:58:23.523857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:23.597825Z","title":"Decoupled weight decay regular- ization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:23.597825Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:7fd637666a7e2865788c4cfc382a857fbb5b4eceebe67b694bc673e25354ce7c","observation_id":"5cd23f56-9c22-47da-bbb3-115be6dba94b","resolution":{"observed_at":"2026-08-04T19:58:23.597825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:58:23.640265Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T19:58:23.640265Z"},"links":{"citing_paper":"/paper/2509.08959"},"observation_digest":"sha256:0c8fe929af3bcef32083d64c713e7aa5b65644ba682f88a5746dc75b5fee3ed0","observation_id":"a367bc3f-b7ba-44d8-aebf-0bf9f32fbde5","resolution":{"observed_at":"2026-08-04T19:58:23.640265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 5 inbound Pith citation observations for arXiv:2509.08959."}