{"as_of":"2026-08-10T17:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c258fb8accf83c6db782bac103d4ca3591c845299633b4e36bb525653df9c4fe","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":36,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T13:07:33.320089Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T21:18:58.619569Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":"2012.12877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-07-03T21:18:58.619569Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"e7594a0e-3a9d-45df-878a-3a6f9c9809a9","year":2012},"citing_paper":{"arxiv_id":"2103.14030","last_updated":"2021-08-17T16:41:34Z","snapshot_observed_at":"2026-08-07T00:32:15.123562Z","submitted_at":"2021-03-25T17:59:31Z","title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-15T19:27:56.785857Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2103.14030"},"observation_digest":"sha256:a0797a202ef39b50bbf299bc2e6ec686da0dd37f26f4919ce42ac7db5375d6d1","observation_id":"62e97a20-5113-4187-b6ab-c46cfa621836","resolution":{"observed_at":"2026-05-15T19:27:56.932084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":"2012.12877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-07-03T21:18:58.619569Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"e7594a0e-3a9d-45df-878a-3a6f9c9809a9","year":2012},"citing_paper":{"arxiv_id":"2104.14294","last_updated":"2021-05-24T17:49:18Z","snapshot_observed_at":"2026-08-04T11:32:10.695202Z","submitted_at":"2021-04-29T12:28:51Z","title":"Emerging Properties in Self-Supervised Vision Transformers","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-16T14:04:51.458382Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2104.14294"},"observation_digest":"sha256:674b6fac657b728cf99c4ea77e1206473b8db150a662eb741a3f9ef0b672aec4","observation_id":"22bc2d3f-a153-4b4c-9bd3-7594978e97e2","resolution":{"observed_at":"2026-05-16T14:04:51.630068Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":"2012.12877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-07-03T21:18:58.619569Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"e7594a0e-3a9d-45df-878a-3a6f9c9809a9","year":2012},"citing_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T11:50:11.476015Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2106.08254"},"observation_digest":"sha256:61abe420d4e2974dc857b2a47154d4586b447d287c38b3e6ee60eccc952b2440","observation_id":"9193c30c-3234-47f1-b1c2-4371b20d77ea","resolution":{"observed_at":"2026-05-13T11:50:11.559446Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":"2012.12877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-07-03T21:18:58.619569Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"e7594a0e-3a9d-45df-878a-3a6f9c9809a9","year":2012},"citing_paper":{"arxiv_id":"2306.14289","last_updated":"2023-07-01T07:26:22Z","snapshot_observed_at":"2026-08-08T16:17:33.420400Z","submitted_at":"2023-06-25T16:37:25Z","title":"Faster Segment Anything: Towards Lightweight SAM for Mobile Applications","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T22:41:43.411128Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2306.14289"},"observation_digest":"sha256:486d35e82931a95ffb35ddfe8d243b71ca02d35049b8f164b88d614f642a3ced","observation_id":"becc204f-26cd-46e1-9856-a034bda213a9","resolution":{"observed_at":"2026-05-17T22:41:43.513849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":"2012.12877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-07-03T21:18:58.619569Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"e7594a0e-3a9d-45df-878a-3a6f9c9809a9","year":2012},"citing_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"reference_index":140,"source":"arxiv_source","source_observed_at":"2026-05-13T09:41:37.937046Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2309.16588"},"observation_digest":"sha256:0736ca24b297a811b915d752e29ce07193f6b568c7331f9c444ae06c5bcaabd1","observation_id":"4f4884d4-5a75-44c0-be61-65c2e4dc8715","resolution":{"observed_at":"2026-05-13T09:41:38.248058Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":"2012.12877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-07-03T21:18:58.619569Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"e7594a0e-3a9d-45df-878a-3a6f9c9809a9","year":2012},"citing_paper":{"arxiv_id":"2410.04941","last_updated":"2026-05-18T08:56:27Z","snapshot_observed_at":"2026-08-05T10:18:09.103385Z","submitted_at":"2024-10-07T11:35:24Z","title":"TOAST: Transformer Optimization using Adaptive and Simple Transformations","version":7},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-23T19:46:07.124996Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2410.04941"},"observation_digest":"sha256:f2a4569a5acf524b47e170f42df1c6319a81c053e87e11b07e11f69709fd7a54","observation_id":"d7a21ffb-5f57-434f-91e8-61db8eaf14fc","resolution":{"observed_at":"2026-05-23T19:48:23.068130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-08-10T13:07:33.320089Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.16471","last_updated":"2025-01-27T20:05:17Z","snapshot_observed_at":"2026-08-10T13:00:11.357772Z","submitted_at":"2025-01-27T20:05:17Z","title":"SIM: Surface-based fMRI Analysis for Inter-Subject Multimodal Decoding from Movie-Watching Experiments","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-10T13:07:33.320089Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2501.16471"},"observation_digest":"sha256:2774878b19d3061309ed7ddfe21253f2e282472ae7316b13d254c00a48a1023c","observation_id":"73f363cd-db2a-4cfb-a526-1b56bdad42bd","resolution":{"observed_at":"2026-08-10T13:07:33.320089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-08-08T18:10:38.319474Z","title":"Training data-efficient image transformers & distillation through attention,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.05738","last_updated":"2025-02-09T01:47:59Z","snapshot_observed_at":"2026-08-09T03:59:41.475264Z","submitted_at":"2025-02-09T01:47:59Z","title":"Performance Analysis of Traditional VQA Models Under Limited Computational Resources","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:38.319474Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2502.05738"},"observation_digest":"sha256:b46eaa0b5ffca63de28d978ce5167e478216166d088b92d30b91e65e24668d44","observation_id":"ed3f86ac-51f9-49e3-a784-ef6b44ceaaf6","resolution":{"observed_at":"2026-08-08T18:10:38.319474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-08-08T17:06:10.335008Z","title":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.06018","last_updated":"2026-05-24T16:33:35Z","snapshot_observed_at":"2026-08-08T16:57:59.773148Z","submitted_at":"2025-02-09T20:21:43Z","title":"Kolmogorov-Arnold Fourier Networks","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T17:06:10.335008Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2502.06018"},"observation_digest":"sha256:000ad77e8c31f2a27b26880c1b4268d2e0fdbbd3df0f6ebfbc1cc1b28b308cd2","observation_id":"36f468b7-4ea3-481c-96c2-b99eae8add2c","resolution":{"observed_at":"2026-08-08T17:06:10.335008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-08-08T15:53:51.527111Z","title":"[Cited on p","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.06314","last_updated":"2025-02-11T16:04:15Z","snapshot_observed_at":"2026-08-10T06:41:29.537301Z","submitted_at":"2025-02-10T10:06:46Z","title":"From Pixels to Components: Eigenvector Masking for Visual Representation Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T15:53:51.527111Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2502.06314"},"observation_digest":"sha256:6ad530dc298ef7532143369956704aece3dca190e9c576aef770d0f31dff5a0f","observation_id":"b0c3e9b2-87dd-42ab-9730-9f4ffd65143f","resolution":{"observed_at":"2026-08-08T15:53:51.527111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-08-08T14:31:18.632986Z","title":"Touvron, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06741","last_updated":"2025-05-23T19:45:19Z","snapshot_observed_at":"2026-08-10T01:13:57.450002Z","submitted_at":"2025-02-10T18:09:45Z","title":"ViSIR: Vision Transformer Single Image Reconstruction Method for Earth System Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T14:31:18.632986Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2502.06741"},"observation_digest":"sha256:e8572ed8846f4f9692aaac3d3584656c4bce9615e3e0dfdd8f89f4cbfd109866","observation_id":"a372d044-985e-4053-b65d-f8443b42bcea","resolution":{"observed_at":"2026-08-08T14:31:18.632986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":"2012.12877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-07-03T21:18:58.619569Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"e7594a0e-3a9d-45df-878a-3a6f9c9809a9","year":2012},"citing_paper":{"arxiv_id":"2503.02170","last_updated":"2026-05-19T08:18:11Z","snapshot_observed_at":"2026-08-01T20:01:42.607861Z","submitted_at":"2025-03-04T01:20:23Z","title":"Adaptive Camera Sensor for Vision Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T02:17:02.071721Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2503.02170"},"observation_digest":"sha256:66dcbecda3d64d6df8777ca71549b8b101a0f6ae455fecb1d7b635920e80c7d5","observation_id":"40ce7000-3c56-400f-a776-40a3d1dba4b9","resolution":{"observed_at":"2026-05-23T02:17:24.507272Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-08-07T13:52:16.332752Z","title":"(2021).Training data-efficient image transformers & distillation through attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20872","last_updated":"2025-05-27T08:22:08Z","snapshot_observed_at":"2026-08-09T03:59:55.167127Z","submitted_at":"2025-05-27T08:22:08Z","title":"In Context Learning with Vision Transformers: Case Study","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:16.332752Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2505.20872"},"observation_digest":"sha256:a8113caaabd38d417cf2cbdc8838ebcc418a10a81677600dbeb7de825af89e21","observation_id":"20f06ed0-4c5f-43e0-8ae5-0951439e0639","resolution":{"observed_at":"2026-08-07T13:52:16.332752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-08-07T11:01:27.482186Z","title":"Training ´ data-efficient image transformers & distillation through attention","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.03740","last_updated":"2025-06-04T09:12:24Z","snapshot_observed_at":"2026-08-09T03:59:51.516939Z","submitted_at":"2025-06-04T09:12:24Z","title":"SAAT: Synergistic Alternating Aggregation Transformer for Image Super-Resolution","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:01:27.482186Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2506.03740"},"observation_digest":"sha256:6fa083203394b05030097156f25b2acbb70b6f755937bc889fbb54076ea8e8ab","observation_id":"47dea056-821e-4fc9-8d04-c317edad8254","resolution":{"observed_at":"2026-08-07T11:01:27.482186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-08-06T22:50:21.996010Z","title":"arxiv 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20563","last_updated":"2025-06-25T16:00:18Z","snapshot_observed_at":"2026-08-10T15:05:46.746236Z","submitted_at":"2025-06-25T16:00:18Z","title":"AdvMIM: Adversarial Masked Image Modeling for Semi-Supervised Medical Image Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:21.996010Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2506.20563"},"observation_digest":"sha256:957d78f2941fc8ca855c7b735a9ee4c3fbac25cf1fc39c2968e85251f667dfb6","observation_id":"6ef99801-722a-4663-9d16-3dbfef595049","resolution":{"observed_at":"2026-08-06T22:50:21.996010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-08-06T16:57:06.574467Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.12157","last_updated":"2025-07-16T11:37:33Z","snapshot_observed_at":"2026-08-09T03:59:44.108083Z","submitted_at":"2025-07-16T11:37:33Z","title":"Fine-Grained Image Recognition from Scratch with Teacher-Guided Data Augmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:57:06.574467Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2507.12157"},"observation_digest":"sha256:536fafd121465245ebd62f9261417ec4f06fba116988f6a6ce3f4fe273f30e65","observation_id":"62b3ebe3-3eb7-46b7-a31a-91ee9114fe7e","resolution":{"observed_at":"2026-08-06T16:57:06.574467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-08-05T18:11:08.807726Z","title":"Training data- efficient image transformers & distillation through attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.15036","last_updated":"2025-08-20T20:02:35Z","snapshot_observed_at":"2026-08-08T01:51:47.464406Z","submitted_at":"2025-08-20T20:02:35Z","title":"MoEcho: Exploiting Side-Channel Attacks to Compromise User Privacy in Mixture-of-Experts LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T18:11:08.807726Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2508.15036"},"observation_digest":"sha256:8f6bf710cad49882b0b4dd491cd3fa91319b3e59c04b16044d9300a6908dd3b0","observation_id":"37c2ffe3-2a3e-4707-a57c-152aeee783fd","resolution":{"observed_at":"2026-08-05T18:11:08.807726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-08-04T17:57:09.534743Z","title":"Training data-efficient image transformers & distillation through attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10334","last_updated":"2026-06-08T10:40:53Z","snapshot_observed_at":"2026-08-07T10:09:45.168277Z","submitted_at":"2025-09-12T15:14:19Z","title":"I-Segmenter: Integer-Only Vision Transformer for Efficient Semantic Segmentation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:09.534743Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2509.10334"},"observation_digest":"sha256:40b49f549ab199e8931e8bdd9434d5490d146afc6d069bd75d32c7ff9aa6b4b5","observation_id":"7bd38294-4c1e-47df-8a9e-73f282841ba6","resolution":{"observed_at":"2026-08-04T17:57:09.534743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-08-04T17:56:03.712567Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10366","last_updated":"2025-09-12T15:59:55Z","snapshot_observed_at":"2026-08-08T10:50:31.995057Z","submitted_at":"2025-09-12T15:59:55Z","title":"Efficient Learned Image Compression Through Knowledge Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T17:56:03.712567Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2509.10366"},"observation_digest":"sha256:bd25393f8bde16eda00c339d20a0653c72a490e0ad32163b43d0317ab23e5586","observation_id":"f1ac5414-7926-4d57-94c5-c2f7707c129a","resolution":{"observed_at":"2026-08-04T17:56:03.712567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":"2012.12877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-07-03T21:18:58.619569Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"e7594a0e-3a9d-45df-878a-3a6f9c9809a9","year":2012},"citing_paper":{"arxiv_id":"2512.01537","last_updated":"2026-05-18T17:15:31Z","snapshot_observed_at":"2026-07-06T22:37:26.652349Z","submitted_at":"2025-12-01T11:06:38Z","title":"Two-Dimensional Quantization for Geometry-Aware Audio Coding","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-21T18:16:51.486807Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2512.01537"},"observation_digest":"sha256:eb77235d33ec3098448796424a1314a3b2d86f195a36889d9c16c140e5d30a02","observation_id":"218be6df-a9d5-426b-96cc-2c4ecdfedf42","resolution":{"observed_at":"2026-05-21T18:20:29.175270Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-08-03T06:36:46.873497Z","title":"Training data-efficient image transformers & distillation through attention, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.22531","last_updated":"2026-05-27T20:55:02Z","snapshot_observed_at":"2026-08-07T23:30:48.750427Z","submitted_at":"2026-01-30T04:07:47Z","title":"Learn from A Rationalist: Distilling Intermediate Interpretable Rationales","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-03T06:36:46.873497Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2601.22531"},"observation_digest":"sha256:00c16946aa76912858342e10059e3a9084697179fd84e838cb70b0ee9cc5266d","observation_id":"7740c2e6-a228-4f4d-b26a-ce9a9323d902","resolution":{"observed_at":"2026-08-03T06:36:46.873497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":"2012.12877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-07-03T21:18:58.619569Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"e7594a0e-3a9d-45df-878a-3a6f9c9809a9","year":2012},"citing_paper":{"arxiv_id":"2602.05243","last_updated":"2026-05-10T15:06:48Z","snapshot_observed_at":"2026-08-03T19:35:07.579864Z","submitted_at":"2026-02-05T03:03:17Z","title":"CORP: Closed-Form One-shot Representation-Preserving Structured Pruning for Transformers","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T07:38:50.252917Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2602.05243"},"observation_digest":"sha256:f1224f9547513eff97abadee8b0f6d6b65bf6ebdb08baa5a1e7ca06f961b49aa","observation_id":"b83b2b8c-464f-44ec-9bf1-3004bc87bcb4","resolution":{"observed_at":"2026-05-16T07:40:43.943667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":"2012.12877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-07-03T21:18:58.619569Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"e7594a0e-3a9d-45df-878a-3a6f9c9809a9","year":2012},"citing_paper":{"arxiv_id":"2603.24422","last_updated":"2026-05-14T07:12:17Z","snapshot_observed_at":"2026-08-01T18:33:19.748881Z","submitted_at":"2026-03-25T15:33:34Z","title":"OneSearch-V2: The Latent Reasoning Enhanced Self-distillation Generative Search Framework","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T07:22:24.713032Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2603.24422"},"observation_digest":"sha256:96e50a2f0bbf1454ce3781c40019440351b045f91858b24355f2b82d63ea8443","observation_id":"353d65f8-ad6f-4557-a655-6018efb041fd","resolution":{"observed_at":"2026-05-15T07:25:12.528985Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":"2012.12877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-07-03T21:18:58.619569Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"e7594a0e-3a9d-45df-878a-3a6f9c9809a9","year":2012},"citing_paper":{"arxiv_id":"2604.04086","last_updated":"2026-04-05T12:08:48Z","snapshot_observed_at":"2026-07-06T22:53:06.517678Z","submitted_at":"2026-04-05T12:08:48Z","title":"LAA-X: Unified Localized Artifact Attention for Quality-Agnostic and Generalizable Face Forgery Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T17:22:28.944874Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2604.04086"},"observation_digest":"sha256:515004864fcd6715520f14c1706693986a0b5b0794cd71f77c1f53eac479dcf0","observation_id":"4f2f174a-a495-40a0-a533-c26af5f10259","resolution":{"observed_at":"2026-05-13T17:23:02.202120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":"2012.12877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-07-03T21:18:58.619569Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"e7594a0e-3a9d-45df-878a-3a6f9c9809a9","year":2012},"citing_paper":{"arxiv_id":"2605.12026","last_updated":"2026-05-12T12:13:35Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T12:13:35Z","title":"Spectral Vision Transformer for Efficient Tokenization with Limited Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T06:53:51.211617Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2605.12026"},"observation_digest":"sha256:99767351814f213897837684dc7b532b019d82cfff739fb7260e499c2fee48b7","observation_id":"9583f3eb-764b-45c1-bba0-8fd5e9ab8dd4","resolution":{"observed_at":"2026-05-13T06:57:28.189880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":"2012.12877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-07-03T21:18:58.619569Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"e7594a0e-3a9d-45df-878a-3a6f9c9809a9","year":2012},"citing_paper":{"arxiv_id":"2605.14255","last_updated":"2026-05-23T10:21:00Z","snapshot_observed_at":"2026-08-07T04:37:06.137105Z","submitted_at":"2026-05-14T01:48:00Z","title":"Architecture-Aware Explanation Auditing for Industrial Visual Inspection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T02:40:36.771439Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2605.14255"},"observation_digest":"sha256:5a61e947a2afaa1826a8c7edf53e03fb7a36a1f72fe57a0555950ccf61618758","observation_id":"15d9f6af-1701-4190-8b13-c7b59526c20b","resolution":{"observed_at":"2026-05-15T02:49:41.680483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":"2012.12877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-07-03T21:18:58.619569Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"e7594a0e-3a9d-45df-878a-3a6f9c9809a9","year":2012},"citing_paper":{"arxiv_id":"2605.14255","last_updated":"2026-05-23T10:21:00Z","snapshot_observed_at":"2026-08-07T04:37:06.137105Z","submitted_at":"2026-05-14T01:48:00Z","title":"Architecture-Aware Explanation Auditing for Industrial Visual Inspection","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T21:02:52.559284Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2605.14255"},"observation_digest":"sha256:22a2a108f97b2bc359a6f236f1c1be28ef0de2b20f6fa1577d1b1f91a8a4c66c","observation_id":"5f842147-b676-4dfe-b834-f53a82b75a8c","resolution":{"observed_at":"2026-05-20T21:03:46.333205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":"2012.12877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-07-03T21:18:58.619569Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"e7594a0e-3a9d-45df-878a-3a6f9c9809a9","year":2012},"citing_paper":{"arxiv_id":"2605.14255","last_updated":"2026-05-23T10:21:00Z","snapshot_observed_at":"2026-08-07T04:37:06.137105Z","submitted_at":"2026-05-14T01:48:00Z","title":"Architecture-Aware Explanation Auditing for Industrial Visual Inspection","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T21:37:34.236270Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2605.14255"},"observation_digest":"sha256:77622209621fe2fae1a61f27dbe8d1034a1698e2b320fd4d02fe488d0b93145f","observation_id":"5728905f-5e00-4884-b9f3-120950d4e2a3","resolution":{"observed_at":"2026-07-01T14:25:46.309279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":"2012.12877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-07-03T21:18:58.619569Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"e7594a0e-3a9d-45df-878a-3a6f9c9809a9","year":2012},"citing_paper":{"arxiv_id":"2605.20287","last_updated":"2026-05-19T06:46:07Z","snapshot_observed_at":"2026-08-07T21:03:01.062024Z","submitted_at":"2026-05-19T06:46:07Z","title":"FusionCell: Cross-Attentive Fusion of Layout Geometry and Netlist Topology for Standard-Cell Performance Prediction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T08:23:09.232227Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2605.20287"},"observation_digest":"sha256:031a20cd0811127a3a84b7061af8acd71b544be54fca6f926602c2b3d6ffd82f","observation_id":"7e27a7ca-61ac-4184-ad7f-37a67bd8fca0","resolution":{"observed_at":"2026-05-21T08:24:03.482603Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":"2012.12877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-07-03T21:18:58.619569Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"e7594a0e-3a9d-45df-878a-3a6f9c9809a9","year":2012},"citing_paper":{"arxiv_id":"2605.27686","last_updated":"2026-05-26T21:03:42Z","snapshot_observed_at":"2026-08-02T04:59:17.402182Z","submitted_at":"2026-05-26T21:03:42Z","title":"Tensor Memory: Fixed-Size Recurrent State for Long-Horizon Transformers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T18:08:42.533804Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2605.27686"},"observation_digest":"sha256:506fd18e9b7a9062c13f7b18ce16e522e4b8d01eef0627dd31aa7ce455ebce6a","observation_id":"2ce62072-1865-4d63-bd01-724e0d827e5c","resolution":{"observed_at":"2026-06-29T18:13:48.728883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":"2012.12877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-07-03T21:18:58.619569Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"e7594a0e-3a9d-45df-878a-3a6f9c9809a9","year":2012},"citing_paper":{"arxiv_id":"2606.06624","last_updated":"2026-06-08T15:12:03Z","snapshot_observed_at":"2026-08-02T09:46:22.331867Z","submitted_at":"2026-06-04T18:21:03Z","title":"Principles and Practice of Deep Representation Learning: or a Mathematical Theory of Memory","version":2},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-06-28T03:07:52.730713Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2606.06624"},"observation_digest":"sha256:9c23eb85e447f23e3f0782eefeac1a50be15bd8890acae2ab0a8eb89a908ada4","observation_id":"2df3c329-abc4-43c0-8d65-bcd5f5058e0b","resolution":{"observed_at":"2026-07-02T11:46:55.237538Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":"2012.12877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-07-03T21:18:58.619569Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"e7594a0e-3a9d-45df-878a-3a6f9c9809a9","year":2012},"citing_paper":{"arxiv_id":"2606.08814","last_updated":"2026-06-07T20:07:24Z","snapshot_observed_at":"2026-08-02T23:58:50.946844Z","submitted_at":"2026-06-07T20:07:24Z","title":"STAR: Rethinking MoE Routing as Structure-Aware Subspace Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T18:28:35.162934Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2606.08814"},"observation_digest":"sha256:5a67cfc1a4a014d2a7421751a0f1b6293ad51cbf6c1555814c8615f2b719ab89","observation_id":"1f5f03a3-0507-4314-9f04-2c2d4b151301","resolution":{"observed_at":"2026-07-02T23:07:26.964860Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":"2012.12877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-07-03T21:18:58.619569Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"e7594a0e-3a9d-45df-878a-3a6f9c9809a9","year":2012},"citing_paper":{"arxiv_id":"2606.18510","last_updated":"2026-06-16T22:00:27Z","snapshot_observed_at":"2026-08-07T09:38:44.858536Z","submitted_at":"2026-06-16T22:00:27Z","title":"Architectural Bias in Face Presentation Attack Detection: A Comparative Study of Vision Transformers and Convolutional Neural Networks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T00:45:33.196262Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2606.18510"},"observation_digest":"sha256:1ac7b27dfcb07039af84997204a06b8b773a347d5b6f3045656a980a851807ce","observation_id":"d861370d-c0ef-4d25-aefa-00da6f255cc2","resolution":{"observed_at":"2026-07-03T21:18:58.622125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":"2012.12877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-07-03T21:18:58.619569Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"e7594a0e-3a9d-45df-878a-3a6f9c9809a9","year":2012},"citing_paper":{"arxiv_id":"2606.30813","last_updated":"2026-06-29T18:37:34Z","snapshot_observed_at":"2026-08-04T02:17:52.840024Z","submitted_at":"2026-06-29T18:37:34Z","title":"Gradient Smoothing: Coupling Layer-wise Updates for Improved Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-01T06:36:48.524846Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2606.30813"},"observation_digest":"sha256:d195e1c910abb9116837779364ed839102ecd847f2ff6f3b45eedf9ad051eb72","observation_id":"71b52d96-24ac-4330-b9f9-3798b11fb4b7","resolution":{"observed_at":"2026-07-01T09:25:41.228666Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":"2012.12877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-07-03T21:18:58.619569Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"e7594a0e-3a9d-45df-878a-3a6f9c9809a9","year":2012},"citing_paper":{"arxiv_id":"2607.02091","last_updated":"2026-07-02T12:30:08Z","snapshot_observed_at":"2026-08-08T15:42:54.569945Z","submitted_at":"2026-07-02T12:30:08Z","title":"Multimodal Fusion for Fine-Grained Classification of Breast Fibroadenoma and Phyllodes Tumors","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-03T15:44:18.845387Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2607.02091"},"observation_digest":"sha256:ad7303f76f8069ffba912a6b4453ee34e7cbe565b89330f9269233f1f78032d6","observation_id":"c8b17841-f315-4858-893a-ed48ef104d10","resolution":{"observed_at":"2026-07-03T15:48:34.949976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-07-14T12:06:28.342674Z","title":"Training Data-Efficient Image Transformers and Distillation Through Attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10388","last_updated":"2026-07-11T16:35:14Z","snapshot_observed_at":"2026-08-09T00:25:30.976841Z","submitted_at":"2026-07-11T16:35:14Z","title":"The evolution of AI from image interpretation toward scientific inference in nanoparticle electron microscopy","version":1},"reference_index":119,"source":"pdf_text","source_observed_at":"2026-07-14T12:06:28.342674Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2607.10388"},"observation_digest":"sha256:9c46e418bbc5a8f30d401a8434cc656b60c50abf70f0f86e2aa3f908be5c266f","observation_id":"b82f85eb-2240-438b-8288-e0e6ce9dd8cd","resolution":{"observed_at":"2026-07-14T12:06:28.342674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2012.12877/citation-record","integrity":"/paper/2012.12877/integrity","json":"/paper/2012.12877/citation-record.json","paper":"/paper/2012.12877"},"outbound":[],"paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 36 inbound Pith citation observations for arXiv:2012.12877."}