{"as_of":"2026-08-15T18:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ddad7d67c4706f6d33cde880569f257f4711420d36c708526c089f65ea9d3108","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:40:32.294790Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T17:17:14.971022Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.06727","last_updated":"2022-12-13T16:55:12Z","snapshot_observed_at":"2026-08-13T13:22:40.427545Z","submitted_at":"2022-12-13T16:55:12Z","title":"What do Vision Transformers Learn? A Visual Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06727","snapshot_observed_at":"2026-08-12T20:40:32.294790Z","title":"What do vision transformers learn? a visual exploration","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.09475","last_updated":"2024-11-14T14:31:30Z","snapshot_observed_at":"2026-08-15T07:28:43.643549Z","submitted_at":"2024-11-14T14:31:30Z","title":"ResidualDroppath: Enhancing Feature Reuse over Residual Connections","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T20:40:32.294790Z"},"links":{"cited_paper":"/paper/2212.06727","citing_paper":"/paper/2411.09475"},"observation_digest":"sha256:478455429c8a3ea14d9461b69c6cc9fe61ee5447e8611cb30be32d291693d20d","observation_id":"c538e3c6-04d4-4d8a-9823-7cd63c719167","resolution":{"observed_at":"2026-08-12T20:40:32.294790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06727","last_updated":"2022-12-13T16:55:12Z","snapshot_observed_at":"2026-08-13T13:22:40.427545Z","submitted_at":"2022-12-13T16:55:12Z","title":"What do Vision Transformers Learn? A Visual Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06727","snapshot_observed_at":"2026-08-11T18:11:15.705533Z","title":"G.; and Goldstein, T","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08176","last_updated":"2024-12-11T08:07:12Z","snapshot_observed_at":"2026-08-11T18:05:02.380779Z","submitted_at":"2024-12-11T08:07:12Z","title":"TextRefiner: Internal Visual Feature as Efficient Refiner for Vision-Language Models Prompt Tuning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T18:11:15.705533Z"},"links":{"cited_paper":"/paper/2212.06727","citing_paper":"/paper/2412.08176"},"observation_digest":"sha256:546d06b7097893a17974c3af096207be7c225d563b8540a5471e0b77b629335b","observation_id":"2cce258a-b3d5-4d64-8f1f-73f2da46dd00","resolution":{"observed_at":"2026-08-11T18:11:15.705533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06727","last_updated":"2022-12-13T16:55:12Z","snapshot_observed_at":"2026-08-13T13:22:40.427545Z","submitted_at":"2022-12-13T16:55:12Z","title":"What do Vision Transformers Learn? A Visual Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06727","snapshot_observed_at":"2026-08-11T17:10:44.328119Z","title":"What do vision transformers learn? A visual ex- ploration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-15T13:08:29.349929Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:44.328119Z"},"links":{"cited_paper":"/paper/2212.06727","citing_paper":"/paper/2412.09353"},"observation_digest":"sha256:f251d2a66a4503cbf9c76e9d21e5b19af9da9a66cadbaa001a5b049cd3e08bf6","observation_id":"4d7426b4-84cc-4554-8330-4ebe450de04f","resolution":{"observed_at":"2026-08-11T17:10:44.328119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06727","last_updated":"2022-12-13T16:55:12Z","snapshot_observed_at":"2026-08-13T13:22:40.427545Z","submitted_at":"2022-12-13T16:55:12Z","title":"What do Vision Transformers Learn? A Visual Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06727","snapshot_observed_at":"2026-08-11T15:47:56.053994Z","title":"G.; and Goldstein, T","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10702","last_updated":"2024-12-17T14:37:34Z","snapshot_observed_at":"2026-08-14T17:07:10.344655Z","submitted_at":"2024-12-14T06:21:24Z","title":"Memory Efficient Matting with Adaptive Token Routing","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T15:47:56.053994Z"},"links":{"cited_paper":"/paper/2212.06727","citing_paper":"/paper/2412.10702"},"observation_digest":"sha256:b7f331f1dd67170d51db2757359b78dd592ab089dc7b6fb401b8c210fc19aaf7","observation_id":"f05b5391-7e4d-468f-8a6c-73c5fd4584f4","resolution":{"observed_at":"2026-08-11T15:47:56.053994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06727","last_updated":"2022-12-13T16:55:12Z","snapshot_observed_at":"2026-08-13T13:22:40.427545Z","submitted_at":"2022-12-13T16:55:12Z","title":"What do Vision Transformers Learn? A Visual Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06727","snapshot_observed_at":"2026-08-11T12:28:54.581153Z","title":"What do vision transformers learn? a visual exploration,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14145","last_updated":"2024-12-18T18:43:21Z","snapshot_observed_at":"2026-08-13T22:50:51.567536Z","submitted_at":"2024-12-18T18:43:21Z","title":"Incorporating Feature Pyramid Tokenization and Open Vocabulary Semantic Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.581153Z"},"links":{"cited_paper":"/paper/2212.06727","citing_paper":"/paper/2412.14145"},"observation_digest":"sha256:494ddf13195c5633bfb9f3229d75174a2dfb0d04648027cf680df55d06738b73","observation_id":"4e5bdf5b-22c8-4752-8bf7-ef7ad3bce46a","resolution":{"observed_at":"2026-08-11T12:28:54.581153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06727","last_updated":"2022-12-13T16:55:12Z","snapshot_observed_at":"2026-08-13T13:22:40.427545Z","submitted_at":"2022-12-13T16:55:12Z","title":"What do Vision Transformers Learn? A Visual Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06727","snapshot_observed_at":"2026-08-10T21:02:01.001570Z","title":"G.; Goldstein, T","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.06708","last_updated":"2026-05-25T22:00:48Z","snapshot_observed_at":"2026-08-12T23:47:24.076762Z","submitted_at":"2025-01-12T04:28:14Z","title":"Evaluating Sample Utility for Efficient Data Selection by Mimicking Model Weights","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:01.001570Z"},"links":{"cited_paper":"/paper/2212.06727","citing_paper":"/paper/2501.06708"},"observation_digest":"sha256:e4efa3c1bbe6fd98834a7d6007fbe708ced56b983e9558db130860dc06231cfd","observation_id":"4a94a302-29d5-4c08-a23d-c8a26386d7f4","resolution":{"observed_at":"2026-08-10T21:02:01.001570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06727","last_updated":"2022-12-13T16:55:12Z","snapshot_observed_at":"2026-08-13T13:22:40.427545Z","submitted_at":"2022-12-13T16:55:12Z","title":"What do Vision Transformers Learn? A Visual Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06727","snapshot_observed_at":"2026-08-11T01:04:00.604755Z","title":"What do vision trans- formers learn? a visual exploration","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.08443","last_updated":"2025-01-17T06:33:23Z","snapshot_observed_at":"2026-08-14T15:42:41.564741Z","submitted_at":"2024-12-26T05:41:31Z","title":"Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T01:04:00.604755Z"},"links":{"cited_paper":"/paper/2212.06727","citing_paper":"/paper/2501.08443"},"observation_digest":"sha256:42cd2bcd56d001994e5818260c967c7177f2dbc8fa2fac02646f368d260f0b7c","observation_id":"af3d2fe9-75c3-4303-b35a-1ba8b32c0ed8","resolution":{"observed_at":"2026-08-11T01:04:00.604755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06727","last_updated":"2022-12-13T16:55:12Z","snapshot_observed_at":"2026-08-13T13:22:40.427545Z","submitted_at":"2022-12-13T16:55:12Z","title":"What do Vision Transformers Learn? A Visual Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06727","snapshot_observed_at":"2026-08-10T17:26:35.983708Z","title":"Ghiasi, H","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12203","last_updated":"2025-01-21T15:18:55Z","snapshot_observed_at":"2026-08-15T03:05:08.572691Z","submitted_at":"2025-01-21T15:18:55Z","title":"Explainability for Vision Foundation Models: A Survey","version":1},"reference_index":253,"source":"pdf_text","source_observed_at":"2026-08-10T17:26:35.983708Z"},"links":{"cited_paper":"/paper/2212.06727","citing_paper":"/paper/2501.12203"},"observation_digest":"sha256:e1c0cf90454f9b062c188bf353d996378b402c75931f91ab62c2c1fa3adf73e1","observation_id":"87bc3f2b-8620-4f94-b1d9-726b1b30fdc6","resolution":{"observed_at":"2026-08-10T17:26:35.983708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06727","last_updated":"2022-12-13T16:55:12Z","snapshot_observed_at":"2026-08-13T13:22:40.427545Z","submitted_at":"2022-12-13T16:55:12Z","title":"What do Vision Transformers Learn? A Visual Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06727","snapshot_observed_at":"2026-08-06T23:01:29.883551Z","title":"What do vision transformers learn? a visual exploration,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20066","last_updated":"2025-06-24T23:58:20Z","snapshot_observed_at":"2026-08-08T00:48:32.373291Z","submitted_at":"2025-06-24T23:58:20Z","title":"ToSA: Token Merging with Spatial Awareness","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:29.883551Z"},"links":{"cited_paper":"/paper/2212.06727","citing_paper":"/paper/2506.20066"},"observation_digest":"sha256:cc33a03192ff73add0d82dea7188ae3a8a45e8778426014469960a2ef8d91df4","observation_id":"71ebff2d-17a0-4d8a-b8e2-2956bc460053","resolution":{"observed_at":"2026-08-06T23:01:29.883551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06727","last_updated":"2022-12-13T16:55:12Z","snapshot_observed_at":"2026-08-13T13:22:40.427545Z","submitted_at":"2022-12-13T16:55:12Z","title":"What do Vision Transformers Learn? A Visual Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06727","snapshot_observed_at":"2026-08-06T22:14:19.008165Z","title":"What do vision transformers learn? a visual exploration.arXiv preprint arXiv:2212.06727,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:19.008165Z"},"links":{"cited_paper":"/paper/2212.06727","citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:d86941fd5d3e30ddbcdd2e7635e758efb8794cca60466309dd2f5cad5bcecfee","observation_id":"98349d3c-4cf6-4b1e-bfa9-44ccd5c843da","resolution":{"observed_at":"2026-08-06T22:14:19.008165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06727","last_updated":"2022-12-13T16:55:12Z","snapshot_observed_at":"2026-08-13T13:22:40.427545Z","submitted_at":"2022-12-13T16:55:12Z","title":"What do Vision Transformers Learn? A Visual Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06727","snapshot_observed_at":"2026-08-06T21:52:05.620893Z","title":"What do vision transformers learn? a visual exploration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23271","last_updated":"2025-06-29T14:52:01Z","snapshot_observed_at":"2026-08-10T09:37:08.379629Z","submitted_at":"2025-06-29T14:52:01Z","title":"Mettle: Meta-Token Learning for Memory-Efficient Audio-Visual Adaptation","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:05.620893Z"},"links":{"cited_paper":"/paper/2212.06727","citing_paper":"/paper/2506.23271"},"observation_digest":"sha256:0e2891d89afef7a19fdd909e09b5781a580511397ab8fa3acbbf96e3053b7eda","observation_id":"86964e6e-d519-4f8d-a782-f5c8373628f6","resolution":{"observed_at":"2026-08-06T21:52:05.620893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06727","last_updated":"2022-12-13T16:55:12Z","snapshot_observed_at":"2026-08-13T13:22:40.427545Z","submitted_at":"2022-12-13T16:55:12Z","title":"What do Vision Transformers Learn? A Visual Exploration","version":1},"cited_work":{"arxiv_id":"2212.06727","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.06727","snapshot_observed_at":"2026-07-02T17:17:14.971022Z","title":"What do vision transformers learn? a visual exploration","venue":null,"work_id":"1799a8a3-6c8c-42f7-be7c-aceca9edd041","year":2022},"citing_paper":{"arxiv_id":"2605.08513","last_updated":"2026-05-08T21:45:28Z","snapshot_observed_at":"2026-08-15T04:10:40.761158Z","submitted_at":"2026-05-08T21:45:28Z","title":"A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-12T01:41:44.898358Z"},"links":{"cited_paper":"/paper/2212.06727","citing_paper":"/paper/2605.08513"},"observation_digest":"sha256:ee43f9ad596cd28ce2c0b7a33c94a9e5ed9e1a93625e50db1d14de534c457964","observation_id":"adb8bb85-54dd-4a31-bbc4-d2298cb69104","resolution":{"observed_at":"2026-05-12T01:46:14.355326Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06727","last_updated":"2022-12-13T16:55:12Z","snapshot_observed_at":"2026-08-13T13:22:40.427545Z","submitted_at":"2022-12-13T16:55:12Z","title":"What do Vision Transformers Learn? A Visual Exploration","version":1},"cited_work":{"arxiv_id":"2212.06727","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.06727","snapshot_observed_at":"2026-07-02T17:17:14.971022Z","title":"What do vision transformers learn? a visual exploration","venue":null,"work_id":"1799a8a3-6c8c-42f7-be7c-aceca9edd041","year":2022},"citing_paper":{"arxiv_id":"2605.13852","last_updated":"2026-03-25T11:30:22Z","snapshot_observed_at":"2026-08-11T18:33:06.917434Z","submitted_at":"2026-03-25T11:30:22Z","title":"Realiz3D: 3D Generation Made Photorealistic via Domain-Aware Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T07:36:16.124800Z"},"links":{"cited_paper":"/paper/2212.06727","citing_paper":"/paper/2605.13852"},"observation_digest":"sha256:7117e8dfb773a453466e04fcd7b74b2f82cae2413f39d1e18fac2f80c2631abb","observation_id":"f15d0c8f-f091-4204-bd86-89d553fcb327","resolution":{"observed_at":"2026-05-15T07:39:50.416786Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06727","last_updated":"2022-12-13T16:55:12Z","snapshot_observed_at":"2026-08-13T13:22:40.427545Z","submitted_at":"2022-12-13T16:55:12Z","title":"What do Vision Transformers Learn? A Visual Exploration","version":1},"cited_work":{"arxiv_id":"2212.06727","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.06727","snapshot_observed_at":"2026-07-02T17:17:14.971022Z","title":"What do vision transformers learn? a visual exploration","venue":null,"work_id":"1799a8a3-6c8c-42f7-be7c-aceca9edd041","year":2022},"citing_paper":{"arxiv_id":"2605.18541","last_updated":"2026-05-18T15:22:26Z","snapshot_observed_at":"2026-08-02T14:46:31.423931Z","submitted_at":"2026-05-18T15:22:26Z","title":"LESSViT: Robust Hyperspectral Representation Learning under Spectral Configuration Shift","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T11:16:01.428052Z"},"links":{"cited_paper":"/paper/2212.06727","citing_paper":"/paper/2605.18541"},"observation_digest":"sha256:37b213c9ae54e51fa06fc7aba593a06aa9f544e33dc469033deccd9dc1adca16","observation_id":"0fe62a99-234c-4b4f-a25d-e6c56e45e090","resolution":{"observed_at":"2026-05-20T11:18:13.744646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06727","last_updated":"2022-12-13T16:55:12Z","snapshot_observed_at":"2026-08-13T13:22:40.427545Z","submitted_at":"2022-12-13T16:55:12Z","title":"What do Vision Transformers Learn? A Visual Exploration","version":1},"cited_work":{"arxiv_id":"2212.06727","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.06727","snapshot_observed_at":"2026-07-02T17:17:14.971022Z","title":"What do vision transformers learn? a visual exploration","venue":null,"work_id":"1799a8a3-6c8c-42f7-be7c-aceca9edd041","year":2022},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"cited_paper":"/paper/2212.06727","citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:c0758f7c021dafbfe9e803e553c733418eb1f96fead7baa82e7fb8953b211b1f","observation_id":"54c4e797-6c7b-49d6-a5d0-fce4f59bd905","resolution":{"observed_at":"2026-07-02T17:17:14.972599Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06727","last_updated":"2022-12-13T16:55:12Z","snapshot_observed_at":"2026-08-13T13:22:40.427545Z","submitted_at":"2022-12-13T16:55:12Z","title":"What do Vision Transformers Learn? A Visual Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06727","snapshot_observed_at":"2026-07-12T01:18:51.054590Z","title":"arXiv preprint arXiv:2212.06727 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03595","last_updated":"2026-07-03T20:34:42Z","snapshot_observed_at":"2026-08-12T22:30:04.734869Z","submitted_at":"2026-07-03T20:34:42Z","title":"Token-Based Affordance Grounding with Large Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T01:18:51.054590Z"},"links":{"cited_paper":"/paper/2212.06727","citing_paper":"/paper/2607.03595"},"observation_digest":"sha256:a030668fd332b453c05221c26544510601c02bea9d15b75d85138a69fcdd053d","observation_id":"c3b693d2-8507-44b3-b09f-9dcea39679c4","resolution":{"observed_at":"2026-07-12T01:18:51.054590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2212.06727/citation-record","integrity":"/paper/2212.06727/integrity","json":"/paper/2212.06727/citation-record.json","paper":"/paper/2212.06727"},"outbound":[],"paper":{"arxiv_id":"2212.06727","last_updated":"2022-12-13T16:55:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T13:22:40.427545Z","submitted_at":"2022-12-13T16:55:12Z","title":"What do Vision Transformers Learn? A Visual Exploration"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2212.06727."}