{"as_of":"2026-08-19T10:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c5b2c8df710d1645dcd0356072b0fd451192ef7c01d7ef22425c2719b60dda78","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:41:10.617330Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":15,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2111.09886","last_updated":"2022-04-17T11:29:52Z","snapshot_observed_at":"2026-08-17T15:04:54.298496Z","submitted_at":"2021-11-18T18:59:45Z","title":"SimMIM: A Simple Framework for Masked Image Modeling","version":2},"cited_work":{"arxiv_id":"2111.09886","doi":"10.48550/arxiv.2111.09886","metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2022)","venue":"arXiv (Cornell University)","work_id":"fb39e77a-beaf-49ac-8156-c4fb8f19cfe4","year":2022},"citing_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-13T15:12:42.567441Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T10:53:08.292063Z"},"links":{"cited_paper":"/paper/2111.09886","citing_paper":"/paper/2205.01917"},"observation_digest":"sha256:8921e2f7655334c3b460495c4955308b724833469eeb893697f333dbb009aba7","observation_id":"0a5c7945-cd9b-41dc-9b6e-6d4085175ca2","resolution":{"observed_at":"2026-05-15T10:53:08.409786Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09886","last_updated":"2022-04-17T11:29:52Z","snapshot_observed_at":"2026-08-17T15:04:54.298496Z","submitted_at":"2021-11-18T18:59:45Z","title":"SimMIM: A Simple Framework for Masked Image Modeling","version":2},"cited_work":{"arxiv_id":"2111.09886","doi":"10.48550/arxiv.2111.09886","metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2022)","venue":"arXiv (Cornell University)","work_id":"fb39e77a-beaf-49ac-8156-c4fb8f19cfe4","year":2022},"citing_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-13T09:41:37.937046Z"},"links":{"cited_paper":"/paper/2111.09886","citing_paper":"/paper/2309.16588"},"observation_digest":"sha256:9fdbce120a6af77e094fe8ca83d452b55094897da55fdb10a29497dd2bdc9df0","observation_id":"acc5e171-64f3-431b-b163-fde77b341ce5","resolution":{"observed_at":"2026-05-13T09:41:38.236334Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09886","last_updated":"2022-04-17T11:29:52Z","snapshot_observed_at":"2026-08-17T15:04:54.298496Z","submitted_at":"2021-11-18T18:59:45Z","title":"SimMIM: A Simple Framework for Masked Image Modeling","version":2},"cited_work":{"arxiv_id":"2111.09886","doi":"10.48550/arxiv.2111.09886","metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2022)","venue":"arXiv (Cornell University)","work_id":"fb39e77a-beaf-49ac-8156-c4fb8f19cfe4","year":2022},"citing_paper":{"arxiv_id":"2404.08471","last_updated":"2024-02-15T18:59:11Z","snapshot_observed_at":"2026-08-17T22:50:34.371081Z","submitted_at":"2024-02-15T18:59:11Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","version":1},"reference_index":290,"source":"arxiv_source","source_observed_at":"2026-05-12T12:40:23.709098Z"},"links":{"cited_paper":"/paper/2111.09886","citing_paper":"/paper/2404.08471"},"observation_digest":"sha256:5aed6f55d90c6bd2ee9d473c8c9305b3ef3f4f14b6cd16c347e4e8b521e78002","observation_id":"bbfc41ed-c0fb-4213-9f46-c6bfd06aad24","resolution":{"observed_at":"2026-05-12T12:40:24.075377Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09886","last_updated":"2022-04-17T11:29:52Z","snapshot_observed_at":"2026-08-17T15:04:54.298496Z","submitted_at":"2021-11-18T18:59:45Z","title":"SimMIM: A Simple Framework for Masked Image Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09886","snapshot_observed_at":"2026-08-16T11:41:10.617330Z","title":"SimMIM: A Simple Framework for Masked Image Modeling, April 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16130","last_updated":"2025-04-21T10:44:06Z","snapshot_observed_at":"2026-08-18T18:01:20.047841Z","submitted_at":"2025-04-21T10:44:06Z","title":"A Self-supervised Learning Method for Raman Spectroscopy based on Masked Autoencoders","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:41:10.617330Z"},"links":{"cited_paper":"/paper/2111.09886","citing_paper":"/paper/2504.16130"},"observation_digest":"sha256:fbf9540de39a2dd688f7fbe46099aa51a0d1fa6c7b5780fe123d25ea5c08fedb","observation_id":"89988654-f3ab-4129-8c52-d4cec6306de0","resolution":{"observed_at":"2026-08-16T11:41:10.617330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09886","last_updated":"2022-04-17T11:29:52Z","snapshot_observed_at":"2026-08-17T15:04:54.298496Z","submitted_at":"2021-11-18T18:59:45Z","title":"SimMIM: A Simple Framework for Masked Image Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09886","snapshot_observed_at":"2026-08-16T11:06:08.394168Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:08.394168Z"},"links":{"cited_paper":"/paper/2111.09886","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:c7bc3a0b1dd82dbc41380fcbfb154e003ddcf7e84bd53eceee088bfe4156b973","observation_id":"4c801cb5-4993-4f15-936b-2da4a8541fb8","resolution":{"observed_at":"2026-08-16T11:06:08.394168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09886","last_updated":"2022-04-17T11:29:52Z","snapshot_observed_at":"2026-08-17T15:04:54.298496Z","submitted_at":"2021-11-18T18:59:45Z","title":"SimMIM: A Simple Framework for Masked Image Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09886","snapshot_observed_at":"2026-08-15T22:11:15.049428Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08819","last_updated":"2025-05-12T18:40:46Z","snapshot_observed_at":"2026-08-18T10:38:25.822600Z","submitted_at":"2025-05-12T18:40:46Z","title":"Thoughts on Objectives of Sparse and Hierarchical Masked Image Model","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T22:11:15.049428Z"},"links":{"cited_paper":"/paper/2111.09886","citing_paper":"/paper/2505.08819"},"observation_digest":"sha256:99d1e339b833f38d49d7b15604d7c023f68af7cf765458d233640e9a85ae23c7","observation_id":"14039709-2f8a-4b23-b34f-7ad03ac69994","resolution":{"observed_at":"2026-08-15T22:11:15.049428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09886","last_updated":"2022-04-17T11:29:52Z","snapshot_observed_at":"2026-08-17T15:04:54.298496Z","submitted_at":"2021-11-18T18:59:45Z","title":"SimMIM: A Simple Framework for Masked Image Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09886","snapshot_observed_at":"2026-08-06T01:05:34.862848Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-17T17:54:23.023654Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:34.862848Z"},"links":{"cited_paper":"/paper/2111.09886","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:520bc8802213a6f6739c31c42d1a16cae6ae2c4713369577ce35171052a76d9b","observation_id":"6f119842-b305-4082-a2a1-3b1d854aeec2","resolution":{"observed_at":"2026-08-06T01:05:34.862848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09886","last_updated":"2022-04-17T11:29:52Z","snapshot_observed_at":"2026-08-17T15:04:54.298496Z","submitted_at":"2021-11-18T18:59:45Z","title":"SimMIM: A Simple Framework for Masked Image Modeling","version":2},"cited_work":{"arxiv_id":"2111.09886","doi":"10.48550/arxiv.2111.09886","metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2022)","venue":"arXiv (Cornell University)","work_id":"fb39e77a-beaf-49ac-8156-c4fb8f19cfe4","year":2022},"citing_paper":{"arxiv_id":"2603.03190","last_updated":"2026-05-18T03:37:10Z","snapshot_observed_at":"2026-08-16T21:10:44.799529Z","submitted_at":"2026-03-03T17:47:09Z","title":"Expectation and Acoustic Neural Network Representations Enhance Music Identification from Brain Activity","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-21T11:36:06.967549Z"},"links":{"cited_paper":"/paper/2111.09886","citing_paper":"/paper/2603.03190"},"observation_digest":"sha256:38657ecd12354945fdc0ee44ee448ee23b51eb7985e656c15369a8cc36d478c5","observation_id":"c40d9ca7-a5bf-440c-93e2-cfd801e2816b","resolution":{"observed_at":"2026-05-21T11:40:03.197599Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09886","last_updated":"2022-04-17T11:29:52Z","snapshot_observed_at":"2026-08-17T15:04:54.298496Z","submitted_at":"2021-11-18T18:59:45Z","title":"SimMIM: A Simple Framework for Masked Image Modeling","version":2},"cited_work":{"arxiv_id":"2111.09886","doi":"10.48550/arxiv.2111.09886","metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2022)","venue":"arXiv (Cornell University)","work_id":"fb39e77a-beaf-49ac-8156-c4fb8f19cfe4","year":2022},"citing_paper":{"arxiv_id":"2605.10835","last_updated":"2026-05-11T16:50:28Z","snapshot_observed_at":"2026-08-17T17:06:17.029723Z","submitted_at":"2026-05-11T16:50:28Z","title":"Transcoda: End-to-End Zero-Shot Optical Music Recognition via Data-Centric Synthetic Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T05:02:02.367347Z"},"links":{"cited_paper":"/paper/2111.09886","citing_paper":"/paper/2605.10835"},"observation_digest":"sha256:6a4aa3aaece7f67eb988d1ea56d88563e30e2f091dc003d1535b734b7eb1bd11","observation_id":"217eab2f-fac3-4a7d-958c-f66bb3443bf0","resolution":{"observed_at":"2026-05-12T05:41:26.797647Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09886","last_updated":"2022-04-17T11:29:52Z","snapshot_observed_at":"2026-08-17T15:04:54.298496Z","submitted_at":"2021-11-18T18:59:45Z","title":"SimMIM: A Simple Framework for Masked Image Modeling","version":2},"cited_work":{"arxiv_id":"2111.09886","doi":"10.48550/arxiv.2111.09886","metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2022)","venue":"arXiv (Cornell University)","work_id":"fb39e77a-beaf-49ac-8156-c4fb8f19cfe4","year":2022},"citing_paper":{"arxiv_id":"2606.26016","last_updated":"2026-07-08T10:57:01Z","snapshot_observed_at":"2026-08-02T07:36:10.167129Z","submitted_at":"2026-06-24T16:37:10Z","title":"MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-25T19:34:02.046104Z"},"links":{"cited_paper":"/paper/2111.09886","citing_paper":"/paper/2606.26016"},"observation_digest":"sha256:ea1798ae4e47348a76c8629b7e4ec085606084e576477617dbaf9ff07cc2da6f","observation_id":"cc81ad20-096b-40bf-b0ae-cf70c7e93e2c","resolution":{"observed_at":"2026-07-04T20:50:11.403617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2111.09886/citation-record","integrity":"/paper/2111.09886/integrity","json":"/paper/2111.09886/citation-record.json","paper":"/paper/2111.09886"},"outbound":[],"paper":{"arxiv_id":"2111.09886","last_updated":"2022-04-17T11:29:52Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T15:04:54.298496Z","submitted_at":"2021-11-18T18:59:45Z","title":"SimMIM: A Simple Framework for Masked Image Modeling"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2111.09886."}