{"as_of":"2026-08-09T16:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8e9c6cab7ae3100cfa1b017921085758c961f66e1886bc663e691d9e9aa1c26a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:46:14.151441Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":436,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":"2203.12602","doi":"10.48550/arxiv.2203.12602","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Videomae: Masked au- toencoders are data-efficient learners for self-supervised video pre-training","venue":"arXiv (Cornell University)","work_id":"04aae106-cf90-4697-aa7a-cd7446997a7a","year":2022},"citing_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-07T05:10:33.059352Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"reference_index":124,"source":"arxiv_source","source_observed_at":"2026-05-17T03:27:58.952076Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2310.01852"},"observation_digest":"sha256:c0ce894c8c2f09f0f38a5990946166d0c68f24eff0abde392132dbd5f11b456c","observation_id":"1a18dcdb-9497-4d96-8ac2-20f2d22e7a76","resolution":{"observed_at":"2026-05-17T03:27:59.064233Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-07T10:46:14.151441Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training.arXiv preprint arXiv:2203.12602, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04367","last_updated":"2025-06-04T18:29:32Z","snapshot_observed_at":"2026-08-08T08:05:18.887044Z","submitted_at":"2025-06-04T18:29:32Z","title":"Fine-Tuning Video Transformers for Word-Level Bangla Sign Language: A Comparative Analysis for Classification Tasks","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:46:14.151441Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2506.04367"},"observation_digest":"sha256:91ace581b37aa5aa984dd7db74cf717ebe6f90a23eca998afe9d4617c9a4d292","observation_id":"1ee0adec-e107-440f-9b09-0ad25428836c","resolution":{"observed_at":"2026-08-07T10:46:14.151441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-07T10:26:59.459159Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05543","last_updated":"2025-06-05T19:44:47Z","snapshot_observed_at":"2026-08-09T06:06:16.397696Z","submitted_at":"2025-06-05T19:44:47Z","title":"FRAME: Pre-Training Video Feature Representations via Anticipation and Memory","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:59.459159Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2506.05543"},"observation_digest":"sha256:67e94348f893a4c8fa2da8105495c808fbba9e09a815985a5af099a8bfb147cf","observation_id":"3a3ce278-b861-4ab0-a19b-46b89a94b4c6","resolution":{"observed_at":"2026-08-07T10:26:59.459159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-06T22:24:19.049850Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21897","last_updated":"2025-06-27T04:34:07Z","snapshot_observed_at":"2026-08-09T12:25:24.460241Z","submitted_at":"2025-06-27T04:34:07Z","title":"One Video to Steal Them All: 3D-Printing IP Theft through Optical Side-Channels","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T22:24:19.049850Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2506.21897"},"observation_digest":"sha256:d3e873f136a984608454916233fc59df6dae0a820f3b91a66c75eda9618d6c24","observation_id":"596e9c2a-34a5-4024-9e7c-e77d82852611","resolution":{"observed_at":"2026-08-06T22:24:19.049850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-06T21:51:57.583666Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:57.583666Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:f439d81e0db47efe435f6dde6bfb5fef1ac0fd58a162f9f14cf8a666291d10c3","observation_id":"af449d3e-434b-4f99-ada6-63a5585c1387","resolution":{"observed_at":"2026-08-06T21:51:57.583666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-06T21:06:56.193790Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00950","last_updated":"2025-07-01T16:52:20Z","snapshot_observed_at":"2026-08-09T12:28:04.824622Z","submitted_at":"2025-07-01T16:52:20Z","title":"MVP: Winning Solution to SMP Challenge 2025 Video Track","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:56.193790Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2507.00950"},"observation_digest":"sha256:a5db7b6112bdec2f78558c631659d0b0fc85bea402e858f3de456763953e4c79","observation_id":"1343f094-5c33-4b3f-b3ad-46901b5913de","resolution":{"observed_at":"2026-08-06T21:06:56.193790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-06T18:33:25.677404Z","title":"VideoMAE: Masked autoencoders are data- efficient learners for self-supervised video pre-training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07938","last_updated":"2025-07-10T17:21:35Z","snapshot_observed_at":"2026-08-09T12:28:16.106059Z","submitted_at":"2025-07-10T17:21:35Z","title":"Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:25.677404Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2507.07938"},"observation_digest":"sha256:f031db21f8af3eef5a2633448624fa708ac4d97018484f8dad691525d11e9981","observation_id":"13d5428e-6ba5-44f3-9677-ad9af44217c8","resolution":{"observed_at":"2026-08-06T18:33:25.677404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-06T18:10:13.574181Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.574181Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:453a59422dcca91cf4229e9de596c3750840b1a7a72bda9dc21decaaca0cd5f6","observation_id":"8627080a-8146-4fd5-893f-d0b40c9a5e1c","resolution":{"observed_at":"2026-08-06T18:10:13.574181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-08T17:42:54.273726Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:65953e7a16c495d058579847f8470dcf062ee56e0cf05c7226ffdd113b8d7054","observation_id":"097ec171-d4f5-48ea-8624-e42e5edbdbd3","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":"2203.12602","doi":"10.48550/arxiv.2203.12602","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Videomae: Masked au- toencoders are data-efficient learners for self-supervised video pre-training","venue":"arXiv (Cornell University)","work_id":"04aae106-cf90-4697-aa7a-cd7446997a7a","year":2022},"citing_paper":{"arxiv_id":"2604.06783","last_updated":"2026-04-08T07:52:28Z","snapshot_observed_at":"2026-07-06T22:55:11.560398Z","submitted_at":"2026-04-08T07:52:28Z","title":"Insights from Visual Cognition: Understanding Human Action Dynamics with Overall Glance and Refined Gaze Transformer","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T18:07:41.426142Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2604.06783"},"observation_digest":"sha256:d1994fe9ef8f1bf951b3dd21c3e0f3148f5fe55f8a2444e054d9866e19044f52","observation_id":"bd06e627-9cbf-48b4-9d99-0592fa36bc05","resolution":{"observed_at":"2026-05-11T05:26:01.661100Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":"2203.12602","doi":"10.48550/arxiv.2203.12602","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Videomae: Masked au- toencoders are data-efficient learners for self-supervised video pre-training","venue":"arXiv (Cornell University)","work_id":"04aae106-cf90-4697-aa7a-cd7446997a7a","year":2022},"citing_paper":{"arxiv_id":"2604.10333","last_updated":"2026-04-11T19:32:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T19:32:33Z","title":"Zero-shot World Models Are Developmentally Efficient Learners","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T15:33:39.342672Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2604.10333"},"observation_digest":"sha256:c1465da2717ae0251e48ee1f68cbbdb350b9026fc69b6345e51d874a4b08de23","observation_id":"32eda57c-720b-401e-8905-3813f7ac41bd","resolution":{"observed_at":"2026-05-11T10:21:00.069998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":"2203.12602","doi":"10.48550/arxiv.2203.12602","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Videomae: Masked au- toencoders are data-efficient learners for self-supervised video pre-training","venue":"arXiv (Cornell University)","work_id":"04aae106-cf90-4697-aa7a-cd7446997a7a","year":2022},"citing_paper":{"arxiv_id":"2604.15096","last_updated":"2026-04-16T14:55:28Z","snapshot_observed_at":"2026-08-06T11:20:47.975988Z","submitted_at":"2026-04-16T14:55:28Z","title":"Beyond Independent Frames: Latent Attention Masked Autoencoders for Multi-View Echocardiography","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-10T11:56:05.271784Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2604.15096"},"observation_digest":"sha256:2dff8acf055623626d72d489724904f48688661a92a61f6eb7880c2c930ab987","observation_id":"436e807f-cc52-4e35-b968-5a6601d722d9","resolution":{"observed_at":"2026-05-10T12:00:22.231240Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":"2203.12602","doi":"10.48550/arxiv.2203.12602","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Videomae: Masked au- toencoders are data-efficient learners for self-supervised video pre-training","venue":"arXiv (Cornell University)","work_id":"04aae106-cf90-4697-aa7a-cd7446997a7a","year":2022},"citing_paper":{"arxiv_id":"2604.19683","last_updated":"2026-04-22T17:44:56Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T17:05:37Z","title":"Mask World Model: Predicting What Matters for Robust Robot Policy Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T02:14:17.676675Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2604.19683"},"observation_digest":"sha256:0b2d0b1288c1daa884f3b06327e137844bdfec090cd489ca766e57cfedc6994b","observation_id":"10c72199-24da-4342-ad3b-d63142d15e99","resolution":{"observed_at":"2026-05-11T13:11:05.988492Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":"2203.12602","doi":"10.48550/arxiv.2203.12602","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Videomae: Masked au- toencoders are data-efficient learners for self-supervised video pre-training","venue":"arXiv (Cornell University)","work_id":"04aae106-cf90-4697-aa7a-cd7446997a7a","year":2022},"citing_paper":{"arxiv_id":"2605.02094","last_updated":"2026-05-03T23:25:45Z","snapshot_observed_at":"2026-07-06T23:15:11.601042Z","submitted_at":"2026-05-03T23:25:45Z","title":"SignMAE: Segmentation-Driven Self-Supervised Learning for Sign Language Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T19:23:07.258575Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2605.02094"},"observation_digest":"sha256:d8ad0e6e83a44f597e97027ca394a9f5556688797ecfd6afdd092b291ed856fe","observation_id":"5c24090c-e261-4807-9828-8c5940807490","resolution":{"observed_at":"2026-05-09T05:55:30.819738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":"2203.12602","doi":"10.48550/arxiv.2203.12602","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Videomae: Masked au- toencoders are data-efficient learners for self-supervised video pre-training","venue":"arXiv (Cornell University)","work_id":"04aae106-cf90-4697-aa7a-cd7446997a7a","year":2022},"citing_paper":{"arxiv_id":"2605.17311","last_updated":"2026-05-17T08:02:42Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:02:42Z","title":"SpecSem-Net: Integrating Spectral and Semantic Features for Robust AI-generated Video Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T14:19:36.263592Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2605.17311"},"observation_digest":"sha256:ce93d46e4feac40638f6aa1b6817725d7d32fab768b0619e62c46ff476f19e3b","observation_id":"012078d3-2e08-4cc7-9d3d-bd8b845b2204","resolution":{"observed_at":"2026-05-20T14:23:21.618120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":"2203.12602","doi":"10.48550/arxiv.2203.12602","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Videomae: Masked au- toencoders are data-efficient learners for self-supervised video pre-training","venue":"arXiv (Cornell University)","work_id":"04aae106-cf90-4697-aa7a-cd7446997a7a","year":2022},"citing_paper":{"arxiv_id":"2605.18878","last_updated":"2026-05-16T02:49:12Z","snapshot_observed_at":"2026-08-02T22:07:15.605820Z","submitted_at":"2026-05-16T02:49:12Z","title":"Prognostic Value of Lung Ultrasound Biomarkers for Readmission Risk in Congestive Heart Failure: A Pilot Data-Driven Analysis","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-20T15:41:31.181025Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2605.18878"},"observation_digest":"sha256:d026f9d9f1fba0897da44ff2a3bf8b5246eacfd3d549503f5a8e421b88fdc53d","observation_id":"eb425c87-a1ff-4375-8e13-c999bb6f4426","resolution":{"observed_at":"2026-05-20T15:43:26.997735Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":"2203.12602","doi":"10.48550/arxiv.2203.12602","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Videomae: Masked au- toencoders are data-efficient learners for self-supervised video pre-training","venue":"arXiv (Cornell University)","work_id":"04aae106-cf90-4697-aa7a-cd7446997a7a","year":2022},"citing_paper":{"arxiv_id":"2605.23428","last_updated":"2026-05-22T09:41:51Z","snapshot_observed_at":"2026-08-01T14:30:00.684735Z","submitted_at":"2026-05-22T09:41:51Z","title":"FAST-ME: Foundation-aware Adaptive Stopping for Motion Estimation for Efficient IoT Video Analysis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-25T04:47:22.381247Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2605.23428"},"observation_digest":"sha256:4300cdd4bd6292b02d1685ed1b3ca269bc78ca41fd07cfc982fdc312f5d3c141","observation_id":"666c8eb3-efaf-45fa-bfc3-08b6c9fdab57","resolution":{"observed_at":"2026-05-25T04:50:21.230946Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":"2203.12602","doi":"10.48550/arxiv.2203.12602","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Videomae: Masked au- toencoders are data-efficient learners for self-supervised video pre-training","venue":"arXiv (Cornell University)","work_id":"04aae106-cf90-4697-aa7a-cd7446997a7a","year":2022},"citing_paper":{"arxiv_id":"2606.01884","last_updated":"2026-07-07T09:42:53Z","snapshot_observed_at":"2026-08-09T14:57:46.013511Z","submitted_at":"2026-06-01T08:29:37Z","title":"EVA-Net: Subject-Independent EEG Motor Decoding with Video-Derived Motor Priors","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T14:59:24.109366Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2606.01884"},"observation_digest":"sha256:9779937c9dc17b7473d1b3201bffde13496b6edb595793ac725160b477953b5e","observation_id":"a4990119-6ac8-4626-9ad9-6aedb9c67083","resolution":{"observed_at":"2026-07-01T22:46:20.318495Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-07-12T15:23:58.657504Z","title":"In: Advances in Neu- ral Information Processing Systems (NeurIPS) (2022).https://arxiv.org/abs/ 2203.12602","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01884","last_updated":"2026-07-07T09:42:53Z","snapshot_observed_at":"2026-08-09T14:57:46.013511Z","submitted_at":"2026-06-01T08:29:37Z","title":"EVA-Net: Subject-Independent EEG Motor Decoding with Video-Derived Motor Priors","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T15:23:58.657504Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2606.01884"},"observation_digest":"sha256:edae0ddd4e46efbf925fb51c968970146631ea4be1951d0749ff66c6f525eb01","observation_id":"60ed711d-f744-49c6-8541-5677007360d6","resolution":{"observed_at":"2026-07-12T15:23:58.657504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":"2203.12602","doi":"10.48550/arxiv.2203.12602","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Videomae: Masked au- toencoders are data-efficient learners for self-supervised video pre-training","venue":"arXiv (Cornell University)","work_id":"04aae106-cf90-4697-aa7a-cd7446997a7a","year":2022},"citing_paper":{"arxiv_id":"2606.05736","last_updated":"2026-06-04T05:55:15Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T05:55:15Z","title":"VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T01:52:44.785582Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2606.05736"},"observation_digest":"sha256:df5215f487f2bc21510f23ef8bbaf8b6d12a4ee46864ffa7be7d48fb4142b9ff","observation_id":"ec84fac8-62f7-4d77-82c0-93596628fa38","resolution":{"observed_at":"2026-07-02T12:46:56.824828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":"2203.12602","doi":"10.48550/arxiv.2203.12602","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Videomae: Masked au- toencoders are data-efficient learners for self-supervised video pre-training","venue":"arXiv (Cornell University)","work_id":"04aae106-cf90-4697-aa7a-cd7446997a7a","year":2022},"citing_paper":{"arxiv_id":"2606.08674","last_updated":"2026-06-24T14:20:12Z","snapshot_observed_at":"2026-08-07T04:03:49.063572Z","submitted_at":"2026-06-07T15:23:49Z","title":"BioVid: Autoregressive Video Generation with Biological Behavior Semantic Comprehension","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T18:35:14.331659Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2606.08674"},"observation_digest":"sha256:a248c6ef32c4ea129e156f1cebd02b0da59bce00bb3145b1e0a2c39b0b81ec77","observation_id":"d398b846-83d2-478c-a491-b75ce976e56f","resolution":{"observed_at":"2026-06-27T18:41:07.978312Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":"2203.12602","doi":"10.48550/arxiv.2203.12602","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Videomae: Masked au- toencoders are data-efficient learners for self-supervised video pre-training","venue":"arXiv (Cornell University)","work_id":"04aae106-cf90-4697-aa7a-cd7446997a7a","year":2022},"citing_paper":{"arxiv_id":"2606.09646","last_updated":"2026-06-08T15:40:32Z","snapshot_observed_at":"2026-08-09T02:42:00.413846Z","submitted_at":"2026-06-08T15:40:32Z","title":"Do Video Foundation Models Understand Intuitive Physics? A Layerwise Probing Analysis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T17:25:15.493925Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2606.09646"},"observation_digest":"sha256:f0ae30704f9130bf703c2b264512328810326d5b76df9891309b7ca014b2cccb","observation_id":"b91c577c-86eb-4d8e-87eb-fcc1e100c55a","resolution":{"observed_at":"2026-07-03T00:07:28.693423Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":"2203.12602","doi":"10.48550/arxiv.2203.12602","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Videomae: Masked au- toencoders are data-efficient learners for self-supervised video pre-training","venue":"arXiv (Cornell University)","work_id":"04aae106-cf90-4697-aa7a-cd7446997a7a","year":2022},"citing_paper":{"arxiv_id":"2606.22494","last_updated":"2026-06-21T13:33:27Z","snapshot_observed_at":"2026-08-03T14:43:55.859204Z","submitted_at":"2026-06-21T13:33:27Z","title":"Deep Learning-Based Sign Language Recognition from Videos and Cross-Lingual Translation to Indian Vernaculars","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T10:55:03.728012Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2606.22494"},"observation_digest":"sha256:93dffd7fa1eb2bb158ecef67e5d5a7ad81d2da555ff9c697edc4373834ff4c4e","observation_id":"12dc5c0b-df9a-48d7-a577-d48b2aa1b896","resolution":{"observed_at":"2026-07-04T08:49:42.467011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":"2203.12602","doi":"10.48550/arxiv.2203.12602","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Videomae: Masked au- toencoders are data-efficient learners for self-supervised video pre-training","venue":"arXiv (Cornell University)","work_id":"04aae106-cf90-4697-aa7a-cd7446997a7a","year":2022},"citing_paper":{"arxiv_id":"2606.29504","last_updated":"2026-06-28T17:05:56Z","snapshot_observed_at":"2026-08-03T11:32:10.544305Z","submitted_at":"2026-06-28T17:05:56Z","title":"Empirical Evaluation of Multi-Modal Touch Detection in Over-the-Shoulder Video Surveillance","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T07:02:23.993806Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2606.29504"},"observation_digest":"sha256:64d102a8eefa2cb16598a2ba91f4cb6831c8b603e262916c3076c9dc87afdc34","observation_id":"ab485a0f-7d57-4e89-84c5-b056706ae7a3","resolution":{"observed_at":"2026-06-30T07:04:20.959297Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-04T23:46:51.632640Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.632640Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:6515d5cb74aa642814ac26e595e0d887ece0556455c1b2d73ba778745a7206b5","observation_id":"beb3c69b-1797-4c66-853a-d40f3b182606","resolution":{"observed_at":"2026-08-04T23:46:51.632640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2203.12602/citation-record","integrity":"/paper/2203.12602/integrity","json":"/paper/2203.12602/citation-record.json","paper":"/paper/2203.12602"},"outbound":[],"paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2203.12602."}