{"as_of":"2026-08-16T20:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:355f848fd47808d72b0316f8536d705b93460cb31af27ec5e3f4fed10fe4be78","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:49:24.574574Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.12270/citation-record","integrity":"/paper/2411.12270/integrity","json":"/paper/2411.12270/citation-record.json","paper":"/paper/2411.12270"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.193398Z","title":"Model selection and multi- model inference","venue":null,"work_id":"f5b8d97d-ec63-4b5c-b9ac-704d24939d1f","year":2020},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.365364Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:4374bf9eb200cdf74e5e7856f30ddac85f43e1c9d8e5846572a438baa11ad760","observation_id":"03170bb8-772a-4245-9522-a02ed23ddedf","resolution":{"observed_at":"2026-08-12T17:49:25.197918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.183632Z","title":"Adamae: Adaptive masking for efficient spatiotempo- ral learning with masked autoencoders","venue":null,"work_id":"2bdbc60e-8628-4535-b219-78bdd76bd717","year":2023},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.369049Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:3dfb49d81b16f10da8eb2d834f24254a2fd55a4ced1e082af997abda0e3edf2c","observation_id":"66c07592-1931-45ba-a0bb-4d7262b22c1b","resolution":{"observed_at":"2026-08-12T17:49:25.187233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.173069Z","title":"Self- supervised learning across domains","venue":null,"work_id":"5aaaffb2-90da-4fdf-83f7-f84ff51e1939","year":2021},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.372767Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:3f765da3a45cb1c1e1e234bdca5154e36324a4ae1d16ec269800129c01a5eeae","observation_id":"926a74d6-2076-4e59-a09e-470510af997b","resolution":{"observed_at":"2026-08-12T17:49:25.176797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03670","last_updated":"2022-02-09T18:33:57Z","snapshot_observed_at":"2026-08-16T17:22:55.292261Z","submitted_at":"2022-02-08T06:15:07Z","title":"How to Understand Masked Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03670","snapshot_observed_at":"2026-08-12T17:49:24.376251Z","title":"How to understand masked autoencoders","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.376251Z"},"links":{"cited_paper":"/paper/2202.03670","citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:aa34954df047fc8a11dc1b3b4102347fecf4d8be032c18a7ff71f08f68e8becc","observation_id":"a3c5e7b1-6ace-4bee-8eab-cb5f4a8acb82","resolution":{"observed_at":"2026-08-12T17:49:24.376251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.379790Z","title":"Domain generalization by solving jigsaw puzzles","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.379790Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:e8c4fe1e9658bc5d7bc343ff309306b4912b5077e2c9550fc1826ef843a9476d","observation_id":"8b7012fd-9287-4eee-89a8-133c200af252","resolution":{"observed_at":"2026-08-12T17:49:24.379790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.157644Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"c27e631a-64cf-4c43-9935-fe739ea71f8e","year":2021},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.383209Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:6d7f06f90bdf48ce94678da0bde3888c257c88696970063bc139657f4da474f4","observation_id":"0c6315da-8e48-49e0-94cb-02a875e4ed62","resolution":{"observed_at":"2026-08-12T17:49:25.161348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.147664Z","title":"Contrastive learning of global and local fea- tures for medical image segmentation with limited annota- tions","venue":null,"work_id":"50013edf-6274-444f-9be4-907072e3d212","year":2020},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.386730Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:aa3668655588b333cddba3731a1a952be71053413a51383de70d8189c7bb89fa","observation_id":"07b83363-99b9-495b-9842-5c780efbf9fa","resolution":{"observed_at":"2026-08-12T17:49:25.151309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.137354Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"a9242dde-c620-4f61-9bf4-53e5d9bfea45","year":2020},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.389820Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:452032fd8c9dfbc10c545ee1ce9cae1425998515086c79911d48fa784bd5f9ec","observation_id":"d9b73c4f-2236-49b7-8d63-d82dfdf9acb2","resolution":{"observed_at":"2026-08-12T17:49:25.141032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.127838Z","title":"Sdae: Self- distillated masked autoencoder","venue":null,"work_id":"78125911-d44a-42a3-a9a8-bfca6d2446f3","year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.392634Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:6d6a0266fcd513d6b203d45f19b81a65ad2bfe492f748f11ae8530c47d73fd5e","observation_id":"f3c29583-242f-4145-ac36-cf1b8b1c5a5c","resolution":{"observed_at":"2026-08-12T17:49:25.131449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.117823Z","title":"Similarity contrastive estima- tion for self-supervised soft contrastive learning","venue":null,"work_id":"6622281c-5a92-465c-8d26-6d642f552a74","year":2023},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.395659Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:578112aff96289ccbdb1eba1b9c8b6ca14f9fe14bdbd00617e9329423073583b","observation_id":"28a5c985-90ab-443a-8dae-48403f2ccc97","resolution":{"observed_at":"2026-08-12T17:49:25.121871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T17:49:24.398730Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.398730Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:48b0824ee19fd9d84cce580aca3e66aa014e3d07c9b043bc05fe19ac667e3abf","observation_id":"df1721c8-55a6-4010-b17e-ad521c68915c","resolution":{"observed_at":"2026-08-12T17:49:24.398730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.107230Z","title":"A large-scale study on unsupervised spatiotemporal representation learning","venue":null,"work_id":"e72071ec-8bc5-4185-a06a-4624855a9857","year":2021},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.402137Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:c8ae24b22b84a97a7f979700e0cae4405349ad1df7dab4fed081f1d59d4bccc1","observation_id":"a90e9fdb-9ce0-4fc4-8dc6-000f0e20f464","resolution":{"observed_at":"2026-08-12T17:49:25.111232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.405197Z","title":"Masked autoencoders as spatiotemporal learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.405197Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:c40104ded478e1de0b6f047d9be91a1ae63a80a8cde761996c9095f23d111f89","observation_id":"8fb3292b-3107-4fb3-9d4c-0f4a7a21e33b","resolution":{"observed_at":"2026-08-12T17:49:24.405197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.089752Z","title":"Audio set: An ontology and human- labeled dataset for audio events","venue":null,"work_id":"eaf55180-1734-4722-add4-a8ad1e3e9a44","year":2017},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.408836Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:cbef6505a0538548834afd3f28ef4fddc7b94ff5c4b936ae5261b9cbda3790a2","observation_id":"cfdc1542-1bb7-4cd4-aa14-d828fd3d0089","resolution":{"observed_at":"2026-08-12T17:49:25.093292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.079124Z","title":"Audiovisual masked autoencoders","venue":null,"work_id":"40f952b7-cfda-49b6-88ca-dac5b425065a","year":2023},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.412244Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:1f5ea0650b4253f0d360fd519a5df33cff5b8477ed77993dfa4b5104b623081e","observation_id":"3586966a-f4a4-4eff-ad1d-35b34c0449d6","resolution":{"observed_at":"2026-08-12T17:49:25.083130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07839","last_updated":"2023-04-11T22:47:19Z","snapshot_observed_at":"2026-08-16T16:27:33.126113Z","submitted_at":"2022-10-02T07:29:57Z","title":"Contrastive Audio-Visual Masked Autoencoder","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07839","snapshot_observed_at":"2026-08-12T17:49:24.415073Z","title":"Contrastive audio-visual masked autoencoder.arXiv preprint arXiv:2210.07839, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.415073Z"},"links":{"cited_paper":"/paper/2210.07839","citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:206cc7314065aa69367e013b4abe6d1f4b32b9bf0d626c841cfb77ab6d6bc387","observation_id":"2cb8e19a-25b3-495a-91d9-2549a660af15","resolution":{"observed_at":"2026-08-12T17:49:24.415073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.069533Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":"1c7dfc9e-3c33-4e4b-a245-52a61e0a853e","year":2020},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.418022Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:bc71b37bb7b688b31e7cf0d74a6f731cad96683672f0860ca765218cf1adbc84","observation_id":"44df7519-8d68-4230-8d98-8bf9e36693e9","resolution":{"observed_at":"2026-08-12T17:49:25.072910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.058747Z","title":"Noise-contrastive estimation: A new estimation principle for unnormalized statistical models","venue":null,"work_id":"59f7a645-253a-42f9-8232-701a1d52bd2a","year":2010},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.420572Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:c84bc0fc01348adafe70cd83bfdc834f8e9b29356a7e5e2dc9902398cb148c9b","observation_id":"b05b76d1-e43a-4dba-8402-ca1094acfd71","resolution":{"observed_at":"2026-08-12T17:49:25.062158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.049295Z","title":"Self- supervised co-training for video representation learning","venue":null,"work_id":"fd72b03f-8b18-45b5-b42c-7e9e88dd5bbb","year":2020},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.423085Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:8e00d2a5360cb53725079c8fea2875bf46bb9b455731740b05ed42edfc782420","observation_id":"5ccdfec7-c0dd-41fd-b090-eff61f466d9e","resolution":{"observed_at":"2026-08-12T17:49:25.052693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.039069Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"195363f6-46cc-4780-b2cd-1921444c95b2","year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.426601Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:7a06bd2e7f7af0f7533002dc0b2e5a8fabf3bcbadb7fa0e4ad104ed9e713216b","observation_id":"f4820904-9951-4bf5-b96a-efc8468aa179","resolution":{"observed_at":"2026-08-12T17:49:25.042592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.029323Z","title":"Mgmae: Motion guided masking for video masked autoencoding","venue":null,"work_id":"b8bd52b4-c1a4-4ad4-aeef-230b57e2a416","year":2023},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.430057Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:534e498e8c27b3f05482999af3d3a3c6e07e105ee08ddf84255f9ae9e5a1fd46","observation_id":"6511cd3a-13f4-46e7-a9f3-4d0d74050c53","resolution":{"observed_at":"2026-08-12T17:49:25.032780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.019784Z","title":"Let there be color! joint end-to-end learning of global and local image priors for automatic image colorization with simulta- neous classification","venue":null,"work_id":"3a530eb2-303f-474e-b588-22196c58c8b6","year":2016},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.433294Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:102a08d609bc87f303371d044ccfa37806f54f5672481d621f775dc91069db60","observation_id":"16af3633-fe5a-47ad-be8f-cd74be696603","resolution":{"observed_at":"2026-08-12T17:49:25.023353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.437173Z","title":"A survey on contrastive self-supervised learning.Technologies, 9(1):2,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.437173Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:3e7504f6870989ebeea8ef68a8077cb10fc5ba35fb0e2947bbcca291a2ecb39a","observation_id":"110d5e02-c323-42a0-b622-d1f6d2176ee1","resolution":{"observed_at":"2026-08-12T17:49:24.437173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-15T11:35:18.832923Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-12T17:49:24.440680Z","title":"The kinetics hu- man action video dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.440680Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:a1b18052918f4ac89e0a7164b161b756630352c94bb187aa1b3eb855c105ffe4","observation_id":"a8e4bc8d-fa97-404b-a061-e55d81f5015f","resolution":{"observed_at":"2026-08-12T17:49:24.440680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:25.002922Z","title":"Learning image representations by completing dam- aged jigsaw puzzles","venue":null,"work_id":"effc5a61-c182-4f53-80e8-1977d24ad590","year":2018},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.444176Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:ba7bcdbd17db591ce62ba05005cc82617e54997b2487cc363faec890fd2ea46c","observation_id":"16bdbbf0-063e-46d1-aa3f-5ae61e8620d1","resolution":{"observed_at":"2026-08-12T17:49:25.006298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.993332Z","title":"Temporally coherent embeddings for self-supervised video representation learning","venue":null,"work_id":"d52cda0d-a83a-4953-9f1c-8f979cee0736","year":2020},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.447443Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:afaa56ef4d568bd4336dd5cb9891f2f3b49a32871a3b5e1384f4df4dcb575d11","observation_id":"dc5e350a-f7ed-4ece-b53a-f5bbacafa182","resolution":{"observed_at":"2026-08-12T17:49:24.996843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.983683Z","title":"Self-supervised video similarity learning","venue":null,"work_id":"52db60f9-6e59-4eaf-90ed-cf6f2c0feab2","year":2023},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.450570Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:538584003ee29811e4b5e1568b1c431623c96bddb61b09a243c0f63cabadd1f9","observation_id":"11101b6c-0d95-4fef-8caf-50aa4ccfc0e0","resolution":{"observed_at":"2026-08-12T17:49:24.987404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.972900Z","title":"Learning representations for automatic colorization","venue":null,"work_id":"64efb3ba-f800-46a3-bb5d-b0811788c003","year":2016},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.453994Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:080f34862d9a895457f2ee41bbc13128740f140ab2cf281a0649acfcabbf4570","observation_id":"b5919228-f576-4dbc-bcb1-6c3c728a6955","resolution":{"observed_at":"2026-08-12T17:49:24.976585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.963190Z","title":"Colorization as a proxy task for visual understanding","venue":null,"work_id":"09317c4b-48d1-4117-8b14-ee00682a3650","year":null},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.457214Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:52d406abd9b3974a0fbeccdfe5c8906a9c7c0d8510c83dd83348286963f9f995","observation_id":"3a6db295-cf8e-44a1-ab10-b1bda27dc815","resolution":{"observed_at":"2026-08-12T17:49:24.967012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.953230Z","title":"Predicting what you already know helps: Provable self- supervised learning","venue":null,"work_id":"1fe1173f-946d-4014-adc3-35d4b8dccdf9","year":2021},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.460827Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:8e5bcedab2084d1b793876d6c49d1f0f5df3576bd78c9f368288027cec04adbd","observation_id":"7bc7ca20-13d8-4444-9d3b-4e39dedcc7c3","resolution":{"observed_at":"2026-08-12T17:49:24.956737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15704","last_updated":"2020-06-28T20:39:45Z","snapshot_observed_at":"2026-07-06T09:33:26.082100Z","submitted_at":"2020-06-28T20:39:45Z","title":"PyTorch Distributed: Experiences on Accelerating Data Parallel Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15704","snapshot_observed_at":"2026-08-12T17:49:24.464193Z","title":"Pytorch distributed: Expe- riences on accelerating data parallel training","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.464193Z"},"links":{"cited_paper":"/paper/2006.15704","citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:e1179da1fab377b1f792800e3679a3fdaf727a7c90cbdc432eb584a9b7a10994","observation_id":"1f0bb04b-ac30-4c94-b96a-7a28c4a03f30","resolution":{"observed_at":"2026-08-12T17:49:24.464193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.943288Z","title":"Audio self-supervised learning: A survey","venue":null,"work_id":"2294a770-8736-4663-84b6-c9dd0b6aecbb","year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.467724Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:837bee5325ed7ef80ee664bb4b3d310cb7a7cbe0f9ae644d188d261a1143f9f5","observation_id":"8c39154f-13fe-4e9a-846a-95d9d3b77155","resolution":{"observed_at":"2026-08-12T17:49:24.947096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.932562Z","title":"Temporal contrastive pretrain- ing for video action recognition","venue":null,"work_id":"53eb203f-1078-440e-bc6a-3d4f8c53c8cb","year":2020},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.470659Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:d254d5e0aa81a6036945c63c6063808431876de86a1e81d56bd37b19dcac3bee","observation_id":"83669153-11e7-4802-9e01-e75a1efb8629","resolution":{"observed_at":"2026-08-12T17:49:24.936030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.923553Z","title":"Learning word em- beddings efficiently with noise-contrastive estimation","venue":null,"work_id":"26a9303e-4acd-468e-9cd3-35b3da6a931a","year":2013},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.473524Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:f8a2bc8cf705564f2657306e8df02437ca02f7da7b85ee11b2616d9061adb831","observation_id":"5c479433-e04c-4f28-adb6-7096eba90b35","resolution":{"observed_at":"2026-08-12T17:49:24.926872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.914555Z","title":"Joint self-supervised image-volume representation learning with intra-inter con- trastive clustering","venue":null,"work_id":"da389fd3-642a-442a-a46c-ae287da7eec7","year":null},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.476890Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:b0ab8588153f255e29c6c7648fe341999aa585ff3bf8f04cb5e774c14da2cef4","observation_id":"c24aa7dc-f589-4ed2-985b-0b464e57f385","resolution":{"observed_at":"2026-08-12T17:49:24.917670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.480305Z","title":"Unsupervised learning of visual representations by solving jigsaw puzzles","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.480305Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:d7306d85c2e7de3545dd61d67903bc0325ed91a7d7fb034bac28565b97542ff7","observation_id":"b2f74a77-3d39-4ec2-b0db-3f38420e70ab","resolution":{"observed_at":"2026-08-12T17:49:24.480305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.899238Z","title":"Boosting self-supervised learning via knowledge transfer","venue":null,"work_id":"73fef1dd-2177-490c-9739-fb123f5a9c8e","year":2018},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.483691Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:874f1ddb161b8826d14da4340a2782e9f5a88de205bee9147e9ef20faebd4a70","observation_id":"34ab244a-d33c-4086-bfc2-a04b3b6b9a1e","resolution":{"observed_at":"2026-08-12T17:49:24.902748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-12T17:49:24.486636Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.486636Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:85eb3357afb82fcacf71366c5a3b38ac2d10394227f00233f700e5c2daa60c42","observation_id":"0908b06a-0ed4-4dff-bbba-2ebd52a208ef","resolution":{"observed_at":"2026-08-12T17:49:24.486636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.888616Z","title":"Spatiotempo- ral contrastive video representation learning","venue":null,"work_id":"b515a0c8-0b10-4003-9173-64862b4144d6","year":2021},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.489809Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:caacfea62efe903fc534da79d30c1ea91be325a4286ccfe9c60c8b3f1d149c84","observation_id":"f124eb39-0b47-411e-bfee-fe841d277665","resolution":{"observed_at":"2026-08-12T17:49:24.892582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.879457Z","title":"Self-taught learning: transfer learning from unlabeled data","venue":null,"work_id":"f15d3623-9f9f-4bdb-bbf3-e53bba71ad8d","year":2007},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.492228Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:cd34a21078802c428d6653628c387324f43a2881749b1a156698911a33304b55","observation_id":"f49b0ab1-245b-486c-afd2-d682594fc4c1","resolution":{"observed_at":"2026-08-12T17:49:24.882984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.870058Z","title":"Masked jigsaw puzzle: A versatile po- sition embedding for vision transformers","venue":null,"work_id":"a4c1e455-ad32-4998-82c4-2f645e238632","year":2023},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.494862Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:f391ab197202b7df575a184ce1d4d1856c0ccb2ef65d1dab939c2aa3b4d4ad50","observation_id":"ab1d1130-b99d-425a-a9ec-ee55f2cd78a5","resolution":{"observed_at":"2026-08-12T17:49:24.873437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.860466Z","title":"Berg, and Li Fei-Fei","venue":null,"work_id":"940f082c-66a4-45bf-9ff2-776129fa1bf2","year":2015},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.497569Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:961c85397f687f05c88c17cd4677f1dd5b7efced66a5bf2270b3ff5817d5ad0e","observation_id":"e26ec018-ecac-489e-a88d-ed4678b6880f","resolution":{"observed_at":"2026-08-12T17:49:24.863782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.12959","last_updated":"2022-02-10T21:06:05Z","snapshot_observed_at":"2026-08-16T08:22:42.479717Z","submitted_at":"2020-08-29T10:53:55Z","title":"Puzzle-AE: Novelty Detection in Images through Solving Puzzles","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.12959","snapshot_observed_at":"2026-08-12T17:49:24.500247Z","title":"Puzzle- ae: Novelty detection in images through solving puzzles","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.500247Z"},"links":{"cited_paper":"/paper/2008.12959","citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:82db8e69d5a0166176392f1320640a438294fd1abca434bb2d1ee3519f6634aa","observation_id":"c439b712-d32e-4b2b-86a3-7e44898e3ad2","resolution":{"observed_at":"2026-08-12T17:49:24.500247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.850798Z","title":"Self-supervised learning for videos: A survey","venue":null,"work_id":"52b726fd-7daa-49ea-9cea-819d4c60867b","year":2023},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.503175Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:9ade6a4a90262617d50212d7e5481b7514eb248d58693f855117f0763cf1799b","observation_id":"8dbb85e4-9bca-43aa-88cd-2e7977d27b5a","resolution":{"observed_at":"2026-08-12T17:49:24.854115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.841502Z","title":"Unsupervised learning of video representations using lstms","venue":null,"work_id":"068b2dbf-8730-4254-b7b5-621413075731","year":2015},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.506560Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:a10af3633937300583028c109cbccbab100f9af7fee190ffb9503f06680ae956","observation_id":"1638a70f-de83-4996-bc52-02a5db3f2997","resolution":{"observed_at":"2026-08-12T17:49:24.844886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.830926Z","title":"Self- supervised video representation learning using inter-intra contrastive framework","venue":null,"work_id":"8853621b-83a2-46de-b193-14d461899a0f","year":null},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.509990Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:c576f96db851c9831018517741c1a1ed437d9eee7f8a62cddb031d4d411da490","observation_id":"c88ec0dc-0f29-4b44-8c81-50712beacd5c","resolution":{"observed_at":"2026-08-12T17:49:24.834152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.822653Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"6953c703-38a2-4ea4-bc28-654c398013ff","year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.513092Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:73309abf203703f4d5b54ae42be9ddada565ee0fa1c1bd523cfd856ad3bf9f06","observation_id":"d4ab85e5-1d50-4686-843f-ea01bf6a854c","resolution":{"observed_at":"2026-08-12T17:49:24.825399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.813618Z","title":"Mocogan: Decomposing motion and content for 10 video generation","venue":null,"work_id":"34e60c02-b1a7-4345-b11e-75efdff2b9de","year":null},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.517021Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:4bb7bc1d5475a99006321c49f618286c134e01623f09584ef07de868452756e9","observation_id":"15e69d7e-f07d-4382-b025-1b9936fb47f5","resolution":{"observed_at":"2026-08-12T17:49:24.817195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.520761Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.520761Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:4137aeb22059702202c1e67ef7915eaa2bee538ff977c317ee3383fa629b406c","observation_id":"75c070b1-bf83-48a6-af80-ebb08286e8f7","resolution":{"observed_at":"2026-08-12T17:49:24.520761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.798741Z","title":"Generating videos with scene dynamics","venue":null,"work_id":"7282a1f3-1872-40b3-8c8c-dafba6efe909","year":2016},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.523822Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:994585365cab0edc627be60f7030c83db00699f34a69c5b587f1fc470a7a3ece","observation_id":"b73dbf01-6530-430d-adf0-fcc3ec6cb10c","resolution":{"observed_at":"2026-08-12T17:49:24.802349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.788994Z","title":"Video anomaly detection by solving decoupled spatio-temporal jigsaw puzzles","venue":null,"work_id":"55b8d667-97e0-40cf-b78d-ed7a3e92f058","year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.526894Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:abda1288cd19ba9095bc78594ac96041c22a4b1a4474728799fd0609ad7f3b44","observation_id":"81e9237a-83dd-44ad-96ed-4bb4e3364508","resolution":{"observed_at":"2026-08-12T17:49:24.792414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.779719Z","title":"Enhancing unsupervised video representation learning by decoupling the scene and the motion","venue":null,"work_id":"e863c7f7-a3b5-435f-a43c-99909b70394a","year":2021},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.530430Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:809102b3492459fef58009fee55f039080dd0861754ee68bbf6b4825e1f117dd","observation_id":"34d500e7-a3d5-4f61-a3b8-303d2b698cf2","resolution":{"observed_at":"2026-08-12T17:49:24.783079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.769836Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":"26bc290e-80da-4732-ba8a-58ef10975c6c","year":2023},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.534417Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:52e90aeec7862ef3523d216b0c2311147c35eca454e9c47e6f142a5016505f26","observation_id":"4f8ad67e-6ec1-4a14-9c5b-260517cc9526","resolution":{"observed_at":"2026-08-12T17:49:24.773678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.759235Z","title":"Knowledge distillation and student-teacher learning for visual intelligence: A review and new outlooks","venue":null,"work_id":"1c03abed-75aa-4921-8a95-3d3f991d3ab9","year":2021},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.537871Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:23071e090ef471e221a7fcb9610e305eb0de55cd1d446e100b9fce1d3cce00b3","observation_id":"6f8bd629-e89e-48d0-9f16-8d22b73023f4","resolution":{"observed_at":"2026-08-12T17:49:24.763431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.750380Z","title":"Bevt: Bert pretraining of video transformers","venue":null,"work_id":"bf234a3a-16e1-4269-acb9-81aa48a5bc3f","year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.540840Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:cfdd8d279fb3f3e4783a623fbe3ff0d5cb72b91c823b2df9b03f4ae73f6853a9","observation_id":"3e8eabf2-4867-4320-a54b-14bea67082fd","resolution":{"observed_at":"2026-08-12T17:49:24.753492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.543950Z","title":"Masked feature predic- tion for self-supervised visual pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.543950Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:a0f8820086eff64dd6cf113d180853ee44efbd2c825f1d0373a6ee36587a920d","observation_id":"f1738650-05dc-4838-b008-221b41809530","resolution":{"observed_at":"2026-08-12T17:49:24.543950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.736473Z","title":"Iterative reorganiza- tion with weak spatial constraints: Solving arbitrary jigsaw puzzles for unsupervised representation learning","venue":null,"work_id":"835554c5-06ac-4e8f-8e96-f395cbe7af84","year":1910},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.546954Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:7f4b3a85c1210bd353bec984c6f98e82d9bba96a9901c41bb120aff082d73e88","observation_id":"7ba6a756-1220-43dc-9cd7-a620c67795d9","resolution":{"observed_at":"2026-08-12T17:49:24.739370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.727867Z","title":"Structured sparsity learning for efficient video super-resolution","venue":null,"work_id":"8447f43f-4880-49a1-b76e-218966e300ed","year":2023},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.550429Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:73360bff12dcf793a3db553589b2f4f7894abe88fd501f40ad60e53ac26d0a64","observation_id":"0bcf54e1-e7fc-4579-ab79-ed9e8d549023","resolution":{"observed_at":"2026-08-12T17:49:24.731183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04154","last_updated":"2022-10-09T03:22:15Z","snapshot_observed_at":"2026-08-16T16:25:50.370331Z","submitted_at":"2022-10-09T03:22:15Z","title":"Self-supervised Video Representation Learning with Motion-Aware Masked Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.04154","snapshot_observed_at":"2026-08-12T17:49:24.553285Z","title":"Self- supervised video representation learning with motion-aware masked autoencoders","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.553285Z"},"links":{"cited_paper":"/paper/2210.04154","citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:2b1dfbc9dcc9cb800d34da6f75d9007d7da2ae1440824f3a33cc3d8590293edf","observation_id":"499db7ef-4e00-4c2c-bb9b-739e4363f0a8","resolution":{"observed_at":"2026-08-12T17:49:24.553285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.718545Z","title":"Seco: Exploring sequence supervision for un- supervised representation learning","venue":null,"work_id":"b6ef781d-12d0-4c76-9705-09a8543a1aaa","year":2021},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.557225Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:6eaaed189ff86a544a6bc7de1b6ebce3aeca3c0e3c6f12a00f53e389d1595f31","observation_id":"f8d1fae6-b6be-4463-869c-0cadd1c2ac45","resolution":{"observed_at":"2026-08-12T17:49:24.721778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.709350Z","title":"Contextualized spatio-temporal contrastive learning with self-supervision","venue":null,"work_id":"afd2b7ab-88f5-474e-8acb-64abc364b626","year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.560670Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:7247492b7f6e5c8f2214fd7f932aeabfe1f4389608f19321a8c3c066fe952aea","observation_id":"6e75d79c-14ad-4be5-9177-2ef385cc1298","resolution":{"observed_at":"2026-08-12T17:49:24.712474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.700353Z","title":"A survey on masked au- toencoder for visual self-supervised learning","venue":null,"work_id":"12cef4f0-4ab5-4b04-bd3c-dcdfd0da542c","year":2023},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.563649Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:b9a3320728765e6d37ba3682ccc9705b4e332082e76202e9d1b713962477acca","observation_id":"29c09f25-7269-48f5-b567-23a21496efbe","resolution":{"observed_at":"2026-08-12T17:49:24.703565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.00173","last_updated":"2022-07-30T09:59:28Z","snapshot_observed_at":"2026-08-16T16:42:18.622309Z","submitted_at":"2022-07-30T09:59:28Z","title":"A Survey on Masked Autoencoder for Self-supervised Learning in Vision and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.00173","snapshot_observed_at":"2026-08-12T17:49:24.566876Z","title":"A survey on masked autoencoder for self-supervised learning in vision and beyond","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.566876Z"},"links":{"cited_paper":"/paper/2208.00173","citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:ab657a396e66bec8b7ffb50a3b394a7feae48c6550692ab6b748d6898866e6ba","observation_id":"7a61fd2b-eb16-47bd-823a-d39f1393a903","resolution":{"observed_at":"2026-08-12T17:49:24.566876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.690923Z","title":"How mask mat- ters: Towards theoretical understandings of masked autoen- coders","venue":null,"work_id":"faa0f698-debf-4963-bec4-fcb680cd37d2","year":2022},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.569726Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:4c3560e91f6b6a8b037c752a25de5f7bb9303b4ba1f97cb1bca835dfd7ee2a62","observation_id":"4e4f03a9-9bdb-44a6-9e76-8a3e8949c78c","resolution":{"observed_at":"2026-08-12T17:49:24.694362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.681469Z","title":"Deep mutual learning","venue":null,"work_id":"15fcd80a-0384-4252-8cf8-d9300d1519fe","year":2018},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.572103Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:336b629196ef9a602af7eb27f94b33e6489db390c497956e38546675b73dab5b","observation_id":"20bff9eb-0649-4998-875b-467726679d02","resolution":{"observed_at":"2026-08-12T17:49:24.684795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:24.668815Z","title":"Masked autoencoders in computer vision: A comprehensive survey","venue":null,"work_id":"a76d9dd7-5a3c-4b87-823b-354fa30d320a","year":null},"citing_paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:24.574574Z"},"links":{"citing_paper":"/paper/2411.12270"},"observation_digest":"sha256:90a217ff05288e285a1bc5c1d0b56f92aca3518839d7e894d0d2c2e72c8b08de","observation_id":"47feeadf-f419-40b0-b267-5a9c7d537a10","resolution":{"observed_at":"2026-08-12T17:49:24.674644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.12270","last_updated":"2024-11-19T06:47:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T13:10:37.836177Z","submitted_at":"2024-11-19T06:47:56Z","title":"KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":51},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2411.12270."}