{"as_of":"2026-08-17T01:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a937b478f03b7925d794c4c6a9a95593849be23b46e8e6f0d4da3cf956b8b957","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:26:32.991891Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.01237/citation-record","integrity":"/paper/2505.01237/integrity","json":"/paper/2505.01237/citation-record.json","paper":"/paper/2505.01237"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:32.775790Z","title":"Self-supervised learning of audio-visual objects from video","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.775790Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:2e93b7440190ca721094b81679ff5f04205b351d2a6ac124cd6e718d363f208a","observation_id":"ab5ba190-b74b-4850-853f-0225be2800ec","resolution":{"observed_at":"2026-08-16T04:26:32.775790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.815745Z","title":"Look, listen and learn","venue":null,"work_id":"b9661b8d-e2f8-4b82-8a31-259c8c3a3adb","year":2017},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.780800Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:1ca07fbd0ee536f1b1d031bc54e5d8090a9ffb67e70fc9772ca5d9a0f5a00fb2","observation_id":"73b9163a-48bc-4536-91e9-ba49dd15249f","resolution":{"observed_at":"2026-08-16T04:26:33.820348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.800740Z","title":"Objects that sound","venue":null,"work_id":"c7f3ff50-8567-4c82-9e38-10cb2be0c8c9","year":2018},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.785314Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:4feeb88e6f899dbeca340ce30a4c388e7a19156a0d1bbe3c8ad1d998cff2415b","observation_id":"8721d22e-4783-44c8-99e1-4be0d12cd5fd","resolution":{"observed_at":"2026-08-16T04:26:33.805349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.785917Z","title":"Sound- net: Learning sound representations from unlabeled video","venue":null,"work_id":"3a113f0d-11fe-4bac-ac47-ccb9b6906d3e","year":null},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.789973Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:4499745e763f5102d18aacb4a0b64d162104a6e5001db396eaa8e54a71309b61","observation_id":"abb8d35f-e874-40ce-b211-b62f120a2b8e","resolution":{"observed_at":"2026-08-16T04:26:33.790489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:32.794959Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.794959Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:91ecb8decc3dc95dcc41ae142c962fc5450ee6b7c7296feb65354a6891b46027","observation_id":"59c34e70-af9a-468a-94aa-9aac795b5112","resolution":{"observed_at":"2026-08-16T04:26:32.794959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.761450Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"b0379ab2-9a74-4e6b-b6e4-ff0128ee69fd","year":2020},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.799505Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:6510fc63622948f29b08061301e0f11dd6d2062da72202b9c2808719ff5b7d2d","observation_id":"9420bd3c-3674-43c4-8681-a06a2d76b89d","resolution":{"observed_at":"2026-08-16T04:26:33.766400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.747531Z","title":"Localiz- ing visual sounds the hard way","venue":null,"work_id":"fb66c3e2-894e-42d1-a95e-1ca86939178d","year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.804317Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:31cb9640c6583c9f340d82506d2e280b8296270bec70504f9bbc0349c2d0cee8","observation_id":"f19c7b18-3466-41f9-b614-78e182dda387","resolution":{"observed_at":"2026-08-16T04:26:33.751761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.734029Z","title":"Distilling audio-visual knowledge by com- positional contrastive learning","venue":null,"work_id":"860b2f78-852a-4e79-9357-4ce00468db55","year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.809033Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:68b5beaa78875c58786bfff464e23c17bb0f81ba652d201491ca75444bd2d096","observation_id":"aba398b6-c9ce-4d75-a004-151350fab2e0","resolution":{"observed_at":"2026-08-16T04:26:33.738412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.719983Z","title":"Look, listen, and attend: Co-attention network for self-supervised audio-visual representation learning","venue":null,"work_id":"f68371a4-f1dd-4949-a3a4-1f4415b42891","year":2020},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.813514Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:eb25ff644f83b7bb3e32754f2c4e455fb8b755a96faa679d31f77185f1f7d6e1","observation_id":"389a656d-d290-4307-9cbf-a00ce46c72ff","resolution":{"observed_at":"2026-08-16T04:26:33.724307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.706578Z","title":"Vision transformers need registers","venue":null,"work_id":"539229e2-30ad-42cc-8156-0ad6059ece18","year":2024},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.817897Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:0c3fe56f2bc8931130781c1a80d9f7e3f7cd1f601927e4926ff8611a70afc268","observation_id":"cc1b77d1-1f77-4738-9521-0773c9fdb621","resolution":{"observed_at":"2026-08-16T04:26:33.711043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.692479Z","title":"Audio set: An ontology and human- labeled dataset for audio events","venue":null,"work_id":"0b995a49-e55e-4da8-b415-7d8006928d73","year":null},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.822446Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:08d345e4fc669dd46865e6b1a5a303d1514eb9e4252224a593816d1a998c2c4e","observation_id":"29d9ea60-eb9f-47fc-998d-7f82934b04ed","resolution":{"observed_at":"2026-08-16T04:26:33.697065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.678768Z","title":"Audiovisual masked autoencoders","venue":null,"work_id":"45883d6d-7749-4185-849d-d0a700628c64","year":2023},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.826992Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:e5698dd8fe0f7fa1fc33f76de1ec0daa7421d01ea05788b878138f035198f60a","observation_id":"3cd7ed33-9754-4237-a3c0-202be15b27a7","resolution":{"observed_at":"2026-08-16T04:26:33.683003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.664662Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":"a54ceb86-c3d7-43e3-908c-b6dab3c65b21","year":2023},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.831640Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:a3ef633483e875b878be2d4a94ab4c3400ed070caff39e81cf35c43501399c5e","observation_id":"fa9b2a8a-99e5-4572-96a7-4ba46a39fa6e","resolution":{"observed_at":"2026-08-16T04:26:33.669127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.649929Z","title":"Liu, David Harwath, Leonid Karlinsky, Hilde Kuehne, and James R","venue":null,"work_id":"57ed131e-c83f-4e50-ae0e-08bdbf2715be","year":2023},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.835914Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:ebdbcb4174aa800bfece5d1498db99ef2b2d55c29cc72ba487580110aa9deefc","observation_id":"6c0f4c33-db18-466c-aa5d-712e26f1a4f8","resolution":{"observed_at":"2026-08-16T04:26:33.654970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.635465Z","title":"Cross- mae: Cross-modality masked autoencoders for region-aware audio-visual pre-training","venue":null,"work_id":"1d6b0c11-0a66-4e53-9dc8-897dd75ef8b1","year":2024},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.840157Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:fa4d6adcf65b7ef3d03ed0b7be534c0c12250cc135a0076e3a0027fa002343b2","observation_id":"7003157a-d225-473d-adb4-ac16868a791a","resolution":{"observed_at":"2026-08-16T04:26:33.639798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.621889Z","title":"Separating the” chirp” from the” chat”: Self-supervised visual grounding of sound and language","venue":null,"work_id":"54377dea-450e-4b3a-8362-d944453c1f54","year":2024},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.844720Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:0c695ec933fcb3cb82d6f864ef09469ff65c2adde5ae0dd340d9ec608b1088a8","observation_id":"7485129c-84de-4caa-ae10-4b5e257db1a9","resolution":{"observed_at":"2026-08-16T04:26:33.626057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.607110Z","title":"Jointly dis- covering visual objects and spoken words from raw sensory input","venue":null,"work_id":"04a1b8f8-1fe6-44e4-9312-2bb9dd7145d2","year":2018},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.848959Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:0287bae4d0eb242dfa97d580f43a915b93368b493a2250b87d6362b28c66555f","observation_id":"1e006760-16ec-420d-bc6b-b7abd2a55357","resolution":{"observed_at":"2026-08-16T04:26:33.611946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.591848Z","title":"Multi- modal attention for fusion of audio and spatiotemporal fea- tures for video description","venue":null,"work_id":"311e0d38-2f5a-4026-b230-e9661abffa36","year":2018},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.853357Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:b355b51ce977ebb65ae6217ba7b67d509e8d472b20489c1a5465a5eacf99aa5a","observation_id":"78ea52a8-0f76-417b-8399-76e4059b0a34","resolution":{"observed_at":"2026-08-16T04:26:33.596598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.467266Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units","venue":null,"work_id":"084df9bf-1841-4044-a419-ca3654214c79","year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.857551Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:23eb4377c909fb4148327b416219e9d5681223b98475a2711d7e602d50b2a17f","observation_id":"30f027fb-4e56-4c69-b832-00867cb4bbb8","resolution":{"observed_at":"2026-08-16T04:26:33.581567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.452016Z","title":"Mavil: Masked audio-video learners","venue":null,"work_id":"9cd163d7-c426-462e-9c6d-b57578dcf8b4","year":2024},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.862296Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:e2e77f9ca235e228c3d4dacf08d3f11f22405df8af5202a73fcc3a3fb9671910","observation_id":"a20842a8-ea8c-4cea-b304-763c02564db4","resolution":{"observed_at":"2026-08-16T04:26:33.457498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.437256Z","title":"EquiA V: Leveraging Equivari- ance for Audio-Visual Contrastive Learning","venue":null,"work_id":"a52e707f-fd0c-484e-aeef-cd103d75477d","year":2024},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.866833Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:59b7da48cfca133a529105a7ff9f0b082104a1208e58093f8f53516b417968f3","observation_id":"52136e88-5727-4d12-b8b6-e0e58f7aa1f8","resolution":{"observed_at":"2026-08-16T04:26:33.442031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.422444Z","title":"Coopera- tive learning of audio and video models from self-supervised synchronization","venue":null,"work_id":"87dd688c-8f0f-4003-a45b-eafdfee3044f","year":2018},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.871032Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:211f43a48a2fcc723501b84d7e6859a0befbe0bb6f3921a7c5fb7d40aa5e67f8","observation_id":"a6e05e86-f8c8-4a25-98b3-0ccfdbc1768a","resolution":{"observed_at":"2026-08-16T04:26:33.426938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:32.875357Z","title":"Cross-attentional audio-visual fusion for weakly- supervised action localization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.875357Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:9db7438397470ff555aa2b82087ddff262fc0bec29d19216bc33d95612721876","observation_id":"4a87a967-a4e1-4ec5-8d90-9d8ce76aca57","resolution":{"observed_at":"2026-08-16T04:26:32.875357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.398781Z","title":"Siamese vision transform- ers are scalable audio-visual learners","venue":null,"work_id":"377704dc-07fc-43bf-a113-424cb8a0aef1","year":2024},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.879753Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:df269bb66ed33b98af31ad654731e17f94c37f1b0f554df9e26e69f4b4b71416","observation_id":"97cfe34f-ac02-4013-af24-f9410fbd6eeb","resolution":{"observed_at":"2026-08-16T04:26:33.403313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.384361Z","title":"Vision transformers are parameter-efficient audio- visual learners","venue":null,"work_id":"50492a50-0508-4217-b786-04cc7476de10","year":2023},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.883993Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:4b21e59ac587d13eee5bf7e3d3da30a78be6f8cc1e880ef8f2af23a81711a287","observation_id":"19cb27be-d1c7-44cd-bc3d-7b3d14033aa8","resolution":{"observed_at":"2026-08-16T04:26:33.389148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.369401Z","title":"Active contrastive learning of audio-visual video representa- tions","venue":null,"work_id":"2c69de36-dbc8-45d3-9be1-1de656311b38","year":2020},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.888136Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:aea726f2c044ad670543fdaa3cc3b4265d4080c593a9d7edb2145a727553429a","observation_id":"4aa27521-bd89-44d0-8dde-73aff2b7ec49","resolution":{"observed_at":"2026-08-16T04:26:33.374522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.354162Z","title":"Active contrastive learning of audio-visual video representa- tions","venue":null,"work_id":"f64fde47-b9ee-46ae-ba7e-6543a109eb05","year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.892420Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:b2b63b8a1b3da16cd7f93276ca9fd8155b434895bd97662d2ff50ac695fc4c44","observation_id":"c48d9fe1-9393-437e-a92b-2beeafada6ea","resolution":{"observed_at":"2026-08-16T04:26:33.359075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.340747Z","title":"Robust audio-visual instance discrimination","venue":null,"work_id":"b300ec65-1568-4abb-a6ec-08c0e7acb12c","year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.896858Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:6218978b41cd1b77283b93746e78552a2914fad25381daf0b2b9824d9c3f140b","observation_id":"261f2fbd-a995-4dd1-8c0e-d4548bedf6c8","resolution":{"observed_at":"2026-08-16T04:26:33.344760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.327096Z","title":"Audio- visual instance discrimination with cross-modal agreement","venue":null,"work_id":"d74336a8-be40-4992-9a6d-87c1e4008e58","year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.901142Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:619e95831a8f0d38cf228b3c2a884a298c86b700e2ec64b5929d4b3a5feb8594","observation_id":"c4844cf3-ab58-4ec3-88bc-72a32a372b69","resolution":{"observed_at":"2026-08-16T04:26:33.331778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.313052Z","title":"Audio-visual scene analysis with self-supervised multisensory features","venue":null,"work_id":"7b4763e8-3170-4a2b-8dca-588e8e39fa14","year":2018},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.905131Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:944faab01577f70af9de01154084f98faf7800243d285c252df4cdf223b89ca6","observation_id":"ded765ae-f5e6-4a40-aecb-402998a79a28","resolution":{"observed_at":"2026-08-16T04:26:33.317636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.299190Z","title":"Ambient sound provides supervision for visual learning","venue":null,"work_id":"ac4d0ec6-1b4a-4729-a964-d082660c3ff4","year":2016},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.909268Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:dd7e8158e248c58216c8e7901305e63e6f15e683fc082f636610460fc4520951","observation_id":"7e8392aa-f18e-4acf-95a7-682aaddfa66f","resolution":{"observed_at":"2026-08-16T04:26:33.303731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.284431Z","title":"On compositions of transformations in contrastive self-supervised learning","venue":null,"work_id":"63c5e04a-ca6c-46fe-887b-edaa8cf57975","year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.913150Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:c6459d918331b161c8073e748a258b2080639570294d56707524e9822624c699","observation_id":"1c192f66-1479-475c-a088-ee4d811c364f","resolution":{"observed_at":"2026-08-16T04:26:33.289207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.270145Z","title":"Broaden your views for self-supervised video learning","venue":null,"work_id":"097eba0f-9fd4-49f7-b13e-46dc9f8153ea","year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.916743Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:874bf6d14fc9ab3fbacd71b48499083314143918def17623f8823d9aa6a7886f","observation_id":"741a9754-e2dc-4f0f-8cf8-db0f6c36e4ed","resolution":{"observed_at":"2026-08-16T04:26:33.274828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.255561Z","title":"Avlnet: Learning audio-visual language representa- tions from instructional videos","venue":null,"work_id":"9264cceb-cb90-4f3c-89f7-f3d27567d66d","year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.920815Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:3c67d741b34eb172d42e2b9d8d0c75c7534180b201db24677284b11e7d587fb0","observation_id":"6a6e6f64-3bc0-4896-80db-b4cb6659f2fc","resolution":{"observed_at":"2026-08-16T04:26:33.260253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.240601Z","title":"Self-supervised audio- visual representation learning with relaxed cross-modal syn- chronicity","venue":null,"work_id":"471e0536-8d71-4783-aa63-1c0b6515c59b","year":2023},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.925091Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:698392bf976990c6172d2c84c6d096217992de81146bb81a13a985ee1429ec7b","observation_id":"edc60b02-4d74-4097-b79c-e28efaf0a2bf","resolution":{"observed_at":"2026-08-16T04:26:33.245489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.225304Z","title":"Event-specific audio-visual fusion layers: A simple and new perspective on video understanding","venue":null,"work_id":"f779e819-f95a-4b47-8113-d61f82f84ee8","year":2023},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.929279Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:e592ccf5c023e35ab151bf80ab82062c9820b20aa89ed8c8b851df7097b685df","observation_id":"6ff6cfa9-1b25-4b6d-bf08-532115f77f59","resolution":{"observed_at":"2026-08-16T04:26:33.230436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.209735Z","title":"From vision to au- dio and beyond: A unified model for audio-visual representa- tion and generation","venue":null,"work_id":"ec63337d-e824-4903-a233-e40d3b04ea94","year":2024},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.933357Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:1ab7cb431ae1d9c9bcc819cf244ce0fa638852b4d45c9fb48778350cd027b407","observation_id":"e4892cd6-6be3-40fc-ad05-52d2911f5a50","resolution":{"observed_at":"2026-08-16T04:26:33.214522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.194504Z","title":"Learning audio-visual source localization via false negative aware contrastive learning","venue":null,"work_id":"a129b62c-4389-4d57-9236-e7e9522d3a17","year":2023},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.937457Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:395d036c6a3f4e545f428b0955e63a024f710c69cb3a44c30304f3ae40d944e0","observation_id":"047fe13b-cd2f-4c29-82c8-3751fc36d5ed","resolution":{"observed_at":"2026-08-16T04:26:33.199227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12807","last_updated":"2021-04-28T15:59:38Z","snapshot_observed_at":"2026-08-16T18:28:57.432936Z","submitted_at":"2021-04-26T18:07:17Z","title":"Multimodal Self-Supervised Learning of General Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.12807","snapshot_observed_at":"2026-08-16T04:26:32.941470Z","title":"Multimodal self- supervised learning of general audio representations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.941470Z"},"links":{"cited_paper":"/paper/2104.12807","citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:3e3006df82b0d1ed2de240dca8a49ab3e6a1a4b169563eacc41c57a320cd26db","observation_id":"fc5418b9-2d54-4061-b30e-9488c3298d4a","resolution":{"observed_at":"2026-08-16T04:26:32.941470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.180577Z","title":"Temporal cue guided video highlight detection with low-rank audio-visual fusion","venue":null,"work_id":"5f845834-ed03-4d70-aed0-82803153c2ba","year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.946526Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:c697beb5be59ac7aa618339fea8c41285799613c826c87dfbbe853e5279861d9","observation_id":"89288667-2be6-4606-8168-8889985cf1d2","resolution":{"observed_at":"2026-08-16T04:26:33.184876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.166405Z","title":"Con- trastive learning of global and local video representations","venue":null,"work_id":"0793d607-afdb-4f55-97d4-8685fc367b9a","year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.950818Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:3a1dc36563adf593a4dcfa95847a55f9fe5fc9eee306b0ddc550038952da49d5","observation_id":"8620266b-ec0c-4d5e-9ab1-4257529d94c2","resolution":{"observed_at":"2026-08-16T04:26:33.171128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.152347Z","title":"The sound of pixels","venue":null,"work_id":"4bd8c6fa-ceaa-4eaa-9a4f-fd7f59587ad7","year":2018},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.955193Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:c7b303ea75ee7b19d064036deca2dffc3cdd5aadf97d278c8a84e3282b9fa929","observation_id":"a0311b32-5c5d-4fc8-abad-76a0f5d08865","resolution":{"observed_at":"2026-08-16T04:26:33.156494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:32.959437Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.959437Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:50ee4e45c09fa5d91ffb8567d71701ae5fa4a4d6be74a01291c60673e23f0935","observation_id":"aa27f171-004a-4ceb-90f0-7c343d55ca27","resolution":{"observed_at":"2026-08-16T04:26:32.959437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.128788Z","title":"Languagebind: Extending video-language pretraining to n- modality by language-based semantic alignment","venue":null,"work_id":"865a9c6c-d44d-4b76-aff3-773ed1560880","year":2024},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.964120Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:d5f8e15aadd805141659e7f6dcc55c26d5763bd35aff5f5727aa179984ef563b","observation_id":"56ae1a59-bbaf-4163-b650-9a12be9fcba5","resolution":{"observed_at":"2026-08-16T04:26:33.133027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.114908Z","title":null,"venue":null,"work_id":"c90639b6-698c-4b90-b408-b158d13b92d6","year":null},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.968662Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:ffb2755bffd9334dec1ac9909834b2b7ca47d41a8eb9911f95644c105d4b86c2","observation_id":"12498e67-28ca-4db0-b812-1f954bcbcfff","resolution":{"observed_at":"2026-08-16T04:26:33.119294Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.100162Z","title":null,"venue":null,"work_id":"bd0e880e-3f40-4ddb-b1d9-c52a630b8045","year":null},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.973334Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:e8938a9681b21d41e069d8ee44e5d7664f3d47b8d6a343ade8e245c733c87a0c","observation_id":"9bb38671-8523-400e-a3c8-de9b7e29c955","resolution":{"observed_at":"2026-08-16T04:26:33.104530Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.085281Z","title":"di- agonal mean","venue":null,"work_id":"dd34c807-8152-4543-8e59-3d6e55ab5d82","year":null},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.977885Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:473032a807be44dc31915deefeb1b4521dc455549ee6a0ffeab8ca47bc314077","observation_id":"da8d6112-834b-4bc6-9fe2-b732aade6310","resolution":{"observed_at":"2026-08-16T04:26:33.089873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.070645Z","title":"Table 12 shows the performance comparison between register to- kens, patch tokens, and the global token","venue":null,"work_id":"72bba7fb-a983-4c31-80d0-d6431ea44e92","year":null},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.982956Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:0039c4a23e1155d9f7e0d5a1a284e2f4876920ee0424dc473af3cfcf0c62c0d3","observation_id":"dbef4d5f-5e60-45ce-8820-907cc749079f","resolution":{"observed_at":"2026-08-16T04:26:33.075447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.055794Z","title":"writing on blackboard with chalk","venue":null,"work_id":"dfb8cbb0-f65f-40cd-b4b8-47f5ea528a85","year":null},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.987325Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:d1f172d81f557ba3b1cdf1a5ac3db2265299d454a7efa9e992b88ccaa01cfe03","observation_id":"e08250c1-bba3-4508-8115-66e6321d4225","resolution":{"observed_at":"2026-08-16T04:26:33.060343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.038877Z","title":"For this experiment, we manually annotate the occurrence of the classes throughout the video","venue":null,"work_id":"2aa12c89-9d9c-4809-b7ef-16a5f29faee2","year":null},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.991891Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:6ba9000a36c4ff65a0a2bffaa89a2917be0f1a58212abbfd7d5dd7f4efa696c2","observation_id":"521aa4e2-2093-47a7-aa0d-aa4e7c0f997c","resolution":{"observed_at":"2026-08-16T04:26:33.045181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","latest_version":2,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":43},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2505.01237."}