{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:YNQB3XH5CNYUNDFOV5LZ4TWBWB","short_pith_number":"pith:YNQB3XH5","schema_version":"1.0","canonical_sha256":"c3601ddcfd1371468caeaf579e4ec1b04eefcf6446be85663a293a7781e62a3b","source":{"kind":"arxiv","id":"2212.05922","version":3},"attestation_state":"computed","paper":{"title":"Audiovisual Masked Autoencoders","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.SD"],"primary_cat":"cs.CV","authors_text":"Anurag Arnab, Cordelia Schmid, Eduardo Fonseca, Mariana-Iuliana Georgescu, Mario Lucic, Radu Tudor Ionescu","submitted_at":"2022-12-09T17:34:53Z","abstract_excerpt":"Can we leverage the audiovisual information already present in video to improve self-supervised representation learning? To answer this question, we study various pretraining architectures and objectives within the masked autoencoding framework, motivated by the success of similar methods in natural language and image understanding. We show that we can achieve significant improvements on audiovisual downstream classification tasks, surpassing the state-of-the-art on VGGSound and AudioSet. Furthermore, we can leverage our audiovisual pretraining scheme for multiple unimodal downstream tasks usi"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2212.05922","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2022-12-09T17:34:53Z","cross_cats_sorted":["cs.SD"],"title_canon_sha256":"ebfd99a053e7e8f19b58c7b8f59b25b4ef20252421bca53aa03f5a9eeefebdec","abstract_canon_sha256":"2fc069fdcb791821b7344aae70ee99711c7297402011c12681742d7693a2b454"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:30:01.149861Z","signature_b64":"B6L92K1HYdNCh5Gpd+ndlxUHe9nCVwow8FiJ2uTzIM/1WNvAfehnvftD7iBFSsJ9kNehwkfvcwBg4/m4zWjvBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c3601ddcfd1371468caeaf579e4ec1b04eefcf6446be85663a293a7781e62a3b","last_reissued_at":"2026-07-05T07:30:01.149361Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:30:01.149361Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Audiovisual Masked Autoencoders","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.SD"],"primary_cat":"cs.CV","authors_text":"Anurag Arnab, Cordelia Schmid, Eduardo Fonseca, Mariana-Iuliana Georgescu, Mario Lucic, Radu Tudor Ionescu","submitted_at":"2022-12-09T17:34:53Z","abstract_excerpt":"Can we leverage the audiovisual information already present in video to improve self-supervised representation learning? To answer this question, we study various pretraining architectures and objectives within the masked autoencoding framework, motivated by the success of similar methods in natural language and image understanding. We show that we can achieve significant improvements on audiovisual downstream classification tasks, surpassing the state-of-the-art on VGGSound and AudioSet. Furthermore, we can leverage our audiovisual pretraining scheme for multiple unimodal downstream tasks usi"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2212.05922","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2212.05922/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2212.05922","created_at":"2026-07-05T07:30:01.149418+00:00"},{"alias_kind":"arxiv_version","alias_value":"2212.05922v3","created_at":"2026-07-05T07:30:01.149418+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2212.05922","created_at":"2026-07-05T07:30:01.149418+00:00"},{"alias_kind":"pith_short_12","alias_value":"YNQB3XH5CNYU","created_at":"2026-07-05T07:30:01.149418+00:00"},{"alias_kind":"pith_short_16","alias_value":"YNQB3XH5CNYUNDFO","created_at":"2026-07-05T07:30:01.149418+00:00"},{"alias_kind":"pith_short_8","alias_value":"YNQB3XH5","created_at":"2026-07-05T07:30:01.149418+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2512.12165","citing_title":"Audio-Visual Camera Pose Estimation with Passive Scene Sounds and In-the-Wild Video","ref_index":18,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/YNQB3XH5CNYUNDFOV5LZ4TWBWB","json":"https://pith.science/pith/YNQB3XH5CNYUNDFOV5LZ4TWBWB.json","graph_json":"https://pith.science/api/pith-number/YNQB3XH5CNYUNDFOV5LZ4TWBWB/graph.json","events_json":"https://pith.science/api/pith-number/YNQB3XH5CNYUNDFOV5LZ4TWBWB/events.json","paper":"https://pith.science/paper/YNQB3XH5"},"agent_actions":{"view_html":"https://pith.science/pith/YNQB3XH5CNYUNDFOV5LZ4TWBWB","download_json":"https://pith.science/pith/YNQB3XH5CNYUNDFOV5LZ4TWBWB.json","view_paper":"https://pith.science/paper/YNQB3XH5","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2212.05922&json=true","fetch_graph":"https://pith.science/api/pith-number/YNQB3XH5CNYUNDFOV5LZ4TWBWB/graph.json","fetch_events":"https://pith.science/api/pith-number/YNQB3XH5CNYUNDFOV5LZ4TWBWB/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/YNQB3XH5CNYUNDFOV5LZ4TWBWB/action/timestamp_anchor","attest_storage":"https://pith.science/pith/YNQB3XH5CNYUNDFOV5LZ4TWBWB/action/storage_attestation","attest_author":"https://pith.science/pith/YNQB3XH5CNYUNDFOV5LZ4TWBWB/action/author_attestation","sign_citation":"https://pith.science/pith/YNQB3XH5CNYUNDFOV5LZ4TWBWB/action/citation_signature","submit_replication":"https://pith.science/pith/YNQB3XH5CNYUNDFOV5LZ4TWBWB/action/replication_record"}},"created_at":"2026-07-05T07:30:01.149418+00:00","updated_at":"2026-07-05T07:30:01.149418+00:00"}