{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2020:YXSBLSQGAPN3AT2YHNDCZTFTXS","short_pith_number":"pith:YXSBLSQG","schema_version":"1.0","canonical_sha256":"c5e415ca0603dbb04f583b462cccb3bc8fd14815614098426257620299f9a480","source":{"kind":"arxiv","id":"2001.08740","version":2},"attestation_state":"computed","paper":{"title":"Audiovisual SlowFast Networks for Video Recognition","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Christoph Feichtenhofer, Fanyi Xiao, Jitendra Malik, Kristen Grauman, Yong Jae Lee","submitted_at":"2020-01-23T18:59:46Z","abstract_excerpt":"We present Audiovisual SlowFast Networks, an architecture for integrated audiovisual perception. AVSlowFast has Slow and Fast visual pathways that are deeply integrated with a Faster Audio pathway to model vision and sound in a unified representation. We fuse audio and visual features at multiple layers, enabling audio to contribute to the formation of hierarchical audiovisual concepts. To overcome training difficulties that arise from different learning dynamics for audio and visual modalities, we introduce DropPathway, which randomly drops the Audio pathway during training as an effective re"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2001.08740","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2020-01-23T18:59:46Z","cross_cats_sorted":[],"title_canon_sha256":"a597159823ce175c825cc20f2b945633f32072046300ddbd81c948ca1ceb5e73","abstract_canon_sha256":"f69744e09730081d9a5c76ecb21b53693019823f2a4c9291f7c11e0ff0b1b3fc"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T00:46:34.798096Z","signature_b64":"XGXt/9uKGYVxuNMSBQceATx/0PicRqDneVmoEO0o1OWhof7yokj43XKTz+96Q382M8nWbKbo4LIT7UntvBVCAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c5e415ca0603dbb04f583b462cccb3bc8fd14815614098426257620299f9a480","last_reissued_at":"2026-07-05T00:46:34.797696Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T00:46:34.797696Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Audiovisual SlowFast Networks for Video Recognition","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Christoph Feichtenhofer, Fanyi Xiao, Jitendra Malik, Kristen Grauman, Yong Jae Lee","submitted_at":"2020-01-23T18:59:46Z","abstract_excerpt":"We present Audiovisual SlowFast Networks, an architecture for integrated audiovisual perception. AVSlowFast has Slow and Fast visual pathways that are deeply integrated with a Faster Audio pathway to model vision and sound in a unified representation. We fuse audio and visual features at multiple layers, enabling audio to contribute to the formation of hierarchical audiovisual concepts. To overcome training difficulties that arise from different learning dynamics for audio and visual modalities, we introduce DropPathway, which randomly drops the Audio pathway during training as an effective re"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2001.08740","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2001.08740/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2001.08740","created_at":"2026-07-05T00:46:34.797754+00:00"},{"alias_kind":"arxiv_version","alias_value":"2001.08740v2","created_at":"2026-07-05T00:46:34.797754+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2001.08740","created_at":"2026-07-05T00:46:34.797754+00:00"},{"alias_kind":"pith_short_12","alias_value":"YXSBLSQGAPN3","created_at":"2026-07-05T00:46:34.797754+00:00"},{"alias_kind":"pith_short_16","alias_value":"YXSBLSQGAPN3AT2Y","created_at":"2026-07-05T00:46:34.797754+00:00"},{"alias_kind":"pith_short_8","alias_value":"YXSBLSQG","created_at":"2026-07-05T00:46:34.797754+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.11602","citing_title":"On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2606.09853","citing_title":"SynIB: Informational Bottleneck for Maximizing Synergy in Multimodal Learning","ref_index":93,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20838","citing_title":"USV: Towards Understanding the User-generated Short-form Videos","ref_index":73,"is_internal_anchor":false},{"citing_arxiv_id":"2604.03329","citing_title":"AViS-Mamba: Adaptive Visual Steering of Audio State-Space Dynamics for Violence Detection","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12021","citing_title":"What-Where Transformer: A Slot-Centric Visual Backbone for Concurrent Representation and Localization","ref_index":78,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/YXSBLSQGAPN3AT2YHNDCZTFTXS","json":"https://pith.science/pith/YXSBLSQGAPN3AT2YHNDCZTFTXS.json","graph_json":"https://pith.science/api/pith-number/YXSBLSQGAPN3AT2YHNDCZTFTXS/graph.json","events_json":"https://pith.science/api/pith-number/YXSBLSQGAPN3AT2YHNDCZTFTXS/events.json","paper":"https://pith.science/paper/YXSBLSQG"},"agent_actions":{"view_html":"https://pith.science/pith/YXSBLSQGAPN3AT2YHNDCZTFTXS","download_json":"https://pith.science/pith/YXSBLSQGAPN3AT2YHNDCZTFTXS.json","view_paper":"https://pith.science/paper/YXSBLSQG","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2001.08740&json=true","fetch_graph":"https://pith.science/api/pith-number/YXSBLSQGAPN3AT2YHNDCZTFTXS/graph.json","fetch_events":"https://pith.science/api/pith-number/YXSBLSQGAPN3AT2YHNDCZTFTXS/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/YXSBLSQGAPN3AT2YHNDCZTFTXS/action/timestamp_anchor","attest_storage":"https://pith.science/pith/YXSBLSQGAPN3AT2YHNDCZTFTXS/action/storage_attestation","attest_author":"https://pith.science/pith/YXSBLSQGAPN3AT2YHNDCZTFTXS/action/author_attestation","sign_citation":"https://pith.science/pith/YXSBLSQGAPN3AT2YHNDCZTFTXS/action/citation_signature","submit_replication":"https://pith.science/pith/YXSBLSQGAPN3AT2YHNDCZTFTXS/action/replication_record"}},"created_at":"2026-07-05T00:46:34.797754+00:00","updated_at":"2026-07-05T00:46:34.797754+00:00"}