{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:TIL7K5XGKKDQAH7AJTTCUCHBMI","short_pith_number":"pith:TIL7K5XG","schema_version":"1.0","canonical_sha256":"9a17f576e65287001fe04ce62a08e16218d1c155bc944fe23d8cc51f4a2af954","source":{"kind":"arxiv","id":"2206.04769","version":1},"attestation_state":"computed","paper":{"title":"CLAP: Learning Audio Concepts From Natural Language Supervision","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["eess.AS"],"primary_cat":"cs.SD","authors_text":"Benjamin Elizalde, Huaming Wang, Mahmoud Al Ismail, Soham Deshmukh","submitted_at":"2022-06-09T21:16:10Z","abstract_excerpt":"Mainstream Audio Analytics models are trained to learn under the paradigm of one class label to many recordings focusing on one task. Learning under such restricted supervision limits the flexibility of models because they require labeled audio for training and can only predict the predefined categories. Instead, we propose to learn audio concepts from natural language supervision. We call our approach Contrastive Language-Audio Pretraining (CLAP), which learns to connect language and audio by using two encoders and a contrastive learning to bring audio and text descriptions into a joint multi"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2206.04769","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.SD","submitted_at":"2022-06-09T21:16:10Z","cross_cats_sorted":["eess.AS"],"title_canon_sha256":"6d478dca32369bdde87f6d1e4e9fcd999452b2db857fc986c1146ccffec5f90a","abstract_canon_sha256":"e5be2b2e81f9c8e900aa00ac746e1bae73bdca3c61246bd5cb455f005458240f"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T04:30:43.844490Z","signature_b64":"OJFvWJg2wc8NddDTWywutpj+M1dlTnJrawbDpeyyXLXX2ADhBYlFqVQp0uKb4e0EYpvmTHviXPD268ZT+2FDCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"9a17f576e65287001fe04ce62a08e16218d1c155bc944fe23d8cc51f4a2af954","last_reissued_at":"2026-07-05T04:30:43.844080Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T04:30:43.844080Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"CLAP: Learning Audio Concepts From Natural Language Supervision","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["eess.AS"],"primary_cat":"cs.SD","authors_text":"Benjamin Elizalde, Huaming Wang, Mahmoud Al Ismail, Soham Deshmukh","submitted_at":"2022-06-09T21:16:10Z","abstract_excerpt":"Mainstream Audio Analytics models are trained to learn under the paradigm of one class label to many recordings focusing on one task. Learning under such restricted supervision limits the flexibility of models because they require labeled audio for training and can only predict the predefined categories. Instead, we propose to learn audio concepts from natural language supervision. We call our approach Contrastive Language-Audio Pretraining (CLAP), which learns to connect language and audio by using two encoders and a contrastive learning to bring audio and text descriptions into a joint multi"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2206.04769","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2206.04769/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2206.04769","created_at":"2026-07-05T04:30:43.844135+00:00"},{"alias_kind":"arxiv_version","alias_value":"2206.04769v1","created_at":"2026-07-05T04:30:43.844135+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2206.04769","created_at":"2026-07-05T04:30:43.844135+00:00"},{"alias_kind":"pith_short_12","alias_value":"TIL7K5XGKKDQ","created_at":"2026-07-05T04:30:43.844135+00:00"},{"alias_kind":"pith_short_16","alias_value":"TIL7K5XGKKDQAH7A","created_at":"2026-07-05T04:30:43.844135+00:00"},{"alias_kind":"pith_short_8","alias_value":"TIL7K5XG","created_at":"2026-07-05T04:30:43.844135+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":11,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2607.01238","citing_title":"SPARCLE: SPeaker-aware Aligned Representations via Contrastive Language Embeddings","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2606.05812","citing_title":"FORTE: FOL-guided Optimal Refinement for Text-audio rEtrieval","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2607.00726","citing_title":"AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2606.11219","citing_title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","ref_index":76,"is_internal_anchor":false},{"citing_arxiv_id":"2605.29765","citing_title":"MMTM: Tri-Modal Topic Modeling for Long-Form Video via Similarity-Gated Fusion","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2512.23994","citing_title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2512.23994","citing_title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2602.12783","citing_title":"SQuTR: A Robustness Benchmark for Spoken Query to Text Retrieval under Acoustic Noise","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2604.01929","citing_title":"Woosh: A Sound Effects Foundation Model","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2311.07919","citing_title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2407.10759","citing_title":"Qwen2-Audio Technical Report","ref_index":11,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/TIL7K5XGKKDQAH7AJTTCUCHBMI","json":"https://pith.science/pith/TIL7K5XGKKDQAH7AJTTCUCHBMI.json","graph_json":"https://pith.science/api/pith-number/TIL7K5XGKKDQAH7AJTTCUCHBMI/graph.json","events_json":"https://pith.science/api/pith-number/TIL7K5XGKKDQAH7AJTTCUCHBMI/events.json","paper":"https://pith.science/paper/TIL7K5XG"},"agent_actions":{"view_html":"https://pith.science/pith/TIL7K5XGKKDQAH7AJTTCUCHBMI","download_json":"https://pith.science/pith/TIL7K5XGKKDQAH7AJTTCUCHBMI.json","view_paper":"https://pith.science/paper/TIL7K5XG","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2206.04769&json=true","fetch_graph":"https://pith.science/api/pith-number/TIL7K5XGKKDQAH7AJTTCUCHBMI/graph.json","fetch_events":"https://pith.science/api/pith-number/TIL7K5XGKKDQAH7AJTTCUCHBMI/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/TIL7K5XGKKDQAH7AJTTCUCHBMI/action/timestamp_anchor","attest_storage":"https://pith.science/pith/TIL7K5XGKKDQAH7AJTTCUCHBMI/action/storage_attestation","attest_author":"https://pith.science/pith/TIL7K5XGKKDQAH7AJTTCUCHBMI/action/author_attestation","sign_citation":"https://pith.science/pith/TIL7K5XGKKDQAH7AJTTCUCHBMI/action/citation_signature","submit_replication":"https://pith.science/pith/TIL7K5XGKKDQAH7AJTTCUCHBMI/action/replication_record"}},"created_at":"2026-07-05T04:30:43.844135+00:00","updated_at":"2026-07-05T04:30:43.844135+00:00"}