{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:L5M4WN4UDROQYRJLT55HCZO6AW","short_pith_number":"pith:L5M4WN4U","schema_version":"1.0","canonical_sha256":"5f59cb37941c5d0c452b9f7a7165de05979afc2a95102c8994649b47d790bddd","source":{"kind":"arxiv","id":"2406.19388","version":4},"attestation_state":"computed","paper":{"title":"Taming Data and Transformers for Audio Generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","cs.CV","cs.MM","eess.AS"],"primary_cat":"cs.SD","authors_text":"Aliaksandr Siarohin, Guha Balakrishnan, Moayed Haji-Ali, Vicente Ordonez, Willi Menapace","submitted_at":"2024-06-27T17:58:54Z","abstract_excerpt":"The scalability of ambient sound generators is hindered by data scarcity, insufficient caption quality, and limited scalability in model architecture. This work addresses these challenges by advancing both data and model scaling. First, we propose an efficient and scalable dataset collection pipeline tailored for ambient audio generation, resulting in AutoReCap-XL, the largest ambient audio-text dataset with over 47 million clips. To provide high-quality textual annotations, we propose AutoCap, a high-quality automatic audio captioning model. By adopting a Q-Former module and leveraging audio "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2406.19388","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.SD","submitted_at":"2024-06-27T17:58:54Z","cross_cats_sorted":["cs.CL","cs.CV","cs.MM","eess.AS"],"title_canon_sha256":"aaba8cf1e1a02630649ebcfe162fa2f6ff6e2e98af9f87852042ed0023e85889","abstract_canon_sha256":"1c59bbee0ea49fcef60afa6c82de3bb78cbce5402a8751ebd58238a731b8df85"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:49:45.171105Z","signature_b64":"EOvzunNs38vinKix0wkNDRHKUmwDNA16ltlFf07KYGmQ+Ohwk6DKOiHZsj09S1Z7K665ikt3hj2mucrejl/aCQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"5f59cb37941c5d0c452b9f7a7165de05979afc2a95102c8994649b47d790bddd","last_reissued_at":"2026-07-05T10:49:45.170684Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:49:45.170684Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Taming Data and Transformers for Audio Generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","cs.CV","cs.MM","eess.AS"],"primary_cat":"cs.SD","authors_text":"Aliaksandr Siarohin, Guha Balakrishnan, Moayed Haji-Ali, Vicente Ordonez, Willi Menapace","submitted_at":"2024-06-27T17:58:54Z","abstract_excerpt":"The scalability of ambient sound generators is hindered by data scarcity, insufficient caption quality, and limited scalability in model architecture. This work addresses these challenges by advancing both data and model scaling. First, we propose an efficient and scalable dataset collection pipeline tailored for ambient audio generation, resulting in AutoReCap-XL, the largest ambient audio-text dataset with over 47 million clips. To provide high-quality textual annotations, we propose AutoCap, a high-quality automatic audio captioning model. By adopting a Q-Former module and leveraging audio "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2406.19388","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2406.19388/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2406.19388","created_at":"2026-07-05T10:49:45.170744+00:00"},{"alias_kind":"arxiv_version","alias_value":"2406.19388v4","created_at":"2026-07-05T10:49:45.170744+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2406.19388","created_at":"2026-07-05T10:49:45.170744+00:00"},{"alias_kind":"pith_short_12","alias_value":"L5M4WN4UDROQ","created_at":"2026-07-05T10:49:45.170744+00:00"},{"alias_kind":"pith_short_16","alias_value":"L5M4WN4UDROQYRJL","created_at":"2026-07-05T10:49:45.170744+00:00"},{"alias_kind":"pith_short_8","alias_value":"L5M4WN4U","created_at":"2026-07-05T10:49:45.170744+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.05196","citing_title":"Unified Audio Intelligence Without Regressing on Text Intelligence","ref_index":68,"is_internal_anchor":true},{"citing_arxiv_id":"2605.31530","citing_title":"UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion","ref_index":70,"is_internal_anchor":false},{"citing_arxiv_id":"2412.03603","citing_title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2510.01284","citing_title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2601.02731","citing_title":"Omni2Sound: Towards Unified Video-Text-to-Audio Generation","ref_index":54,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/L5M4WN4UDROQYRJLT55HCZO6AW","json":"https://pith.science/pith/L5M4WN4UDROQYRJLT55HCZO6AW.json","graph_json":"https://pith.science/api/pith-number/L5M4WN4UDROQYRJLT55HCZO6AW/graph.json","events_json":"https://pith.science/api/pith-number/L5M4WN4UDROQYRJLT55HCZO6AW/events.json","paper":"https://pith.science/paper/L5M4WN4U"},"agent_actions":{"view_html":"https://pith.science/pith/L5M4WN4UDROQYRJLT55HCZO6AW","download_json":"https://pith.science/pith/L5M4WN4UDROQYRJLT55HCZO6AW.json","view_paper":"https://pith.science/paper/L5M4WN4U","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2406.19388&json=true","fetch_graph":"https://pith.science/api/pith-number/L5M4WN4UDROQYRJLT55HCZO6AW/graph.json","fetch_events":"https://pith.science/api/pith-number/L5M4WN4UDROQYRJLT55HCZO6AW/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/L5M4WN4UDROQYRJLT55HCZO6AW/action/timestamp_anchor","attest_storage":"https://pith.science/pith/L5M4WN4UDROQYRJLT55HCZO6AW/action/storage_attestation","attest_author":"https://pith.science/pith/L5M4WN4UDROQYRJLT55HCZO6AW/action/author_attestation","sign_citation":"https://pith.science/pith/L5M4WN4UDROQYRJLT55HCZO6AW/action/citation_signature","submit_replication":"https://pith.science/pith/L5M4WN4UDROQYRJLT55HCZO6AW/action/replication_record"}},"created_at":"2026-07-05T10:49:45.170744+00:00","updated_at":"2026-07-05T10:49:45.170744+00:00"}