{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:C4SNRRIU42D3UMIOCMFYU3CTOU","short_pith_number":"pith:C4SNRRIU","schema_version":"1.0","canonical_sha256":"1724d8c514e687ba310e130b8a6c53752779cb6013fb4f6ed0f29c625d74dfee","source":{"kind":"arxiv","id":"2507.20880","version":1},"attestation_state":"computed","paper":{"title":"JAM: A Tiny Flow-based Song Generator with Fine-grained Controllability and Aesthetic Alignment","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.SD","authors_text":"Amir Ali Bagherzadeh, Chia-Yu Hung, Chuan Li, Dorien Herremans, Navonil Majumder, Renhang Liu, Soujanya Poria, Taylor Gautreaux","submitted_at":"2025-07-28T14:34:02Z","abstract_excerpt":"Diffusion and flow-matching models have revolutionized automatic text-to-audio generation in recent times. These models are increasingly capable of generating high quality and faithful audio outputs capturing to speech and acoustic events. However, there is still much room for improvement in creative audio generation that primarily involves music and songs. Recent open lyrics-to-song models, such as, DiffRhythm, ACE-Step, and LeVo, have set an acceptable standard in automatic song generation for recreational use. However, these models lack fine-grained word-level controllability often desired "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2507.20880","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-sa/4.0/","primary_cat":"cs.SD","submitted_at":"2025-07-28T14:34:02Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"386782c8d9befaa5d2b3d50c22f80dd61d0724b4ae90f26643000870aa4e062a","abstract_canon_sha256":"86e8704269a7a3b5286130e836563a89a4357ee532a0015891d35579355eb25c"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:44:27.461667Z","signature_b64":"mq/U5WLtIpEdRJF9DXyHIotO/5YGx7fZpEtQBYEQvUCE7TyfynZQ4zE0C6DkpJixnsWKvXQbjMjOjP91JwPxCA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"1724d8c514e687ba310e130b8a6c53752779cb6013fb4f6ed0f29c625d74dfee","last_reissued_at":"2026-07-05T11:44:27.461157Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:44:27.461157Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"JAM: A Tiny Flow-based Song Generator with Fine-grained Controllability and Aesthetic Alignment","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.SD","authors_text":"Amir Ali Bagherzadeh, Chia-Yu Hung, Chuan Li, Dorien Herremans, Navonil Majumder, Renhang Liu, Soujanya Poria, Taylor Gautreaux","submitted_at":"2025-07-28T14:34:02Z","abstract_excerpt":"Diffusion and flow-matching models have revolutionized automatic text-to-audio generation in recent times. These models are increasingly capable of generating high quality and faithful audio outputs capturing to speech and acoustic events. However, there is still much room for improvement in creative audio generation that primarily involves music and songs. Recent open lyrics-to-song models, such as, DiffRhythm, ACE-Step, and LeVo, have set an acceptable standard in automatic song generation for recreational use. However, these models lack fine-grained word-level controllability often desired "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2507.20880","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2507.20880/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2507.20880","created_at":"2026-07-05T11:44:27.461232+00:00"},{"alias_kind":"arxiv_version","alias_value":"2507.20880v1","created_at":"2026-07-05T11:44:27.461232+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2507.20880","created_at":"2026-07-05T11:44:27.461232+00:00"},{"alias_kind":"pith_short_12","alias_value":"C4SNRRIU42D3","created_at":"2026-07-05T11:44:27.461232+00:00"},{"alias_kind":"pith_short_16","alias_value":"C4SNRRIU42D3UMIO","created_at":"2026-07-05T11:44:27.461232+00:00"},{"alias_kind":"pith_short_8","alias_value":"C4SNRRIU","created_at":"2026-07-05T11:44:27.461232+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.29202","citing_title":"Auditing Training Data in Generative Music Models via Black-Box Membership Inference","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2602.22029","citing_title":"MIDI-Informed Singing Accompaniment Generation in a Compositional Song Pipeline","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2604.11052","citing_title":"LaDA-Band: Language Diffusion Models for Vocal-to-Accompaniment Generation","ref_index":33,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/C4SNRRIU42D3UMIOCMFYU3CTOU","json":"https://pith.science/pith/C4SNRRIU42D3UMIOCMFYU3CTOU.json","graph_json":"https://pith.science/api/pith-number/C4SNRRIU42D3UMIOCMFYU3CTOU/graph.json","events_json":"https://pith.science/api/pith-number/C4SNRRIU42D3UMIOCMFYU3CTOU/events.json","paper":"https://pith.science/paper/C4SNRRIU"},"agent_actions":{"view_html":"https://pith.science/pith/C4SNRRIU42D3UMIOCMFYU3CTOU","download_json":"https://pith.science/pith/C4SNRRIU42D3UMIOCMFYU3CTOU.json","view_paper":"https://pith.science/paper/C4SNRRIU","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2507.20880&json=true","fetch_graph":"https://pith.science/api/pith-number/C4SNRRIU42D3UMIOCMFYU3CTOU/graph.json","fetch_events":"https://pith.science/api/pith-number/C4SNRRIU42D3UMIOCMFYU3CTOU/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/C4SNRRIU42D3UMIOCMFYU3CTOU/action/timestamp_anchor","attest_storage":"https://pith.science/pith/C4SNRRIU42D3UMIOCMFYU3CTOU/action/storage_attestation","attest_author":"https://pith.science/pith/C4SNRRIU42D3UMIOCMFYU3CTOU/action/author_attestation","sign_citation":"https://pith.science/pith/C4SNRRIU42D3UMIOCMFYU3CTOU/action/citation_signature","submit_replication":"https://pith.science/pith/C4SNRRIU42D3UMIOCMFYU3CTOU/action/replication_record"}},"created_at":"2026-07-05T11:44:27.461232+00:00","updated_at":"2026-07-05T11:44:27.461232+00:00"}