{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2019:CRSLTK5AW2MGNXR2DMZ4P2FT54","short_pith_number":"pith:CRSLTK5A","schema_version":"1.0","canonical_sha256":"1464b9aba0b69866de3a1b33c7e8b3ef3a7464238a28183ee08f8763896cec7e","source":{"kind":"arxiv","id":"1909.03522","version":1},"attestation_state":"computed","paper":{"title":"MIDI-Sandwich2: RNN-based Hierarchical Multi-modal Fusion Generation VAE networks for multi-track symbolic music generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.SD","eess.AS"],"primary_cat":"cs.LG","authors_text":"Jing Cao, Junmin Wu, Xia Liang","submitted_at":"2019-09-08T17:55:16Z","abstract_excerpt":"Currently, almost all the multi-track music generation models use the Convolutional Neural Network (CNN) to build the generative model, while the Recurrent Neural Network (RNN) based models can not be applied in this task. In view of the above problem, this paper proposes a RNN-based Hierarchical Multi-modal Fusion Generation Variational Autoencoder (VAE) network, MIDI-Sandwich2, for multi-track symbolic music generation. Inspired by VQ-VAE2, MIDI-Sandwich2 expands the dimension of the original hierarchical model by using multiple independent Binary Variational Autoencoder (BVAE) models withou"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"1909.03522","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-09-08T17:55:16Z","cross_cats_sorted":["cs.SD","eess.AS"],"title_canon_sha256":"bb00ac9b8709d161eb50757cdd8046b8d8e63f75ebb9bb41dde990133d44a6c7","abstract_canon_sha256":"c285a35daae53760f3c3764cd32660d850cb7d481546371abe589726cc40a8c3"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T00:03:06.445325Z","signature_b64":"syMahjkBArRmA1s/uW+Y8NOO4wov3Va+1penEJHQc3vt/KGtIVE7d8N76TxdWhn+VbfoBusdWsTTO/HVmCIGCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"1464b9aba0b69866de3a1b33c7e8b3ef3a7464238a28183ee08f8763896cec7e","last_reissued_at":"2026-07-05T00:03:06.444873Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T00:03:06.444873Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"MIDI-Sandwich2: RNN-based Hierarchical Multi-modal Fusion Generation VAE networks for multi-track symbolic music generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.SD","eess.AS"],"primary_cat":"cs.LG","authors_text":"Jing Cao, Junmin Wu, Xia Liang","submitted_at":"2019-09-08T17:55:16Z","abstract_excerpt":"Currently, almost all the multi-track music generation models use the Convolutional Neural Network (CNN) to build the generative model, while the Recurrent Neural Network (RNN) based models can not be applied in this task. In view of the above problem, this paper proposes a RNN-based Hierarchical Multi-modal Fusion Generation Variational Autoencoder (VAE) network, MIDI-Sandwich2, for multi-track symbolic music generation. Inspired by VQ-VAE2, MIDI-Sandwich2 expands the dimension of the original hierarchical model by using multiple independent Binary Variational Autoencoder (BVAE) models withou"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"1909.03522","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/1909.03522/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"1909.03522","created_at":"2026-07-05T00:03:06.444930+00:00"},{"alias_kind":"arxiv_version","alias_value":"1909.03522v1","created_at":"2026-07-05T00:03:06.444930+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.1909.03522","created_at":"2026-07-05T00:03:06.444930+00:00"},{"alias_kind":"pith_short_12","alias_value":"CRSLTK5AW2MG","created_at":"2026-07-05T00:03:06.444930+00:00"},{"alias_kind":"pith_short_16","alias_value":"CRSLTK5AW2MGNXR2","created_at":"2026-07-05T00:03:06.444930+00:00"},{"alias_kind":"pith_short_8","alias_value":"CRSLTK5A","created_at":"2026-07-05T00:03:06.444930+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2509.00914","citing_title":"TinyMusician: On-Device Music Generation with Knowledge Distillation and Mixed Precision Quantization","ref_index":19,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/CRSLTK5AW2MGNXR2DMZ4P2FT54","json":"https://pith.science/pith/CRSLTK5AW2MGNXR2DMZ4P2FT54.json","graph_json":"https://pith.science/api/pith-number/CRSLTK5AW2MGNXR2DMZ4P2FT54/graph.json","events_json":"https://pith.science/api/pith-number/CRSLTK5AW2MGNXR2DMZ4P2FT54/events.json","paper":"https://pith.science/paper/CRSLTK5A"},"agent_actions":{"view_html":"https://pith.science/pith/CRSLTK5AW2MGNXR2DMZ4P2FT54","download_json":"https://pith.science/pith/CRSLTK5AW2MGNXR2DMZ4P2FT54.json","view_paper":"https://pith.science/paper/CRSLTK5A","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=1909.03522&json=true","fetch_graph":"https://pith.science/api/pith-number/CRSLTK5AW2MGNXR2DMZ4P2FT54/graph.json","fetch_events":"https://pith.science/api/pith-number/CRSLTK5AW2MGNXR2DMZ4P2FT54/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/CRSLTK5AW2MGNXR2DMZ4P2FT54/action/timestamp_anchor","attest_storage":"https://pith.science/pith/CRSLTK5AW2MGNXR2DMZ4P2FT54/action/storage_attestation","attest_author":"https://pith.science/pith/CRSLTK5AW2MGNXR2DMZ4P2FT54/action/author_attestation","sign_citation":"https://pith.science/pith/CRSLTK5AW2MGNXR2DMZ4P2FT54/action/citation_signature","submit_replication":"https://pith.science/pith/CRSLTK5AW2MGNXR2DMZ4P2FT54/action/replication_record"}},"created_at":"2026-07-05T00:03:06.444930+00:00","updated_at":"2026-07-05T00:03:06.444930+00:00"}