{"as_of":"2026-08-07T06:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4f1874f8998aa8e08ca38cd34e6d2e05bdd05219fed99e71fa7df001fb01baea","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T05:32:33.761298Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T12:18:17.950810Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T20:07:21.617859Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"cited_work":{"arxiv_id":"2509.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.05256","snapshot_observed_at":"2026-07-02T20:07:21.617859Z","title":"Recomposer: Event-roll-guided generative audio editing","venue":null,"work_id":"d2046684-1e81-4f75-8447-ef12a90871a4","year":2025},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"cited_paper":"/paper/2509.05256","citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:cdb649566743d599d45aff0dd57babb5dce9411909cf3d1f6415c866ed34a635","observation_id":"e49812c5-c163-4796-881b-ab1cb714c36c","resolution":{"observed_at":"2026-07-02T20:07:21.619554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.05256","snapshot_observed_at":"2026-08-01T12:18:17.950810Z","title":"Recomposer: Event-roll- guided generative audio editing.arXiv preprint arXiv:2509.05256, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19605","last_updated":"2026-07-23T11:52:28Z","snapshot_observed_at":"2026-08-06T22:41:38.018163Z","submitted_at":"2026-07-21T22:12:12Z","title":"RIME: Enabling Large-Scale Agentic Music Post-Production","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T12:18:17.950810Z"},"links":{"cited_paper":"/paper/2509.05256","citing_paper":"/paper/2607.19605"},"observation_digest":"sha256:0c9a5941386aeec2f2a658e2ff3583c52f2f88b77cbc3ce391d7828d96eda112","observation_id":"fc55a138-3b0f-493b-8f2f-56f192e94180","resolution":{"observed_at":"2026-08-01T12:18:17.950810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.05256/citation-record","integrity":"/paper/2509.05256/integrity","json":"/paper/2509.05256/citation-record.json","paper":"/paper/2509.05256"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.276213Z","title":"Listen, think, and understand,","venue":null,"work_id":"dca14b78-f3ca-447c-94db-390d55794594","year":2024},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.616656Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:1439776519807de91fc70c329ac7949b6f1e50ab6b4107cf3b709d5d0120781e","observation_id":"a42aa3a9-7821-4b24-a49b-4d6281f28b9c","resolution":{"observed_at":"2026-08-05T05:32:34.280732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.262068Z","title":"Text-driven separation of arbitrary sounds,","venue":null,"work_id":"835f3abb-d94e-4ac9-b23a-3542adecbbbb","year":2022},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.621645Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:0b0f21b4c8949333d4a9578eeadf27c2338b07ec44c38698e92fef8fa7fe3d13","observation_id":"7495a408-be9e-4f8e-80ec-244160261353","resolution":{"observed_at":"2026-08-05T05:32:34.266795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.248988Z","title":"AudioGen: Textually guided audio generation,","venue":null,"work_id":"6b7c55ea-fdfe-44e8-bf50-1b860bb1a91e","year":2023},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.625970Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:673d28caf23e78fe434e70ec7127e61e54f30dc28179ca5902e29f40c6bb603b","observation_id":"9255ccf1-9525-456b-b805-e02abe2fbcd5","resolution":{"observed_at":"2026-08-05T05:32:34.253217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.235837Z","title":"AudioLDM: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":"5bd03cff-aef6-4c99-aa76-d8b6a93c85b7","year":2023},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.630349Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:5704727b493453d9957aaf9b82d075cca38f8da9b5dfdccb5179d9256844adc0","observation_id":"bee84d90-8800-4441-bb63-4eeda2dd8623","resolution":{"observed_at":"2026-08-05T05:32:34.240263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.222504Z","title":"Text-to-audio generation using instruction guided latent diffusion model,","venue":null,"work_id":"dffe2c7d-eeba-4a42-830d-7daf6d2bcab8","year":2023},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.634609Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:a482d49c0da84c2468930e06c2da0eec7c6276f630db6da7afc57a76041a050f","observation_id":"398ad15c-2169-483a-9805-5a539235d454","resolution":{"observed_at":"2026-08-05T05:32:34.226823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.208923Z","title":"AudioLDM 2: Learning holistic audio generation with self-supervised pretraining,","venue":null,"work_id":"e32bb62a-f3bb-47c4-8fe3-68b76951b51a","year":2024},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.639157Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:f3816850fa23b5019dff2d6796d9329caf3fcd38808ed9e25dcee8de7c2c850a","observation_id":"ec5a9522-6699-4df5-8004-60e0d25d6686","resolution":{"observed_at":"2026-08-05T05:32:34.213262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.194717Z","title":"Adding conditional control to text-to-image diffusion models,","venue":null,"work_id":"344272b9-17d0-41fb-91c3-22675d714794","year":2023},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.644021Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:df2b0063d2adf754bb352056cb7cb96f261dab473e57f856a42ec43ae57b7a4e","observation_id":"d17e5bbd-84d1-433a-ac45-e34c305e5a0f","resolution":{"observed_at":"2026-08-05T05:32:34.199360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.180938Z","title":"Uni-ControlNet: All-in-one control to text-to-image diffusion models,","venue":null,"work_id":"1b9630ec-b977-45f5-88e9-1b5ef6de36ee","year":2023},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.648286Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:c06875ae5a87c0a9e38d0c443fd16c8a386195aeb391a47bfad6dac24c3d6599","observation_id":"6daed0e6-09b3-46e8-a3a0-1d9e01af5c72","resolution":{"observed_at":"2026-08-05T05:32:34.185460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.166277Z","title":"Emu Edit: Precise image editing via recognition and generation tasks,","venue":null,"work_id":"7023b168-9784-4546-b2c1-bf9ae9663f88","year":2024},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.652545Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:0aabcb0974e6a8a205bed4e6cbb2dcd55a9af82399318856680ee354e3da7e8b","observation_id":"862b467a-9599-4b14-9139-f5f7873916cc","resolution":{"observed_at":"2026-08-05T05:32:34.171318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.151150Z","title":"AUDIT: Audio editing by following instructions with latent diffusion models,","venue":null,"work_id":"d963e662-6e1e-418e-a118-2a308242a42b","year":2023},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.656487Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:e33b20a36ecdf38fee6f10bd068dc869ee153ccd9a5e414182d15c418a569091","observation_id":"6220212e-3aa5-4dcc-9e51-24385a1c249b","resolution":{"observed_at":"2026-08-05T05:32:34.155698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.136976Z","title":"Music ControlNet: Multiple time-varying controls for music generation,","venue":null,"work_id":"c7f3f5f9-df87-4771-a863-bf1e575e252e","year":2024},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.660544Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:08d517f46d618d0e51147788fb1feebe25ad70b6b19cb5e173508ac5d2606320","observation_id":"d98e338c-2485-4933-8ce8-45fc17728dad","resolution":{"observed_at":"2026-08-05T05:32:34.141426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18386","last_updated":"2025-07-17T21:29:13Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:27:20Z","title":"Instruct-MusicGen: Unlocking Text-to-Music Editing for Music Language Models via Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18386","snapshot_observed_at":"2026-08-05T05:32:33.664662Z","title":"Instruct- MusicGen: Unlocking text-to-music editing for music language models via instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.664662Z"},"links":{"cited_paper":"/paper/2405.18386","citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:790139f668535c33cfbc66d52896e3a4b73a872b9e672299b344ac1cab50cf1e","observation_id":"663fdd3e-1b49-4d44-8146-a8fdd5e7a604","resolution":{"observed_at":"2026-08-05T05:32:33.664662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08550","last_updated":"2025-04-14T14:16:41Z","snapshot_observed_at":"2026-07-06T20:05:23.685854Z","submitted_at":"2024-12-11T17:11:21Z","title":"Sketch2Sound: Controllable Audio Generation via Time-Varying Signals and Sonic Imitations","version":2},"cited_work":{"arxiv_id":"2412.08550","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.08550","snapshot_observed_at":"2026-08-05T05:32:33.834298Z","title":"Sketch2Sound: Controllable Audio Generation via Time-Varying Signals and Sonic Imitations","venue":"cs.SD","work_id":"b10c4a13-71c4-4fc1-9c96-5e089da714b0","year":2024},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.669434Z"},"links":{"cited_paper":"/paper/2412.08550","citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:21b584cdfc6492409992fb42b548cef54334f67e9d52a7eade2906f6574accc1","observation_id":"61f9ceaf-ae69-4965-a99f-93d782e08ae8","resolution":{"observed_at":"2026-08-05T05:32:33.839237Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.122947Z","title":"Audio- Composer: Towards fine-grained audio generation with natural language descriptions,","venue":null,"work_id":"d7e0f9cc-b337-46de-bd93-734c44f08b8d","year":2025},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.674616Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:f9a9cd6c8c6fda73b5741822b866bcf62e5819f1e38859e51f6c63db465b1be1","observation_id":"639a913f-959b-48e4-9f29-7c470e1b45fb","resolution":{"observed_at":"2026-08-05T05:32:34.127624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02869","last_updated":"2024-07-17T09:50:57Z","snapshot_observed_at":"2026-08-05T21:18:47.882543Z","submitted_at":"2024-07-03T07:33:14Z","title":"PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation","version":2},"cited_work":{"arxiv_id":"2407.02869","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.02869","snapshot_observed_at":"2026-08-05T05:32:33.811406Z","title":"PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation","venue":"cs.SD","work_id":"b6cf07a4-172d-4450-ad89-d00d64367e32","year":2024},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.678675Z"},"links":{"cited_paper":"/paper/2407.02869","citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:14ee974933679c9a0e21d28a9eaa93d1f67cc1879f0091aab9a5324a8b280c75","observation_id":"8aaf6312-616e-433b-9ffb-578811d8e898","resolution":{"observed_at":"2026-08-05T05:32:33.818520Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.109112Z","title":"AudioLM: a language modeling approach to audio generation,","venue":null,"work_id":"1f38cd83-e8f3-4053-8da0-e387b2a715b3","year":2023},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.683329Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:403f8b5f3b7e5d370fcd547dfa086c0c5f1f136dd5a060a3955894a3ca5bd231","observation_id":"e2dda31f-d73b-4480-ae0c-7e94fbec2f39","resolution":{"observed_at":"2026-08-05T05:32:34.113720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.095067Z","title":"SoundStream: An end-to-end neural audio codec,","venue":null,"work_id":"05c36a4b-30b4-448b-bb40-0c35df9822f4","year":2021},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.687573Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:41cf36a9713bf8ac69cd9a94a2198ecbda1d461a0d432519dc16a52b8c4dbba3","observation_id":"a3520dae-36d6-4ef5-a387-574be102d4b5","resolution":{"observed_at":"2026-08-05T05:32:34.099548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.691930Z","title":"Neural machine translation by jointly learning to align and translate,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.691930Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:dd79c010f78c73604e65bf06d8cab64d57d73b3f7cb81b8dbfb4e636def31641","observation_id":"a261696b-5ff1-4a2b-b920-7ef2cbf2ec38","resolution":{"observed_at":"2026-08-05T05:32:33.691930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.695957Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.695957Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:4af8fb13e0f8d4829a190bab344211cca8381ba18d944c77fbfa976a24c024bf","observation_id":"9488dbe5-9f4d-4fa8-83f3-4f281a055b1f","resolution":{"observed_at":"2026-08-05T05:32:33.695957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.063016Z","title":"Sentence-T5: Scalable sentence encoders from pre-trained text-to-text models,","venue":null,"work_id":"c1ced8a5-7624-4d14-add3-1d2d9d9b4b37","year":2022},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.700126Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:23aac5571daac149455308900f31fbe9d95b60924fdcd9eb7318b7e964a25d2b","observation_id":"38477326-f681-4adb-95d1-ebcfb9f2948e","resolution":{"observed_at":"2026-08-05T05:32:34.067426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.049385Z","title":"Autoregressive image generation using residual quantization,","venue":null,"work_id":"6a360186-1812-41cb-93af-67ff2e0d7b3c","year":2022},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.704230Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:85852a145f81debee37a75b1d61716e7878fb4f48ec27504ab41f15091ddf1c9","observation_id":"f8271f57-1855-41a7-b370-51dc2b92bc19","resolution":{"observed_at":"2026-08-05T05:32:34.053783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-05T05:32:33.708489Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.708489Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:080fc27f86bd354035b74bcc6e38f15ebf7bbc0bef84b67d7125c63623fff45f","observation_id":"9e62e05c-d10f-4c46-a55a-c1ee77179051","resolution":{"observed_at":"2026-08-05T05:32:33.708489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.036115Z","title":"Freesound technical demo,","venue":null,"work_id":"ee3e4833-55fc-4578-a881-9e3aec2b3b58","year":2013},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.712985Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:5cf967e8d08f25b5f0f04c24edd19518b91d3dbfd0f66103ea1a46e1f0ed8259","observation_id":"27671ccd-b904-4269-b7e4-4567e5c9d0a0","resolution":{"observed_at":"2026-08-05T05:32:34.040442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.022010Z","title":"Unsupervised sound separation using mixture invariant training,","venue":null,"work_id":"c881d53c-8a5c-4249-b6b8-9f228be144ad","year":2020},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.716937Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:af471adaf46d63f0aaef850f989327da7572951b69d8c0f3c0093e3471836ace","observation_id":"afe5d0cb-10e1-4103-a8cf-780bfc7eb7fe","resolution":{"observed_at":"2026-08-05T05:32:34.026602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:34.008006Z","title":"Evaluation of algorithms using games: the case of music annotation,","venue":null,"work_id":"5e6f45cb-32ae-4dbb-9785-21738cf3603b","year":2010},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.720905Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:f5db9f2e00b010a09f7e952563728f0494233d9fec82452f2f17e18eac56867b","observation_id":"6ca11ffc-cb85-47c7-93bf-eb127c6656a4","resolution":{"observed_at":"2026-08-05T05:32:34.012561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.993739Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"3ba78243-3772-4450-9888-03c4a53d1204","year":2019},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.724937Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:6c01140b0cbf8e8b3fcf5bdd7c76430bffd2d5e4fc4304d610cb2c41eb11445a","observation_id":"5a0930af-89f9-4956-a492-de499d824c68","resolution":{"observed_at":"2026-08-05T05:32:33.998452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.979306Z","title":"The benefit of temporally-strong labels in audio event classification,","venue":null,"work_id":"b9e428bf-70dc-487f-ae4b-75a06aad3dac","year":2021},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.728939Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:dfa3e38284998db9ed968289f5eade7dfa8c431df40c6259873bcde9aae1deba","observation_id":"5975b4e4-7fe5-4bbc-8441-0c3551eb273f","resolution":{"observed_at":"2026-08-05T05:32:33.984097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.965157Z","title":"Sound classification with Y AMNet,","venue":null,"work_id":"8e18c5d2-abd5-4d0b-9d0f-64f080c1ec7b","year":2020},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.732879Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:61c743296f33de763bafc2b97bfbd9ea408570a6dfb15c6370f4df469e124878","observation_id":"13031998-eb7d-42ce-b2a4-b408499e0aea","resolution":{"observed_at":"2026-08-05T05:32:33.969734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.951222Z","title":"FSD50K: an open dataset of human-labeled sound events,","venue":null,"work_id":"8559197f-4fa2-4709-aef0-1b4b43df8100","year":2022},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.736855Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:456bb2773ed33d88f06385c690c5444f2dbbdda3de4ddc76f60dcea4ad165170","observation_id":"a7429c27-a626-4d34-ab3a-e790d6e24de1","resolution":{"observed_at":"2026-08-05T05:32:33.955733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.936288Z","title":"Neural source-filter waveform models for statistical parametric speech synthesis,","venue":null,"work_id":"1ab905ad-3e8a-4aa0-8a9d-fdede8b08f64","year":2019},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.741081Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:1cc2d799d7132936f81ad76483f53cf5d02020454448d4c3828d241dda7545fb","observation_id":"1ce18887-7738-4fb6-b549-710f87d82507","resolution":{"observed_at":"2026-08-05T05:32:33.941214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.921224Z","title":"DDSP: Differentiable digital signal processing,","venue":null,"work_id":"5b74a9fa-552f-4d28-ba0d-1728d421533f","year":2020},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.745141Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:b36068f57099cc43e7a2ebbd2bfd75d19905981a7629650169dfc8f6e4d84e8b","observation_id":"5f96546f-e018-453a-930c-d1edffbce357","resolution":{"observed_at":"2026-08-05T05:32:33.925841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.907166Z","title":"Diffsound: Discrete diffusion model for text-to-sound generation,","venue":null,"work_id":"4d1ccf0b-6ad3-4746-b67b-e1fa885e315d","year":2023},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.749190Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:dd643882b8f07ce700bd5c04467f623ba146efba416ca7cdb37864c8b6066c9e","observation_id":"c5e36e78-62c6-4984-983c-777e99696164","resolution":{"observed_at":"2026-08-05T05:32:33.911670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.892460Z","title":"Fr ´echet audio distance: A metric for evaluating music enhancement algorithms,","venue":null,"work_id":"6a0b7f22-156b-48be-8461-a3c24ed321fc","year":2019},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.753098Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:5b4f8500139a3ee9c330d2365efc82091902f4168afd808cb949a4a67c382e43","observation_id":"9901077a-0838-4ed8-91b9-99b259d46523","resolution":{"observed_at":"2026-08-05T05:32:33.896931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.878500Z","title":"Adapting Fr ´echet audio distance for generative music evaluation,","venue":null,"work_id":"35307327-4393-4bc3-af29-30b13949fbd0","year":2024},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.757206Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:fd1d27d2a297b4a019d0957ee43c9151ae002be09471d5a9287c3cecfd9e7bc1","observation_id":"3be47c5d-004a-4bc6-9fcb-7b1518a8248e","resolution":{"observed_at":"2026-08-05T05:32:33.883079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:32:33.863404Z","title":"Correlation of Fr ´echet audio distance with human perception of environmental audio is embedding dependent,","venue":null,"work_id":"4a6c898d-98a4-48c5-b21f-cab9e32948a0","year":2024},"citing_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T05:32:33.761298Z"},"links":{"citing_paper":"/paper/2509.05256"},"observation_digest":"sha256:6005755a6c8c7e7ed91082ea810a7f62403f7a6daed46e2a47afe55e032c09bf","observation_id":"b229e865-e96e-4a8d-9ae5-5aee982029ba","resolution":{"observed_at":"2026-08-05T05:32:33.868695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":2,"verified_fuzzy":29},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 2 inbound Pith citation observations for arXiv:2509.05256."}