{"as_of":"2026-08-07T10:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5fe7f67c4fb7934d8d1eb70a5702dedc8a77c6caf2b71668f81648fb31acaf2c","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:21:31.637571Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:21:31.422666Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:39:38.492700Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.11096","snapshot_observed_at":"2026-08-06T17:21:31.422666Z","title":"arXiv:2507.11096v1 [cs.SD] 15 Jul 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.422666Z"},"links":{"cited_paper":"/paper/2507.11096","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:2667cc41be133a822258569ba3062d1ca92c1fa27f12cef2feca2b98b0cb0105","observation_id":"1af8fecf-7da0-47ff-a5d9-9cb2350948dd","resolution":{"observed_at":"2026-08-06T17:21:31.422666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"cited_work":{"arxiv_id":"2507.11096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.11096","snapshot_observed_at":"2026-07-04T07:39:38.492700Z","title":"Editgen: Harnessing cross-attention control for instruction-based auto- regressive audio editing,","venue":null,"work_id":"5d25b4ff-7821-464f-846b-5f33a0cdeaab","year":2025},"citing_paper":{"arxiv_id":"2606.21227","last_updated":"2026-06-19T08:47:05Z","snapshot_observed_at":"2026-08-05T17:22:44.002469Z","submitted_at":"2026-06-19T08:47:05Z","title":"Bagpiper-Edit: Zero-Shot Open-Ended Audio Editing via Rich-Caption","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T13:17:40.718000Z"},"links":{"cited_paper":"/paper/2507.11096","citing_paper":"/paper/2606.21227"},"observation_digest":"sha256:2df9dd306c27f2ca36cf20659d83009b206bbfa5785602cbf9bb3f9271e3264d","observation_id":"0615c238-6ed3-4616-b1d8-e7d03f23a4a6","resolution":{"observed_at":"2026-07-04T07:39:38.494215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.11096/citation-record","integrity":"/paper/2507.11096/integrity","json":"/paper/2507.11096/citation-record.json","paper":"/paper/2507.11096"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.368376Z","title":"EditGen: Harness- ing Cross Attention Control for Instruction-Based auto-regressive Audio Editing","venue":null,"work_id":"a2a2979f-8fc4-454c-8b93-d9bb59a40239","year":2024},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.410643Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:6db4c66b307881de183e135abf797d74b4178f22a64825ddc4ecaf090ae94ee3","observation_id":"f1836cb7-56b4-40b5-8a95-1dd7398a3814","resolution":{"observed_at":"2026-08-06T17:21:32.371790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.359046Z","title":null,"venue":null,"work_id":"95b84ab7-b603-48cb-990b-96056bd2f9c1","year":null},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.418748Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:793168d7b5137c969bab8165ba9c29b15a8ba84bc29fe8cb20ae4d0519e3e8c9","observation_id":"39fb741f-b162-410a-847e-7ee8294c203f","resolution":{"observed_at":"2026-08-06T17:21:32.362693Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.11096","snapshot_observed_at":"2026-08-06T17:21:31.422666Z","title":"arXiv:2507.11096v1 [cs.SD] 15 Jul 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.422666Z"},"links":{"cited_paper":"/paper/2507.11096","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:2667cc41be133a822258569ba3062d1ca92c1fa27f12cef2feca2b98b0cb0105","observation_id":"1af8fecf-7da0-47ff-a5d9-9cb2350948dd","resolution":{"observed_at":"2026-08-06T17:21:31.422666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.349043Z","title":null,"venue":null,"work_id":"bb5794d8-4ab0-438a-a361-59ca9110bd02","year":null},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.427018Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:174a4c89187e0dfed74c73898ece26503dcc265ed6b7bd25fbf742900d5d1fdf","observation_id":"62c952b9-1fb4-4883-81ca-5f8d0c33861e","resolution":{"observed_at":"2026-08-06T17:21:32.352291Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.339331Z","title":"Yang et al","venue":null,"work_id":"05e8b188-4d62-458e-b666-04193b3fc440","year":null},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.438096Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:0f15592df8468a1356e52df18f09d320b6e3ea932e1853b3bc17e18ba565f2da","observation_id":"cd8834d9-09b7-4c01-aebb-3e43448982ef","resolution":{"observed_at":"2026-08-06T17:21:32.342500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.266065Z","title":"We began with Auffusion, leveraging its existing capabilities for prompt- based editing","venue":null,"work_id":"e44b8bf7-f4bc-4857-a377-6645aaf60183","year":null},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.468785Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:6c3b7821ae0e1ed718409576264db3642549735d6e67cf6192d1e47e01ebd94b","observation_id":"14ee1a2e-467a-4ef6-b21b-050c29796121","resolution":{"observed_at":"2026-08-06T17:21:32.269463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.193678Z","title":"Masked autoencoders that listen,","venue":null,"work_id":"f8ce39d3-f847-4789-a207-f62f261d7cc9","year":2022},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.499750Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:b0fed38e0cbeae67ab761f8896309fdf2580ba68475ba8119694b463785a05f4","observation_id":"74e85710-6cef-4bc2-8fa4-66c6473c4f52","resolution":{"observed_at":"2026-08-06T17:21:32.197286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.305016Z","title":"The input, a reference audio random variableX, is encoded into a continuous ten- sor with a lower frame rate ( fr) compared to the sample rate (fs)","venue":null,"work_id":"0163447c-686e-42d9-8ada-9b494ee5bc8c","year":null},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.455289Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:3eb4a41eea7ccfdf05aa0dbb4ec7f45fac7041388265397c94c4116e30ba3f3b","observation_id":"8f6c65de-b84c-44fb-be5b-9f5ef05bc44e","resolution":{"observed_at":"2026-08-06T17:21:32.309637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.286209Z","title":"prompt strength","venue":null,"work_id":"25f6c668-c3ed-4f5c-bba2-b8aef55ef519","year":null},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.459793Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:698aff68f6d1c63162905af79c5659f8bfbc551609fee93f4a6dc91dd9bfd404","observation_id":"d2e3bb99-8b24-4daa-9251-504a96eea1a2","resolution":{"observed_at":"2026-08-06T17:21:32.289769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.276261Z","title":"prompt strength","venue":null,"work_id":"b36b0bed-648a-4066-897b-ad1a9976fac6","year":null},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.463949Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:79b311a2a94ff7be60ea7991660c8541f06e0d770825d5ac5acd61cea2ef697a","observation_id":"7ffbaf05-ae58-446b-8e7f-cfb9a91a1885","resolution":{"observed_at":"2026-08-06T17:21:32.279470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.171769Z","title":"HiFi-GAN: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":"8da7c4fb-cc4a-4c3e-8b7e-cba4f36ac957","year":2020},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.520183Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:70c2e1412cc9b1d225c2456691414ab2e2bc3e47cb0e3e4797c2cee0f98a079a","observation_id":"5ea41673-d7c3-4a12-95d4-bf4abbf531ea","resolution":{"observed_at":"2026-08-06T17:21:32.175498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.255990Z","title":"Prompt-to- prompt image editing with cross-attention con- trol,","venue":null,"work_id":"4e4b81b1-f87d-4143-9ee5-044f5e0626fa","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.473034Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:6168c7a6373d0b9a66d2b6c014174f218d137d9cb9e7b41314df1ff196ba3a9e","observation_id":"dfbc75aa-9c63-4334-925d-661392fa34f9","resolution":{"observed_at":"2026-08-06T17:21:32.259659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.329673Z","title":"Auto-regressive audio generation: As an alternative to diffusion-based models for audio and music generation, autoregressive models have shown promise in recent years","venue":null,"work_id":"5df8f23c-8ea3-4d80-b6d0-ab9e0b5fae5b","year":null},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.444796Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:6520eabf87db4b3295467011100fd3158354de143e5ab4e82b1fca307dfaaf44","observation_id":"51391606-a24e-44bd-a28a-3088e7a2d9f7","resolution":{"observed_at":"2026-08-06T17:21:32.333086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.246321Z","title":"Diffsound: Discrete diffusion model for text-to-sound generation,","venue":null,"work_id":"7b01d6f4-9a59-4bd0-ae38-8889b39933b1","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.477277Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:24b67874025a96bde2df32ed336d5f3f488b92d638925ea2740eb427c84f1790","observation_id":"13c1e6ef-09d2-4070-974d-b5c4e9ff79cb","resolution":{"observed_at":"2026-08-06T17:21:32.249345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.235387Z","title":"Make- an-audio: Text-to-audio generation with prompt- enhanced diffusion models,","venue":null,"work_id":"fb45d6a4-2584-49c7-8cf7-f6c4582545d1","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.481096Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:5ac7c3e445a9d85934a9d12e6b3a8c6b730f26f41bb8edc3951c4bdd014cc58f","observation_id":"d163a200-2080-4189-81c4-ec27564fde37","resolution":{"observed_at":"2026-08-06T17:21:32.239226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.225091Z","title":"CLAP: Learning audio concepts from natural lan- guage supervision,","venue":null,"work_id":"ae891a3b-33b7-4742-a64c-0e0651bf6468","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.484451Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:93fe0dd41826054737f449df16a7907ca7f8127ed38580eb653b5255fbabfa1c","observation_id":"0c747d61-fac2-41a2-9f55-67d3490b89d9","resolution":{"observed_at":"2026-08-06T17:21:32.228419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.319772Z","title":"Audi- oLM [18] utilizes tokens generated by a SoundStream [19] neural codec [20, 21] as targets for a sequence modeling task","venue":null,"work_id":"3361d6b7-67a2-4c82-b646-7aa624ad4887","year":null},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.450753Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:a395fc98fae84d6f6bec300fada59dc1f8a1f7220bdf509c173c4c568eba02f5","observation_id":"05a24ad4-193e-4e78-a85c-39471fa3a39e","resolution":{"observed_at":"2026-08-06T17:21:32.323341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.204756Z","title":"AudioLDM: Text- to-audio generation with latent diffusion models,","venue":null,"work_id":"81fd499e-709b-43de-91c3-158183b6a5dd","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.491844Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:1abc2aeb12a7441f541004f5ae19c65db9588b5669894dedfaffe6fc61df0b06","observation_id":"094ae7f7-c06b-4836-970a-c16f3a7d3432","resolution":{"observed_at":"2026-08-06T17:21:32.213796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05734","last_updated":"2024-05-11T11:24:51Z","snapshot_observed_at":"2026-08-07T06:58:30.754944Z","submitted_at":"2023-08-10T17:55:13Z","title":"AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05734","snapshot_observed_at":"2026-08-06T17:21:31.495779Z","title":"AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.495779Z"},"links":{"cited_paper":"/paper/2308.05734","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:6041a5cfb4e9f09729f5406e1821ee9cf95d568b1458331bfa107a27954ce332","observation_id":"641e40c4-6c03-4697-812a-0c7803250b6b","resolution":{"observed_at":"2026-08-06T17:21:31.495779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.182886Z","title":"AUDIT: Audio editing by following in- structions with latent diffusion models,","venue":null,"work_id":"5c54cd37-d284-4717-b725-b974d043fe53","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.506419Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:860ba7cdb295104f57292e4259ee46f2622d50aa6c5df1f8ddb000b706c5893e","observation_id":"6f653922-2083-43b9-a3de-f852195c57c6","resolution":{"observed_at":"2026-08-06T17:21:32.186979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:31.510770Z","title":"Text-to-audio generation using instruction guided latent diffusion model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.510770Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:f114bc86a1c3cca9fa953cf20326df5623b6004c0e1e0542d6162e6b6890a909","observation_id":"b58c729e-353c-4979-b850-2ae52784f25a","resolution":{"observed_at":"2026-08-06T17:21:31.510770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01044","last_updated":"2024-01-02T05:42:14Z","snapshot_observed_at":"2026-08-05T01:13:48.815001Z","submitted_at":"2024-01-02T05:42:14Z","title":"Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01044","snapshot_observed_at":"2026-08-06T17:21:31.516295Z","title":"Auffusion: Lever- aging the Power of Diffusion and Large Language Models for Text-to-Audio Generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.516295Z"},"links":{"cited_paper":"/paper/2401.01044","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:460de44db2a1ec9e9795e86f83af474beda78785440ded5164f9a71f3939b5d1","observation_id":"cb1355dd-1f1a-4735-9bf3-4289fa82414b","resolution":{"observed_at":"2026-08-06T17:21:31.516295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.162150Z","title":"MusicLDM: Enhanc- ing novelty in text-to-music generation using beat- synchronous mixup strategies,","venue":null,"work_id":"93ba2f45-0b2b-4ae6-9e31-753f93f7fcfb","year":2024},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.524168Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:4037704ffc3852e2736bfb3ae34ffd9128734601c6ca6270926b0e4e9d632890","observation_id":"41414649-1fb4-454d-9aa2-7b702a3ff99c","resolution":{"observed_at":"2026-08-06T17:21:32.165442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14360","last_updated":"2023-12-12T06:55:08Z","snapshot_observed_at":"2026-07-06T16:11:06.578398Z","submitted_at":"2023-08-28T07:11:42Z","title":"InstructME: An Instruction Guided Music Edit And Remix Framework with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2308.14360","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.14360","snapshot_observed_at":"2026-08-06T17:21:31.776362Z","title":"InstructME: An Instruction Guided Music Edit And Remix Framework with Latent Diffusion Models","venue":"cs.SD","work_id":"9d41cfdb-58d2-4649-a2db-37489b886337","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.527735Z"},"links":{"cited_paper":"/paper/2308.14360","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:3e7d175c5d534916a53d8cfeb3445817ca233179f1136307f10eb7d9fad685ab","observation_id":"96f0f70d-1ed0-4b70-9f00-2f55e8cd2515","resolution":{"observed_at":"2026-08-06T17:21:31.780086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-06T17:21:31.531204Z","title":"WaveNet: A Generative Model for Raw Audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.531204Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:21ef18b64102a0da208e2de6fc04526c3be2bd8301bf92b0c2193b9c26d3693e","observation_id":"27980d42-36ee-4c10-96a4-2befd82c6f23","resolution":{"observed_at":"2026-08-06T17:21:31.531204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.147394Z","title":"Audiogen: Textually guided audio genera- tion,","venue":null,"work_id":"7e78ba59-665d-40f9-8926-3bba8521d99c","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.535045Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:4e92f8848743a8c2a2385695fc8eb1749398ead19579b45ccc3767bd6fa77d67","observation_id":"1b32fa68-7f95-4f25-8b3f-9db7c204b828","resolution":{"observed_at":"2026-08-06T17:21:32.154915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00341","last_updated":"2020-04-30T09:02:45Z","snapshot_observed_at":"2026-08-06T03:57:57.420510Z","submitted_at":"2020-04-30T09:02:45Z","title":"Jukebox: A Generative Model for Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00341","snapshot_observed_at":"2026-08-06T17:21:31.540076Z","title":"Jukebox: A Generative Model for Music,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.540076Z"},"links":{"cited_paper":"/paper/2005.00341","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:458494d11c3cca381d9fd8faf0e3e34ea912f14af92ec12bb16fbe27118c533c","observation_id":"e8084bfe-9e05-4bb0-86ea-71ba8fef237c","resolution":{"observed_at":"2026-08-06T17:21:31.540076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.136598Z","title":"Neural discrete representation learning,","venue":null,"work_id":"aaa7e4a5-fdfc-47cb-b72a-e3f92fa02f15","year":2017},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.543739Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:371755883c8d3693d5c9bd197962ea2b0b8113ba65f96919a0813ed23f7dacc7","observation_id":"05075a94-0224-4dae-8a53-2acfa6dd4680","resolution":{"observed_at":"2026-08-06T17:21:32.140555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03143","last_updated":"2023-07-26T03:52:36Z","snapshot_observed_at":"2026-08-02T01:30:06.675966Z","submitted_at":"2022-09-07T13:40:08Z","title":"AudioLM: a Language Modeling Approach to Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03143","snapshot_observed_at":"2026-08-06T17:21:31.547479Z","title":"AudioLM: a Language Modeling Approach to Audio Generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.547479Z"},"links":{"cited_paper":"/paper/2209.03143","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:4e7e3475336fad8658f465a4fb719858eed0beb557a7b1d65ea913cbeaf0d9b8","observation_id":"0f0f49c6-7193-4135-8835-6f6a1965dd3e","resolution":{"observed_at":"2026-08-06T17:21:31.547479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.120398Z","title":"Soundstream: An end-to-end neu- ral audio codec,","venue":null,"work_id":"dc05ee9d-b7ef-4464-810d-bb961f960c5d","year":2022},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.551187Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:170f228100e2a87d74637aa7e89cd5cd8ada14cfbd08ad32d18be1fdb8bd94eb","observation_id":"757c56d3-8f1f-4fe2-a449-14bc158deee4","resolution":{"observed_at":"2026-08-06T17:21:32.123953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.103470Z","title":"End-to-end optimized speech cod- ing with deep neural networks,","venue":null,"work_id":"3768dc7f-d71c-479d-8a6d-96d08773420c","year":2018},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.554641Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:28abf2849195b640a6d4bf4ffeda7928ad23392de1bf04c2088ac815312a52a0","observation_id":"430323d8-6cab-48ee-aeb1-1e38f82c512c","resolution":{"observed_at":"2026-08-06T17:21:32.107018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.092628Z","title":"Harp- net: Hyper-autoencoded reconstruction propagation for scalable neural audio coding,","venue":null,"work_id":"3101ab50-d712-4fc5-baec-c7eaa4f6a18e","year":2021},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.558163Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:ddf4defdc4eea703ead76647c5286201c02a849dd1f48128b3054823ec6e7124","observation_id":"df02e93d-76c6-4a72-a3b7-d9874ff8e559","resolution":{"observed_at":"2026-08-06T17:21:32.096933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-06T17:21:31.562352Z","title":"MusicLM: Generating Music From Text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.562352Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:1a69e3de54a5a3a37951023742ecf64f6b0fc544cd8be4dbc2b3b910e1d36ee6","observation_id":"7dcc803c-55e9-4d6b-9ea3-99ce39c413ab","resolution":{"observed_at":"2026-08-06T17:21:31.562352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.081826Z","title":"Simple and control- lable music generation,","venue":null,"work_id":"5301b8a2-ece8-4b99-86bf-f8f8eae3d850","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.566201Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:ffe284bc0b1c9ed6282ce77bc864629cd35c13c7af3166732a1060ade0e1575b","observation_id":"8e362c39-afec-48c0-98cf-0b86c0f3a3d8","resolution":{"observed_at":"2026-08-06T17:21:32.085641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.066702Z","title":"High fidelity neural audio compression,","venue":null,"work_id":"ba4ea0b4-dcff-480c-98d9-10058096f414","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.569796Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:bc9fefb54d14bd46f3f8373de1f69c71177f7786316b1800b5c8a29abdc3d689","observation_id":"45e2670d-ef47-403c-b9a5-c0e5e8c579ad","resolution":{"observed_at":"2026-08-06T17:21:32.070692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.051612Z","title":"Null-text inversion for editing real im- ages using guided diffusion models,","venue":null,"work_id":"89c541d0-b6cc-4ae0-94dc-d5f122254983","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.573681Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:992165d501fae2ade96ee065565a9ba98c9c11d92d17a0909795f46f8c92793f","observation_id":"efb8e301-1609-4cef-8345-274ad718c106","resolution":{"observed_at":"2026-08-06T17:21:32.054968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.036652Z","title":"Dreambooth: Fine tuning text-to- image diffusion models for subject-driven generation,","venue":null,"work_id":"35885dec-ddc7-436a-9d6e-6e7a20d480e0","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.578547Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:5fd400606c17c14b737a4815194c3da49f9936a951077894f06a5dac45346b01","observation_id":"baaa9fc4-4c3f-49cc-ba3c-acb8cd9b5641","resolution":{"observed_at":"2026-08-06T17:21:32.041200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:32.005517Z","title":"Multi-concept customization of text-to-image diffusion,","venue":null,"work_id":"695c9655-066e-4d41-9e78-3d0953af573a","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.581943Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:af1d2ff1807467e5570a66b06f1af7c945ee0834216235ff826550c5d761e0c6","observation_id":"769f635d-1cac-4d9e-8b60-21c208ca9497","resolution":{"observed_at":"2026-08-06T17:21:32.010492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:31.987787Z","title":"SVDiff: Compact parameter space for dif- fusion fine-tuning,","venue":null,"work_id":"1c23a301-15da-4847-a50b-14c0d9c32de7","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.585641Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:e3cb59eb3028232fce6726bd8397c2d13d9e40fd7ec6596a7454c708c9e1b88c","observation_id":"3235656a-5e43-4ab0-b6fa-d678989ffe1c","resolution":{"observed_at":"2026-08-06T17:21:31.992132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:31.976168Z","title":"Countering language drift via visual grounding,","venue":null,"work_id":"c12c6d44-2fcc-494d-bf24-04a462211f87","year":2019},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.591831Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:ef74926b3be534b95321e84160e1b9b2bd0ee947f1cdc4ed93b1d5e7b635d0be","observation_id":"7f52f4b6-2a27-4684-9c18-f4a4979c02b9","resolution":{"observed_at":"2026-08-06T17:21:31.979777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:31.896472Z","title":"Likert scale: Explored and explained,","venue":null,"work_id":"9a0e850e-7dfa-4eb6-88d4-bcfcbe789dfd","year":2015},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.637571Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:4f4ca8f98167ca665bf2329ffb3554fb4496d5718d6359a0e8a4a4d9e19ea7b5","observation_id":"e7739275-b8fb-4c94-bd53-a58cdba6eccd","resolution":{"observed_at":"2026-08-06T17:21:31.899844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:31.955145Z","title":"Investigating personaliza- tion methods in text to music generation,","venue":null,"work_id":"f59678c7-edfd-40fc-9c11-fe5ed7ccd5df","year":2024},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.599929Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:444954a181b6ccf0ac1641077c4b69dbe289f1bf9e4ceae95566d511bb2209d7","observation_id":"6f6943c1-c394-47c9-a915-fc26e93bb154","resolution":{"observed_at":"2026-08-06T17:21:31.958897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10009","last_updated":"2024-05-29T11:27:24Z","snapshot_observed_at":"2026-07-06T17:30:39.245059Z","submitted_at":"2024-02-15T15:17:26Z","title":"Zero-Shot Unsupervised and Text-Based Audio Editing Using DDPM Inversion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10009","snapshot_observed_at":"2026-08-06T17:21:31.603502Z","title":"Zero-Shot Unsuper- vised and Text-Based Audio Editing Using DDPM Inversion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.603502Z"},"links":{"cited_paper":"/paper/2402.10009","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:404c6833510c7429f4d381975af49d48a640654a286e30e6b2655dc2a31c76a5","observation_id":"e13327b7-eb7e-4d5a-8ffa-013c22004306","resolution":{"observed_at":"2026-08-06T17:21:31.603502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06140","last_updated":"2024-04-09T17:09:03Z","snapshot_observed_at":"2026-07-06T15:15:03.449968Z","submitted_at":"2023-04-12T19:47:13Z","title":"An Edit Friendly DDPM Noise Space: Inversion and Manipulations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06140","snapshot_observed_at":"2026-08-06T17:21:31.607581Z","title":"An Edit Friendly DDPM Noise Space: Inversion and Manipulations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.607581Z"},"links":{"cited_paper":"/paper/2304.06140","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:69d852d0c26957aa68d2a14b247fc0a4ae13f03feefd1f608202b94cf4eb8bdc","observation_id":"79b0cdd2-eeb8-4192-88d7-48621f19d2f2","resolution":{"observed_at":"2026-08-06T17:21:31.607581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:31.944873Z","title":"Photorealistic text-to-image diffu- sion models with deep language understanding,","venue":null,"work_id":"16867541-c842-4432-87cd-8f5c66ef4bc8","year":2022},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.611446Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:dedbd3244f3b9191f6713f802fa0981dc246a87dbb5a35b3ce3843e456787081","observation_id":"e87ace66-a28a-4ddf-a7f4-86419d50b3ce","resolution":{"observed_at":"2026-08-06T17:21:31.948459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07069","last_updated":"2023-11-13T04:24:14Z","snapshot_observed_at":"2026-08-07T04:08:54.908229Z","submitted_at":"2023-11-13T04:24:14Z","title":"Music ControlNet: Multiple Time-varying Controls for Music Generation","version":1},"cited_work":{"arxiv_id":"2311.07069","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07069","snapshot_observed_at":"2026-08-06T17:21:31.693242Z","title":"Music ControlNet: Multiple Time-varying Controls for Music Generation","venue":"cs.SD","work_id":"3b12f633-edfc-419b-a28b-72d8887cc16f","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.615013Z"},"links":{"cited_paper":"/paper/2311.07069","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:fa44c019d71ef7570e69e9c2f241b9a2fa6ab3b4207ff9780e8f2f14e68f5e6c","observation_id":"41af34df-31d2-47da-984d-967b6956125f","resolution":{"observed_at":"2026-08-06T17:21:31.697050Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1080/09298210701653252","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:31.665081Z","title":"Evaluation of Audio Beat Tracking and Music Tempo Extraction Algorithms,","venue":null,"work_id":"97ce7c6e-3f62-4fc0-9b1c-1c9f266a3488","year":2007},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.618387Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:2edf16432f7b798b28695eceaa5d1b6af02e90b616004188f29489eaa9902eeb","observation_id":"d1855218-0518-461c-ba1a-da8cc5f7a7b3","resolution":{"observed_at":"2026-08-06T17:21:31.671027Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:31.934497Z","title":"mir_eval: A transparent implementation of common mir metrics,","venue":null,"work_id":"8afeec66-8c64-46b2-ac46-052f838cb04f","year":2014},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.621895Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:dbc4a864212a2688eeb13c6ba7466cb6943f31948af5fb3728805fe8393e7967","observation_id":"1e2e7b21-c867-484f-a509-356a3ea75b37","resolution":{"observed_at":"2026-08-06T17:21:31.938083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:31.625142Z","title":"An efficient state- space model for joint tempo and meter tracking","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.625142Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:30f6d6882bcdbede888ee4672b85b55d0cd3ae38f7ea66d028406adca4a207b9","observation_id":"149c2df2-8efe-4795-8e0c-12f93b27d828","resolution":{"observed_at":"2026-08-06T17:21:31.625142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:31.918247Z","title":"Large-scale contrastive language- audio pretraining with feature fusion and keyword-to- caption augmentation,","venue":null,"work_id":"bfa2a5c3-b4d7-4b0f-941c-f17f8ee4e16f","year":2023},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.628136Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:1d01e0a161dca3be785aef73374e48654d7a4a7a496a2c4c5e9a78db39209949","observation_id":"7928f099-baf0-4901-8ba7-de10090931ff","resolution":{"observed_at":"2026-08-06T17:21:31.921391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:31.907073Z","title":"HTS-AT: A hierarchical token- semantic audio transformer for sound classification and detection,","venue":null,"work_id":"c0a16174-a28b-4db6-abd0-447570236ecf","year":2022},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.631335Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:b8654d4a9377b4a03084adff19c9ef6d500d164a63a9dfa6f2719ed5cab41237","observation_id":"983330f6-1d59-42aa-94ef-5bd46daeb1dc","resolution":{"observed_at":"2026-08-06T17:21:31.911114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-06T17:21:31.634601Z","title":"Representation Learning with Contrastive Predictive Coding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.634601Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:eaaf6e821b9ebf9e6a5744b0fdb52d3bf1b76fc3c4aad22de50c922d727f380c","observation_id":"8c76b7c9-5998-4a40-a9ba-417eed918ec9","resolution":{"observed_at":"2026-08-06T17:21:31.634601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:21:31.966511Z","title":"Available: https://aclanthology.org/ D19-1447","venue":null,"work_id":"f9074379-bca6-418a-ae02-5267cb94f875","year":null},"citing_paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing","version":1},"reference_index":4395,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:31.596119Z"},"links":{"citing_paper":"/paper/2507.11096"},"observation_digest":"sha256:38a3efd6943af9b5af657b26a161a6086c4371dfc3567d88ec6c6fe6a6ebd7d2","observation_id":"9f26091d-4751-422e-9db3-f3d6d8799954","resolution":{"observed_at":"2026-08-06T17:21:31.969764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.11096","last_updated":"2025-07-15T08:44:11Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T17:14:11.721392Z","submitted_at":"2025-07-15T08:44:11Z","title":"EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":3,"verified_fuzzy":36},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 2 inbound Pith citation observations for arXiv:2507.11096."}