{"as_of":"2026-08-13T04:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b240e7815a2ca51d7d40b4ad982578b8221b6bdf3d7e91dcf7e8064d034ab36c","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T07:10:49.047784Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:14:46.893801Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:14:51.965614Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.23139","snapshot_observed_at":"2026-08-04T16:29:26.450915Z","title":"Audio editing in the era of foundation models: A survey","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-12T20:32:11.393687Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-04T16:29:26.450915Z"},"links":{"cited_paper":"/paper/2606.23139","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:c9b9d2fc1c5357f4a9df7fdcbe698aef30b1ab691b06424b952b2c296f3c09aa","observation_id":"63e73bf0-5802-41dd-a8da-044596636ada","resolution":{"observed_at":"2026-08-04T16:29:26.450915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"cited_work":{"arxiv_id":"2606.23139","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.23139","snapshot_observed_at":"2026-08-07T00:14:51.965614Z","title":"Audio Editing in the Era of Foundation Models: A Survey","venue":"eess.AS","work_id":"88f10a97-560b-42b8-88d9-935fcdc323f6","year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-12T20:32:11.393687Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:46.893801Z"},"links":{"cited_paper":"/paper/2606.23139","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:7615703b49f13dbcd117fb1c9d7c170805aed669f3a2507487cdc05711363efd","observation_id":"131edcb5-940e-44b9-96ce-f9d35819cbee","resolution":{"observed_at":"2026-08-07T00:14:52.074519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.23139/citation-record","integrity":"/paper/2606.23139/integrity","json":"/paper/2606.23139/citation-record.json","paper":"/paper/2606.23139"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2107.12346","last_updated":"2021-07-27T16:49:15Z","snapshot_observed_at":"2026-07-06T11:32:37.657047Z","submitted_at":"2021-07-26T17:40:43Z","title":"Beyond Voice Identity Conversion: Manipulating Voice Attributes by Adversarial Learning of Structured Disentangled Representations","version":2},"cited_work":{"arxiv_id":"2107.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.12346","snapshot_observed_at":"2026-07-04T12:09:49.444945Z","title":"Paul Boersma and David Weenink","venue":null,"work_id":"2f066e6e-ed84-4f14-b4b4-c06b4b62fb56","year":2021},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"cited_paper":"/paper/2107.12346","citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:931942a9ba316293370d92426211ca7e2c505b84b549200b09a792334ed08b28","observation_id":"cb4f76ea-3110-4914-9eb0-bcab61f47a1d","resolution":{"observed_at":"2026-07-04T12:09:49.446364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05329","last_updated":"2026-06-28T13:33:39Z","snapshot_observed_at":"2026-08-08T08:13:19.448320Z","submitted_at":"2026-01-08T19:16:27Z","title":"CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models","version":2},"cited_work":{"arxiv_id":"2601.05329","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.05329","snapshot_observed_at":"2026-07-04T12:09:49.437611Z","title":"CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models","venue":"cs.SD","work_id":"43f2902f-60df-4313-b5f0-a64d350617c4","year":2026},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"cited_paper":"/paper/2601.05329","citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:96bba7cafe489b605df2295e9b0480d4d81a3323af4bfd8fbc1b8aa7d168723a","observation_id":"94582d15-3150-40de-928a-1554ac99539e","resolution":{"observed_at":"2026-07-04T12:09:49.438815Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:65d0797e9d3fa841fae2e8516b2cf2de358e61fb1d96b567fe0ac439e62f65f4","observation_id":"896d5d7c-a539-41fa-b14a-32f9678cde2f","resolution":{"observed_at":"2026-07-04T12:09:49.448839Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T07:10:49.047784Z","title":"InForty-first interna- tional conference on machine learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:08d1c9367c6753826a4ffcb578e2aace2c48b0ff130fa3386bcc6d38608557c4","observation_id":"dd9c876d-64c2-4be7-adbd-133aae9c09ee","resolution":{"observed_at":"2026-06-26T07:10:49.047784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03538","last_updated":"2021-06-04T09:15:25Z","snapshot_observed_at":"2026-08-07T02:34:36.889171Z","submitted_at":"2021-04-08T06:46:35Z","title":"MetricGAN+: An Improved Version of MetricGAN for Speech Enhancement","version":2},"cited_work":{"arxiv_id":"2104.03538","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.03538","snapshot_observed_at":"2026-07-04T12:09:49.442368Z","title":"Youquan Fu, Ruiyang Si, Hongfa Wang, Dongzhan Zhou, Jiacheng Sun, Ping Luo, Di Hu, Hongyuan Zhang, and Xuelong Li","venue":null,"work_id":"b0a66b79-2108-4031-8b93-8faba779c18c","year":2025},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"cited_paper":"/paper/2104.03538","citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:5369fc635caded2867fbb8a3cf40b06dbab92bdf88463fa3b9bd77916149fc16","observation_id":"e4efb388-6349-4dc3-9823-e30a4318b712","resolution":{"observed_at":"2026-07-04T12:09:49.443926Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-08T00:35:10.506000Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":"2305.11013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-07-10T11:27:03.142196Z","title":"FunASR: A fundamental end-to-end speech recognition toolkit","venue":"cs.SD","work_id":"a1b4d167-dd83-49f9-8309-1e4d5492acf5","year":2023},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:1b142d193775701129d73176afe1ee82082acd1249eff6478e2fefb392743493","observation_id":"6ec8d7f1-8f17-47db-9598-021d3bb1e87a","resolution":{"observed_at":"2026-07-04T12:09:49.451429Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-12T20:06:41.245137Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:ee1a7ca5dae01b1ac399f089871b5550eb3062870baab35bf088bd9d6fe06183","observation_id":"5bff76c7-2b3a-478d-bc3e-aaf2a390e528","resolution":{"observed_at":"2026-07-04T12:09:49.441309Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02858","last_updated":"2025-06-05T04:46:57Z","snapshot_observed_at":"2026-08-09T09:31:21.536819Z","submitted_at":"2025-06-03T13:24:57Z","title":"DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization","version":2},"cited_work":{"arxiv_id":"2506.02858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02858","snapshot_observed_at":"2026-07-04T12:09:49.455046Z","title":"Keon Lee, Kyumin Park, and Daeyoung Kim","venue":null,"work_id":"3755b62f-b0e2-4be9-a9f1-6cf10456970a","year":2023},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"cited_paper":"/paper/2506.02858","citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:f96528ba2511e46092a65eb0ca7a54072d4747407c6b28e7b3f6383161f0f634","observation_id":"62ddaa29-ccb2-47a4-911d-59ebd14e2bcb","resolution":{"observed_at":"2026-07-04T12:09:49.456447Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16076","last_updated":"2025-05-21T23:23:37Z","snapshot_observed_at":"2026-08-07T15:05:12.227854Z","submitted_at":"2025-05-21T23:23:37Z","title":"AudioMorphix: Training-free audio editing with diffusion probabilistic models","version":1},"cited_work":{"arxiv_id":"2505.16076","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16076","snapshot_observed_at":"2026-07-04T12:09:49.459974Z","title":"Jinhua Liang, Yuanzhe Chen, Yi Yuan, Dongya Jia, Xiaobin Zhuang, Zhuo Chen, Yuping Wang, and Yux- uan Wang","venue":null,"work_id":"c137244a-a3d6-4491-acfc-5d4a396a0850","year":2025},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"cited_paper":"/paper/2505.16076","citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:98c23d1c2afd8c7c1519b396efd11b2a05bbe7c5859bc7915df534a048a77e08","observation_id":"d12137e7-5982-4350-a79a-a27cfaf0e2fc","resolution":{"observed_at":"2026-07-04T12:09:49.461540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.20113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T12:09:49.452538Z","title":"Chen-Chou Lo, Szu-Wei Fu, Wen-Chin Huang, Xin Wang, Junichi Yamagishi, Yu Tsao, and Hsin-Min Wang","venue":null,"work_id":"c62fb0d0-c274-4162-862f-3eada3cdc59b","year":2019},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:9c443adc5b92550801321f9f9e698e76feddc30f9e1aedf4c2f97ca429c06c2b","observation_id":"5c29b7a7-62cb-4922-8fb1-85cb048405d2","resolution":{"observed_at":"2026-07-04T12:09:49.453966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12858","last_updated":"2024-09-24T11:25:49Z","snapshot_observed_at":"2026-08-12T08:40:10.449876Z","submitted_at":"2023-10-19T16:09:44Z","title":"Audio Editing with Non-Rigid Text Prompts","version":3},"cited_work":{"arxiv_id":"2310.12858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.12858","snapshot_observed_at":"2026-07-04T12:09:49.457466Z","title":"arXiv preprint arXiv:2310.12858","venue":null,"work_id":"57ae8170-ae9d-4a75-b9c8-ef76de8f2f79","year":2023},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"cited_paper":"/paper/2310.12858","citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:1c048cd7a315ecf480ffd0c5fdae24d9b5672341501d5cc05c0fc53dc60c03b7","observation_id":"32873808-289a-4db8-8c88-9929310350bf","resolution":{"observed_at":"2026-07-04T12:09:49.458732Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T07:10:49.047784Z","title":"Alessandro Ragano, Jan Skoglund, and Andrew Hines","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:ed54b2393d19fec39e015bda950ded3a71e48a2ef40ee35b5b78b481fcdb08be","observation_id":"c31157f7-ed2f-4a12-9335-966e9d650b62","resolution":{"observed_at":"2026-06-26T07:10:49.047784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T07:10:49.047784Z","title":"InICASSP 2024-2024 IEEE International Confer- ence on Acoustics, Speech and Signal Processing (ICASSP), pages 1011–1015","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:8043a256bf2f6ac1d9a0430138795ea7008a089e6eb5d8ff3331aaf4ff8591eb","observation_id":"99705ab8-2efa-47e9-a1bd-1a5a30aa568e","resolution":{"observed_at":"2026-06-26T07:10:49.047784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-08-12T10:49:35.463190Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"cited_work":{"arxiv_id":"2604.14148","doi":"10.48550/arxiv.2604.14148","metadata_source":"pith","pith_arxiv_id":"2604.14148","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","venue":"cs.CV","work_id":"ceac4ea4-1ca6-4fe9-8324-880c07aec27d","year":2026},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"cited_paper":"/paper/2604.14148","citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:a071edd5fb3d37e6764d01d02bd48e8417790b43bed7ccd5a1c2860999f8c460","observation_id":"c5fa8f1f-5d05-4aa1-8956-3fbde8d9f65b","resolution":{"observed_at":"2026-07-04T12:09:49.466189Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02584","last_updated":"2022-07-09T17:22:14Z","snapshot_observed_at":"2026-08-07T14:37:50.867285Z","submitted_at":"2021-10-06T08:51:10Z","title":"EdiTTS: Score-based Editing for Controllable Text-to-Speech","version":3},"cited_work":{"arxiv_id":"2110.02584","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02584","snapshot_observed_at":"2026-07-04T12:09:49.462620Z","title":"Jaesung Tae, Hyeongju Kim, and Taesu Kim","venue":null,"work_id":"c347bb79-81cf-46b9-9192-2713c56a7fb2","year":2021},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"cited_paper":"/paper/2110.02584","citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:1c41ee6c5de58b45c00599c1865a382481c33853c1506d2b10bd37dd10026b9e","observation_id":"7824c1a5-e363-4d2e-96a7-6333d233b71b","resolution":{"observed_at":"2026-07-04T12:09:49.463871Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15412","last_updated":"2023-06-28T01:53:37Z","snapshot_observed_at":"2026-08-12T08:31:41.720254Z","submitted_at":"2023-06-27T12:11:55Z","title":"RMVPE: A Robust Model for Vocal Pitch Estimation in Polyphonic Music","version":2},"cited_work":{"arxiv_id":"2306.15412","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.15412","snapshot_observed_at":"2026-07-04T12:09:49.469630Z","title":"Rmvpe: A robust model for vocal pitch estimation in polyphonic music","venue":null,"work_id":"95c87790-bf62-48af-923a-8d382aa82bae","year":2023},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"cited_paper":"/paper/2306.15412","citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:80429beb06bac570887d3e8c47f159a59d127000f9577a058bd10c7993b57ba9","observation_id":"71f28937-d60a-405b-a0be-14662efa2971","resolution":{"observed_at":"2026-07-04T12:09:49.471000Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:d937eaba080ddb1e38fa7956eedc50ee7fc98cafbf819bdd6586176544cc0488","observation_id":"79789653-23c4-4158-b840-b3078efe1965","resolution":{"observed_at":"2026-07-04T12:09:49.468540Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18386","last_updated":"2025-07-17T21:29:13Z","snapshot_observed_at":"2026-08-12T23:55:55.387554Z","submitted_at":"2024-05-28T17:27:20Z","title":"Instruct-MusicGen: Unlocking Text-to-Music Editing for Music Language Models via Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2405.18386","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.18386","snapshot_observed_at":"2026-07-04T12:09:49.472075Z","title":"remove the background crowd noise from the speech","venue":null,"work_id":"41c29b33-b508-4e17-b70d-4f91c85cc28c","year":2023},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"cited_paper":"/paper/2405.18386","citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:4f031f27e8d3d68bc21b9e928e0231f47eb6630c587efd8a51a78fd2dd6835ba","observation_id":"9b5921d0-3a44-4430-ab2a-1aa7512fca92","resolution":{"observed_at":"2026-07-04T12:09:49.473578Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T07:10:49.047784Z","title":"When the editable unit is defined by speaker activity rather than text, pyannote (Bredin,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:8ed020735835f51271d1747c654a84f67299aadbfae95be93b69f0fc68f3f269","observation_id":"2135d651-c307-4c94-b3ec-073964a0d8c0","resolution":{"observed_at":"2026-06-26T07:10:49.047784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T07:10:49.047784Z","title":"For general au- dio, sound event detection models (Kong et al., 2020; Li et al., 2023) produce event-level activity boundaries","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:aa33917ced37b82c82d54846332e79281ce9349e176182436dd4a1c6f5c4f766","observation_id":"b86f0995-a9a7-4ee3-a6ec-d00deea93a91","resolution":{"observed_at":"2026-06-26T07:10:49.047784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T07:10:49.047784Z","title":"How- ever, their effectiveness depends heavily on stable text-acoustic alignment and high-quality tokeniza- tion","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:5a2fca5bd67b66f69ac001a91a63aeeeacdecf211f01a9d02ef8316a184ba8ee","observation_id":"b3cb866c-a75c-409b-84f4-59ba612d096c","resolution":{"observed_at":"2026-06-26T07:10:49.047784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-03T12:53:27.814197Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":6,"verified_exact":9,"verified_fuzzy":0},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 2 inbound Pith citation observations for arXiv:2606.23139."}