{"as_of":"2026-08-18T04:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3632545282e0eb5aac8e8c3c92d1371ac2041efadd7993e8347b980c0f32ed12","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T12:54:20.815371Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T01:28:25.427320Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.01804","snapshot_observed_at":"2026-08-03T01:28:25.427320Z","title":"2606.01804 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28896","last_updated":"2026-07-30T23:28:11Z","snapshot_observed_at":"2026-08-15T02:28:36.148100Z","submitted_at":"2026-07-30T23:28:11Z","title":"TORUS: A Test of Rendering-Understanding Self-Coherence for Unified Audio Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T01:28:25.427320Z"},"links":{"cited_paper":"/paper/2606.01804","citing_paper":"/paper/2607.28896"},"observation_digest":"sha256:a5ff2d67d250fdd068f395452472ef085613451a4e8edec500f9b29a316dc547","observation_id":"309978da-38c1-4a03-aa81-7b013dd50e5e","resolution":{"observed_at":"2026-08-03T01:28:25.427320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.01804/citation-record","integrity":"/paper/2606.01804/integrity","json":"/paper/2606.01804/citation-record.json","paper":"/paper/2606.01804"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:61236e20c1a64f617af31686c0e773f73b5f798acd9e14b4f3ed256716618940","observation_id":"ee76aed2-47a9-4948-b749-edd5c9d02f5b","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02426","last_updated":"2023-10-03T20:46:10Z","snapshot_observed_at":"2026-08-16T14:55:20.395869Z","submitted_at":"2023-10-03T20:46:10Z","title":"EditVal: Benchmarking Diffusion Based Text-Guided Image Editing Methods","version":1},"cited_work":{"arxiv_id":"2310.02426","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.02426","snapshot_observed_at":"2026-07-02T01:06:23.935820Z","title":"Tim Brooks, Aleksander Holynski, and Alexei A Efros","venue":null,"work_id":"70eabd2b-079e-468f-b1da-539fe1c1587f","year":2023},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2310.02426","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:84aa40500b101b0e6c6c1ec34e8d53354b8bbd1acafd669cb3a01875c5ac08ab","observation_id":"4cf37549-51ad-4e9a-b497-993889c76e0d","resolution":{"observed_at":"2026-07-02T01:06:23.937231Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:7e9d019d597df011abed4d97d681d7a2279d84e833e467970f5233240a97165f","observation_id":"28e12a76-3141-4adc-9006-da65dbbee667","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13143","last_updated":"2025-04-17T17:51:59Z","snapshot_observed_at":"2026-08-16T12:11:40.367862Z","submitted_at":"2025-04-17T17:51:59Z","title":"$\\texttt{Complex-Edit}$: CoT-Like Instruction Generation for Complexity-Controllable Image Editing Benchmark","version":1},"cited_work":{"arxiv_id":"2504.13143","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13143","snapshot_observed_at":"2026-07-02T01:06:23.900532Z","title":"Complex- edit: Cot-like instruction generation for complexity-controllable image editing benchmark.arXiv preprint arXiv:2504.13143","venue":null,"work_id":"3e4778c3-81ed-439d-b5ee-96b6f734ff44","year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2504.13143","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:80bbddcf28669f66375f233b83f91fc6be3e10e872edadd0801b579c6af968ec","observation_id":"f3f6fdc0-0527-40d0-b198-3a26dd73b987","resolution":{"observed_at":"2026-07-02T01:06:23.902353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:4c9ef4cfbd8ff2de1bc3ce1dc813ba0002fe95ebbbdf8f63f2df077da4d2abe0","observation_id":"5227f2d9-7387-4ce3-9182-80a822ec8e70","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11493","last_updated":"2025-07-25T08:24:07Z","snapshot_observed_at":"2026-08-16T21:36:27.436550Z","submitted_at":"2025-05-16T17:55:54Z","title":"GIE-Bench: Towards Grounded Evaluation for Text-Guided Image Editing","version":3},"cited_work":{"arxiv_id":"2505.11493","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.11493","snapshot_observed_at":"2026-07-09T21:16:34.356874Z","title":"Gie-bench: Towards grounded evaluation for text-guided image editing.arXiv preprint","venue":"cs.CV","work_id":"489714b6-180f-4824-aef6-be392bf3adda","year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2505.11493","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:79d0d86b1680775ccb0aabbc3015e6a7e1ee844c26503a8a011070f115c27328","observation_id":"b4d2bef4-f75e-4b7f-973a-790357831bd4","resolution":{"observed_at":"2026-07-02T01:06:23.932282Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.01851","last_updated":"2026-05-21T06:04:51Z","snapshot_observed_at":"2026-08-17T21:33:24.023756Z","submitted_at":"2026-02-02T09:24:45Z","title":"How Well Do Models Follow Visual Instructions? VIBE: A Systematic Benchmark for Visual Instruction-Driven Image Editing","version":2},"cited_work":{"arxiv_id":"2602.01851","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.01851","snapshot_observed_at":"2026-07-02T01:06:23.925085Z","title":"How well do models follow visual instructions? vibe: A systematic benchmark for visual instruction-driven image editing","venue":"cs.CV","work_id":"08e1f330-fbb1-4178-ba48-7481c52c979e","year":2026},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2602.01851","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:513448a995259d0bddea53dd32909c362798d7085a72b3d5802ac22d1491b0d7","observation_id":"e231e905-cfcb-481f-baa8-b53aa347a764","resolution":{"observed_at":"2026-07-02T01:06:23.926450Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.18159","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T01:06:23.914874Z","title":"arXiv preprint arXiv:2508.18159 , year=","venue":null,"work_id":"6437f66d-7037-47ab-b190-5b9ccd262ad0","year":null},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:054462a467d7fdfb907b5454c6f23c8645fc4290dd8cf623c54bc18df2f2a7c2","observation_id":"a4eb8b4b-c071-4e33-ba99-1866febf2fc9","resolution":{"observed_at":"2026-07-02T01:06:23.916381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:ecac9ae568f2b1d6862f7ec47e3ae21c171fd9aecdb2d2727072bfdbf8a16b6c","observation_id":"68aec290-559c-4724-8b1d-b603976d534b","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:db5e786d885ce5b5c1555896f086e730d50c57918acef1aea72f11bfcb95e83d","observation_id":"9b4e5438-754c-40d5-b185-5837502d3f54","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:b592b4fdf8ac5bc4e4a85575d9e14573445bef2a39adf9c5392248634e1fed95","observation_id":"1ee040b6-1acc-43be-bee9-1428c020a454","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.15727","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:00:05.337825Z","title":"Vocalbench: Benchmarking the vocal conversational abilities for speech interaction models","venue":null,"work_id":"c3125692-20ab-4e87-8b2e-9b5ae17a15c1","year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:f4d7f99dc4a7a6f8494d55a84ea6f8a87829cab959efd2e9286e952895cb0c4d","observation_id":"3c97eb17-b127-4242-b95c-7941e226f078","resolution":{"observed_at":"2026-07-02T01:06:23.899368Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04779","last_updated":"2026-03-16T09:24:19Z","snapshot_observed_at":"2026-08-15T11:17:04.997179Z","submitted_at":"2025-06-05T09:09:36Z","title":"MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark","version":3},"cited_work":{"arxiv_id":"2506.04779","doi":"10.48550/arxiv.2506.04779","metadata_source":"pith","pith_arxiv_id":"2506.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark","venue":"cs.CL","work_id":"1a24d3b1-2d00-407c-90f0-b0aeec13bfe6","year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2506.04779","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:42b72f5780630e9eb4c2fde329d3ba82ce6feb09b9a2488a92dc0632425d4d20","observation_id":"675c33d0-5743-4640-b1b8-3d7e53449328","resolution":{"observed_at":"2026-07-02T01:06:23.879688Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-21T09:22:14.816429+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T09:22:14.816429+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:da894a693348f9751c57e4f5366868f38440d768393e18ac790e8ff6b71fe3ef","observation_id":"ba08ad6d-9b9d-4bac-a5e3-a803bb95135d","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19040","last_updated":"2025-07-25T07:51:22Z","snapshot_observed_at":"2026-08-16T06:00:15.954531Z","submitted_at":"2025-07-25T07:51:22Z","title":"FD-Bench: A Full-Duplex Benchmarking Pipeline Designed for Full Duplex Spoken Dialogue Systems","version":1},"cited_work":{"arxiv_id":"2507.19040","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.19040","snapshot_observed_at":"2026-07-02T01:06:23.922738Z","title":"Fd-bench: A full-duplex benchmarking pipeline designed for full duplex spoken dialogue systems","venue":null,"work_id":"0280ec7e-0b4b-4aa4-9944-88beba7bbaba","year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2507.19040","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:2585aeef3c8cb285f611153eb13e6a8f707617ac4ae6d838c107f0ba3d308dc1","observation_id":"6550477f-a88c-4e9b-a139-7923adc5c048","resolution":{"observed_at":"2026-07-02T01:06:23.924147Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-16T12:52:23.297044Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:61c12196593574518ea2eee6d8cc25c8ea938e63abeeaef5017fed9b43724215","observation_id":"c638c299-5ffc-48b8-8338-4b8eb26dafe0","resolution":{"observed_at":"2026-07-02T01:06:23.921592Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10262","last_updated":"2026-04-17T03:17:04Z","snapshot_observed_at":"2026-08-15T02:03:43.709183Z","submitted_at":"2025-11-13T12:50:04Z","title":"MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models","version":3},"cited_work":{"arxiv_id":"2511.10262","doi":"10.48550/arxiv.2511.10262","metadata_source":"pith","pith_arxiv_id":"2511.10262","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models","venue":"cs.CL","work_id":"440cc3b6-b8c4-4ec5-8501-bcb0026e0808","year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2511.10262","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:dfb153d680b11e49449814b5120b48bfc5dc966efc2342ab9abf971d4e4ff1c9","observation_id":"3db47c35-2200-4517-b0a8-3959ebb202d3","resolution":{"observed_at":"2026-07-02T01:06:23.885910Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"2021 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU) , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:8dc626937a79b848267bd645fbad079064001823a3873c1116c86798fd4c392b","observation_id":"b46864aa-0300-49b8-ac58-039e9bff22d6","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11725","last_updated":"2023-09-22T02:05:36Z","snapshot_observed_at":"2026-08-16T14:58:56.780280Z","submitted_at":"2023-09-21T01:58:01Z","title":"FluentEditor: Text-based Speech Editing by Considering Acoustic and Prosody Consistency","version":2},"cited_work":{"arxiv_id":"2309.11725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.11725","snapshot_observed_at":"2026-07-02T01:06:23.871557Z","title":"arXiv preprint arXiv:2309.11725 , year=","venue":null,"work_id":"630faf1c-3f1d-45dd-a360-d3d2425e8980","year":null},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2309.11725","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:668d9dab3b8417b9fae6754f0b2b54945105939a1d56c625b7f484fc665d49f7","observation_id":"76680612-c7e3-4be1-b0b4-280536b8cb56","resolution":{"observed_at":"2026-07-02T01:06:23.873184Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"IEEE Transactions on Audio, Speech and Language Processing , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:4f2882af77ae2936d309b42b8679848a323da2259c3de1074e378b4b1d0c2872","observation_id":"31943259-43ed-42c8-99f7-7a4088933530","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:5c3c1591c145b98c87ce030455f21b6147f8f90ec555a6542212d63d01873d2e","observation_id":"b563fbe2-5205-4f80-bf44-9d905719a94c","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:693f4ce64df64991f2644194a3926d6205317d95e4196bbe7aaa6f1b3be8ad02","observation_id":"bc43f36a-d381-4a81-becd-7f9d33268fd3","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05329","last_updated":"2026-06-28T13:33:39Z","snapshot_observed_at":"2026-08-17T18:18:38.946960Z","submitted_at":"2026-01-08T19:16:27Z","title":"CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models","version":2},"cited_work":{"arxiv_id":"2601.05329","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.05329","snapshot_observed_at":"2026-07-04T12:09:49.437611Z","title":"CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models","venue":"cs.SD","work_id":"43f2902f-60df-4313-b5f0-a64d350617c4","year":2026},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2601.05329","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:2f2a66045c690176e35eacfdc1a82ec26fa2a82e9dbbc4a831c2af7e2a89f7e5","observation_id":"a217536d-2c7c-4f73-aae2-7985e83cffb8","resolution":{"observed_at":"2026-07-02T01:06:23.913744Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.04738","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T01:06:23.922357Z","title":"arXiv preprint arXiv:2510.04738 , year=","venue":null,"work_id":"11938660-15c0-4368-98fe-3d0c26462317","year":null},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:f7997edb8838952c1575cf0284767a9ce7151d8504a14716f45a5c16badc06e8","observation_id":"f70c4a77-ae8b-422d-b903-be71978b7630","resolution":{"observed_at":"2026-07-02T01:06:23.923837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.05516","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:59:52.830598Z","title":"Ming-uniaudio: Speech llm for joint understanding, generation and editing with unified representation","venue":null,"work_id":"11c153e9-984d-4efa-a9d8-c056545c0042","year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:e19764d0011153cd5bc3ad84fbee2c7421f07d4b133bf76ffc8bff317dfb649a","observation_id":"3e594db9-73fb-434b-9166-b5b9d670d0a9","resolution":{"observed_at":"2026-07-02T01:06:23.934696Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.03601","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T07:39:38.491718Z","title":"Step-audio-editx technical report","venue":null,"work_id":"72708f56-8cbe-49d9-a132-7fb2895ef10e","year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:ea2e7c20fdb565d48bc3f28904f79760e8eb3850f360cf60aa8d6f5a049fe8f6","observation_id":"f84530e1-3fc6-46ce-b6bd-ea35795edd3d","resolution":{"observed_at":"2026-07-02T01:06:23.921180Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"ICASSP 2026-2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:1da3ac150c4fd443e9780abaeda361ee61e4e0c35a4a8b3f0d1073bd6f28f4f8","observation_id":"4d2566a2-04a0-4ac5-9510-f66ce0c0b9e3","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.16056","last_updated":"2026-08-03T16:51:20Z","snapshot_observed_at":"2026-08-16T12:42:56.856916Z","submitted_at":"2026-04-17T13:30:59Z","title":"AST: Adaptive, Seamless, and Training-Free Precise Speech Editing","version":2},"cited_work":{"arxiv_id":"2604.16056","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.16056","snapshot_observed_at":"2026-07-02T01:06:23.933510Z","title":"AST: Adaptive, Seamless, and Training-Free Precise Speech Editing","venue":"cs.SD","work_id":"2f25015c-d111-4e6b-8f03-07a263a3ce5b","year":2026},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2604.16056","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:b024c113c34ced98ef73d9896048d09b32c522b3111c9448603a275ecb890e8d","observation_id":"aedba24b-7a58-46e9-9b59-8cbf34784580","resolution":{"observed_at":"2026-07-02T01:06:23.934771Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17172","last_updated":"2024-07-24T11:22:57Z","snapshot_observed_at":"2026-08-16T13:31:28.573343Z","submitted_at":"2024-07-24T11:22:57Z","title":"Speech Editing -- a Summary","version":1},"cited_work":{"arxiv_id":"2407.17172","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.17172","snapshot_observed_at":"2026-07-02T01:06:23.903657Z","title":"arXiv preprint arXiv:2407.17172 , year=","venue":null,"work_id":"b18cd6d8-483c-4f24-99ee-7e6f90eaadd4","year":2024},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2407.17172","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:40fe5c960a456782cc9f5ebb8866ad2c1ef0128f5d8a85863fcd440db5e8f355","observation_id":"7af05103-8eec-4533-a114-58b693f10eff","resolution":{"observed_at":"2026-07-02T01:06:23.905812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:30629b27bd4f86ce912e2f8e532fab613d924e7598fb5330c5b734b360ed82bf","observation_id":"3ee241dd-1b45-4903-a2bd-6e8edc314ada","resolution":{"observed_at":"2026-07-02T01:06:23.873963Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T16:38:12.229447+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T16:38:12.229447+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T16:38:12.229447+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2504.18425","doi":"10.48550/arxiv.2504.18425","metadata_source":"pith","pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi-Audio Technical Report","venue":"eess.AS","work_id":"9c2ba56b-5585-4f28-b751-703f31dca2d5","year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:73fbdf47d7be9b0d87193e45479c708d9218b58f336d8ff3e95120d612971580","observation_id":"b4ad691d-b8be-4333-a001-255959dc6220","resolution":{"observed_at":"2026-07-02T01:06:23.888363Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.23808","doi":"10.48550/arxiv.2512.23808","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mimo-audio: Audio language models are few-shot learners","venue":"arXiv (Cornell University)","work_id":"8c438dfc-e0fb-45e5-983b-3708cd7afa91","year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:f43d6a906e14cfedd520db44b9ebb15212bbabd6cb9399288806dda80ac10167","observation_id":"9c17c911-2c84-4f7d-9c4e-351328e4b11f","resolution":{"observed_at":"2026-07-02T01:06:23.929677Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-08-13T23:38:52.637908Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"cited_work":{"arxiv_id":"2507.16632","doi":"10.48550/arxiv.2507.16632","metadata_source":"pith","pith_arxiv_id":"2507.16632","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Audio 2 Technical Report","venue":"cs.CL","work_id":"2317bc9f-2d58-4e53-b7ea-804337e9fdef","year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2507.16632","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:2c894a3276483a10102475477461cd6daf6f7f67faef6c72675d8713f6a746a4","observation_id":"5961811b-46f4-4b63-9ac2-a0435eb4a629","resolution":{"observed_at":"2026-07-02T01:06:23.888556Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:45.403831+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:45.403831+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2407.10759","doi":"10.48550/arxiv.2407.10759","metadata_source":"pith","pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-Audio Technical Report","venue":"eess.AS","work_id":"c249e63c-cf40-408f-a4ff-fdf68e8cbeb8","year":2024},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:00b3701ad2a255570eb2408b4e100de6642aae3c1cb5995e748023117f44f509","observation_id":"cbc50df3-d388-4731-abf8-4ca904425673","resolution":{"observed_at":"2026-07-02T01:06:23.871215Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-15T16:44:02.859541Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":"1904.02882","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-07-10T15:47:23.389293Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","venue":"cs.SD","work_id":"3a241487-e181-45f0-bf68-c4a23cbb5674","year":2019},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:fc8c3cf7b6391722dbbfeaf6ea192c893e697bf4a2e545139df199404e8b946a","observation_id":"5090ab68-1d01-4822-8848-2b4d125dc98a","resolution":{"observed_at":"2026-07-02T01:06:23.862465Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-16T19:11:31.952500Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":"2010.11567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-07-04T07:49:38.607429Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines","venue":null,"work_id":"56ec7c2f-2845-4626-80a8-7399c98291f3","year":2020},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:300fc0e6b23d69f5dda515504c5d8918606e3bfaa5ed8c0979fdc2e25900ed0a","observation_id":"1436a86b-d04e-4db9-a1a8-371b85b70769","resolution":{"observed_at":"2026-07-02T01:06:23.940166Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:c5756edcc7fba9f89bc23af4bb52f1a7ceb8f875b826605138240b1cb838cebd","observation_id":"0e8cecbc-25c1-44cd-8471-b6ea3109c888","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"The Rainbow Passage which the speakers read out can be found in the International Dialects of English Archive:(http://web","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:d9500bb513fd0806d3f42b25daaaea8fe84891cc6f4fb653e992882f78026853","observation_id":"61d3f02c-16f5-44d0-985e-44b686bb050c","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"Language resources and evaluation , volume=","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:36e3d54254b47baf8ce9cbf6d0fb91217a1634ffa948ee72033a7bdbe6f3ed0f","observation_id":"fc74b6c9-70bb-4053-bf96-b092c5f23aa1","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02038","last_updated":"2026-08-12T14:00:40Z","snapshot_observed_at":"2026-08-15T23:11:57.132318Z","submitted_at":"2025-08-04T04:08:22Z","title":"Marco-Voice Technical Report","version":5},"cited_work":{"arxiv_id":"2508.02038","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.02038","snapshot_observed_at":"2026-08-13T01:24:38.668245Z","title":"Marco-voice technical report","venue":null,"work_id":"474fe862-9aef-4ff7-89b0-69c90c8d2d3f","year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2508.02038","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:972896bb28c35369e4bd2521d6ed4a24de6f2ef278312441023d6e9db2417592","observation_id":"ae97962b-e266-4109-8d59-ed4aa6f9e464","resolution":{"observed_at":"2026-08-13T01:24:38.668245Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13155","last_updated":"2025-07-17T14:17:40Z","snapshot_observed_at":"2026-08-15T21:10:26.251082Z","submitted_at":"2025-07-17T14:17:40Z","title":"NonverbalTTS: A Public English Corpus of Text-Aligned Nonverbal Vocalizations with Emotion Annotations for Text-to-Speech","version":1},"cited_work":{"arxiv_id":"2507.13155","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13155","snapshot_observed_at":"2026-07-04T07:29:38.659519Z","title":"Nonverbaltts: A public english corpus of text-aligned nonverbal vocalizations with emotion annotations for text-to-speech","venue":null,"work_id":"86df4422-0ef3-4278-b59d-371b130a40fa","year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2507.13155","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:a00ccd0fdafec80ad3bbfff8d99ed7571a40dd99e409ee69a893439ddb38d360","observation_id":"728e6d83-5522-4b63-a6d7-84042f735378","resolution":{"observed_at":"2026-07-02T01:06:23.893986Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:ec0deba69d7ebba5c8176e0df49c512006d3372f56111d010431611dfc285814","observation_id":"e5f7254a-24f4-4392-b404-cb9ba2231f0a","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-08-14T22:25:51.884597Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":"1510.08484","doi":null,"metadata_source":"pith","pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-07-10T12:57:07.598373Z","title":"MUSAN: A Music, Speech, and Noise Corpus","venue":"cs.SD","work_id":"7c604702-578b-4f91-9cc6-f8aa7dbe6d26","year":2015},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:2ab94b9b0ec325a0cf65b5e46bbf5fa68db18b335756fd0ca969c16959e16cab","observation_id":"f90adece-f942-4e69-9eb1-59d51d8c9099","resolution":{"observed_at":"2026-07-02T01:06:23.907611Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"2017 IEEE international conference on acoustics, speech and signal processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:fcea5938d25ac3a53e0e9dd9338ca65e043bb02cced6029f7665dd31864787e0","observation_id":"6593fdb7-6391-42d0-b7c3-ab9aa512db67","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09943","last_updated":"2024-11-15T04:43:44Z","snapshot_observed_at":"2026-08-13T06:34:37.505459Z","submitted_at":"2024-11-15T04:43:44Z","title":"Zero-shot Voice Conversion with Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2411.09943","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.09943","snapshot_observed_at":"2026-07-04T08:29:41.883949Z","title":"Liu, ”Zero-shot Voice Conversion with Diffusion Transformers,”","venue":null,"work_id":"a2d874f7-bf61-4f6e-8a45-e939f8b9b605","year":2024},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2411.09943","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:05f69f9b81fb0261a099f5e5451c201e9fd79087c293d72876d8d08837bd58f3","observation_id":"0ea1d867-762f-42d1-b092-b9539be5185b","resolution":{"observed_at":"2026-07-02T01:06:23.865289Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"GitHub , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:99bbf1d70be18340b9f2870af61ed49f913d8bd7aeede56f0d807fabd31f4860","observation_id":"be1b9965-c26c-4025-a216-fe81bc906771","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.24650","doi":"10.48550/arxiv.2509.24650","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxcpm: Tokenizer-free tts for context-aware speech generation and true-to-life voice cloning","venue":"ArXiv.org","work_id":"191e619c-8028-43ca-952e-2aa85335d419","year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:0701b83ebdff4bd8566742c3ff99e962a0a41b49bc51e953f91537e3c3d89ee9","observation_id":"d05d06dd-deb0-4e48-b968-b849672ed2a6","resolution":{"observed_at":"2026-07-02T01:06:23.894504Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T16:38:11.136296+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T16:38:11.136296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T16:38:11.136296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:b5586ca715429c821e9a956fa9dab71925bd2a8e4fb795c433627184d691bd03","observation_id":"6e8398b6-bd43-4e6e-be83-468e2894b4aa","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05037","last_updated":"2024-12-01T15:17:03Z","snapshot_observed_at":"2026-08-18T03:50:03.772012Z","submitted_at":"2023-08-09T16:09:44Z","title":"Separate Anything You Describe","version":3},"cited_work":{"arxiv_id":"2308.05037","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.05037","snapshot_observed_at":"2026-07-02T01:06:23.917534Z","title":"Plumbley, and Wenwu Wang","venue":null,"work_id":"af611b9a-7615-48ab-ab3f-f1a58dd79b74","year":2024},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2308.05037","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:0451caf80d4622a531c0122d69ed30defc12cdfa635ce9bcd613c2ba60bd68ca","observation_id":"c38663f4-4bb6-4f2f-b7a2-6b9917adee3f","resolution":{"observed_at":"2026-07-02T01:06:23.918980Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"and Maier, Andreas , booktitle=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:071cd032a46dd95451be4335d350f415c18e06891b3e43bbb943dbdd37d07dc0","observation_id":"ac1d2195-59bd-42f8-b0f2-b7df2e6c66ff","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:5242715b52624a0ef9d91955b1855d8df144f646d5b5b98c9862d995abfd766d","observation_id":"a558ddfb-5913-4863-831a-3162989ae8cd","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:2c26be0e9a3021c9e5b1d3cdcf3d3e2dbf70907b4d81d216e4b43dd484c003ec","observation_id":"a8a92170-eb87-4304-bb0e-9f7a778e8806","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04072","last_updated":"2026-04-21T15:32:24Z","snapshot_observed_at":"2026-07-06T22:23:48.679487Z","submitted_at":"2025-09-04T10:05:06Z","title":"Computational Narrative Understanding for Expressive Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2509.04072","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.04072","snapshot_observed_at":"2026-07-02T01:06:23.925379Z","title":"Computational Narrative Understanding for Expressive Text-to-Speech","venue":"eess.AS","work_id":"58b53c93-b056-49bc-beaa-69678585db76","year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2509.04072","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:286e510c36499107135dce889b064877295758fb8e139ba17df3b6be51e63b6e","observation_id":"78a5b616-f034-4352-9432-833ab9c13a7d","resolution":{"observed_at":"2026-07-02T01:06:23.926881Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.00256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T01:06:23.936005Z","title":"Naturalvoices: A large-scale, sponta- neous and emotional podcast dataset for voice conversion","venue":null,"work_id":"2f4b38fa-2b27-46e9-9540-3d2a8372189b","year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:a28a8963ce7fcd90327543c50c1dbee2d4a76428c85fc234b497392972059cd3","observation_id":"991e7e91-c4d9-439a-8da5-15a93dde1156","resolution":{"observed_at":"2026-07-02T01:06:23.937473Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"ICASSP 2026-2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:8fad044d0709e074b277d7df9b273c4a918d06a42aab52b9564ae819a0591f15","observation_id":"af6921e4-04ff-4fb5-8324-11f488e025dc","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16844","last_updated":"2022-03-31T07:01:06Z","snapshot_observed_at":"2026-08-16T17:10:21.435342Z","submitted_at":"2022-03-31T07:01:06Z","title":"Open Source MagicData-RAMC: A Rich Annotated Mandarin Conversational(RAMC) Speech Dataset","version":1},"cited_work":{"arxiv_id":"2203.16844","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.16844","snapshot_observed_at":"2026-07-04T02:49:25.025919Z","title":"Open source magicdata-ramc: A rich annotated mandarin conversational (ramc) speech dataset","venue":null,"work_id":"4b3f52d5-4ee0-4e23-92e6-d68344e22092","year":2022},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2203.16844","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:8a86250cd65ef1d001026a745994c4485a62807bb2b5cdc9319ecbf2d677562c","observation_id":"688d5ea3-4957-4350-b729-444791f5fb87","resolution":{"observed_at":"2026-07-02T01:06:23.896665Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:61e9748cfa1cd24b6eb1d8854140a3f5a7f65245239efdb7c4221b92e37663c5","observation_id":"f5fbbe69-ed2b-486a-a164-f982f9d9268d","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"ICASSP 2026-2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:4758fc2b6ca8e43e2f989dfaea5026dbb2847a5686482723e19bc73f4a941393","observation_id":"a03cf1f3-9b9c-4b47-8a0b-696f3dffa7b8","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:3b1fb72f06450cfb5eec1549126336706a6e88c2ee6592291854dc93312e417d","observation_id":"a8246163-df13-4deb-be7f-7e1d90aeee52","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:75472364ea87e42b2ec46fcb86f7a2f365b70e02520fa2f5e03f364d191e2e83","observation_id":"dadb6c4a-5c90-4d50-8c2f-f922f5133ec3","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:db7dacc00fb25ed7d34dba44081f0240747110b36d2f68e985d85b8e9aaf9c8f","observation_id":"058b5e27-5f12-4eed-b016-7a11938e70da","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-16T16:52:27.830195Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":"2206.08317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-07-02T01:06:23.909166Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition","venue":null,"work_id":"90141a8e-b4e7-4362-8aeb-cf0206bf13b3","year":2022},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:ad6cbbe20a524403b8812d686bfb5b27c6853110ee1a21b537c870b6cb49c886","observation_id":"f4eb1ede-32e2-4e7d-8aef-3877653bd09e","resolution":{"observed_at":"2026-07-02T01:06:23.910895Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-16T15:31:59.301352Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":"2305.11013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-07-10T11:27:03.142196Z","title":"FunASR: A fundamental end-to-end speech recognition toolkit","venue":"cs.SD","work_id":"a1b4d167-dd83-49f9-8309-1e4d5492acf5","year":2023},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:31f234da067df71b1ffeb0f668e28acd8140a4f8f3036b9cc9dbd69916bcd9e6","observation_id":"d235f828-8034-4223-a655-4712c715573e","resolution":{"observed_at":"2026-07-02T01:06:23.860879Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-16T17:09:10.917820Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":"2204.02152","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-07-07T14:53:55.727508Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022","venue":"cs.SD","work_id":"672f99d7-62cc-4d7d-931c-4e7b0083fcd9","year":2022},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:212f28c0a9accb07a62a09d67a7c5f8233a150aefd081f267e63fd4564a0c215","observation_id":"294e9089-c49a-48a7-8acb-0e111bdfec12","resolution":{"observed_at":"2026-07-02T01:06:23.915551Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"IEEE Journal of Selected Topics in Signal Processing , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:779d55c68db358df15e1ae18888980f6afb78d3b8634eb36901b314474f27509","observation_id":"12267ebd-3c48-4610-b6aa-8ea5ac70a1a3","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01466","last_updated":"2021-04-03T19:37:51Z","snapshot_observed_at":"2026-08-16T18:34:03.148289Z","submitted_at":"2021-04-03T19:37:51Z","title":"ECAPA-TDNN Embeddings for Speaker Diarization","version":1},"cited_work":{"arxiv_id":"2104.01466","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.01466","snapshot_observed_at":"2026-07-02T01:06:23.865226Z","title":"arXiv preprint arXiv:2104.01466 , year=","venue":null,"work_id":"e558837c-2bfb-4d30-b66f-2fc9cf7e03bd","year":null},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2104.01466","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:ad1e29540ac4de9be20ebc794fe8683bf95e20d928b3b44d457ef8240061bdf8","observation_id":"1a796340-92da-489c-a5ae-a7d1a991e4b6","resolution":{"observed_at":"2026-07-02T01:06:23.866908Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"ICASSP , year=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:81b16aee45f9b68a408bba9e7cb99523b70ca0c80adf992d85f9683495969dda","observation_id":"fb2ded1b-71b8-4009-be43-9704d7ca97a4","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:7256026fdce332997e0e5cf5febe4c6d7f85886f8f1e654ec904a783991c0ddf","observation_id":"382cace6-d87e-4556-bb44-f4fa0896bfdb","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"2019 , eprint=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:67f0578d155fa50d803ddcf2a50b0a6bba26fec988a31018d64a09815d5536bc","observation_id":"34a45504-7587-42c9-acd5-211608d506cc","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T12:54:20.815371Z","title":"2022 , eprint=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:16c50bc850c0aca62949d30a09f6d6717218de73493c04e780ce05ced419472a","observation_id":"3f0e7370-8e70-4632-b8a5-211055b881a5","resolution":{"observed_at":"2026-06-28T12:54:20.815371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":31,"parse_uncertain":3,"unresolved":30,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 1 inbound Pith citation observation for arXiv:2606.01804."}