{"as_of":"2026-08-10T22:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:636074cda96d549e5b69adcc9b4e96621233a463c16c0936d4771dbc451e2c3c","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:29:50.822607Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06424/citation-record","integrity":"/paper/2608.06424/integrity","json":"/paper/2608.06424/citation-record.json","paper":"/paper/2608.06424"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:29:51.179105Z","title":"Mapache: Masked parallel transformer for advanced speech editing and synthesis","venue":null,"work_id":"9d57c888-05ad-4a50-919b-c055cbb5e859","year":2024},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.730382Z"},"links":{"citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:6bff5bc195992e2eaf4fe19f1c105797f8303680d021fbce30ee795726f962a9","observation_id":"493e87f9-4f2a-400b-9ce8-e63e37ce9c30","resolution":{"observed_at":"2026-08-10T04:29:51.183649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-10T04:29:50.739671Z","title":"High fidelity neural audio compression.arXiv preprint arXiv:2210.13438,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.739671Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:b20222b61e46fba8bf500d8a7f7322386477523aadca7e5eaf3ee9b8edb3d2e6","observation_id":"a92a2c7b-0e8b-4805-942e-2373fc3c6952","resolution":{"observed_at":"2026-08-10T04:29:50.739671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:29:51.107778Z","title":"For substitution and insertion operations, the system must determine the number of codec frames allocated to the edited span before generation","venue":null,"work_id":"1c5596f9-9f9a-49d6-87ea-a0d31a5bdd7c","year":2020},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.822607Z"},"links":{"citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:22de9413cf1653ad6461293e31a9282da6290b3a9f9383f673529dd27ede449d","observation_id":"e1e26ccf-f13c-4ce4-8a66-ff0e77653a3f","resolution":{"observed_at":"2026-08-10T04:29:51.112349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-08-07T23:06:05.723893Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-10T04:29:50.753985Z","title":"Wavtokenizer: an efficient acoustic discrete codec tokenizer for audio language modeling.arXiv preprint arXiv:2408.16532,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.753985Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:09afe4a2ea599c22a745491869e6810bc9ecfcf9c4c196e374a869b0fc7a6663","observation_id":"870693b7-d270-4e07-be0a-43b7cf31c432","resolution":{"observed_at":"2026-08-10T04:29:50.753985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16834","last_updated":"2024-06-06T21:06:44Z","snapshot_observed_at":"2026-07-06T16:38:29.188225Z","submitted_at":"2023-10-25T17:59:12Z","title":"Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16834","snapshot_observed_at":"2026-08-10T04:29:50.768197Z","title":"Discrete diffusion modeling by estimating the ratios of the data distribution, 2024.URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.768197Z"},"links":{"cited_paper":"/paper/2310.16834","citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:243c06275ee64a254dc53533fa8f3cb5195a9804bd823172555760b9ff7d033c","observation_id":"13167d88-46d8-4538-a913-7a85fd875129","resolution":{"observed_at":"2026-08-10T04:29:50.768197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00489","last_updated":"2023-06-01T09:40:47Z","snapshot_observed_at":"2026-08-10T09:44:07.280231Z","submitted_at":"2023-06-01T09:40:47Z","title":"Speech inpainting: Context-based speech synthesis guided by video","version":1},"cited_work":{"arxiv_id":"2306.00489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.00489","snapshot_observed_at":"2026-08-10T04:29:50.986336Z","title":"Speech inpainting: Context-based speech synthesis guided by video","venue":"cs.SD","work_id":"109a48aa-3dd5-4752-b3a0-d9057229a8d9","year":2023},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.772653Z"},"links":{"cited_paper":"/paper/2306.00489","citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:c3cf427494be8ed481b3e37d98979c838e28a43c812385d3c930034a158f9419","observation_id":"306adf4f-176d-4628-89a5-b0a44f456ae9","resolution":{"observed_at":"2026-08-10T04:29:50.991444Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08890","last_updated":"2025-08-12T12:25:53Z","snapshot_observed_at":"2026-08-09T08:17:21.912763Z","submitted_at":"2025-08-12T12:25:53Z","title":"Transient Noise Removal via Diffusion-based Speech Inpainting","version":1},"cited_work":{"arxiv_id":"2508.08890","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.08890","snapshot_observed_at":"2026-08-10T04:29:50.966054Z","title":"Transient Noise Removal via Diffusion-based Speech Inpainting","venue":"eess.AS","work_id":"f5b05e0f-acb8-4dba-8126-3b8c1007bef9","year":2025},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.777180Z"},"links":{"cited_paper":"/paper/2508.08890","citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:347bbfeca8e556a60c898fb984598d2167c53bcaabdba5622957c07daaefa96a","observation_id":"f294eefb-200d-46d8-8e4c-7adfd03ee704","resolution":{"observed_at":"2026-08-10T04:29:50.970902Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-08-10T04:29:50.786020Z","title":"Large language diffusion models.arXiv preprint arXiv:2502.09992,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.786020Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:f89f03c7a39185d04ad70669a952e12070b60664c2277cb9b3177029fc57a84c","observation_id":"68e1f938-7d18-4350-9453-50e95ab20872","resolution":{"observed_at":"2026-08-10T04:29:50.786020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-10T04:29:50.790349Z","title":"Yi Ren, Chenxu Hu, Xu Tan, Tao Qin, Sheng Zhao, Zhou Zhao, and Tie-Yan Liu","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.790349Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:5d926a3e0f9b01bb05748713bc9a8646697d11196438face032005655f3c895a","observation_id":"cff0339d-8e44-4e09-9fed-bc787adb64e1","resolution":{"observed_at":"2026-08-10T04:29:50.790349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-10T04:29:50.799726Z","title":"Score-based generative modeling through stochastic differential equations.arXiv preprint arXiv:2011.13456,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.799726Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:a30c7564f7e168bf09f85b20630fab526433f40c1f5cb5d0307b58a5a1590f26","observation_id":"4460e2a5-e242-44b2-ade8-5b385c264709","resolution":{"observed_at":"2026-08-10T04:29:50.799726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.16750","last_updated":"2023-03-06T18:57:42Z","snapshot_observed_at":"2026-08-07T14:16:10.981980Z","submitted_at":"2022-11-30T05:33:29Z","title":"Score-based Continuous-time Discrete Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.16750","snapshot_observed_at":"2026-08-10T04:29:50.804323Z","title":"Score-based continuous-time discrete diffusion models.arXiv preprint arXiv:2211.16750,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.804323Z"},"links":{"cited_paper":"/paper/2211.16750","citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:d63f140f129b94e3ae5855fdd2cc07417a14b8b1da92c2135edc18b9ec34a1a6","observation_id":"695dd7ba-2dbb-40ff-bdaa-3e17869b4416","resolution":{"observed_at":"2026-08-10T04:29:50.804323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:29:51.122136Z","title":"usee: Unified speech enhancement and editing with conditional diffusion models","venue":null,"work_id":"232a2451-8dc3-4560-ad14-2bf8657e1b93","year":2024},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.813283Z"},"links":{"citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:6b0c862f44102cc95afee0be0a2a928820ba3bb092af7bfd68a4736c652f1a51","observation_id":"ec8c193e-abee-4711-86df-568a36703bc2","resolution":{"observed_at":"2026-08-10T04:29:51.126709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-10T09:39:47.608323Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-10T04:29:50.817951Z","title":"Libritts: A corpus derived from librispeech for text-to-speech.arXiv preprint arXiv:1904.02882,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.817951Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:246b57e9a05296f220755185545e6cc24d60cc76452cc242c9f541af355379c6","observation_id":"496d843a-deeb-4b8e-bc93-2d289e9be7c4","resolution":{"observed_at":"2026-08-10T04:29:50.817951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:29:51.150668Z","title":"Discrete diffusion for generative modeling of text-aligned speech tokens","venue":null,"work_id":"0126debc-636f-40fd-9479-8e54012c99f0","year":2026},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":1981,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.758646Z"},"links":{"citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:485faf31bd3dbc958e021a02cde71795e0244dd6bc799a7169be79033e09c762","observation_id":"ae67ffad-d65e-4189-a488-2f004e558dde","resolution":{"observed_at":"2026-08-10T04:29:51.155056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:29:51.192928Z","title":"Block diffusion: Interpolating between autoregressive and diffusion language models","venue":null,"work_id":"bae67f07-cca0-46c9-a1c3-8c517759470c","year":2025},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.720825Z"},"links":{"citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:1a5b1843b2533a6b20d0a8b9f1be37525f9ac6c152131d7103b10b349dcbea63","observation_id":"aad7ddf9-75d8-4283-804b-d82883370553","resolution":{"observed_at":"2026-08-10T04:29:51.197422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11725","last_updated":"2023-09-22T02:05:36Z","snapshot_observed_at":"2026-07-06T16:21:33.523806Z","submitted_at":"2023-09-21T01:58:01Z","title":"FluentEditor: Text-based Speech Editing by Considering Acoustic and Prosody Consistency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11725","snapshot_observed_at":"2026-08-10T04:29:50.763054Z","title":"Fluenteditor: Text-based speech editing by considering acoustic and prosody consistency.arXiv preprint arXiv:2309.11725,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.763054Z"},"links":{"cited_paper":"/paper/2309.11725","citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:af1b6b6d02e163fdadde4e8018dcb7463f6130db120de8314fa08f47cc81b121","observation_id":"8231d0da-6716-4abe-887c-ea922dd5d965","resolution":{"observed_at":"2026-08-10T04:29:50.763054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-04T06:18:23.412967Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-10T04:29:50.795291Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022.arXiv preprint arXiv:2204.02152,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.795291Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:f7715fb8d119a28f7bfd2437cd58bbaebc7af6bf1a9c3a41d1e2825504ef7c3d","observation_id":"5f7e274b-4338-4875-be56-f1de170b042d","resolution":{"observed_at":"2026-08-10T04:29:50.795291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:29:51.164007Z","title":"Token-based audio inpainting via discrete diffusion","venue":null,"work_id":"c5454beb-ac5a-41b1-b001-cf370bf632d7","year":2026},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.744507Z"},"links":{"citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:2f542d7bf384f159991426389f64ddfdacc7f9dba242827ae0d32e132727cddb","observation_id":"377a4f7b-9223-4b5a-b392-376cf5a50bb7","resolution":{"observed_at":"2026-08-10T04:29:51.169124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07273","last_updated":"2022-03-30T17:23:15Z","snapshot_observed_at":"2026-07-06T12:37:55.156832Z","submitted_at":"2022-02-15T09:33:30Z","title":"SpeechPainter: Text-conditioned Speech Inpainting","version":2},"cited_work":{"arxiv_id":"2202.07273","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07273","snapshot_observed_at":"2026-08-10T04:29:51.092901Z","title":"SpeechPainter: Text-conditioned Speech Inpainting","venue":"cs.SD","work_id":"9c2bc4f5-30df-4078-b546-073e1565154e","year":2022},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.725712Z"},"links":{"cited_paper":"/paper/2202.07273","citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:ea3377e2c2582d759f0af9d2c8846399e8954ab1baeddede14fcf89e24e34fc0","observation_id":"7b322f63-27e0-4658-895b-cc44b133efae","resolution":{"observed_at":"2026-08-10T04:29:51.098061Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-10T04:29:50.749133Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.749133Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:d29be7887959735855dfe17a375629f1c07670f4b844decfa67c2785d62d2a00","observation_id":"433897b6-e47c-4e2e-a46f-19001d27301c","resolution":{"observed_at":"2026-08-10T04:29:50.749133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-09T08:32:43.969496Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-10T04:29:50.734798Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio.arXiv preprint arXiv:2106.06909,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.734798Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:e8f262038159341ccc2b25f386700071ec498651a415e8783ab7278c2a0c1b65","observation_id":"a755dd70-14c7-4da9-a1b6-0ed318841856","resolution":{"observed_at":"2026-08-10T04:29:50.734798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19709","last_updated":"2023-05-31T10:05:33Z","snapshot_observed_at":"2026-07-06T15:35:52.836404Z","submitted_at":"2023-05-31T10:05:33Z","title":"XPhoneBERT: A Pre-trained Multilingual Model for Phoneme Representations for Text-to-Speech","version":1},"cited_work":{"arxiv_id":"2305.19709","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.19709","snapshot_observed_at":"2026-08-10T04:29:50.943389Z","title":"XPhoneBERT: A Pre-trained Multilingual Model for Phoneme Representations for Text-to-Speech","venue":"cs.CL","work_id":"1fd8aa20-04b3-400c-a81a-cafdfd115def","year":2023},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.781601Z"},"links":{"cited_paper":"/paper/2305.19709","citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:fd3ab2107449e494dcd23c4d68bc97094d7e5d32afb08ac7fd0c36c89434f64b","observation_id":"e7f8c054-2f42-463c-98ce-d9cd246d7ac6","resolution":{"observed_at":"2026-08-10T04:29:50.950424Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:29:51.136886Z","title":"Ssr-speech: Towards stable, safe and robust zero-shot text-based speech editing and synthesis","venue":null,"work_id":"20ed87de-51a3-4a32-8745-03617723ab70","year":2025},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.808904Z"},"links":{"citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:e0b6986ef3bb8a54db641d935c319515241dcfb90514cc09d3098c76a93e97d3","observation_id":"0d2d4c22-7347-4b15-8700-235ef0533c0e","resolution":{"observed_at":"2026-08-10T04:29:51.141461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-10T22:09:50.795577Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":4,"verified_fuzzy":7},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2608.06424."}