{"as_of":"2026-08-14T00:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:01ad264fd187a0f888dbf849b2180b87870bfe9e0c95bdacb465bef113d07a99","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:46:23.404901Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:46:23.292385Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-12T04:46:23.543943Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"cited_work":{"arxiv_id":"2412.01100","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.01100","snapshot_observed_at":"2026-08-12T04:46:23.543943Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","venue":"cs.SD","work_id":"52e7c76c-40ba-4d27-a406-8bf685044422","year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.292385Z"},"links":{"cited_paper":"/paper/2412.01100","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:ba62a20999c4004992f498dee54b749b0ec4056abc2eda6cc782e09104a1e23d","observation_id":"a5953255-227d-4271-9788-83a2cc98c164","resolution":{"observed_at":"2026-08-12T04:46:23.547969Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.01100/citation-record","integrity":"/paper/2412.01100/integrity","json":"/paper/2412.01100/citation-record.json","paper":"/paper/2412.01100"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.783291Z","title":"On the one hand, TTS systems need to accurately replicate the target speakers’ voice, including their timbre, pitch, and prosody, using voice cloning techniques","venue":null,"work_id":"8d79036b-3f5b-47dd-ad25-79abdfcf3425","year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.285394Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:23ec006cdc81ea7966e3d62bf539089efc95e9d594b9cc63a8c8ae963976d2e1","observation_id":"1190a25e-e7b2-4c45-889b-8d3fc6a7410d","resolution":{"observed_at":"2026-08-12T04:46:23.787300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"cited_work":{"arxiv_id":"2412.01100","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.01100","snapshot_observed_at":"2026-08-12T04:46:23.543943Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","venue":"cs.SD","work_id":"52e7c76c-40ba-4d27-a406-8bf685044422","year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.292385Z"},"links":{"cited_paper":"/paper/2412.01100","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:ba62a20999c4004992f498dee54b749b0ec4056abc2eda6cc782e09104a1e23d","observation_id":"a5953255-227d-4271-9788-83a2cc98c164","resolution":{"observed_at":"2026-08-12T04:46:23.547969Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.772018Z","title":"Firstly, we will overview the text represen- tations and the discrete speech tokens, and then introduce the LLaMA-based codec language model with a delay pattern","venue":null,"work_id":"bcc0ea27-9107-4598-a52a-11af538386fb","year":null},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.296336Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:1c0b2cc6e64cb2a664252881b62b15736ca2ab9dbb8253c96205a86a7af07412","observation_id":"592e28c6-cd5f-4b2a-98ac-9cdff6417d90","resolution":{"observed_at":"2026-08-12T04:46:23.775974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.760171Z","title":"Model Configurations We use the open-source models and parameters of MT5-base, DAC and HuBERT, with both DAC and HuBERT configured for a sampling rate of 16 kHz","venue":null,"work_id":"54cb8fa1-1278-48e2-af31-e68c51a586ec","year":null},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.300465Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:3abb6aff47ae8bed01f8df3502f6404b7fc35c318fd9afe1fb533abde232fdc9","observation_id":"6f26b3b5-fbf7-41de-9a15-3bd8a680e28b","resolution":{"observed_at":"2026-08-12T04:46:23.764622Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.748803Z","title":"嗯” (En- glish translation: “um","venue":null,"work_id":"77fdf4cb-18a0-4512-a7a4-fcd4180fc6df","year":null},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.304430Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:a8cd74cea740a4e6d3774ebeec0bf564d9f2f908519ae05fff90305dbe259b86","observation_id":"01c61244-b2b2-41d0-90ba-e3291cb72429","resolution":{"observed_at":"2026-08-12T04:46:23.752707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.736697Z","title":"We propose a LLaMA-based codec language model with a delay pattern for spontaneous style voice cloning","venue":null,"work_id":"e0f5ad37-7196-405a-ad8a-bb31e9a2350d","year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.308086Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:45b48255aeb223bb2ca9c526f66cc46165642fc3733764172c3143b6b7c03d04","observation_id":"b7fa6797-065c-45fa-8d5d-8d8bf1dff17b","resolution":{"observed_at":"2026-08-12T04:46:23.740832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.724110Z","title":null,"venue":null,"work_id":"4f34d28d-bc35-4093-971f-cc1a34a74a17","year":null},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.311926Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:05aeea29cbb2cf01a73219e91d64d5baed1cfcccefeceb702092247222974e80","observation_id":"542d5b6a-0118-423b-9794-2f06bfeb2511","resolution":{"observed_at":"2026-08-12T04:46:23.727825Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.712111Z","title":"Deep voice 3: Scaling text- to-speech with convolutional sequence learning,","venue":null,"work_id":"6cd43568-225a-4143-9abc-b3c8357bf161","year":2018},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.315475Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:0b17c5e92b3007cc1f90dde22734da1659caeaf2bd9c942e61498bf70811251e","observation_id":"139d5379-45c2-4cf5-bd1c-874b58db1a35","resolution":{"observed_at":"2026-08-12T04:46:23.716321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.701175Z","title":"Neural voice cloning with a few samples,","venue":null,"work_id":"807116e5-0158-4920-9e4e-54b942fbb9be","year":2018},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.319118Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:4c2ab83025aa6b65bf2c1fc898c4ebbd0d45d4e891933e1d524b1388541a3845","observation_id":"b710d84c-195f-4657-98c3-a383d04cd232","resolution":{"observed_at":"2026-08-12T04:46:23.705048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.689450Z","title":"Adaspeech: Adaptive text to speech for custom voice,","venue":null,"work_id":"0a83ed00-2273-4632-8727-c8a0a99ba76c","year":null},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.322596Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:23b753635d69cc506d830c7ceffb95ac6217967c7c32da19d886554625feb9e1","observation_id":"ea60877d-f449-4e08-bac4-d82e9ed42ed0","resolution":{"observed_at":"2026-08-12T04:46:23.693828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-12T04:46:23.326163Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.326163Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:08f6a7f0e492fbdc96635a9f8647c47370a96ea8c05db1e814a8df650fe4105a","observation_id":"2be492a3-b375-428d-9fd9-c5743916fb77","resolution":{"observed_at":"2026-08-12T04:46:23.326163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-13T12:29:52.281350Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-12T04:46:23.330505Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.330505Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:abef8c3181cadf48449946fb88523671cbe2769b536102cb5f083eed897d885e","observation_id":"d446060d-6a77-46c0-81dd-6940d5873c3c","resolution":{"observed_at":"2026-08-12T04:46:23.330505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.678425Z","title":"Speechx: Neural codec language model as a versatile speech transformer,","venue":null,"work_id":"384751dd-3324-4a5f-9766-e964ce4b2d78","year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.334229Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:23e37d1251065eb84a5804ea17c477c6ca646832ac6cc8c1e9550667312b5d7b","observation_id":"d293bd2d-c7d7-4380-9a81-fddc37b9b8b6","resolution":{"observed_at":"2026-08-12T04:46:23.682223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07333","last_updated":"2024-01-14T17:43:55Z","snapshot_observed_at":"2026-08-13T04:43:10.925367Z","submitted_at":"2024-01-14T17:43:55Z","title":"ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07333","snapshot_observed_at":"2026-08-12T04:46:23.337892Z","title":"Ella-v: Stable neural codec language modeling with alignment-guided sequence reordering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.337892Z"},"links":{"cited_paper":"/paper/2401.07333","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:2f8ccb62d41c14f7894a1dee83fba2464ee9e1475500e8279d4487f23f815778","observation_id":"52a4f702-c67b-4136-bb99-3b2fed255e00","resolution":{"observed_at":"2026-08-12T04:46:23.337892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-12T04:46:23.341898Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.341898Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:eafd3fb071cc2f6a70dbc6c588c6cb4c9515c9ac60db041a4302135eb93da8e1","observation_id":"9536cd50-92d2-420f-b1a8-48d92887b299","resolution":{"observed_at":"2026-08-12T04:46:23.341898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.345998Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.345998Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:86ad3f83a35c0e913f2afa99a6700405ff934472697d7da34d9c7c1bd606c551","observation_id":"56d4e3c2-ab15-4282-8e69-e1e06b5951f9","resolution":{"observed_at":"2026-08-12T04:46:23.345998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.658532Z","title":"Conversational end-to-end tts for voice agents,","venue":null,"work_id":"feba0a30-e00f-4089-898a-9a8526149b33","year":2021},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.349799Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:5a50dfcfb346c6a9ae4f6f806c8ecf292f8fa3dfcd4e1fe9d7e0ec0814ad4811","observation_id":"2336ffaf-b83f-4884-8c33-73fefbbd7960","resolution":{"observed_at":"2026-08-12T04:46:23.662670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.647553Z","title":"End-to-end text-to-speech based on latent representa- tion of speaking styles using spontaneous dialogue,","venue":null,"work_id":"b410ca49-346d-4940-9365-cd8cb50a5e6f","year":2022},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.353254Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:2d04bee904348649edc4a1d3dd30822adff527ce90ba277c055eb6a54013a1c6","observation_id":"9ace13ad-7a94-4da0-b69b-b61de73813ed","resolution":{"observed_at":"2026-08-12T04:46:23.651480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.636451Z","title":"Spontts: modeling and transferring spontaneous style for tts,","venue":null,"work_id":"d2d2189a-6ac6-44ec-80b5-719abebddfda","year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.356699Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:01aafcd3ffbe8eddcc052206c424bfd691cc8b34b4f34577d4a25f50e1ac797b","observation_id":"e941ab01-b81a-4b56-82c3-6611513a1fc5","resolution":{"observed_at":"2026-08-12T04:46:23.640293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.10828","last_updated":"2021-06-21T03:36:14Z","snapshot_observed_at":"2026-08-07T19:39:50.501914Z","submitted_at":"2021-06-21T03:36:14Z","title":"Controllable Context-aware Conversational Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2106.10828","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.10828","snapshot_observed_at":"2026-08-12T04:46:23.486002Z","title":"Controllable Context-aware Conversational Speech Synthesis","venue":"eess.AS","work_id":"14f78864-601a-49ff-b88d-718b7c5db310","year":2021},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.360982Z"},"links":{"cited_paper":"/paper/2106.10828","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:418ebcd7e8545f76ba0b8eb7e918aa16c25850096462eabe2c482bd180d49e7c","observation_id":"ab184b98-a3ca-4c99-96f8-ebee51f4f082","resolution":{"observed_at":"2026-08-12T04:46:23.491867Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13509","last_updated":"2024-07-18T13:42:38Z","snapshot_observed_at":"2026-08-12T23:19:28.940447Z","submitted_at":"2024-07-18T13:42:38Z","title":"Spontaneous Style Text-to-Speech Synthesis with Controllable Spontaneous Behaviors Based on Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13509","snapshot_observed_at":"2026-08-12T04:46:23.364935Z","title":"Spontaneous style text-to-speech synthesis with con- trollable spontaneous behaviors based on language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.364935Z"},"links":{"cited_paper":"/paper/2407.13509","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:12224368aad84a54b4ccd723064aaa277930ec629fc5aa88bf411622cea6f579","observation_id":"eef021a3-549c-473f-8d2f-0f8ff685f326","resolution":{"observed_at":"2026-08-12T04:46:23.364935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05763","last_updated":"2024-06-19T04:52:56Z","snapshot_observed_at":"2026-08-12T23:47:01.101483Z","submitted_at":"2024-06-09T12:32:42Z","title":"WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05763","snapshot_observed_at":"2026-08-12T04:46:23.368773Z","title":"Wenetspeech4tts: A 12,800-hour mandarin tts corpus for large speech generation model bench- mark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.368773Z"},"links":{"cited_paper":"/paper/2406.05763","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:6d84d6634a9c9b83646923907839c957f16cbe44fd7111c92a4a72434149a241","observation_id":"8198aee0-864b-4a99-aae9-39ad1aece243","resolution":{"observed_at":"2026-08-12T04:46:23.368773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.624991Z","title":"Wenetspeech: A 10000+ hours multi- domain mandarin corpus for speech recognition,","venue":null,"work_id":"52e900dc-cd92-428a-8c26-d4b7abe1e061","year":2022},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.371902Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:bcc6d02863987d834afb07d5276786d49d0cb583e78a652768a1f36514afd350","observation_id":"713e2b56-1c94-4773-bb5a-85dd25ea7cc5","resolution":{"observed_at":"2026-08-12T04:46:23.629094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.613505Z","title":"mt5: A massively multilingual pre-trained text-to-text transformer,","venue":null,"work_id":"b8347ff5-cab0-405a-adbd-f9cb6efdbc8e","year":2021},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.374799Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:8a7b0d6a158e7c86eef2219b312895bacc885d01d97d50c2f3e88b2ed487d8ea","observation_id":"d7bf9a78-9f93-4ed1-baf8-69e0a9c4cdcc","resolution":{"observed_at":"2026-08-12T04:46:23.617503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.377892Z","title":"HuBERT: Self-Supervised Speech Rep- resentation Learning by Masked Prediction of Hidden Units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.377892Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:97906b3811a5605d9bc4bd0d26d56ec35dd91548f4493d139f2450b722d40337","observation_id":"a8c3f4cf-12b0-42e2-b03f-74b31a86af06","resolution":{"observed_at":"2026-08-12T04:46:23.377892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.596254Z","title":"High-fidelity audio compression with improved rvqgan,","venue":null,"work_id":"9d66b5d4-a8d3-4bce-8c3e-5eee7c39c953","year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.381246Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:782835d62336524cdc9965398f7758ebf3926462e7615cf2d195781b71c8892f","observation_id":"f66521be-d789-4b3c-8d13-68af8feaa5a6","resolution":{"observed_at":"2026-08-12T04:46:23.599558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T04:46:23.384154Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.384154Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:320316afa850bbe8b9e7554e2673e4add3d860d059c9848e9e6ddcb43ef82b31","observation_id":"0f5ec975-e862-44f8-8c43-08b91f42b660","resolution":{"observed_at":"2026-08-12T04:46:23.384154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.585567Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness,","venue":null,"work_id":"74df0e64-d1c9-4220-8880-e902824f3ab9","year":2022},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.387495Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:cc40baf10630e2c5f61f4b492213e78dd54d530fc8404b2a924b708299701314","observation_id":"d9cbc3d8-0b36-4985-b679-2ddd1768a059","resolution":{"observed_at":"2026-08-12T04:46:23.589572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.390561Z","title":"Speak, read and prompt: High-fidelity text-to-speech with min- imal supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.390561Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:e98254c0718d8818eaeda00f3081f805cae0b1e78a561caa5594f4df23354fac","observation_id":"30144310-756d-41df-ba16-52faf1b7a0e8","resolution":{"observed_at":"2026-08-12T04:46:23.390561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.566618Z","title":"Simple and controllable music gen- eration,","venue":null,"work_id":"8ca21293-bc4f-4792-b415-ca245a1cea5c","year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.394037Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:324d98297d2744938b7e2b498de30a684ee0da94673e8f82ed18e6c6fcee389b","observation_id":"b902a4c1-e7f8-48ac-8890-11e9b59feea2","resolution":{"observed_at":"2026-08-12T04:46:23.570739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-13T04:28:02.323611Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-12T04:46:23.397620Z","title":"Natural language guidance of high- fidelity text-to-speech with synthetic annotations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.397620Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:f091c19a724c53fcb688ddd6248cdc3e9fcb9076e4271b7b879382be1a84dd08","observation_id":"d6439b49-a38e-4d9c-82ea-8e7aacd6f301","resolution":{"observed_at":"2026-08-12T04:46:23.397620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17806","last_updated":"2023-06-30T17:07:02Z","snapshot_observed_at":"2026-08-13T11:05:10.061658Z","submitted_at":"2023-06-30T17:07:02Z","title":"Stay on topic with Classifier-Free Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17806","snapshot_observed_at":"2026-08-12T04:46:23.401316Z","title":"Stay on topic with classifier-free guidance,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.401316Z"},"links":{"cited_paper":"/paper/2306.17806","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:89271aa8996cc06853bb8e5399d9d4774676690d3f1fda229cac8680392473e7","observation_id":"39d733d5-23be-4d16-a63b-ccb8ab33b86a","resolution":{"observed_at":"2026-08-12T04:46:23.401316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.555233Z","title":"V oxinstruct: Expressive human instruction-to-speech generation with unified multilingual codec language modelling,","venue":null,"work_id":"d8e7ed05-f59c-465d-bfaf-5b633daf0d87","year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.404901Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:cef155464bfa1a1cd0f440b8282b37b9f12f90c33c1d303f1afd9a151f6b41cf","observation_id":"724b1e42-e0be-4518-9a48-49440cf836ad","resolution":{"observed_at":"2026-08-12T04:46:23.559034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-12T04:39:17.017850Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":13,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 1 inbound Pith citation observation for arXiv:2412.01100."}