{"as_of":"2026-08-08T03:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:26ed858816269d5e9712da0027b58ef92a7173474d3d856a7d2aae40d9f9db46","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:22:27.950994Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.22746/citation-record","integrity":"/paper/2507.22746/integrity","json":"/paper/2507.22746/citation-record.json","paper":"/paper/2507.22746"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-06T11:22:25.341706Z","title":"Better speech synthesis through scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:25.341706Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:d2d08c2f0d2e9c4651a79d3422515729c88fd523cbe136a44963792802642fe5","observation_id":"6229081c-1426-49c8-90a8-da36704ba759","resolution":{"observed_at":"2026-08-06T11:22:25.341706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-06T11:22:25.630747Z","title":"High fidelity neural audio compression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:25.630747Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:7bb5089712037c0ff0c3b6edc603d940d804fcd4d0f81dd55b49b5208fbf086b","observation_id":"3b306d4d-dbb8-43b9-b58d-7acdf6d27af1","resolution":{"observed_at":"2026-08-06T11:22:25.630747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02617","last_updated":"2026-04-17T21:00:45Z","snapshot_observed_at":"2026-07-30T10:05:05.279382Z","submitted_at":"2024-12-03T17:44:23Z","title":"Improving Dynamic Object Interactions in Text-to-Video Generation with AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02617","snapshot_observed_at":"2026-08-06T11:22:25.922271Z","title":"Improving dynamic object interactions in text-to-video generation with ai feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:25.922271Z"},"links":{"cited_paper":"/paper/2412.02617","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:1c954c9c041f2f9d9a43377238a4e7ded6cb282129b03a3c7df7d932d8a45ad2","observation_id":"4c112359-d552-43bb-9d01-693ec47a680d","resolution":{"observed_at":"2026-08-06T11:22:25.922271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13447","last_updated":"2025-05-19T17:59:42Z","snapshot_observed_at":"2026-07-06T21:26:30.087184Z","submitted_at":"2025-05-19T17:59:42Z","title":"Mean Flows for One-step Generative Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13447","snapshot_observed_at":"2026-08-06T11:22:25.951018Z","title":"Mean flows for one-step generative modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:25.951018Z"},"links":{"cited_paper":"/paper/2505.13447","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:c02bb56c600712aaf4f97d6ca9bde546526ecd1222e804f6fdb9ffab7fc4f480","observation_id":"3265b4f7-b4a9-463f-9301-ac12a400f9da","resolution":{"observed_at":"2026-08-06T11:22:25.951018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:26.029534Z","title":"Ditar: Diffusion transformer autoregressive modeling for speech generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.029534Z"},"links":{"citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:bf17908f726f566f36b59a38c8ba692fe296691d74109dbaf4b958b433e349b7","observation_id":"ce0731a6-61e7-4eb0-bc97-2580a1e39188","resolution":{"observed_at":"2026-08-06T11:22:26.029534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-07T23:22:31.422843Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-06T11:22:26.095836Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.095836Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:1d1efc30f4d936089d0cdb12ee12b400c23c8e2294f8db0769238629f0e4916f","observation_id":"42b581fd-1e21-41bf-b2d1-564f140f6444","resolution":{"observed_at":"2026-08-06T11:22:26.095836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07383","last_updated":"2024-03-04T19:15:29Z","snapshot_observed_at":"2026-08-07T15:18:58.729991Z","submitted_at":"2024-02-12T02:58:10Z","title":"Making Flow-Matching-Based Zero-Shot Text-to-Speech Laugh as You Like","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07383","snapshot_observed_at":"2026-08-06T11:22:26.208323Z","title":"Making flow-matching-based zero-shot text-to-speech laugh as you like","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.208323Z"},"links":{"cited_paper":"/paper/2402.07383","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:a74689f2c4aec38e488a1ad4a5505679f8ff696f00054ab524805cef2659090a","observation_id":"a5fa5a1c-84dd-47af-8e12-f28339bbaec8","resolution":{"observed_at":"2026-08-06T11:22:26.208323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:29.057928Z","title":"istftnet: Fast and lightweight mel-spectrogram vocoder incorporating inverse short-time fourier transform","venue":null,"work_id":"8bb6cd4a-3b9e-4e3b-93a9-8a15e3d0da5c","year":2022},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.324190Z"},"links":{"citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:3135c79983908f4d6dbabbc13c8e345c12e2fbbb3ce110ab5cdc1779fd5cc172","observation_id":"aa2df25a-9a0d-4912-8631-37d282ff4376","resolution":{"observed_at":"2026-08-06T11:22:29.105049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07477","last_updated":"2022-12-05T09:15:28Z","snapshot_observed_at":"2026-08-03T21:45:08.939710Z","submitted_at":"2022-02-14T18:59:47Z","title":"Understanding DDPM Latent Codes Through Optimal Transport","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07477","snapshot_observed_at":"2026-08-06T11:22:26.402690Z","title":"Understanding ddpm latent codes through optimal transport","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.402690Z"},"links":{"cited_paper":"/paper/2202.07477","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:6264e6341fd868dcebe8fe8ef12ebadc57b92180b0dd3ce66ee819210d5522d6","observation_id":"16933749-f487-4e28-8067-c097a54726a6","resolution":{"observed_at":"2026-08-06T11:22:26.402690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02285","last_updated":"2023-10-12T03:05:36Z","snapshot_observed_at":"2026-08-01T15:11:32.829718Z","submitted_at":"2023-09-05T14:45:27Z","title":"PromptTTS 2: Describing and Generating Voices with Text Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02285","snapshot_observed_at":"2026-08-06T11:22:26.482050Z","title":"Prompttts 2: Describing and generating voices with text prompt","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.482050Z"},"links":{"cited_paper":"/paper/2309.02285","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:d7de0dce6cde32bcabdf6dc6d585d7ffcb56a4110487502ccc6cfb0c2671b6a8","observation_id":"3763f71c-b841-4b96-8274-d7fe01dee4d1","resolution":{"observed_at":"2026-08-06T11:22:26.482050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04016","last_updated":"2024-09-06T04:06:50Z","snapshot_observed_at":"2026-08-07T06:40:10.412326Z","submitted_at":"2024-09-06T04:06:50Z","title":"Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation","version":1},"cited_work":{"arxiv_id":"2409.04016","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.04016","snapshot_observed_at":"2026-08-06T11:22:28.800955Z","title":"Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation","venue":"cs.SD","work_id":"9919d8b4-1261-427e-91e1-a360f3fcef40","year":2024},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.545205Z"},"links":{"cited_paper":"/paper/2409.04016","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:196acb5a23c425365e3e1b52a3da282fc6ba0d047c41184e4647c3698c7b9980","observation_id":"2d8b244c-560b-408d-a460-e5e525c30581","resolution":{"observed_at":"2026-08-06T11:22:28.855073Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-06T11:22:26.665411Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.665411Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:bd0de632ea0d178acce11e773842ae87cbc7294a424d77e13736e287abeea0a9","observation_id":"1877fbd7-3822-4a5d-95c0-d4b452f46c9f","resolution":{"observed_at":"2026-08-06T11:22:26.665411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04646","last_updated":"2022-07-11T06:15:45Z","snapshot_observed_at":"2026-08-06T07:27:28.537293Z","submitted_at":"2022-07-11T06:15:45Z","title":"DelightfulTTS 2: End-to-End Speech Synthesis with Adversarial Vector-Quantized Auto-Encoders","version":1},"cited_work":{"arxiv_id":"2207.04646","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.04646","snapshot_observed_at":"2026-08-06T11:22:28.509789Z","title":"DelightfulTTS 2: End-to-End Speech Synthesis with Adversarial Vector-Quantized Auto-Encoders","venue":"cs.SD","work_id":"00bd8f91-a87f-4049-82b2-5124c035fbf5","year":2022},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.737905Z"},"links":{"cited_paper":"/paper/2207.04646","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:5c808beca0d22a00618a4ffb88288695509c978af6be607def99fb7c46404715","observation_id":"5c6132fe-1c44-4db0-a7a9-dc422b4ccf88","resolution":{"observed_at":"2026-08-06T11:22:28.570689Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08551","last_updated":"2025-05-27T05:07:56Z","snapshot_observed_at":"2026-08-05T05:08:56.833881Z","submitted_at":"2024-07-11T14:36:53Z","title":"Autoregressive Speech Synthesis without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08551","snapshot_observed_at":"2026-08-06T11:22:26.796662Z","title":"Autoregressive speech synthesis without vector quantization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.796662Z"},"links":{"cited_paper":"/paper/2407.08551","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:af93b3951d96d54f306672f2ba2c58925b150d6a3e5562cb8ad9772dc6b917b2","observation_id":"d3549354-974d-4d53-b100-5142f17f4f53","resolution":{"observed_at":"2026-08-06T11:22:26.796662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-06T11:22:26.883167Z","title":"Finite scalar quantization: Vq-vae made simple","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.883167Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:2a8db871ec81cc1462dce97095ca731c81ea1762e233fc0a27e3e5ccab7dd774","observation_id":"d4b868e7-0546-4ed3-be84-a08794a3fc41","resolution":{"observed_at":"2026-08-06T11:22:26.883167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19842","last_updated":"2024-11-29T16:58:02Z","snapshot_observed_at":"2026-07-06T19:59:01.756640Z","submitted_at":"2024-11-29T16:58:02Z","title":"Scaling Transformers for Low-Bitrate High-Quality Speech Coding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19842","snapshot_observed_at":"2026-08-06T11:22:26.987973Z","title":"Scaling transformers for low-bitrate high-quality speech coding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.987973Z"},"links":{"cited_paper":"/paper/2411.19842","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:b28e7bb0313d4ceac96230f00dab07696f183f2067e719dacaddb9ac067160c3","observation_id":"f01925d6-4100-4867-b4ef-5eb009bfc73c","resolution":{"observed_at":"2026-08-06T11:22:26.987973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11757","last_updated":"2023-10-23T20:47:30Z","snapshot_observed_at":"2026-07-06T14:45:19.481734Z","submitted_at":"2023-01-27T14:52:53Z","title":"Mo\\^usai: Text-to-Music Generation with Long-Context Latent Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11757","snapshot_observed_at":"2026-08-06T11:22:27.053403Z","title":"Mo \\ˆ usai: Text-to-music generation with long-context latent diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.053403Z"},"links":{"cited_paper":"/paper/2301.11757","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:a3d2487f76915df952a15cb420de47093ad2ac2b742e43481996e01663de7385","observation_id":"d123e31a-3705-44d4-864b-225d16ba3970","resolution":{"observed_at":"2026-08-06T11:22:27.053403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09116","last_updated":"2023-05-30T16:09:10Z","snapshot_observed_at":"2026-08-08T00:30:28.663818Z","submitted_at":"2023-04-18T16:31:59Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09116","snapshot_observed_at":"2026-08-06T11:22:27.121148Z","title":"Naturalspeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.121148Z"},"links":{"cited_paper":"/paper/2304.09116","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:1426a2893eae456d446c196660610bcafc63076f37ab2e36c295f2f187dd2853","observation_id":"faba2588-9e08-487e-b264-81415b3455e9","resolution":{"observed_at":"2026-08-06T11:22:27.121148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"cited_work":{"arxiv_id":"2505.19669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19669","snapshot_observed_at":"2026-08-06T11:22:28.361623Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","venue":"cs.LG","work_id":"198e2c51-d3be-4195-8a87-b6c703fbe641","year":2025},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.182862Z"},"links":{"cited_paper":"/paper/2505.19669","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:228425fbae863d2155b9d1fa35f973822bf8ccf5b1cdb34ceca3be0203843dcb","observation_id":"4706dce0-0b29-472a-80c5-38080d13a8c1","resolution":{"observed_at":"2026-08-06T11:22:28.411634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T11:22:27.280963Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.280963Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:cd3bc4a89d68e62f32996885027111ca1a83157225d185ae6e01fdad453542cc","observation_id":"d503ec9f-d481-4f10-aab6-d5a8b36a0787","resolution":{"observed_at":"2026-08-06T11:22:27.280963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00482","last_updated":"2024-03-11T14:27:48Z","snapshot_observed_at":"2026-07-06T14:47:04.817434Z","submitted_at":"2023-02-01T14:47:17Z","title":"Improving and generalizing flow-based generative models with minibatch optimal transport","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00482","snapshot_observed_at":"2026-08-06T11:22:27.357575Z","title":"Improving and generalizing flow-based generative models with minibatch optimal transport","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.357575Z"},"links":{"cited_paper":"/paper/2302.00482","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:1f4f7c9628e00048661196c90dac26c92ca8172f248f7eeb5c4944efb17f7633","observation_id":"7001ad77-5a82-47ef-a1b7-01fb19ad16d9","resolution":{"observed_at":"2026-08-06T11:22:27.357575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11128","last_updated":"2025-09-03T01:59:58Z","snapshot_observed_at":"2026-08-07T18:14:46.399260Z","submitted_at":"2025-02-16T13:54:32Z","title":"FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11128","snapshot_observed_at":"2026-08-06T11:22:27.493156Z","title":"Felle: Autoregressive speech synthesis with token-wise coarse-to-fine flow matching","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.493156Z"},"links":{"cited_paper":"/paper/2502.11128","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:60a7cc893788c99b5a7645756041094e99d6ca9de521540155b88d1e93255f41","observation_id":"efbba303-682e-4bdb-9678-fe4e6a456f05","resolution":{"observed_at":"2026-08-06T11:22:27.493156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10352","last_updated":"2025-08-05T15:33:39Z","snapshot_observed_at":"2026-08-07T16:05:49.660014Z","submitted_at":"2025-04-14T16:03:21Z","title":"Pseudo-Autoregressive Neural Codec Language Models for Efficient Zero-Shot Text-to-Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10352","snapshot_observed_at":"2026-08-06T11:22:27.528989Z","title":"Pseudo-autoregressive neural codec language models for efficient zero-shot text-to-speech synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.528989Z"},"links":{"cited_paper":"/paper/2504.10352","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:427eef657f2bd9863ecf1bf33de193496bb58326eb287a8fd65b0969b07a1946","observation_id":"b2a6f30a-9185-4d39-bc60-d608c1c65b1c","resolution":{"observed_at":"2026-08-06T11:22:27.528989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:27.625768Z","title":"Lumos-1: On autoregressive video generation from a unified model perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.625768Z"},"links":{"citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:78d7619ee2580ba771673a15fc3ff996076206ffaaf81d9e748ad3c87eaf6501","observation_id":"f3d6bb98-fc36-488c-8faf-0489bb1a1767","resolution":{"observed_at":"2026-08-06T11:22:27.625768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04917","last_updated":"2024-12-06T10:16:04Z","snapshot_observed_at":"2026-07-06T20:02:43.795985Z","submitted_at":"2024-12-06T10:16:04Z","title":"Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04917","snapshot_observed_at":"2026-08-06T11:22:27.693175Z","title":"Continuous speech tokens makes llms robust multi-modality learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.693175Z"},"links":{"cited_paper":"/paper/2412.04917","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:c0750c8ade6889313ee9c0fd64b57b73112fb575a94ee05880ec3aaf91df1d9b","observation_id":"57703305-fd3c-4bd1-8837-dd90a5334c5e","resolution":{"observed_at":"2026-08-06T11:22:27.693175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04633","last_updated":"2024-06-07T04:34:03Z","snapshot_observed_at":"2026-08-07T20:43:34.793280Z","submitted_at":"2024-06-07T04:34:03Z","title":"Boosting Diffusion Model for Spectrogram Up-sampling in Text-to-speech: An Empirical Study","version":1},"cited_work":{"arxiv_id":"2406.04633","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04633","snapshot_observed_at":"2026-08-06T11:22:28.061312Z","title":"Boosting Diffusion Model for Spectrogram Up-sampling in Text-to-speech: An Empirical Study","venue":"eess.AS","work_id":"c1122563-90cb-403f-9ec5-d20d37396a13","year":2024},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.789945Z"},"links":{"cited_paper":"/paper/2406.04633","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:70d993444b5589b5c0aacac85a7bcd397f51b14e67531e5fa9e5471c4436e380","observation_id":"12782ae2-731c-4d75-bc15-cfd92c294d8f","resolution":{"observed_at":"2026-08-06T11:22:28.145958Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17190","last_updated":"2022-07-19T19:19:47Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:12:26Z","title":"Mixed-Phoneme BERT: Improving BERT with Mixed Phoneme and Sup-Phoneme Representations for Text to Speech","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17190","snapshot_observed_at":"2026-08-06T11:22:27.883606Z","title":"Mixed-phoneme bert: Improving bert with mixed phoneme and sup-phoneme representations for text to speech","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.883606Z"},"links":{"cited_paper":"/paper/2203.17190","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:93c8bf16734510eecfbd689ec42f1f9b18b23438b9a9313f93d9050a19c7f57b","observation_id":"53ce42bb-f56c-4f05-b7e7-2ad9bf1494fd","resolution":{"observed_at":"2026-08-06T11:22:27.883606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-06T11:22:27.950994Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.950994Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:ee953d5afb602ebf165073b9e68cfd63f5837dcb93c1a946a6dbfdf74eaaceee","observation_id":"d4517a79-8173-4f65-8551-ffcd886f9f98","resolution":{"observed_at":"2026-08-06T11:22:27.950994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T11:22:27.428195Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.428195Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:2592aa80068a9dea41ecc7a3d3b93e647de7e37a0804f1a7231d8ff02dd5e0b8","observation_id":"2e844282-1ca3-4230-b734-949e062f358f","resolution":{"observed_at":"2026-08-06T11:22:27.428195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08528","last_updated":"2020-06-09T05:01:20Z","snapshot_observed_at":"2026-08-07T21:29:41.343803Z","submitted_at":"2020-05-18T08:36:12Z","title":"MoBoAligner: a Neural Alignment Model for Non-autoregressive TTS with Monotonic Boundary Search","version":2},"cited_work":{"arxiv_id":"2005.08528","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.08528","snapshot_observed_at":"2026-08-06T11:22:28.646096Z","title":"MoBoAligner: a Neural Alignment Model for Non-autoregressive TTS with Monotonic Boundary Search","venue":"eess.AS","work_id":"78059abd-b72b-4fce-a4e6-d4cd06c891a1","year":2020},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.621996Z"},"links":{"cited_paper":"/paper/2005.08528","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:911c1d422c9a6b3bcbdf1150fbd3cfd83197829ae367745f607687c756be7d73","observation_id":"ebfe630b-423b-4645-a172-64b64bff40ab","resolution":{"observed_at":"2026-08-06T11:22:28.701598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00993","last_updated":"2021-03-01T13:28:59Z","snapshot_observed_at":"2026-07-06T10:45:38.818760Z","submitted_at":"2021-03-01T13:28:59Z","title":"AdaSpeech: Adaptive Text to Speech for Custom Voice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00993","snapshot_observed_at":"2026-08-06T11:22:25.496315Z","title":"Adaspeech: Adaptive text to speech for custom voice","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:25.496315Z"},"links":{"cited_paper":"/paper/2103.00993","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:d61e9ca3cc3ce3bd545f2eda1b11fee7a17e73c25d77bc2c7772834b1246ffa5","observation_id":"d8d21cbe-36a0-4a83-ae5c-37f0360f7ef3","resolution":{"observed_at":"2026-08-06T11:22:25.496315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05370","last_updated":"2024-06-17T04:39:08Z","snapshot_observed_at":"2026-08-06T08:54:58.638188Z","submitted_at":"2024-06-08T06:31:03Z","title":"VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05370","snapshot_observed_at":"2026-08-06T11:22:25.548417Z","title":"Vall-e 2: Neural codec language models are human parity zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:25.548417Z"},"links":{"cited_paper":"/paper/2406.05370","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:eb2e88268516ebf83eb0908963fa483312d67e24f0a13a78b0d0ad7b095368cc","observation_id":"0c650765-46aa-4e7f-868f-ebc596c3d331","resolution":{"observed_at":"2026-08-06T11:22:25.548417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18009","last_updated":"2024-09-12T17:45:37Z","snapshot_observed_at":"2026-08-04T03:12:21.293095Z","submitted_at":"2024-06-26T01:38:37Z","title":"E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18009","snapshot_observed_at":"2026-08-06T11:22:25.706245Z","title":"E2 tts: Embarrassingly easy fully non- autoregressive zero-shot tts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:25.706245Z"},"links":{"cited_paper":"/paper/2406.18009","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:61b3a5d308182e080fa0d6372465e5539d25697d9e004df970bc29e869931365","observation_id":"572e330a-4104-4d2b-b35e-f211c1787355","resolution":{"observed_at":"2026-08-06T11:22:25.706245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:25.418317Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:25.418317Z"},"links":{"citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:7fb1f5ae28e93e42e30c5db423fa3456e8cf6e24e7ca56668924503545be70ca","observation_id":"9e9ba83c-6772-4838-9f60-dc93aea1ba61","resolution":{"observed_at":"2026-08-06T11:22:25.418317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12557","last_updated":"2025-06-23T14:26:35Z","snapshot_observed_at":"2026-07-06T19:34:32.629776Z","submitted_at":"2024-10-16T13:34:40Z","title":"One Step Diffusion via Shortcut Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12557","snapshot_observed_at":"2026-08-06T11:22:25.814243Z","title":"One step diffusion via shortcut models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:25.814243Z"},"links":{"cited_paper":"/paper/2410.12557","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:18c9008be09c3f037e64abc031560b957ef9aa69b33cb8bdf8fe46e354ae8b0f","observation_id":"68f10129-0acc-4fc5-a3d2-d6a4e1b0060c","resolution":{"observed_at":"2026-08-06T11:22:25.814243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07855","last_updated":"2024-06-12T04:09:44Z","snapshot_observed_at":"2026-08-05T04:07:33.037081Z","submitted_at":"2024-06-12T04:09:44Z","title":"VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07855","snapshot_observed_at":"2026-08-06T11:22:25.974745Z","title":"Vall-e r: Robust and efficient zero-shot text-to-speech synthesis via monotonic alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:25.974745Z"},"links":{"cited_paper":"/paper/2406.07855","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:7ffc3a11e6b8367e432cd90eebe7ed21fe0ebf0cf4c9f6b23a5b140c977e1938","observation_id":"0b58e0cd-015b-4b9c-a206-ecd55188d95f","resolution":{"observed_at":"2026-08-06T11:22:25.974745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":5,"verified_fuzzy":1},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2507.22746."}