{"as_of":"2026-08-09T04:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4b14737a9c70bb0e0cb2987dd72d51fdb3312434416fa4bbb7462f696740b9ca","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T11:33:14.254397Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.19859/citation-record","integrity":"/paper/2607.19859/integrity","json":"/paper/2607.19859/citation-record.json","paper":"/paper/2607.19859"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-01T11:33:11.240813Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:11.240813Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:528ca1aa2f36f84c5cb74ab14c8ebdab0da170a47a3f19b1d6fa289c332dbdb4","observation_id":"762d9abe-c9e1-45d6-b5c6-8b016af7e3d8","resolution":{"observed_at":"2026-08-01T11:33:11.240813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-01T11:33:11.360312Z","title":"Cosyvoice: A scalable multilingual zero- shot text-to-speech synthesizer based on supervised se- mantic tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:11.360312Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:6192d3321aac9b9189986fb13af46b778549c90859895b161980544ac34899b5","observation_id":"e95087c6-65a3-4578-b689-5d7c7a80761a","resolution":{"observed_at":"2026-08-01T11:33:11.360312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-07T06:02:40.568271Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-01T11:33:11.513298Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:11.513298Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:b46bc7d4bc09b85fbdaf1fc38cec1404cad8583538f2c4f2fffeffcaaaff44e9","observation_id":"ba334b15-2f8f-4727-adbf-68c4606b6ace","resolution":{"observed_at":"2026-08-01T11:33:11.513298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-08-06T19:45:49.830925Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-01T11:33:11.673952Z","title":"Soundstorm: Efficient parallel audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:11.673952Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:9caf689bafaecb2e678c22aaf50d9cfcbfaa66a5d06291b1850355612b97daa4","observation_id":"032aedcf-b139-4bfc-bec3-cb8564c8078b","resolution":{"observed_at":"2026-08-01T11:33:11.673952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-01T10:20:49.367508Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-01T11:33:11.847608Z","title":"Maskgct: Zero-shot text-to- speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:11.847608Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:8aa806418e7d9533dc64ede26546bce529ed7b60793e38669d17bc3df69afe73","observation_id":"60ab2a50-c696-4b5d-905b-9e54efd22029","resolution":{"observed_at":"2026-08-01T11:33:11.847608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18009","last_updated":"2024-09-12T17:45:37Z","snapshot_observed_at":"2026-08-04T03:12:21.293095Z","submitted_at":"2024-06-26T01:38:37Z","title":"E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18009","snapshot_observed_at":"2026-08-01T11:33:12.021514Z","title":"E2 tts: Embarrass- ingly easy fully non-autoregressive zero-shot tts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:12.021514Z"},"links":{"cited_paper":"/paper/2406.18009","citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:c76b03c3173874f8b3e98e5efa0ba6b18c80f9ea0474131b72b2899c2123a50d","observation_id":"eb22d84c-56d5-40f1-a14d-1a95d0c6e2be","resolution":{"observed_at":"2026-08-01T11:33:12.021514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-01T11:33:12.225012Z","title":"F5- TTS: A fairytaler that fakes fluent and faithful speech with flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:12.225012Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:c54f52b7a7be7367ac49c4f2231f7310051bdf22c6c4cb7d05547620096c05e5","observation_id":"559dbbb9-104c-4d86-b497-679ab7fe43a6","resolution":{"observed_at":"2026-08-01T11:33:12.225012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-07T23:22:31.422843Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-01T11:33:12.331909Z","title":"Naturalspeech 3: Zero- shot speech synthesis with factorized codec and diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:12.331909Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:151dfb5009975f1dc140f4cb44fe2eddbae1cd3ad93c1edf37aeb5e58c25cb70","observation_id":"c255864a-fb98-409a-ad4e-539c5adf2442","resolution":{"observed_at":"2026-08-01T11:33:12.331909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:33:12.392017Z","title":"Fastspeech: Fast, robust and controllable text to speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:12.392017Z"},"links":{"citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:bd6de275601e957f3a1dbbe5947f0380cd2c0e567c649b1052a6c79be9553ddf","observation_id":"4ad4210d-96e1-4a88-bc55-07a6f53cb46b","resolution":{"observed_at":"2026-08-01T11:33:12.392017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-01T11:33:12.513735Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:12.513735Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:40481bc6408a8e82bd187798bf37814da53259121bbdb85fc286e93027ece8ee","observation_id":"a0d3e1bf-75f0-4f90-b74b-e46458c72f28","resolution":{"observed_at":"2026-08-01T11:33:12.513735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:33:12.652904Z","title":"V oicebox: Text-guided multilingual universal speech generation at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:12.652904Z"},"links":{"citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:38d14b3224fa9a1e6f030a8a6348097b46873853051a906417bd6a3c50d7dd96","observation_id":"927b2462-ee40-49c2-987a-e358666ffbf7","resolution":{"observed_at":"2026-08-01T11:33:12.652904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09116","last_updated":"2023-05-30T16:09:10Z","snapshot_observed_at":"2026-08-08T00:30:28.663818Z","submitted_at":"2023-04-18T16:31:59Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09116","snapshot_observed_at":"2026-08-01T11:33:12.827054Z","title":"Naturalspeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:12.827054Z"},"links":{"cited_paper":"/paper/2304.09116","citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:b6ff3b1722859a47569ffe53b2319500088c6b97c7bae67d83d0d8f6abc7596e","observation_id":"feb60fb7-d20c-49c9-93c2-cc2bafa5bac3","resolution":{"observed_at":"2026-08-01T11:33:12.827054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-01T11:33:12.964112Z","title":"Llama: Open and efficient founda- tion language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:12.964112Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:25275cf3a231b1222a6a045b669ef3896cb20442a17149e9c7f04f0ca2e7b420","observation_id":"b0a25f98-c10c-4f9c-8a48-09af0406945a","resolution":{"observed_at":"2026-08-01T11:33:12.964112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-01T11:33:13.102191Z","title":"Seed-tts: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:13.102191Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:f808aa7412061817a470f1c9d5b4fea0ae45794714e5b72a3e525ca548a4b158","observation_id":"b382ecb4-1ab2-4503-b3d6-547b06d9e204","resolution":{"observed_at":"2026-08-01T11:33:13.102191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:33:13.210604Z","title":"Neural discrete representation learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:13.210604Z"},"links":{"citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:6f812705cb8a583fb450c66e18ff7403c8f0ac55e17c9246cf23a73961f4d748","observation_id":"2229f2bd-e850-4bf5-b9e1-0b068a98df86","resolution":{"observed_at":"2026-08-01T11:33:13.210604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:33:13.347635Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:13.347635Z"},"links":{"citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:4e42be7dadc722d83722d20c0064d309ff305b8262f3bc6d7b2ee3568eec84bd","observation_id":"4fc1f77a-fc24-40d7-9683-4155eee4a389","resolution":{"observed_at":"2026-08-01T11:33:13.347635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-01T11:33:13.485060Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:13.485060Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:b37b380e61938f41afb87aa9e3facc917472de7cf1998e74a32aeb0596d9500e","observation_id":"9dabd932-87a8-4315-9da8-06b623d3b42a","resolution":{"observed_at":"2026-08-01T11:33:13.485060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:33:13.624740Z","title":"Hubert: Self-supervised speech repre- sentation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:13.624740Z"},"links":{"citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:e7bdb7f36348cccefaca64b8af2e5e2de050b2521d4972d12c854a39e63db618","observation_id":"4c54927a-3390-40db-af24-1c7d8fa7252b","resolution":{"observed_at":"2026-08-01T11:33:13.624740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:33:13.767556Z","title":"Wavlm: Large-scale self- supervised pretraining for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:13.767556Z"},"links":{"citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:599b9b68ddc6a692abd46d9a245aaf847f492f88fbb462773211c2e603cadd76","observation_id":"ddee6882-f116-4dbf-ad7e-24097741fbee","resolution":{"observed_at":"2026-08-01T11:33:13.767556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:33:13.914349Z","title":"W2v-bert: Combining contrastive learning and masked language modeling for self-supervised speech pre-training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:13.914349Z"},"links":{"citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:42053cc1edad72b668ce45d0b67e4f7673adfbe5e350ab2a668b7534100b8042","observation_id":"98219372-94ca-4c97-b7cd-f74e065db327","resolution":{"observed_at":"2026-08-01T11:33:13.914349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15354","last_updated":"2023-09-25T02:36:41Z","snapshot_observed_at":"2026-08-07T07:23:53.931725Z","submitted_at":"2023-06-27T10:09:43Z","title":"3D-Speaker: A Large-Scale Multi-Device, Multi-Distance, and Multi-Dialect Corpus for Speech Representation Disentanglement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15354","snapshot_observed_at":"2026-08-01T11:33:14.026639Z","title":"3D-Speaker: A Large-Scale Multi- Device, Multi-Distance, and Multi-Dialect Corpus for Speech Representation Disentanglement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:14.026639Z"},"links":{"cited_paper":"/paper/2306.15354","citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:76d82c22e0315c4192536b6b8d0c639baadd21b630fc10ffa3ac8dd7d2399c16","observation_id":"505248d2-3a49-4223-b368-65e25321864d","resolution":{"observed_at":"2026-08-01T11:33:14.026639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-01T11:33:14.162197Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech gener- ation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:14.162197Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:5ccc5b64cd39d57c1bdfbe8021cb5c1e78e05fb0ca88079e17b3335132565187","observation_id":"dcfe1bb0-7916-43a6-ad3b-06d4a79bf3d3","resolution":{"observed_at":"2026-08-01T11:33:14.162197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-01T11:33:14.254397Z","title":"Fir- eRedTTS: A foundation text-to-speech framework for industry-level generative speech applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:14.254397Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:af28804bcf143f47114395a048c41c02f9e14a57c90bb1a5f18229785e2e7ac9","observation_id":"1c9468fe-a430-472d-8256-dce62ab51a78","resolution":{"observed_at":"2026-08-01T11:33:14.254397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T12:49:18.178302Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2607.19859."}