{"as_of":"2026-08-07T16:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3ea4d7f7f90114cdb899ce0bdec16f7306aae3dcfffd3367c0f2ebde35534344","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:52:04.191022Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.12570/citation-record","integrity":"/paper/2506.12570/integrity","json":"/paper/2506.12570/citation-record.json","paper":"/paper/2506.12570"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:52:01.571286Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:01.571286Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:3bb2eaf8912687760a63f89a4e7e94213b9fc494b59e7b121e22dd03a11a9400","observation_id":"bf49560b-b22b-4a55-bc8b-a52da9d87aef","resolution":{"observed_at":"2026-08-07T00:52:01.571286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:07.766966Z","title":"Audiolm: A language modeling approach to audio generation,","venue":null,"work_id":"250e8766-7ae0-4c25-b2a5-81b2f54f7213","year":2023},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:01.613360Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:fd0778f335922a3a12f6ca0502881ab837e952a76c4832de2690d475a47db366","observation_id":"bca8a2f3-7387-45e2-9b6f-e2b86e6e457e","resolution":{"observed_at":"2026-08-07T00:52:07.859576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:01.712370Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:01.712370Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:aecfc77de93415481b7ad3e6666b3236398d14fadc6877a0f080fbc46b9deacd","observation_id":"f2786bbc-8f4c-4d59-89ae-3d62f6eb06f4","resolution":{"observed_at":"2026-08-07T00:52:01.712370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:01.782086Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:01.782086Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:9723e25ea977885755c82dd11bd302b444e9e54ab5c482fd90ba6996e353d7ca","observation_id":"09327ca5-7b3b-4ede-a6c2-08250ab64b36","resolution":{"observed_at":"2026-08-07T00:52:01.782086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:01.901321Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:01.901321Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:fdf425e7541a1c507966dcd967ae15cfc22656c2d2bc7edf95c6f256dd835b1e","observation_id":"b570ac72-c91a-4522-928a-e9ceca604e5f","resolution":{"observed_at":"2026-08-07T00:52:01.901321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:07.511032Z","title":"V ALL-E 2: Neural codec language models are human parity zero-shot text to speech synthesizers,","venue":null,"work_id":"e0b146f2-5df0-49ee-b10e-24d1169fa349","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:01.985281Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:d2ab6df6f8682b6bb92e3e0d29f7daa17da87b59f0f12d2ab08baff5e52e59a0","observation_id":"18b91231-a431-4427-b361-ebbc14d04113","resolution":{"observed_at":"2026-08-07T00:52:07.616899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:07.323714Z","title":"CosyV oice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic to- kens,","venue":null,"work_id":"80d6d74f-a3dc-43e2-93d7-ecb386fa9b3f","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.050554Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:7a21ddb38491ffc73d758b27a5441e7fb35ad57927a86ee1ef16c7468983b41a","observation_id":"15a4defa-8156-4b3a-902d-49cd85587af8","resolution":{"observed_at":"2026-08-07T00:52:07.417375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:07.215354Z","title":"Seed-TTS: A family of high- quality versatile speech generation models,","venue":null,"work_id":"fb1a75e8-ed25-41a4-95d0-1c27a94d738b","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.180105Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:9801ffbaf7e9c3284626cc13680a13f06d92fedc40e9ab95197025e8adec02e9","observation_id":"b9089ddd-2bd8-46f9-94c8-a6a0b10a4ec5","resolution":{"observed_at":"2026-08-07T00:52:07.317431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-07-06T21:29:06.781083Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-07T00:52:02.203070Z","title":"Cosyvoice 3: Towards in-the-wild speech genera- tion via scaling-up and post-training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.203070Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:d279f4c24807a2bd83d9ce77a77c3d9a037f005d6ae761a600fc802a4f000e4f","observation_id":"8bfc3e62-250f-40b5-b08d-a9fb8af1b6eb","resolution":{"observed_at":"2026-08-07T00:52:02.203070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:07.065881Z","title":"Pseudo-autoregressive neural codec language models for efficient zero-shot text-to-speech synthesis,","venue":null,"work_id":"b3ba3d5d-f7f5-41f8-9d3d-f4805f1202ea","year":2025},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.264484Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:d00c19af6de0646dd839122aa8ff056ae095fd09ef5036b28c89af6dd0330c0a","observation_id":"7a4cf7c7-35da-4e8f-be7a-fe8607cfd06e","resolution":{"observed_at":"2026-08-07T00:52:07.129504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:06.928088Z","title":"Autoregressive speech synthesis without vector quantization,","venue":null,"work_id":"6cd32467-247e-4f75-935f-e85d6897363e","year":2025},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.305103Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:620bdc8994da0cdeaef54f986b3f2a49a498361f9c7b9f5816e549974ec3df50","observation_id":"604d4ff9-0d40-492c-a316-7f8b8ab3404e","resolution":{"observed_at":"2026-08-07T00:52:06.990494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:06.828461Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models,","venue":null,"work_id":"0b9b43af-ca82-4c05-9ff4-ede7fb0fb883","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.351297Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:c778e2002b03b3a64e1ed70a5b8bd5637bc0c68a8a30444db2c24d1d14de7ae4","observation_id":"d6f696a4-cffe-4f11-ae11-587f4073529b","resolution":{"observed_at":"2026-08-07T00:52:06.879628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:06.683302Z","title":"Interleaved speech-text language models are simple streaming text to speech synthesizers,","venue":null,"work_id":"7fb93247-4563-41ec-9f01-570c02fc0c91","year":null},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.392778Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:a534f4b9dd17f6c1ca5b8ae676688965cd8382a3d8945c6bd4979c5878890206","observation_id":"412ef6ee-0c2f-4a1f-b7b2-7d5c4a68b520","resolution":{"observed_at":"2026-08-07T00:52:06.747229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19669","snapshot_observed_at":"2026-08-07T00:52:02.492729Z","title":"Zero-shot streaming text to speech synthesis with transducer and auto-regressive modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.492729Z"},"links":{"cited_paper":"/paper/2505.19669","citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:a50e7dd0f29ca7d67f8d4fcf0ba1960042a4eb98d433fdb8e4e3b9cf8d193469","observation_id":"ad5cbb77-9e8e-4f73-ad1a-344020d4bdf4","resolution":{"observed_at":"2026-08-07T00:52:02.492729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:06.578309Z","title":"Syncspeech: Low-latency and efficient dual-stream text-to-speech based on temporal masked transformer,","venue":null,"work_id":"374b7a53-7ec6-4ef2-86f5-e71d31c35f85","year":2025},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.548264Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:a4e94b6aabe19206a75dcc296366003d812e32cd4396a699b7e3c548ee91272b","observation_id":"254d6ae7-804d-420e-bdcc-a5b0db8c718d","resolution":{"observed_at":"2026-08-07T00:52:06.604284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:06.437226Z","title":"Discrete audio representation as an alternative to mel-spectrograms for speaker and speech recognition,","venue":null,"work_id":"6480919d-89e8-463d-9cfb-065f0336066b","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.596251Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:3af8e64d09235c11caa585295900eecee00e34a33a3e22b8049c3056e46901f3","observation_id":"8d3e0bf1-4ff6-4c04-8ce3-36988ce854e1","resolution":{"observed_at":"2026-08-07T00:52:06.522611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:06.286913Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis,","venue":null,"work_id":"9936ce7f-0469-4493-897b-e820c67176da","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.665547Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:f3cb7850f0621e430f40b2766241ab241d867efa0ae7a52510e33f09a12d68df","observation_id":"72d6443a-abea-45aa-87b7-dbf0dd6e7ea1","resolution":{"observed_at":"2026-08-07T00:52:06.344259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-07T00:52:02.719163Z","title":"Autoregressive image gen- eration without vector quantization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.719163Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:a5b6d8b8bbc597d5491acc497ea8c286ed760b7b6817c6b761f8393180a8be2f","observation_id":"7b78f69d-f61f-4bc9-87f5-6da2c7246e5b","resolution":{"observed_at":"2026-08-07T00:52:02.719163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:06.158331Z","title":"FELLE: autoregressive speech synthesis with token-wise coarse-to-fine flow matching,","venue":null,"work_id":"490becb4-6239-481c-ba36-0827b7a4f402","year":2025},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.782039Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:33f8f82639c560902cdb20d9e3211b49d1c813c00359621679a31fada1ce62db","observation_id":"67d72c9a-6b5f-4763-8b44-4b5490c36bdc","resolution":{"observed_at":"2026-08-07T00:52:06.224882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:02.873718Z","title":"Ditar: Diffusion transformer autoregressive modeling for speech generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.873718Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:23c307c957e48dc2750c79a64a78cbfc29b173c6e26bc6bd5f686be9514ebc99","observation_id":"4c47da4f-c6a1-4481-95c1-2ef253ecaca8","resolution":{"observed_at":"2026-08-07T00:52:02.873718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:02.939608Z","title":"Auto-encoding variational bayes,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.939608Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:aaf603c32ded42e774da84865a2cdffb9428f35a0c3e59a7794993aa09084b0f","observation_id":"36ccc01f-48dc-49d0-91d7-a45a98b8938b","resolution":{"observed_at":"2026-08-07T00:52:02.939608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:05.981557Z","title":"Tacotron: Towards end- to-end speech synthesis,","venue":null,"work_id":"de473cd9-5766-42dc-a1d1-04e5ef7f20f4","year":2017},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:03.055590Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:a525f6f8653c1e4507978806dddfc154165797833d83ba91c29cb07b74a5e53d","observation_id":"7082f2ce-2d21-48db-abde-1422f8f5d842","resolution":{"observed_at":"2026-08-07T00:52:06.061420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:05.856597Z","title":"Librispeech: an ASR corpus based on public domain audio books,","venue":null,"work_id":"444ff17a-3e77-4779-a6d3-93d06c238733","year":2015},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:03.132846Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:9a1b5b77ed076aa08ea9f05cc12a9729fd2b20ebb3674aab2cf66d866d2fe319","observation_id":"99733192-e98e-40c2-9b61-e859f987b52d","resolution":{"observed_at":"2026-08-07T00:52:05.895076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:05.711010Z","title":"V ALL-E R: robust and efficient zero-shot text-to-speech synthesis via monotonic alignment,","venue":null,"work_id":"9bc1afae-c9ae-4b1c-b3b0-ee8b1d0ce3fc","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:03.223595Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:6288036d695e2f6dbabe852f887a8f452623fd8cce0619685b24fce6427a0564","observation_id":"1e041d1c-da61-40fa-b08a-35a0d788755a","resolution":{"observed_at":"2026-08-07T00:52:05.762832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:05.531311Z","title":"F5-TTS: A fairytaler that fakes fluent and faithful speech with flow matching,","venue":null,"work_id":"479f4975-1af3-4502-9cbe-4ae351c782da","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:03.285128Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:459b851c399d7b67775386e9daadd4064f52fcee03917e7557fea2a004abb52b","observation_id":"6d419976-a6ed-4cf3-9dd7-97606372ab49","resolution":{"observed_at":"2026-08-07T00:52:05.621674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:05.409127Z","title":"MaskGCT: Zero-shot text-to-speech with masked generative codec transformer,","venue":null,"work_id":"8c94949c-b7f8-44e8-bff9-41123e17c8d6","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:03.385295Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:cf6e0bcfd35d0203c777ac1a1a25bae26e1d2f659e742dd8543948f6a20b121f","observation_id":"f6a18580-b41c-42af-b442-e71d1614e80c","resolution":{"observed_at":"2026-08-07T00:52:05.442194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:05.271108Z","title":"Ramp: Retrieval-augmented mos prediction via confidence-based dynamic weighting,","venue":null,"work_id":"0cc24038-1dd3-4a04-9a19-81abb75d8ab9","year":2023},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:03.475605Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:5c42649fa93885e0021e3cbfbef14d112a4173f1d212b78b3adff8b7c8e8d550","observation_id":"7afb6a5c-1d16-46c5-9b28-d3f2c1bd98c9","resolution":{"observed_at":"2026-08-07T00:52:05.327200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:05.173694Z","title":"Ramp+: Retrieval-augmented mos prediction with prior knowledge integration,","venue":null,"work_id":"2e295dc3-84e2-4c15-a78a-41fa019c7bf7","year":2025},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:03.590269Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:eee196dde51eea6e6337a084efa7b96d155b6802bbc2fa822ecb69b2745f8147","observation_id":"462c7a9a-7137-421b-829c-2e2aaa8cb3ec","resolution":{"observed_at":"2026-08-07T00:52:05.232775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-07-06T09:20:55.416309Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T00:52:03.732161Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:03.732161Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:241b59bc5c36ad917a58586181b9250613fb913bb241901139c64d81a4b8035c","observation_id":"7d1701fd-bfef-49fa-abcc-e7495a5d0181","resolution":{"observed_at":"2026-08-07T00:52:03.732161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:05.075500Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"a4f0d1ba-c05a-4acd-85fb-7ec6b56d1b15","year":2021},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:03.807837Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:37d3ad1d314857a112a995b9de42e21af7da082a73d96bf3861c4fe4d7a16f2d","observation_id":"204c52a3-173f-43c0-a320-2e4a4bc4181b","resolution":{"observed_at":"2026-08-07T00:52:05.107680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T00:52:03.933734Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:03.933734Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:dc588dfc03b45bee732af14550f951b5f6d8756a391cbf92fbcbbe66e48f4c9f","observation_id":"ef7dbf33-7411-4e07-87b9-bc4450a22762","resolution":{"observed_at":"2026-08-07T00:52:03.933734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:04.943293Z","title":"WavLM: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"7464c67e-794e-45d8-b1f5-c0ad2c4938c8","year":2022},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:04.039029Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:27d184100742c4f109e581b8932c3cea7383cbd0f2932f4b4b051fb4a5dc571f","observation_id":"50132868-6da2-4174-9ba8-8a8d3b9a67df","resolution":{"observed_at":"2026-08-07T00:52:05.018828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:04.753589Z","title":"Libriheavy: a 50,000 hours ASR corpus with punctuation casing and context,","venue":null,"work_id":"f3da2e52-ae8d-48d3-89db-0a61a211da49","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:04.109157Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:9d6cf7b4679ad8a7b5d42598d3655495134fa8609271936c1d20fc7b5fa7105f","observation_id":"63c65484-ae4f-4ce4-80a1-aa28b396b6c3","resolution":{"observed_at":"2026-08-07T00:52:04.863237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:04.599966Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,","venue":null,"work_id":"24073f45-52c4-40a2-87f8-67b2bf62dd0a","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:04.191022Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:42a3dbe7167ef970543a3f56f1b1091ffda6662397e38fb8653db010c3c4c5e0","observation_id":"68ed7cca-35c7-4bf2-bf63-e61243bf22fc","resolution":{"observed_at":"2026-08-07T00:52:04.682115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16102","last_updated":"2025-08-09T10:01:51Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T17:43:50Z","title":"Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis","version":3},"cited_work":{"arxiv_id":"2412.16102","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.16102","snapshot_observed_at":"2026-08-07T00:52:04.433992Z","title":"Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis","venue":"eess.AS","work_id":"ebc6ca5e-7b48-4dcf-9ddd-d8573306b39d","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.441261Z"},"links":{"cited_paper":"/paper/2412.16102","citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:d15717dc1e5b1b81ee56d7ad2e57daab43b0bac6196e1c87650ef8b11c70ca63","observation_id":"2f204fc6-c3d9-4824-bc3b-a67581bde4cc","resolution":{"observed_at":"2026-08-07T00:52:04.503082Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2506.12570."}