{"as_of":"2026-08-08T03:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8d08ef30fabafb28beafafed7f2f52b9acd8cafcee9554d17531e39c79f120a5","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:15:56.850541Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:15:54.536075Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T11:22:28.361623Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19669","snapshot_observed_at":"2026-08-07T14:15:54.536075Z","title":"𝑥#𝑥$y! 𝑦","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.536075Z"},"links":{"cited_paper":"/paper/2505.19669","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:2ddeef5a58f73b8cd0e8988e3d3f5d9c5141002dc8af2e17ba1d9ac48ce4a58f","observation_id":"b157e099-92a6-4c5f-86fa-8feddde23ab5","resolution":{"observed_at":"2026-08-07T14:15:54.536075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19669","snapshot_observed_at":"2026-08-07T00:52:02.492729Z","title":"Zero-shot streaming text to speech synthesis with transducer and auto-regressive modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-07T00:43:22.701364Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.492729Z"},"links":{"cited_paper":"/paper/2505.19669","citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:a50e7dd0f29ca7d67f8d4fcf0ba1960042a4eb98d433fdb8e4e3b9cf8d193469","observation_id":"ad5cbb77-9e8e-4f73-ad1a-344020d4bdf4","resolution":{"observed_at":"2026-08-07T00:52:02.492729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"cited_work":{"arxiv_id":"2505.19669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19669","snapshot_observed_at":"2026-08-06T11:22:28.361623Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","venue":"cs.LG","work_id":"198e2c51-d3be-4195-8a87-b6c703fbe641","year":2025},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.182862Z"},"links":{"cited_paper":"/paper/2505.19669","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:228425fbae863d2155b9d1fa35f973822bf8ccf5b1cdb34ceca3be0203843dcb","observation_id":"4706dce0-0b29-472a-80c5-38080d13a8c1","resolution":{"observed_at":"2026-08-06T11:22:28.411634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19669/citation-record","integrity":"/paper/2505.19669/integrity","json":"/paper/2505.19669/citation-record.json","paper":"/paper/2505.19669"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:00.670410Z","title":"<eos> <bos> 𝑦! <eos> 𝑦#<bos> 𝑦","venue":null,"work_id":"9c118a43-ed60-4dde-99dd-0ed260ea63e2","year":null},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.302540Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:93b504beff13186432dc1a2a7513fc16a95316b234f1af2d0b748ab7cf28f0ba","observation_id":"3db29749-9a2b-4027-bf1f-044ab8826a08","resolution":{"observed_at":"2026-08-07T14:16:00.735947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:00.500461Z","title":"Specifically, it uses a Transducer to convert the text into a sequence of se- mantic token in real time","venue":null,"work_id":"ef89b027-c857-4939-b462-3b2254a98450","year":null},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.368789Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:49c64384a98c88708bde012cb15db9fe039642fb9f21dea27904eb56d0aa7d94","observation_id":"1ca17757-54e9-4855-a3da-83635fb401c5","resolution":{"observed_at":"2026-08-07T14:16:00.561077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:00.221125Z","title":"Delete ⟨Bos⟩ Mechanism","venue":null,"work_id":"083b3798-1faa-4d2f-a790-1757e2b8c41a","year":null},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.457220Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:a61e92f9f24e86c8f87bd13d45f9d8ef4bbcbb144b1c2b7e1088a6cc45e876c6","observation_id":"abd7dcf7-bf08-4280-a845-e12a5cd2ab21","resolution":{"observed_at":"2026-08-07T14:16:00.399535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19669","snapshot_observed_at":"2026-08-07T14:15:54.536075Z","title":"𝑥#𝑥$y! 𝑦","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.536075Z"},"links":{"cited_paper":"/paper/2505.19669","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:2ddeef5a58f73b8cd0e8988e3d3f5d9c5141002dc8af2e17ba1d9ac48ce4a58f","observation_id":"b157e099-92a6-4c5f-86fa-8feddde23ab5","resolution":{"observed_at":"2026-08-07T14:15:54.536075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:59.981795Z","title":"𝑚# 𝑚$ 𝑚% 𝑚& 𝑚'…… 𝑚! 𝑚% 𝑚","venue":null,"work_id":"bccbe26a-a92d-4a48-976d-eb763c58ecc5","year":null},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.612074Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:47f7f132e3e13a5f48a9c668c1fd740c03c4d2a8a74813a1b8ce26d8642e8deb","observation_id":"b7359fb2-2924-46d9-ac34-68d8b76debfa","resolution":{"observed_at":"2026-08-07T14:16:00.102532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:59.672214Z","title":"Training Datasets We train SMLLE on the LibriSpeech dataset [27]","venue":null,"work_id":"13462b1a-68c7-4030-a10f-70a8a086ebd0","year":null},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.679034Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:cd66dde0aad51716470eaad07d944c519622d7813ed79f8170f1bfd2cbfc9c56","observation_id":"10fe7834-ee62-4958-a01f-13f37865905d","resolution":{"observed_at":"2026-08-07T14:15:59.849141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:59.386420Z","title":"SMLLE-R5","venue":null,"work_id":"315e1590-cecc-4a10-aa61-545b93920a49","year":null},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.734281Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:0eeb35026033e1060bb484b8e48f4e82e07a6892ecd497abaf5ce32a36641d88","observation_id":"637d4ad4-31c2-4e52-a91e-db1f8143081f","resolution":{"observed_at":"2026-08-07T14:15:59.537632Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:59.214748Z","title":"It uses a Transducer model to convert text into semantic tokens in real time and reconstructs them into mel-spectrograms frame by frame using an AR model","venue":null,"work_id":"6e9413f3-8521-474a-bc84-10aea3e31a90","year":null},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.800671Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:c207dece6a287c5e92f4ef6096e26c6ffd1463f875e3ed7d2dad5e74a8496f8d","observation_id":"660d2a3d-5bc9-4dc2-b223-71d37dbf1aaa","resolution":{"observed_at":"2026-08-07T14:15:59.284368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:15:54.839595Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.839595Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:91497e4591f860224d28b6d509fb05855baccd8ba07ea0d3292c59f0d73fe1ff","observation_id":"e61516d7-dcd4-4687-81c3-8ab1b49cc20a","resolution":{"observed_at":"2026-08-07T14:15:54.839595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:15:54.910526Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.910526Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:8be9d32f4fcd151682ad2384740342e42b739fd4133af2b80da49c3c10e76f55","observation_id":"10855297-8798-4096-83be-7c47490509e8","resolution":{"observed_at":"2026-08-07T14:15:54.910526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:54.998181Z","title":"Zero-shot text-to-image generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.998181Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:b3b9bf58f30516b304946924f278f7abf163ada2f1634bd6811de3cdeea3504e","observation_id":"e3a2c76e-35c3-4c52-be70-1536443c2ff4","resolution":{"observed_at":"2026-08-07T14:15:54.998181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:55.105958Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.105958Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:f0b5a60b8c51b85508aabe6b6ca65e18e41242860a392e687a33cb62426f7cb3","observation_id":"91e8bcbc-9c99-4d09-9708-81e495670817","resolution":{"observed_at":"2026-08-07T14:15:55.105958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T14:15:55.172894Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.172894Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:f0fbcc41e67042f40c09053a3ba47c3f6bbc2dd6fefd176b3d3633c96e37bf3e","observation_id":"8688be3c-dae8-4999-810d-adf59919d480","resolution":{"observed_at":"2026-08-07T14:15:55.172894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-07T14:15:55.227783Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.227783Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:4464e069f6e78bc44a43cc1b1f7e497d4f7fb0e7bdf62c94cfc5b591746c4ffa","observation_id":"fab4a743-7c6c-42bb-a1ab-0ef3ae3e293a","resolution":{"observed_at":"2026-08-07T14:15:55.227783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08551","last_updated":"2025-05-27T05:07:56Z","snapshot_observed_at":"2026-08-05T05:08:56.833881Z","submitted_at":"2024-07-11T14:36:53Z","title":"Autoregressive Speech Synthesis without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08551","snapshot_observed_at":"2026-08-07T14:15:55.347789Z","title":"Autoregressive speech synthesis without vector quantization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.347789Z"},"links":{"cited_paper":"/paper/2407.08551","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:d7ac44d0d2105043d37974ad9b89abe01e86ce26bd2cd3affe1b2bbfbc4e84b1","observation_id":"d5d276c2-d1f9-4b0d-b676-8d33a54b07dd","resolution":{"observed_at":"2026-08-07T14:15:55.347789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T14:15:55.424547Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.424547Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:9d85cc40c6f48bc21956f7f70d6751011d6f7d9bd2eb2cd883e91654e7303057","observation_id":"ba626b19-461e-4a04-8d57-da15f014d083","resolution":{"observed_at":"2026-08-07T14:15:55.424547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-07T14:15:55.510988Z","title":"Mini-omni: Language models can hear, talk while thinking in streaming,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.510988Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:102d620b78d110ccd70f5bc30cc16dbc026fb896ac8d42a7e8bdb40173cf1283","observation_id":"a56efe66-560a-4033-8703-cdd811a4327f","resolution":{"observed_at":"2026-08-07T14:15:55.510988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T14:15:55.598942Z","title":"Llama- omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.598942Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:de2ecd9d48ab6d5e03799aaed53390587d5ad7b59b68dfbaafc1b689b13b67a2","observation_id":"132089e7-bcf9-4ff1-ada2-857a733acffe","resolution":{"observed_at":"2026-08-07T14:15:55.598942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-07T14:15:55.630686Z","title":"Salmonn: Towards generic hearing abilities for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.630686Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:b806c44506a8bfb025ed95a6976fcad1e2026a710492bd994acccd773543e9a7","observation_id":"6bc85ce0-590c-4bb0-9971-49c256c354fc","resolution":{"observed_at":"2026-08-07T14:15:55.630686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T14:15:55.684869Z","title":"Qwen-audio: Advancing universal audio understand- ing via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.684869Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:ce1998552edb55f53a1b4a7586e6b18ef2a22345d09c2390fc99bcfc7dda6618","observation_id":"b5c68240-e06e-4395-a491-797cb4e11261","resolution":{"observed_at":"2026-08-07T14:15:55.684869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T14:15:55.743399Z","title":"Wavllm: Towards ro- bust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.743399Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:97864c2b8fd6165378b500739963ab884420fb25767d95ffc8784de59e5cb2d5","observation_id":"0f9d2bf0-68e8-41e4-8fa5-9059d48c1758","resolution":{"observed_at":"2026-08-07T14:15:55.743399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02897","last_updated":"2024-06-10T05:50:53Z","snapshot_observed_at":"2026-07-31T21:41:43.347268Z","submitted_at":"2024-06-05T03:36:11Z","title":"LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02897","snapshot_observed_at":"2026-08-07T14:15:55.806875Z","title":"Livespeech: Low- latency zero-shot text-to-speech via autoregressive modeling of audio discrete codes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.806875Z"},"links":{"cited_paper":"/paper/2406.02897","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:88c73436850ca50ae80dee3ae8b883d461df67e5f5a5c735a776ccf9b0a39dd2","observation_id":"943ecc01-d9c2-4724-a43d-1676c5147316","resolution":{"observed_at":"2026-08-07T14:15:55.806875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:58.994892Z","title":"Speech-t: Transducer for text to speech and beyond,","venue":null,"work_id":"b24ded36-b150-4796-9e43-71f9625494be","year":2021},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.885997Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:411d63603ea336d1e5c2928eff3265cfcc8ae2f40e89154f34e7eb2a2f2b698d","observation_id":"f0f38e56-6acc-4499-aa22-b0ff256ed87f","resolution":{"observed_at":"2026-08-07T14:15:59.070271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:58.686727Z","title":"Transduce and speak: Neural transducer for text-to-speech with semantic to- ken prediction,","venue":null,"work_id":"20020706-4284-49d7-b859-7e51b6378f5d","year":2023},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.955500Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:732763b24a9f07de8be9cea380f10fd1303162522b3030a4003f09b67f86117f","observation_id":"d76bc8fa-d7af-4976-923f-a96854527548","resolution":{"observed_at":"2026-08-07T14:15:58.838464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17310","last_updated":"2024-06-25T06:46:47Z","snapshot_observed_at":"2026-07-06T18:36:34.369503Z","submitted_at":"2024-06-25T06:46:47Z","title":"High Fidelity Text-to-Speech Via Discrete Tokens Using Token Transducer and Group Masked Language Model","version":1},"cited_work":{"arxiv_id":"2406.17310","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.17310","snapshot_observed_at":"2026-08-07T14:15:57.324517Z","title":"High Fidelity Text-to-Speech Via Discrete Tokens Using Token Transducer and Group Masked Language Model","venue":"eess.AS","work_id":"cd68a3ae-ee9e-4577-be4c-41b875107ae8","year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.035770Z"},"links":{"cited_paper":"/paper/2406.17310","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:ab855f0dd67f7a570f8fe249115a5d29f5145ee6c42c1c4099fdf58fb4ba43da","observation_id":"d8ca4da6-6379-4673-9cd4-4329b7ea5d42","resolution":{"observed_at":"2026-08-07T14:15:57.452738Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06320","last_updated":"2025-01-10T19:50:32Z","snapshot_observed_at":"2026-08-04T05:22:43.756074Z","submitted_at":"2025-01-10T19:50:32Z","title":"TTS-Transducer: End-to-End Speech Synthesis with Neural Transducer","version":1},"cited_work":{"arxiv_id":"2501.06320","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.06320","snapshot_observed_at":"2026-08-07T14:15:57.171500Z","title":"TTS-Transducer: End-to-End Speech Synthesis with Neural Transducer","venue":"eess.AS","work_id":"22b545b3-378e-4a98-a028-5a96699af0d9","year":2025},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.168758Z"},"links":{"cited_paper":"/paper/2501.06320","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:2fa8d96ef2f2221877913a73d3c51c30617894554cd85f2cacb0e6c5132b78f8","observation_id":"a5d1a7e1-0a42-4b77-9bae-a43bb0475ee4","resolution":{"observed_at":"2026-08-07T14:15:57.238904Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-07T03:22:13.424379Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-07T14:15:56.248113Z","title":"Speechtok- enizer: Unified speech tokenizer for speech large language mod- els,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.248113Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:385386ecb72f3119e59269366a0178db71cf5bbdc3f5ace6509853a0574436b2","observation_id":"042c7359-715b-468c-98a5-c2a1e3645329","resolution":{"observed_at":"2026-08-07T14:15:56.248113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07333","last_updated":"2024-01-14T17:43:55Z","snapshot_observed_at":"2026-08-07T19:28:41.853565Z","submitted_at":"2024-01-14T17:43:55Z","title":"ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07333","snapshot_observed_at":"2026-08-07T14:15:56.310389Z","title":"ELLA-V: Sta- ble neural codec language modeling with alignment-guided se- quence reordering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.310389Z"},"links":{"cited_paper":"/paper/2401.07333","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:c83383ffbfe260beb025d562471c3b9ed5d28590ab483bf12036ab8a67f69fd8","observation_id":"b835ee00-fb8d-4e72-8092-748c120d4af8","resolution":{"observed_at":"2026-08-07T14:15:56.310389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07855","last_updated":"2024-06-12T04:09:44Z","snapshot_observed_at":"2026-08-05T04:07:33.037081Z","submitted_at":"2024-06-12T04:09:44Z","title":"VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07855","snapshot_observed_at":"2026-08-07T14:15:56.366851Z","title":"V ALL-E R: Robust and efficient zero- shot text-to-speech synthesis via monotonic alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.366851Z"},"links":{"cited_paper":"/paper/2406.07855","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:4db67af66f01be169849b8b8b3f11e90cb8c48bff36eab8ff12f0c40408299d1","observation_id":"2ae8e0e9-d909-44bc-b465-2e2e7fd95af7","resolution":{"observed_at":"2026-08-07T14:15:56.366851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03204","last_updated":"2024-05-19T21:34:28Z","snapshot_observed_at":"2026-07-06T17:55:28.812944Z","submitted_at":"2024-04-04T05:15:07Z","title":"RALL-E: Robust Codec Language Modeling with Chain-of-Thought Prompting for Text-to-Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03204","snapshot_observed_at":"2026-08-07T14:15:56.438913Z","title":"RALL-E: Robust codec language modeling with chain-of-thought prompting for text-to- speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.438913Z"},"links":{"cited_paper":"/paper/2404.03204","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:320bf3615109205a07442e58e478141278400c85cc7b6820be4bfa1fd22b0d5f","observation_id":"fb0d1b7d-887d-45c5-a7ff-2646d3a864b2","resolution":{"observed_at":"2026-08-07T14:15:56.438913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:58.454760Z","title":"CLaM-TTS: Improving neural codec language model for zero-shot text-to-speech,","venue":null,"work_id":"682770c1-bd95-4f8a-860a-dd6700044703","year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.518067Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:1023bde455bcf90d48f1eecbfc17fb1876a99662682d5847dfb89ae106fea006","observation_id":"9181c0a4-cfee-4a30-b9b8-fe8424ceb737","resolution":{"observed_at":"2026-08-07T14:15:58.542504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05370","last_updated":"2024-06-17T04:39:08Z","snapshot_observed_at":"2026-08-06T08:54:58.638188Z","submitted_at":"2024-06-08T06:31:03Z","title":"VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05370","snapshot_observed_at":"2026-08-07T14:15:56.602314Z","title":"V ALL-E 2: Neural codec language models are hu- man parity zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.602314Z"},"links":{"cited_paper":"/paper/2406.05370","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:d6dbc2bee80db03f0e46ffaf12cd162a3de9e8f9522705a5b3ee4fd579580ac8","observation_id":"f6446f42-6a4d-4da2-8133-f9a06b7a46a7","resolution":{"observed_at":"2026-08-07T14:15:56.602314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:58.120659Z","title":"V oicebox: Text-guided multilingual universal speech gen- eration at scale,","venue":null,"work_id":"dfaff12c-da3e-4cb0-bad0-1b49f6cfcc0e","year":2023},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.695232Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:58504bced323411544e20014dcff18aebce2bf3001ea1e821ee6f9e850b2b1cd","observation_id":"01897a29-0ba8-4177-8598-5b7d749b6ec3","resolution":{"observed_at":"2026-08-07T14:15:58.207909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:57.935873Z","title":"Lib- rispeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":"c953f27d-502e-4587-861b-864bb24477aa","year":2015},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.756041Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:b06df4f7e1a56e79ce999599e60052444a1a2ce9d0ce639915871f2ebf488690","observation_id":"187165c8-e0e0-453a-9c32-094d0596e4c6","resolution":{"observed_at":"2026-08-07T14:15:58.035412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-07T13:32:24.356336Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-07T14:15:56.797055Z","title":"LibriTTS: A corpus derived from librispeech for text- to-speech,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.797055Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:8ed4f5c0385c16b924c0617a79ee5330dafedad34d38b4403cebd18cc73e1ef0","observation_id":"4f863876-8cb1-4ca8-a1ed-7fe38cb5bdd7","resolution":{"observed_at":"2026-08-07T14:15:56.797055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00767","last_updated":"2024-10-01T15:04:21Z","snapshot_observed_at":"2026-08-07T13:41:45.419727Z","submitted_at":"2024-10-01T15:04:21Z","title":"Zero-Shot Text-to-Speech from Continuous Text Streams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00767","snapshot_observed_at":"2026-08-07T14:15:56.850541Z","title":"Zero- shot text-to-speech from continuous text streams,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.850541Z"},"links":{"cited_paper":"/paper/2410.00767","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:89919f229663b4d6854e05ff02fc045fc33ddce8a50d768447f940415c99ee4a","observation_id":"041daa36-4dc0-4883-aa0a-bc187e0c0483","resolution":{"observed_at":"2026-08-07T14:15:56.850541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T14:06:47.459513Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 3 inbound Pith citation observations for arXiv:2505.19669."}