{"as_of":"2026-08-08T00:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5a8a1e5a763016f586222456315c161b4ca476a8ac446a328ae03914a2bbf4eb","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:17:45.506100Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:17:41.821457Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.10774","snapshot_observed_at":"2026-08-04T10:17:41.821457Z","title":"While multilingual efforts like Common V oice arXiv:2510.10774v2 [cs.SD] 14 Oct 2025 Fig","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:41.821457Z"},"links":{"cited_paper":"/paper/2510.10774","citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:61c3994069314ac7047e1c2343558c5090435cd672c0ac3120b20a60cf83652b","observation_id":"c0e8d3b0-4d08-48be-9860-72519bfe2f81","resolution":{"observed_at":"2026-08-04T10:17:41.821457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.10774/citation-record","integrity":"/paper/2510.10774/integrity","json":"/paper/2510.10774/citation-record.json","paper":"/paper/2510.10774"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:41.605111Z","title":"Persian, although spoken by more than 100 million people worldwide, remains significantly under- represented in speech corpora compared to high-resource languages such as English","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:41.605111Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:209c23cc5883d33f3fe7855550ceba675c0eb0cab05cb1d3415e22537b61d0f0","observation_id":"190b0dc4-c8c6-4599-9b0e-be9471148fd4","resolution":{"observed_at":"2026-08-04T10:17:41.605111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.10774","snapshot_observed_at":"2026-08-04T10:17:41.821457Z","title":"While multilingual efforts like Common V oice arXiv:2510.10774v2 [cs.SD] 14 Oct 2025 Fig","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:41.821457Z"},"links":{"cited_paper":"/paper/2510.10774","citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:61c3994069314ac7047e1c2343558c5090435cd672c0ac3120b20a60cf83652b","observation_id":"c0e8d3b0-4d08-48be-9860-72519bfe2f81","resolution":{"observed_at":"2026-08-04T10:17:41.821457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:41.976790Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:41.976790Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:f400f1f2c574e548cf79256dd746baddd241e371c67e8199048a8bbc2e9e499e","observation_id":"a399881c-b80f-44ff-93b9-bd42c650cf16","resolution":{"observed_at":"2026-08-04T10:17:41.976790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:42.188591Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:42.188591Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:530655c8c4c70733889c2d66ce4ebda8084fd466002908d11f04e47e50610413","observation_id":"b58c1500-7fe9-41d9-981f-9ce4d607146b","resolution":{"observed_at":"2026-08-04T10:17:42.188591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:42.347797Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:42.347797Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:84cc4b015d49cfd0a74d224efaa734b9d9651920d40abd3ef9bc2158ec0d7542","observation_id":"e994f30d-f6d5-40f8-bc30-15a2226b03cb","resolution":{"observed_at":"2026-08-04T10:17:42.347797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:42.496763Z","title":"Binary search continues until re-transcription differs from the origi- nal","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:42.496763Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:63785f767ea4fc1e92e00d85b471307a84eb563508d18c4e9db03ffaff3e113a","observation_id":"3fcbdc75-9a15-49e7-bef6-1266f60a8918","resolution":{"observed_at":"2026-08-04T10:17:42.496763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:42.599071Z","title":"This approach ensures that each segment contains only the essential speech content while maintaining transcription accuracy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:42.599071Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:389c8b5fe03b6d39675ad85cf52c70f5ee0f29bbd0e9169a54802760d153f824","observation_id":"485a3165-3922-4f3a-a12c-59e659f2c705","resolution":{"observed_at":"2026-08-04T10:17:42.599071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:42.713961Z","title":"Collection and Processing Results Out of 3,807 books (9,538 hours), we fully processed 2,000","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:42.713961Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:58adbbfdca23c2246a48a03eb1cce93d29df490ac0e16b47cbd1500c2753a4fb","observation_id":"14bc078c-da92-4243-941b-977c74c6406f","resolution":{"observed_at":"2026-08-04T10:17:42.713961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:42.857606Z","title":"Training:A BPE model was trained, and 2,500 new Per- sian tokens were extracted from Copera and added to the GPT model vocabulary","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:42.857606Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:29197770c42123c92654e560420981f96fcc5c15fd742dcaed475992f515ba2e","observation_id":"40d3a534-7145-466c-8b3a-e2114fc17829","resolution":{"observed_at":"2026-08-04T10:17:42.857606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:43.026902Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:43.026902Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:6db061a22047dde2c8f5479f2fa5aec941d39d5cfca369d925b154c1538f50e6","observation_id":"286b6f04-4f8e-4fbf-8280-d840015c4958","resolution":{"observed_at":"2026-08-04T10:17:43.026902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:43.172516Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:43.172516Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:e893193cc57d166688964debb7528f9494749996c0cb8b88a8f83ea26cd751a1","observation_id":"c90464b4-3d5a-47c5-91b4-89a77fbfc108","resolution":{"observed_at":"2026-08-04T10:17:43.172516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:43.302446Z","title":"Librispeech: An asr corpus based on public domain audio books","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:43.302446Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:d6e16826893fad462901eeddcb2d33883d6ee9ff4dec82ac72eb30f4b0a1a7a8","observation_id":"e32f4bf4-0951-4849-ac5c-03b0cdce5e9c","resolution":{"observed_at":"2026-08-04T10:17:43.302446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:43.396224Z","title":"The lj speech dataset, 2017.https://keithito.com/ LJ-Speech-Dataset/","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:43.396224Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:e2eb8a41f6a0ec1ae82f658ed4549e8f52af2e631a101c4361524221ec61dce9","observation_id":"12b5401f-a2b9-4553-8992-cfef05532687","resolution":{"observed_at":"2026-08-04T10:17:43.396224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:43.484771Z","title":"Cstr vctk corpus: English multi-speaker corpus for cstr voice cloning toolkit, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:43.484771Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:2252c244d0ce67620c9d96483982311511c9f06fc5ced690369bf368c1867455","observation_id":"a15d94aa-b61a-4a31-82ee-e873424bd98f","resolution":{"observed_at":"2026-08-04T10:17:43.484771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-05T11:17:11.092255Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-04T10:17:43.634745Z","title":"Common voice: A massively-multilingual speech corpus, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:43.634745Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:8d4e386a6de89e0a09d8aac841f426c606234c9a62730ed967ff81b7e3a7d35e","observation_id":"45a4395a-97e2-4646-939d-8f26357d7598","resolution":{"observed_at":"2026-08-04T10:17:43.634745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:43.775671Z","title":"Mls: A large- scale multilingual dataset for speech research","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:43.775671Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:56508ef9e6ab073d140342e18f0efe0af2211e577f7912941162743866057eb7","observation_id":"26ada9f8-aed5-4442-a131-dccbfd027460","resolution":{"observed_at":"2026-08-04T10:17:43.775671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-04T10:17:43.934752Z","title":"V oxpopuli: A large-scale multilingual speech corpus for representation learn- ing, semi-supervised learning and interpretation, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:43.934752Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:f9e38acd12aa5a26796dcfb93119e5b7ee39906d4e760982310674ff65b59f09","observation_id":"512e650d-05d0-4566-8218-f216c51451e2","resolution":{"observed_at":"2026-08-04T10:17:43.934752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.03627","last_updated":"2019-12-08T07:05:36Z","snapshot_observed_at":"2026-07-06T08:42:52.741268Z","submitted_at":"2019-12-08T07:05:36Z","title":"A Multi Purpose and Large Scale Speech Corpus in Persian and English for Speaker and Speech Recognition: the DeepMine Database","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.03627","snapshot_observed_at":"2026-08-04T10:17:44.054749Z","title":"A multi purpose and large scale speech corpus in persian and english for speaker and speech recognition: the deepmine database, 2019.https: //arxiv.org/abs/1912.03627","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:44.054749Z"},"links":{"cited_paper":"/paper/1912.03627","citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:62095b24ff1e1d0254e689b39142afeda16506669890c84a0c177437f6896c91","observation_id":"db3122dd-39b0-48a7-b35a-da162b972c53","resolution":{"observed_at":"2026-08-04T10:17:44.054749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03585","last_updated":"2023-04-07T10:52:55Z","snapshot_observed_at":"2026-08-07T05:16:03.289001Z","submitted_at":"2023-04-07T10:52:55Z","title":"ArmanTTS single-speaker Persian dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03585","snapshot_observed_at":"2026-08-04T10:17:44.244772Z","title":"Ar- mantts single-speaker persian dataset.arXiv preprint arXiv:2304.03585, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:44.244772Z"},"links":{"cited_paper":"/paper/2304.03585","citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:19852558146343b3a14e1ce9f8b9894a9dcec7c5150e877d79128c9d5885e7da","observation_id":"6c7aae63-dce6-415c-a61f-a9e1c61c1ef5","resolution":{"observed_at":"2026-08-04T10:17:44.244772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07259","last_updated":"2024-09-11T13:28:41Z","snapshot_observed_at":"2026-07-06T19:13:46.489307Z","submitted_at":"2024-09-11T13:28:41Z","title":"ManaTTS Persian: a recipe for creating TTS datasets for lower resource languages","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07259","snapshot_observed_at":"2026-08-04T10:17:44.404775Z","title":"Manatts persian: a recipe for creating tts datasets for lower resource languages.arXiv preprint arXiv:2409.07259, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:44.404775Z"},"links":{"cited_paper":"/paper/2409.07259","citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:b4cd2778fedee11e0da9385ce5d877e164db0ce3cd5de50cafdfaa632ff1384e","observation_id":"c9dc8844-02a9-4c10-89ba-57fbc9274576","resolution":{"observed_at":"2026-08-04T10:17:44.404775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:44.553412Z","title":"End-to-end multi- speaker fastspeech2 with hierarchical decoder.IEEE Ac- cess, 13:127805–127814, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:44.553412Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:bfd12df6ce32c4e756df0ebc1d1ae05b499288ca1e48725dfb2a6f5823c3b082","observation_id":"d8007dbe-4b52-40df-9991-46aeedd2e9cb","resolution":{"observed_at":"2026-08-04T10:17:44.553412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:44.637374Z","title":"Deepmine-multi-tts: a persian speech corpus for multi-speaker text-to-speech.Language Resources and Evaluation, 59:2245–2264, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:44.637374Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:51533bead4b5cb952119b46694e6b5c3f0f6727fcf388b841aa704d97e66cd38","observation_id":"550374eb-971b-4588-95db-cec1d30a513d","resolution":{"observed_at":"2026-08-04T10:17:44.637374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:44.737114Z","title":"Parsbert: Transformer-based model for persian language under- standing.Neural Processing Letters, 53(6):3831–3847, October 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:44.737114Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:2b73c1271afd513d6b597931ba47cb2cbbf0a5bf0437f553a798c55e56f4800b","observation_id":"27b2bae3-c57f-4a0f-bf2b-fcde867e8d89","resolution":{"observed_at":"2026-08-04T10:17:44.737114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:44.884592Z","title":"Persianpunc, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:44.884592Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:fac2a624ab1bc6087a3947ae3d06a484f3ddf24a8176285bc0882a096a5c4e60","observation_id":"aaaef879-b2b1-4ef1-b8ea-747db4f5e7c4","resolution":{"observed_at":"2026-08-04T10:17:44.884592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:45.026168Z","title":"Webrtc voice activity detector.https: //github.com/wiseman/py-webrtcvad","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:45.026168Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:8d6f8e9533c63b3519b55e19bf3efe34a0592c1169fd4514ee0ff932430f9c4d","observation_id":"87d787a5-f1b3-44db-b6e6-98cb74f4a8b6","resolution":{"observed_at":"2026-08-04T10:17:45.026168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:45.165224Z","title":"Ina’s mirex 2018 music and speech detec- tion system","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:45.165224Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:0b20e9b4578e6c4e17914e9906f4b14e43faba955b476c0c7de9af479d633469","observation_id":"ecee115a-6c73-4fe2-a973-97143ecd780f","resolution":{"observed_at":"2026-08-04T10:17:45.165224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:45.373146Z","title":"ECAPA-TDNN: Empha- sized channel attention, propagation and aggregation in TDNN based speaker verification","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:45.373146Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:4bbfee286133ef097e66dc0c0589ecfc4d51c3eac76a8392cfa5313ae7171d3d","observation_id":"7f02eb9d-ed3d-47f7-b723-31c9988c68c1","resolution":{"observed_at":"2026-08-04T10:17:45.373146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-06T13:29:11.244845Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-04T10:17:45.506100Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:45.506100Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:bf6c995563fed29a220dfc009ee31a00806b47efa55172d0ab2ea8312d28a18a","observation_id":"aa2e9eef-15e4-4f97-aadc-7ed3d18401ba","resolution":{"observed_at":"2026-08-04T10:17:45.506100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 1 inbound Pith citation observation for arXiv:2510.10774."}