{"as_of":"2026-08-07T10:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ed3d6009e8fa5cdde4458f6ea519bbc845ed247a05f2bdb22c40041c28ba201d","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:14:31.528872Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.16875/citation-record","integrity":"/paper/2507.16875/integrity","json":"/paper/2507.16875/citation-record.json","paper":"/paper/2507.16875"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:28.851711Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:28.851711Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:038d1301d42e0ed91c4a92d21cc4e9c6197dc6d3a41cdba208f24e7744c3fbd9","observation_id":"3486352c-35ec-4299-8248-c85b2028d082","resolution":{"observed_at":"2026-08-06T15:14:28.851711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:28.900880Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:28.900880Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:9edc5e0adb539d9caacfc77b6a58e16c0d7dcf3fcfd40db0c02a6dc1cd7ee5c8","observation_id":"c217d86d-aaa0-4943-97ef-8421acdeac8c","resolution":{"observed_at":"2026-08-06T15:14:28.900880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:33.733303Z","title":null,"venue":null,"work_id":"bc7bc1ab-5bf4-4036-9c2f-088995f911f5","year":2025},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:28.949257Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:f08a420dcf1e759cf58c704365a731f67956edfde479723fa87d7cc60c2b20a0","observation_id":"65c8152b-ec59-4a19-b156-ee8ccc09051e","resolution":{"observed_at":"2026-08-06T15:14:33.801529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:33.650793Z","title":null,"venue":null,"work_id":"3b944243-14a2-40e4-8f85-79f38cce33f9","year":2024},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.046283Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:4b0a7070d78196852f147d18ea548db1162919010a6f5969c2761db0b61cfe5f","observation_id":"6744d350-15ac-4e12-9b94-6d6a1ea08ffc","resolution":{"observed_at":"2026-08-06T15:14:33.695220Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-05T11:17:11.092255Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-06T15:14:29.110045Z","title":"Tyers, and Gregor Weber","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.110045Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:bc5c6665840d34c51e23ddd6c609e4c373c443472cc0dd923758996001fa7fac","observation_id":"a231c882-4e11-4c31-b255-050eb910fe15","resolution":{"observed_at":"2026-08-06T15:14:29.110045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:33.525856Z","title":null,"venue":null,"work_id":"223065cf-d956-4320-93c5-9622d6b6df20","year":2023},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.154651Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:100a3f3de1f956231029800a0de7ce44a7c247319b02dae514939efc1aecae39","observation_id":"418719bb-0509-40e0-a452-0067eec1d065","resolution":{"observed_at":"2026-08-06T15:14:33.578220Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15386","last_updated":"2023-08-02T13:29:31Z","snapshot_observed_at":"2026-07-06T15:32:49.322000Z","submitted_at":"2023-05-24T17:46:03Z","title":"Vistaar: Diverse Benchmarks and Training Sets for Indian Language ASR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15386","snapshot_observed_at":"2026-08-06T15:14:29.185047Z","title":"Khapra, and Pratyush Kumar","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.185047Z"},"links":{"cited_paper":"/paper/2305.15386","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:2ea95c60a899a647a24ea5f8670e940e34b2a5e5e45447a16d322db4490233b9","observation_id":"59d85089-f29c-4588-a8eb-4446db136635","resolution":{"observed_at":"2026-08-06T15:14:29.185047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:29.258511Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.258511Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:1b64d59f202f68ad148ab82d47ff27f2f6c52c0e8779657bb972667f87102d2f","observation_id":"75463a93-7eba-4e22-b544-9d749f5c31e6","resolution":{"observed_at":"2026-08-06T15:14:29.258511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12446","last_updated":"2022-05-25T02:29:03Z","snapshot_observed_at":"2026-07-06T13:13:37.143547Z","submitted_at":"2022-05-25T02:29:03Z","title":"FLEURS: Few-shot Learning Evaluation of Universal Representations of Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12446","snapshot_observed_at":"2026-08-06T15:14:29.325515Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.325515Z"},"links":{"cited_paper":"/paper/2205.12446","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:54e6262fdf3938e814ab9e1aeef9459777c397dc824cb79e8d00bd48e3418fee","observation_id":"3c674f5f-94d6-4e13-8644-be859c9f748b","resolution":{"observed_at":"2026-08-06T15:14:29.325515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:29.369006Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.369006Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:6a5b01e9006d67d02c423a05d98726cb6928a87dfbc1d0c8f2410db2a537f0c7","observation_id":"d63cf14c-b70d-4c1c-80b0-ed050c653bac","resolution":{"observed_at":"2026-08-06T15:14:29.369006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2021-1339","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:31.675044Z","title":null,"venue":null,"work_id":"2329df02-479c-488a-9843-1e0b05b4a672","year":2021},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.480961Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:8108748adfd7045c4aa7977210ecd87dabf48d057b072f5953c7fa9a81932e79","observation_id":"62b2027e-4be7-47a2-b16c-ca045da36cbf","resolution":{"observed_at":"2026-08-06T15:14:31.755373Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.11761","last_updated":"2022-12-15T07:32:25Z","snapshot_observed_at":"2026-07-06T13:45:11.872750Z","submitted_at":"2022-08-24T20:14:52Z","title":"IndicSUPERB: A Speech Processing Universal Performance Benchmark for Indian languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.11761","snapshot_observed_at":"2026-08-06T15:14:29.537980Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.537980Z"},"links":{"cited_paper":"/paper/2208.11761","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:382ab8a41b4388fd82a84349b04e16ab7ffbc019ce328aa3c01a592fd4bc1d5b","observation_id":"b0ed9496-8a61-447e-b9f5-c4f6fab4dd73","resolution":{"observed_at":"2026-08-06T15:14:29.537980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01926","last_updated":"2024-03-04T10:42:08Z","snapshot_observed_at":"2026-07-06T17:39:07.926765Z","submitted_at":"2024-03-04T10:42:08Z","title":"IndicVoices: Towards building an Inclusive Multilingual Speech Dataset for Indian Languages","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01926","snapshot_observed_at":"2026-08-06T15:14:29.703143Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.703143Z"},"links":{"cited_paper":"/paper/2403.01926","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:44eba2873fb8111eb09a1a91eebb2d19873f604649fa6251a6d67cc52c9d64eb","observation_id":"5691cadf-4806-4b99-af9b-ee7b6b662e7a","resolution":{"observed_at":"2026-08-06T15:14:29.703143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11129","last_updated":"2020-10-23T01:53:58Z","snapshot_observed_at":"2026-08-05T00:14:52.991281Z","submitted_at":"2020-05-22T12:06:46Z","title":"Glow-TTS: A Generative Flow for Text-to-Speech via Monotonic Alignment Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11129","snapshot_observed_at":"2026-08-06T15:14:29.752321Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.752321Z"},"links":{"cited_paper":"/paper/2005.11129","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:ed624e789529c37f7a4ed397a8a6c879aa86e8beb44c246a9fd7d93bea1ad049","observation_id":"ea993c09-867e-4142-971d-c66408588c40","resolution":{"observed_at":"2026-08-06T15:14:29.752321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06103","last_updated":"2021-06-11T01:07:12Z","snapshot_observed_at":"2026-08-02T17:41:21.677381Z","submitted_at":"2021-06-11T01:07:12Z","title":"Conditional Variational Autoencoder with Adversarial Learning for End-to-End Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06103","snapshot_observed_at":"2026-08-06T15:14:29.789462Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.789462Z"},"links":{"cited_paper":"/paper/2106.06103","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:abfd48d9e6ae7145ab2ab96628cc3ce2e7764b825e99bb7725a89a474cb93ad1","observation_id":"d5ce8eca-58e1-46c1-92ab-e59d5d3f4173","resolution":{"observed_at":"2026-08-06T15:14:29.789462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:33.428772Z","title":"Shih, Rohan Badlani, Joao Felipe Santos, Evelina Bakhturina, Mikyas T","venue":null,"work_id":"a61d4d54-7f2c-4752-b509-bb64f2bfdd6f","year":2023},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.857641Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:c64fd27cc016c8325a870fc7e8c4c7f99c9acedfaab94b389f232e6617ae265b","observation_id":"507cb6a4-b091-439e-94ca-747d269f103a","resolution":{"observed_at":"2026-08-06T15:14:33.473985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.05646","last_updated":"2020-10-23T09:12:04Z","snapshot_observed_at":"2026-07-06T10:03:33.857220Z","submitted_at":"2020-10-12T12:33:43Z","title":"HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.05646","snapshot_observed_at":"2026-08-06T15:14:29.951696Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:29.951696Z"},"links":{"cited_paper":"/paper/2010.05646","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:1cf331529a372bf7fea8c0136f4645891bcb5b472d35935e8ae7e9f715c29760","observation_id":"724417c4-7bab-481d-90ce-930880d48b18","resolution":{"observed_at":"2026-08-06T15:14:29.951696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09536","last_updated":"2023-02-17T08:09:02Z","snapshot_observed_at":"2026-07-06T14:19:47.424778Z","submitted_at":"2022-11-17T13:59:34Z","title":"Towards Building Text-To-Speech Systems for the Next Billion Users","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09536","snapshot_observed_at":"2026-08-06T15:14:30.026285Z","title":"Khapra, and Karthik Nandakumar","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.026285Z"},"links":{"cited_paper":"/paper/2211.09536","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:ad8993ef73445248b4c98c1d703e3e0a510d5959c836ee3f151a9f6b68692df0","observation_id":"2a268d05-5e41-4234-8418-029e20a4b169","resolution":{"observed_at":"2026-08-06T15:14:30.026285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-07-06T15:47:26.532273Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-06T15:14:30.133816Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.133816Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:e8c6ae30a6fa774765b6eb8cca35dc37d655b399998a1785def3e31ce2091c40","observation_id":"ead94f66-2b8d-4b78-928d-1d85dd3b77a5","resolution":{"observed_at":"2026-08-06T15:14:30.133816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-06T15:14:30.216423Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.216423Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:53be5542338df2b9bf5fcd4a15a2473cd48511c6b7d300dfd2e72f2991a97bc4","observation_id":"718d8ba3-b7d5-4f66-9602-9376b60effcc","resolution":{"observed_at":"2026-08-06T15:14:30.216423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:33.296152Z","title":null,"venue":null,"work_id":"b072a490-5eca-47b9-ad76-2f221698067c","year":2020},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.258751Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:9de2afb8bc58ecc162be43b6299896f35e253bf3887440c9dd352fd8bc747177","observation_id":"9e9212a2-a1db-4b53-89d0-f1b3761ba85f","resolution":{"observed_at":"2026-08-06T15:14:33.361801Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03500","last_updated":"2020-12-07T07:46:46Z","snapshot_observed_at":"2026-07-06T10:21:17.333971Z","submitted_at":"2020-12-07T07:46:46Z","title":"EfficientTTS: An Efficient and High-Quality Text-to-Speech Architecture","version":1},"cited_work":{"arxiv_id":"2012.03500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.03500","snapshot_observed_at":"2026-08-06T15:14:32.401201Z","title":"EfficientTTS: An Efficient and High-Quality Text-to-Speech Architecture","venue":"eess.AS","work_id":"ceb33664-6129-4573-8c60-bf2ea5c9cf57","year":2020},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.316970Z"},"links":{"cited_paper":"/paper/2012.03500","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:e30cf52169ef884a93658bfa8ac62d85b96f8639c3f052ef3eef23052189fc11","observation_id":"bf8952db-b67f-493f-a3db-2b79f90a01d6","resolution":{"observed_at":"2026-08-06T15:14:32.518024Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:33.131236Z","title":null,"venue":null,"work_id":"12b85b52-1f11-48b0-87ae-342d6edeb6e0","year":2020},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.418669Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:2dd8a708e738fde89084ffbb503e143ba14458f714816d255a3cd5be742712b4","observation_id":"1b685550-945e-4d48-9d63-02d92c9de4bc","resolution":{"observed_at":"2026-08-06T15:14:33.192578Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14654","last_updated":"2023-10-24T06:03:14Z","snapshot_observed_at":"2026-07-06T16:36:59.440643Z","submitted_at":"2023-10-23T07:50:10Z","title":"SPRING-INX: A Multilingual Indian Language Speech Corpus by SPRING Lab, IIT Madras","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14654","snapshot_observed_at":"2026-08-06T15:14:30.445886Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.445886Z"},"links":{"cited_paper":"/paper/2310.14654","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:4e515a904f884f1809b56b096de92393a2edfc80b857ccb0be1794ba6d91b418","observation_id":"fa5599c9-21d1-484b-8623-55f5ca3074a4","resolution":{"observed_at":"2026-08-06T15:14:30.445886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-06T15:14:30.485844Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.485844Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:0099c38a7c94f5b249445afbe6be2a0a7cdd2528a25cc8575cd7fe5951e630f5","observation_id":"dbec8d13-d99a-4ef8-bbec-77b4844aaab6","resolution":{"observed_at":"2026-08-06T15:14:30.485844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.09263","last_updated":"2019-11-20T09:37:22Z","snapshot_observed_at":"2026-08-07T08:05:20.018613Z","submitted_at":"2019-05-22T17:50:21Z","title":"FastSpeech: Fast, Robust and Controllable Text to Speech","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.09263","snapshot_observed_at":"2026-08-06T15:14:30.581398Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.581398Z"},"links":{"cited_paper":"/paper/1905.09263","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:0dcb58cc0b907d8772f5834d22580695e697f70d9fd428f59e1ca32cd80b87c5","observation_id":"58d67193-7f70-4504-84d4-09c56b858988","resolution":{"observed_at":"2026-08-06T15:14:30.581398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04597","last_updated":"2015-05-18T11:28:37Z","snapshot_observed_at":"2026-08-06T11:05:16.105361Z","submitted_at":"2015-05-18T11:28:37Z","title":"U-Net: Convolutional Networks for Biomedical Image Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04597","snapshot_observed_at":"2026-08-06T15:14:30.713340Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.713340Z"},"links":{"cited_paper":"/paper/1505.04597","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:e80448a19ed3111b44443c2fd28068d12fc1f047c60ff4569a60aae40e17b44d","observation_id":"86b0fe1b-611a-4c98-a7a8-505b0962d4ee","resolution":{"observed_at":"2026-08-06T15:14:30.713340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05356","last_updated":"2024-10-07T05:29:01Z","snapshot_observed_at":"2026-08-04T09:16:47.088267Z","submitted_at":"2024-09-09T06:28:47Z","title":"IndicVoices-R: Unlocking a Massive Multilingual Multi-speaker Speech Corpus for Scaling Indian TTS","version":2},"cited_work":{"arxiv_id":"2409.05356","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.05356","snapshot_observed_at":"2026-08-06T15:14:32.068359Z","title":"IndicVoices-R: Unlocking a Massive Multilingual Multi-speaker Speech Corpus for Scaling Indian TTS","venue":"cs.CL","work_id":"dbce4188-78bb-4511-bb9a-864f7b0ee880","year":2024},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.761558Z"},"links":{"cited_paper":"/paper/2409.05356","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:56dec6f4863e6e7c6993f5c2f82e3ae0523511e8caff87f71c30ec9ffef3682f","observation_id":"26448455-0f63-47d1-9b08-1c9949650b2f","resolution":{"observed_at":"2026-08-06T15:14:32.221966Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:30.799973Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.799973Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:3f0f26e88b0877544bc0cb38704afc778703757ccee9a77bb1a767398f0ecc22","observation_id":"017f1592-d3c9-4c8c-af18-073a264abff0","resolution":{"observed_at":"2026-08-06T15:14:30.799973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04301","last_updated":"2021-05-11T04:12:14Z","snapshot_observed_at":"2026-08-06T20:00:38.096518Z","submitted_at":"2020-10-08T23:41:39Z","title":"Non-Attentive Tacotron: Robust and Controllable Neural TTS Synthesis Including Unsupervised Duration Modeling","version":4},"cited_work":{"arxiv_id":"2010.04301","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.04301","snapshot_observed_at":"2026-08-06T15:14:31.871791Z","title":"Non-Attentive Tacotron: Robust and Controllable Neural TTS Synthesis Including Unsupervised Duration Modeling","venue":"cs.SD","work_id":"63150e68-7c2a-49f2-88b2-004f80dd9693","year":2020},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.879930Z"},"links":{"cited_paper":"/paper/2010.04301","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:b845e493fe4430c65b61f932af83d7ae4c4145d772d804a2918cdfc94869770b","observation_id":"c55ea404-b1f0-4317-824e-a2302233b547","resolution":{"observed_at":"2026-08-06T15:14:31.926697Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05884","last_updated":"2018-02-16T01:28:23Z","snapshot_observed_at":"2026-07-06T06:14:40.571088Z","submitted_at":"2017-12-16T00:51:40Z","title":"Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05884","snapshot_observed_at":"2026-08-06T15:14:30.947024Z","title":"Weiss, Mike Schuster, Navdeep Jaitly, Zongheng Yang, Zhifeng Chen, Yu Zhang, Yuxuan Wang, RJ Skerry-Ryan, Rif A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.947024Z"},"links":{"cited_paper":"/paper/1712.05884","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:4d8b609a01c23053b2fbc1752550924773ca31767d05f1c00b21c910fa3e8610","observation_id":"3eee1f02-b148-45ec-823e-ce31c42c0ba5","resolution":{"observed_at":"2026-08-06T15:14:30.947024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:32.911640Z","title":"Shih, Rafael Valle, Rohan Badlani, Adrian Lancucki, Wei Ping, and Bryan Catanzaro","venue":null,"work_id":"72ca9a22-44d9-4235-b01e-1348d2cd687f","year":2021},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:31.001141Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:228383a105642a76676e06b576e9ea6770bb917849475f04f306e3490dbbe71f","observation_id":"07d178d3-7e4d-4005-ab9c-6371c1de726a","resolution":{"observed_at":"2026-08-06T15:14:32.995561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-06T15:14:31.084431Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:31.084431Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:af56e7b6f01a258542cbdcc606b7f7f7ce6d2d241ef9a32e2b81f4cd7e41a7b2","observation_id":"c6d4ee7c-67c7-4b0c-a61a-e255d614d34d","resolution":{"observed_at":"2026-08-06T15:14:31.084431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.04421","last_updated":"2022-05-10T15:25:20Z","snapshot_observed_at":"2026-07-06T13:08:11.000809Z","submitted_at":"2022-05-09T16:57:35Z","title":"NaturalSpeech: End-to-End Text to Speech Synthesis with Human-Level Quality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.04421","snapshot_observed_at":"2026-08-06T15:14:31.231631Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:31.231631Z"},"links":{"cited_paper":"/paper/2205.04421","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:3d7119d43af8cfb3f635ef3ea6832e6051a39cf1ef6b9d63b915b8e8bde72780","observation_id":"9159994c-8716-48fc-88c7-28012bea8ee2","resolution":{"observed_at":"2026-08-06T15:14:31.231631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:14:32.682036Z","title":null,"venue":null,"work_id":"da5cc12b-717e-46f9-b7c4-ff85e240eb7d","year":2025},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:31.284147Z"},"links":{"citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:9683a30fafa1611135f97c8fa749cf220d050a2a5ac231c59a9d3b1e56d62e0f","observation_id":"8206b7f7-ae58-4a33-8f73-0f73277eff22","resolution":{"observed_at":"2026-08-06T15:14:32.772004Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-06T15:14:31.321308Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:31.321308Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:78dcfff930f0811e7cb97008c399b23b2f569e914d40deaa93ac6920cfd332ed","observation_id":"830c4312-e079-43fb-9f64-424885b3efe7","resolution":{"observed_at":"2026-08-06T15:14:31.321308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-06T15:14:31.387276Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:31.387276Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:3bceb34133f8f93befeeb3faf0cc2f9b425a6853e8ce3b60876900e50cefaf75","observation_id":"30737b08-bc54-40b5-94e2-c69128a91585","resolution":{"observed_at":"2026-08-06T15:14:31.387276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T15:14:31.452735Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:31.452735Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:74d7b0e569e2c5a483b2dc9503cb9f3cbcea6dc04885794f9f47d86ce644051c","observation_id":"f0760b92-4652-409b-8b16-d7a37068a120","resolution":{"observed_at":"2026-08-06T15:14:31.452735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.09017","last_updated":"2018-03-23T23:56:49Z","snapshot_observed_at":"2026-07-06T06:29:57.506159Z","submitted_at":"2018-03-23T23:56:49Z","title":"Style Tokens: Unsupervised Style Modeling, Control and Transfer in End-to-End Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.09017","snapshot_observed_at":"2026-08-06T15:14:31.491408Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:31.491408Z"},"links":{"cited_paper":"/paper/1803.09017","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:242d8e1debe3f6e8e03753798c7b0adbb036a3a1770a730a1245b3011a7abf4d","observation_id":"b439e1d8-a09d-4530-82b3-6062dc1a6caf","resolution":{"observed_at":"2026-08-06T15:14:31.491408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07467","last_updated":"2019-10-16T16:44:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-16T16:44:22Z","title":"Root Mean Square Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07467","snapshot_observed_at":"2026-08-06T15:14:31.528872Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:31.528872Z"},"links":{"cited_paper":"/paper/1910.07467","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:84931a123f6b159b58097a086d61a1783c4c1fe36b632811c183a1b9339f9586","observation_id":"c0d9e11f-ccaa-4d7e-a440-31147ca3c488","resolution":{"observed_at":"2026-08-06T15:14:31.528872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-06T18:07:39.816960Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":4,"verified_fuzzy":2},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2507.16875."}