{"as_of":"2026-08-09T13:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:37f62bf5e0936494a6387e5dcb9359908441e4828909c67b1a9c7567dc4e6b55","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:34:09.630347Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:34:07.882293Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T11:34:10.011767Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"cited_work":{"arxiv_id":"2507.22612","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.22612","snapshot_observed_at":"2026-08-06T11:34:10.011767Z","title":"Adaptive Duration Model for Text Speech Alignment","venue":"cs.SD","work_id":"e204af43-da6e-43bb-96a2-adb79b38452d","year":2025},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:07.882293Z"},"links":{"cited_paper":"/paper/2507.22612","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:af91b4de2bf44095e39ea65370b8e41595966f84a2944dc0eee20f21a9478d59","observation_id":"e822238e-0ba3-457f-bee2-0dc2c323cba7","resolution":{"observed_at":"2026-08-06T11:34:10.121918Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.22612/citation-record","integrity":"/paper/2507.22612/integrity","json":"/paper/2507.22612/citation-record.json","paper":"/paper/2507.22612"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:12.353545Z","title":"A typical TTS system includes an encoder, a decoder, and an alignment mechanism linking linguistic and acoustic representations [3–6]","venue":null,"work_id":"5a8446b7-cc38-4e31-8416-8cd2f3c76154","year":null},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:07.829227Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:d5e03d33c80de09d0af195c0434a87b50f60fbaba051360ebd843658a0f5a146","observation_id":"769360fc-7bb6-4889-b742-f172efc4899d","resolution":{"observed_at":"2026-08-06T11:34:12.419908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"cited_work":{"arxiv_id":"2507.22612","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.22612","snapshot_observed_at":"2026-08-06T11:34:10.011767Z","title":"Adaptive Duration Model for Text Speech Alignment","venue":"cs.SD","work_id":"e204af43-da6e-43bb-96a2-adb79b38452d","year":2025},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:07.882293Z"},"links":{"cited_paper":"/paper/2507.22612","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:af91b4de2bf44095e39ea65370b8e41595966f84a2944dc0eee20f21a9478d59","observation_id":"e822238e-0ba3-457f-bee2-0dc2c323cba7","resolution":{"observed_at":"2026-08-06T11:34:10.121918Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:12.195522Z","title":"We use Premium and Basic subsets of Wenet- Speech4TTS as our experiment dataset","venue":null,"work_id":"d866bafb-4683-43ed-95e5-4a5b1cd41e57","year":2020},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:07.942094Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:42e1c6c413800b2e14c71ddbd22154091a8d07800c1de40b95ed639716c8801f","observation_id":"50b46a03-b979-44fc-86c3-0b452df8c76e","resolution":{"observed_at":"2026-08-06T11:34:12.271952Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:12.002747Z","title":"Durformer outperforms baseline methods with respect to efficiency and accuracy","venue":null,"work_id":"305f83ef-cbfe-4fff-a0dc-c697ea2c88f2","year":null},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.046867Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:30110e15155c395771ee8863d17ed9def89bbe02bf60b4db6bf6526897e763ca","observation_id":"458ac7de-2dbe-4a37-80c5-c02a70b6ea43","resolution":{"observed_at":"2026-08-06T11:34:12.084758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:11.802960Z","title":"One tts align- ment to rule them all,","venue":null,"work_id":"8c0308d4-deb8-47d8-bc28-228ef6b0370e","year":2022},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.114869Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:b808409d52d920dc775d51ab858fb1850707589fa13fdbc17ad95af6cbdcd519","observation_id":"0e2b5885-beda-4b19-8418-c051f936a75c","resolution":{"observed_at":"2026-08-06T11:34:11.898860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-06T11:34:08.167239Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single- stream decoupled speech tokens,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.167239Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:03f925176fa5b526fa516dbad40b9316a9dd2199dd61985a8a83f95c21f688cc","observation_id":"0c5d9294-2c5c-4955-820b-fd37b48e7a1b","resolution":{"observed_at":"2026-08-06T11:34:08.167239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.05957","last_updated":"2020-07-16T15:10:18Z","snapshot_observed_at":"2026-08-09T10:06:53.035106Z","submitted_at":"2020-05-12T17:57:17Z","title":"Flowtron: an Autoregressive Flow-based Generative Network for Text-to-Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.05957","snapshot_observed_at":"2026-08-06T11:34:08.232019Z","title":"Flowtron: an autoregressive flow-based generative network for text-to-speech synthesis,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.232019Z"},"links":{"cited_paper":"/paper/2005.05957","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:3246ce126b1a5bf3d5db4f63bfa77cc9013b0f8bc2dae2df0c1e722685288c8e","observation_id":"d5b85757-2026-4848-bdb3-4bc26b481cdf","resolution":{"observed_at":"2026-08-06T11:34:08.232019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:11.596915Z","title":"Fastspeech: Fast, robust and controllable text to speech,","venue":null,"work_id":"7a22581c-9975-4f63-9042-cbc0142e4a0e","year":2019},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.320168Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:a139fe36e005219d6b9e9691f43d33381b353d8f8513647d8a654ecb2d5d3c49","observation_id":"1dc12977-4893-42a9-9c18-67a74ec62837","resolution":{"observed_at":"2026-08-06T11:34:11.701373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:11.436818Z","title":"Fastpitch: Parallel text-to-speech with pitch prediction,","venue":null,"work_id":"1edd672f-a59c-4fc6-9496-db0a79e619b3","year":2021},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.378954Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:c64a2ef27527d85951404fd683f34b21d2f20643ab6f8899ff301e15f5da00eb","observation_id":"03f6445e-4212-4a15-8f2a-1c798a8804c9","resolution":{"observed_at":"2026-08-06T11:34:11.524555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-06T11:34:08.523005Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.523005Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:3e5a5c8b057f19b8652dd6b7215cee9f5101cfa38b0ffaa3f195ca90ece5034c","observation_id":"10183caa-b808-4807-92b6-767070d9fb8e","resolution":{"observed_at":"2026-08-06T11:34:08.523005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:11.276912Z","title":"Location-relative attention mechanisms for ro- bust long-form speech synthesis,","venue":null,"work_id":"9907aebb-f388-4ea2-ada3-d064ef929f7b","year":2020},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.586589Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:f11140f3179e13dc26ec2b937b350af79c5157f406bcf4fad562d78d72eafc5b","observation_id":"849ba4da-4596-46cd-8456-028e7175abd4","resolution":{"observed_at":"2026-08-06T11:34:11.359121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T11:34:08.681690Z","title":"Seed-tts: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.681690Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:7009631813a79fa7546b290a4f6aa25a96c35ea079dab5113e8b317165f61701","observation_id":"368df377-e60e-4603-b996-af6b64354af5","resolution":{"observed_at":"2026-08-06T11:34:08.681690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-07T23:22:31.422843Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-06T11:34:08.767437Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.767437Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:eea1ab9582650eeff0402fc80f2ca3160823c6170ba058a89fffde43360761b0","observation_id":"71ddde11-7728-46f0-97c8-631b877d30c0","resolution":{"observed_at":"2026-08-06T11:34:08.767437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:11.115054Z","title":"Non-autoregressive neural text-to-speech,","venue":null,"work_id":"1a41cab3-3633-420c-a65b-d84d54b219fd","year":2020},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.866084Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:b9e5c27987ef8768ecd50973fd3eec72ac548a4d5687cf824e4aac365e3cbdf4","observation_id":"2a3f2b53-4432-4704-bf13-5ce8b7d01f08","resolution":{"observed_at":"2026-08-06T11:34:11.191926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:10.958730Z","title":"Durian-e 2: Duration informed attention net- work with adaptive variational autoencoder and adver- sarial learning for expressive text-to-speech synthesis,","venue":null,"work_id":"141c6378-19c5-484b-a0fe-12cc01f92b53","year":2024},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:08.959203Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:79ce9e946c88fb77db68f77c2637039f3b694ac69b5095a2faa0ac13403fb6e5","observation_id":"21c31295-447d-46b1-8bc5-31f1d935c5ab","resolution":{"observed_at":"2026-08-06T11:34:11.038847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.09645","last_updated":"2020-05-15T20:46:24Z","snapshot_observed_at":"2026-07-06T08:39:04.136342Z","submitted_at":"2019-11-21T18:04:47Z","title":"Prosody Transfer in Neural Text to Speech Using Global Pitch and Loudness Features","version":2},"cited_work":{"arxiv_id":"1911.09645","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.09645","snapshot_observed_at":"2026-08-06T11:34:09.797800Z","title":"Prosody Transfer in Neural Text to Speech Using Global Pitch and Loudness Features","venue":"cs.SD","work_id":"17286b19-c789-449b-83ad-eae0bb962b72","year":2019},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.044690Z"},"links":{"cited_paper":"/paper/1911.09645","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:5de884c63408511ec4608c05ecdbb28ee7b3a60dc888f1851830b92ef0468d4f","observation_id":"6cbc73b0-781d-4ae4-99b2-0c2dc1b537e5","resolution":{"observed_at":"2026-08-06T11:34:09.863491Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:10.807787Z","title":"Simple-tts: End-to-end text-to-speech synthesis with latent diffusion,","venue":null,"work_id":"bc3eac48-b89a-4dcc-9b3c-16409f71e46c","year":2023},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.097184Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:077c615b06fec6b98b2e251ae234e12d1d1d32b539d6acda7885513fc878805c","observation_id":"10f337af-c4fa-42b6-bcc3-fe35ea5ccb08","resolution":{"observed_at":"2026-08-06T11:34:10.878139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T11:34:09.160142Z","title":"Neural codec lan- guage models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.160142Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:a3b2ada2498f6a8b82cc9dfc031e0984fce4049efcf02554ccdae53fbffa6a4c","observation_id":"7f2d6d4c-ffdd-4fe9-8d08-605b21eeb050","resolution":{"observed_at":"2026-08-06T11:34:09.160142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:10.659561Z","title":"Natural tts synthesis by conditioning wavenet on mel spectrogram predictions,","venue":null,"work_id":"1a246776-6b16-4411-ba30-83266cd16ca0","year":2018},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.231739Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:2f8c3fdf75897d91bb7e955092e18355e4ea4f24f8dc64dd53b5bc71fe8cc46c","observation_id":"06f29d60-5a31-40d7-a324-22c2f553eea3","resolution":{"observed_at":"2026-08-06T11:34:10.727750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:10.458647Z","title":"Portaspeech: Portable and high-quality generative text-to-speech,","venue":null,"work_id":"7f5aef36-ed8f-47e9-a7d3-79078dc3890c","year":2021},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.286028Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:533f4506a5376603ebe32f4b17d14b1eba9b5a75a2716606965e7239a02659d0","observation_id":"cbfaa89b-f5e3-42c5-8734-c4c308da99e2","resolution":{"observed_at":"2026-08-06T11:34:10.564583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:10.267293Z","title":"V oicebox: Text-guided multilingual universal speech generation at scale,","venue":null,"work_id":"a841c80e-0f9d-4188-8b68-df98a981bc1a","year":2023},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.356034Z"},"links":{"citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:25134aa5a43422f51af3298a8c21049b76e8bbdafece74099b6b010ee287fbac","observation_id":"a65be6c9-43c0-465b-a52b-8a8010999c00","resolution":{"observed_at":"2026-08-06T11:34:10.353445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-01T10:20:49.367508Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-06T11:34:09.403232Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.403232Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:9c363ea6447b31957115a2e1bb3c463e49b902ad09aa109eab340c42b2a707db","observation_id":"752c8ba0-a959-4247-8d1e-c3737aee4cf3","resolution":{"observed_at":"2026-08-06T11:34:09.403232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","snapshot_observed_at":"2026-07-06T18:25:09.965258Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02328","snapshot_observed_at":"2026-08-06T11:34:09.476364Z","title":"Sim- plespeech: Towards simple and efficient text-to-speech with scalar latent transformer diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.476364Z"},"links":{"cited_paper":"/paper/2406.02328","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:f0e790b2f4609b3beed41fa159f6d219ec0c4700616b0dbda7d853d88bee4d0e","observation_id":"9cb08e55-b39c-4f59-ab51-4d28892893d5","resolution":{"observed_at":"2026-08-06T11:34:09.476364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-06T11:34:09.568289Z","title":"F5- tts: A fairytaler that fakes fluent and faithful speech with flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.568289Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:64f27ccf05504101b47bd1b586973876c438b1a6e4d80f773110ab712ac823d2","observation_id":"56b91bcd-6dbd-4bf0-b070-a152a73ffcc4","resolution":{"observed_at":"2026-08-06T11:34:09.568289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05763","last_updated":"2024-06-19T04:52:56Z","snapshot_observed_at":"2026-07-06T18:27:45.631190Z","submitted_at":"2024-06-09T12:32:42Z","title":"WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05763","snapshot_observed_at":"2026-08-06T11:34:09.630347Z","title":"Wenetspeech4tts: A 12,800-hour mandarin tts corpus for large speech generation model benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.630347Z"},"links":{"cited_paper":"/paper/2406.05763","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:0af087f450de2f72ee1085befca3c24f277a8415d7115d2197ac1c546e5bdac3","observation_id":"f5a86135-f78e-4daf-8f2e-11ed8cd36458","resolution":{"observed_at":"2026-08-06T11:34:09.630347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T23:11:59.570748Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":12},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 1 inbound Pith citation observation for arXiv:2507.22612."}