{"as_of":"2026-08-16T10:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:964c0dc7dfdffc7100b3cca4d9bc4f2db74dbcdccb0a17d347465aa08ddd4d8e","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:16:26.973724Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.08112/citation-record","integrity":"/paper/2412.08112/integrity","json":"/paper/2412.08112/citation-record.json","paper":"/paper/2412.08112"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:16:26.917953Z","title":"Fastspeech: Fast, robust and controllable text to speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08112","last_updated":"2024-12-11T05:39:12Z","snapshot_observed_at":"2026-08-16T05:34:19.657013Z","submitted_at":"2024-12-11T05:39:12Z","title":"Aligner-Guided Training Paradigm: Advancing Text-to-Speech Models with Aligner Guided Duration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:26.917953Z"},"links":{"citing_paper":"/paper/2412.08112"},"observation_digest":"sha256:e4f843de5e09535beb2c9412f8909f8aeae9ba83563df7f7628b221d33a97168","observation_id":"f560fb69-7657-4e82-ab6e-b306216a25a9","resolution":{"observed_at":"2026-08-11T18:16:26.917953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-14T02:11:04.009144Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-11T18:16:26.922799Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.08112","last_updated":"2024-12-11T05:39:12Z","snapshot_observed_at":"2026-08-16T05:34:19.657013Z","submitted_at":"2024-12-11T05:39:12Z","title":"Aligner-Guided Training Paradigm: Advancing Text-to-Speech Models with Aligner Guided Duration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:26.922799Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2412.08112"},"observation_digest":"sha256:8a81b0f03c0e73ce538fdbd0fc1afb63647df2706ce3596d18061850fbeca409","observation_id":"2ec1ae0d-b63b-44fb-a6c7-f2372c92b755","resolution":{"observed_at":"2026-08-11T18:16:26.922799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:16:26.927864Z","title":"Stylespeech: Parameter-efficient fine tuning for pre-trained controllable text-to- speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08112","last_updated":"2024-12-11T05:39:12Z","snapshot_observed_at":"2026-08-16T05:34:19.657013Z","submitted_at":"2024-12-11T05:39:12Z","title":"Aligner-Guided Training Paradigm: Advancing Text-to-Speech Models with Aligner Guided Duration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:26.927864Z"},"links":{"citing_paper":"/paper/2412.08112"},"observation_digest":"sha256:02e3eaa721366cbad24737070e4ad500ce64442bf93c922dcb13c2783490ae41","observation_id":"7275fe30-9ac6-4f4e-8d1d-bd7f647be84f","resolution":{"observed_at":"2026-08-11T18:16:26.927864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:16:27.132624Z","title":"Montreal forced aligner: Trainable text- speech alignment using kaldi.,","venue":null,"work_id":"5f3e15cd-10a4-4c80-a10d-f69dbec7c075","year":2017},"citing_paper":{"arxiv_id":"2412.08112","last_updated":"2024-12-11T05:39:12Z","snapshot_observed_at":"2026-08-16T05:34:19.657013Z","submitted_at":"2024-12-11T05:39:12Z","title":"Aligner-Guided Training Paradigm: Advancing Text-to-Speech Models with Aligner Guided Duration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:26.932348Z"},"links":{"citing_paper":"/paper/2412.08112"},"observation_digest":"sha256:e75fdf901043b7c5a54df95fefab2f1b271f2cf730f9c0b0c1eb13143c124e8c","observation_id":"900cc78f-fec9-4a2c-80eb-0e049fa537bc","resolution":{"observed_at":"2026-08-11T18:16:27.137777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:16:27.115404Z","title":"The kaldi speech recognition toolkit,","venue":null,"work_id":"86f2e161-cbd1-47e3-a9cc-cd6ecf68e6c6","year":2011},"citing_paper":{"arxiv_id":"2412.08112","last_updated":"2024-12-11T05:39:12Z","snapshot_observed_at":"2026-08-16T05:34:19.657013Z","submitted_at":"2024-12-11T05:39:12Z","title":"Aligner-Guided Training Paradigm: Advancing Text-to-Speech Models with Aligner Guided Duration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:26.936995Z"},"links":{"citing_paper":"/paper/2412.08112"},"observation_digest":"sha256:b30763161b57efb4094f5a37bab7f28a70077e3f8b67fa9b1055feeb69c2f2de","observation_id":"f98cb569-ce62-4360-a6be-238a161353b0","resolution":{"observed_at":"2026-08-11T18:16:27.121236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:16:27.101104Z","title":"An introduction to hidden markov models,","venue":null,"work_id":"9cac6567-2e03-4346-a734-c4f9b8526182","year":1986},"citing_paper":{"arxiv_id":"2412.08112","last_updated":"2024-12-11T05:39:12Z","snapshot_observed_at":"2026-08-16T05:34:19.657013Z","submitted_at":"2024-12-11T05:39:12Z","title":"Aligner-Guided Training Paradigm: Advancing Text-to-Speech Models with Aligner Guided Duration","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:26.941294Z"},"links":{"citing_paper":"/paper/2412.08112"},"observation_digest":"sha256:bf2508c0c42b361c54f311c24a9532caf22c0b09c2cfca276dfbeab78f6288d6","observation_id":"22e600d4-296e-4cec-bfe6-afe035b083f1","resolution":{"observed_at":"2026-08-11T18:16:27.105994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:16:27.084162Z","title":"Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks,","venue":null,"work_id":"aa45f0dd-59f2-453a-b8b5-fd9afcdc7984","year":2006},"citing_paper":{"arxiv_id":"2412.08112","last_updated":"2024-12-11T05:39:12Z","snapshot_observed_at":"2026-08-16T05:34:19.657013Z","submitted_at":"2024-12-11T05:39:12Z","title":"Aligner-Guided Training Paradigm: Advancing Text-to-Speech Models with Aligner Guided Duration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:26.946079Z"},"links":{"citing_paper":"/paper/2412.08112"},"observation_digest":"sha256:0aa7b64e4d8bd2e7426a3683ee032956f79271065cab8c28ae5a280be5ddc31a","observation_id":"0e3f3873-eb07-40ac-a0b9-703aaf58d2ac","resolution":{"observed_at":"2026-08-11T18:16:27.091344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.05011","last_updated":"2021-12-15T16:42:14Z","snapshot_observed_at":"2026-08-15T06:00:56.018391Z","submitted_at":"2021-11-09T09:07:30Z","title":"RAVE: A variational autoencoder for fast and high-quality neural audio synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.05011","snapshot_observed_at":"2026-08-11T18:16:26.951656Z","title":"Rave: A variational autoencoder for fast and high-quality neural audio synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08112","last_updated":"2024-12-11T05:39:12Z","snapshot_observed_at":"2026-08-16T05:34:19.657013Z","submitted_at":"2024-12-11T05:39:12Z","title":"Aligner-Guided Training Paradigm: Advancing Text-to-Speech Models with Aligner Guided Duration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:26.951656Z"},"links":{"cited_paper":"/paper/2111.05011","citing_paper":"/paper/2412.08112"},"observation_digest":"sha256:5d55d2a1d9c2030042c3332d8d8607ddc46228baede204958d392aee70ef8d8a","observation_id":"b0d1201b-80cf-4fc9-8afc-5498299bf0bb","resolution":{"observed_at":"2026-08-11T18:16:26.951656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:16:26.956497Z","title":"Chinese mandarin female corpus,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08112","last_updated":"2024-12-11T05:39:12Z","snapshot_observed_at":"2026-08-16T05:34:19.657013Z","submitted_at":"2024-12-11T05:39:12Z","title":"Aligner-Guided Training Paradigm: Advancing Text-to-Speech Models with Aligner Guided Duration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:26.956497Z"},"links":{"citing_paper":"/paper/2412.08112"},"observation_digest":"sha256:6adeaa0dc2151b9532e648ce185f51f98c4274bdfef0bb7f3913dec1e65eb402","observation_id":"73789886-b9b6-4ba0-bd39-246065e0b6db","resolution":{"observed_at":"2026-08-11T18:16:26.956497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:16:26.960896Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08112","last_updated":"2024-12-11T05:39:12Z","snapshot_observed_at":"2026-08-16T05:34:19.657013Z","submitted_at":"2024-12-11T05:39:12Z","title":"Aligner-Guided Training Paradigm: Advancing Text-to-Speech Models with Aligner Guided Duration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:26.960896Z"},"links":{"citing_paper":"/paper/2412.08112"},"observation_digest":"sha256:d0024092901599bc4f428c95d52b8f7736a4d0536240ba069838aff4a8c4dafb","observation_id":"ff00fc4c-716c-4322-a7ac-86e254bc9e3f","resolution":{"observed_at":"2026-08-11T18:16:26.960896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:16:26.965277Z","title":"Mel-cepstral distance measure for objective speech quality assessment,","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2412.08112","last_updated":"2024-12-11T05:39:12Z","snapshot_observed_at":"2026-08-16T05:34:19.657013Z","submitted_at":"2024-12-11T05:39:12Z","title":"Aligner-Guided Training Paradigm: Advancing Text-to-Speech Models with Aligner Guided Duration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:26.965277Z"},"links":{"citing_paper":"/paper/2412.08112"},"observation_digest":"sha256:ad004eeaa90036d6a1497eb7c72077f6f7a9450667f3508ac053e3c4d4881445","observation_id":"31ebd09f-9c89-4825-b76d-ea16e2de42b4","resolution":{"observed_at":"2026-08-11T18:16:26.965277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:16:26.969170Z","title":"Perceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2412.08112","last_updated":"2024-12-11T05:39:12Z","snapshot_observed_at":"2026-08-16T05:34:19.657013Z","submitted_at":"2024-12-11T05:39:12Z","title":"Aligner-Guided Training Paradigm: Advancing Text-to-Speech Models with Aligner Guided Duration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:26.969170Z"},"links":{"citing_paper":"/paper/2412.08112"},"observation_digest":"sha256:3d634235b6d92f4e844a294dd196b2b7dd7bf34cdf34a2d7b30b19634f143d62","observation_id":"1d3fd358-e60e-4d17-ba07-f4cd4b06bca8","resolution":{"observed_at":"2026-08-11T18:16:26.969170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:16:26.973724Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08112","last_updated":"2024-12-11T05:39:12Z","snapshot_observed_at":"2026-08-16T05:34:19.657013Z","submitted_at":"2024-12-11T05:39:12Z","title":"Aligner-Guided Training Paradigm: Advancing Text-to-Speech Models with Aligner Guided Duration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:26.973724Z"},"links":{"citing_paper":"/paper/2412.08112"},"observation_digest":"sha256:47d8aa2c3f0b6d1da666d26b835db46f46edd1ea8a7ddb458bfcfd0a989a5abb","observation_id":"0386afa9-ea54-4870-bb66-e2e0c4e35193","resolution":{"observed_at":"2026-08-11T18:16:26.973724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.08112","last_updated":"2024-12-11T05:39:12Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T05:34:19.657013Z","submitted_at":"2024-12-11T05:39:12Z","title":"Aligner-Guided Training Paradigm: Advancing Text-to-Speech Models with Aligner Guided Duration"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2412.08112."}