{"as_of":"2026-08-16T10:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:49c6261c7bc5632856bdfb2c0cb7a69aaf3673661dcfa9c72d4b696f646c31dc","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:25:16.247483Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T08:30:57.095678Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2205.15439","last_updated":"2023-11-20T04:31:13Z","snapshot_observed_at":"2026-08-13T15:33:42.741748Z","submitted_at":"2022-05-30T21:34:40Z","title":"StyleTTS: A Style-Based Generative Model for Natural and Diverse Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15439","snapshot_observed_at":"2026-08-11T14:39:11.756716Z","title":"A.; Han, C.; and Mesgarani, N","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11795","last_updated":"2024-12-19T15:21:44Z","snapshot_observed_at":"2026-08-13T19:35:22.952027Z","submitted_at":"2024-12-16T14:07:39Z","title":"ProsodyFM: Unsupervised Phrasing and Intonation Control for Intelligible Speech Synthesis","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T14:39:11.756716Z"},"links":{"cited_paper":"/paper/2205.15439","citing_paper":"/paper/2412.11795"},"observation_digest":"sha256:d6417b41aad7ec0f8c6d56b439f76d302bb145a2ea7542fd38b68dedbcd66b18","observation_id":"1eab5a8d-3828-48e2-bcf0-42473337183e","resolution":{"observed_at":"2026-08-11T14:39:11.756716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15439","last_updated":"2023-11-20T04:31:13Z","snapshot_observed_at":"2026-08-13T15:33:42.741748Z","submitted_at":"2022-05-30T21:34:40Z","title":"StyleTTS: A Style-Based Generative Model for Natural and Diverse Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15439","snapshot_observed_at":"2026-08-10T21:41:05.292855Z","title":"StyleTTS: A style-based generative model for natural and diverse text-to-speech synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04256","last_updated":"2025-01-08T03:47:54Z","snapshot_observed_at":"2026-08-10T21:35:22.314779Z","submitted_at":"2025-01-08T03:47:54Z","title":"DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:05.292855Z"},"links":{"cited_paper":"/paper/2205.15439","citing_paper":"/paper/2501.04256"},"observation_digest":"sha256:34036e9aeb5c538e7884b9240aef6508d30a246299ac422accb7a36a63c7750c","observation_id":"983c872f-43f9-4b2c-a6a1-4569aa63bad7","resolution":{"observed_at":"2026-08-10T21:41:05.292855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15439","last_updated":"2023-11-20T04:31:13Z","snapshot_observed_at":"2026-08-13T15:33:42.741748Z","submitted_at":"2022-05-30T21:34:40Z","title":"StyleTTS: A Style-Based Generative Model for Natural and Diverse Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15439","snapshot_observed_at":"2026-08-09T16:43:08.775875Z","title":"Styletts: A style-based generative model for natural and diverse text-to-speech synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-12T14:31:13.290515Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.775875Z"},"links":{"cited_paper":"/paper/2205.15439","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:33703582b7e1241ead820d931a326c2fe76197f03b3ba0cbc36de79b6d6538e5","observation_id":"46734ece-16fc-4464-b22c-f7d03c37f3cb","resolution":{"observed_at":"2026-08-09T16:43:08.775875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15439","last_updated":"2023-11-20T04:31:13Z","snapshot_observed_at":"2026-08-13T15:33:42.741748Z","submitted_at":"2022-05-30T21:34:40Z","title":"StyleTTS: A Style-Based Generative Model for Natural and Diverse Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15439","snapshot_observed_at":"2026-08-07T15:30:35.054489Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-11T13:10:50.735067Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:35.054489Z"},"links":{"cited_paper":"/paper/2205.15439","citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:90aa29f13602fcf0866a4bb55f2dab81342b5dead145a0551d4b8783e1f7fe62","observation_id":"dbac7877-7128-4abe-8a4a-fe50e05afa1a","resolution":{"observed_at":"2026-08-07T15:30:35.054489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15439","last_updated":"2023-11-20T04:31:13Z","snapshot_observed_at":"2026-08-13T15:33:42.741748Z","submitted_at":"2022-05-30T21:34:40Z","title":"StyleTTS: A Style-Based Generative Model for Natural and Diverse Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15439","snapshot_observed_at":"2026-08-15T19:25:16.247483Z","title":"StyleTTS: A style-based generative model for natural and diverse text-to-speech synthesis,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16741","last_updated":"2025-06-20T04:19:29Z","snapshot_observed_at":"2026-08-15T19:17:23.654198Z","submitted_at":"2025-06-20T04:19:29Z","title":"RapFlow-TTS: Rapid and High-Fidelity Text-to-Speech with Improved Consistency Flow Matching","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T19:25:16.247483Z"},"links":{"cited_paper":"/paper/2205.15439","citing_paper":"/paper/2506.16741"},"observation_digest":"sha256:7ace9d15de2b1bd24f2e123bc5a219f84715ab6ed6325348d8310426d8f332c6","observation_id":"cedd6373-444c-41af-8de8-ad01e718ea8f","resolution":{"observed_at":"2026-08-15T19:25:16.247483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15439","last_updated":"2023-11-20T04:31:13Z","snapshot_observed_at":"2026-08-13T15:33:42.741748Z","submitted_at":"2022-05-30T21:34:40Z","title":"StyleTTS: A Style-Based Generative Model for Natural and Diverse Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15439","snapshot_observed_at":"2026-08-06T15:48:22.067217Z","title":"Styletts: A style-based generative model for natural and diverse text-to-speech synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:22.067217Z"},"links":{"cited_paper":"/paper/2205.15439","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:adf34d325edc29d8f1b05829f39de0d1f74e74f0fdd75ee017ceac665a7f2c31","observation_id":"c4d5860e-7b97-4dcc-9c27-e2996a404932","resolution":{"observed_at":"2026-08-06T15:48:22.067217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15439","last_updated":"2023-11-20T04:31:13Z","snapshot_observed_at":"2026-08-13T15:33:42.741748Z","submitted_at":"2022-05-30T21:34:40Z","title":"StyleTTS: A Style-Based Generative Model for Natural and Diverse Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2205.15439","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.15439","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Styletts: A style-based generative model for natural and diverse text-to-speech synthesis","venue":null,"work_id":"e0f0b51f-d088-46e0-a857-1dd2f7053175","year":2022},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2205.15439","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:e1941ce8fe508ec94438100199389ab1b1b60019689d46589f0afde34483a93c","observation_id":"c0ec5bb6-911c-431d-a0cb-8ee88c1898ba","resolution":{"observed_at":"2026-05-11T08:30:57.097369Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15439","last_updated":"2023-11-20T04:31:13Z","snapshot_observed_at":"2026-08-13T15:33:42.741748Z","submitted_at":"2022-05-30T21:34:40Z","title":"StyleTTS: A Style-Based Generative Model for Natural and Diverse Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15439","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Styletts: A style-based generative model for natural and diverse text-to-speech synthesis,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2205.15439","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:3f1283aca5f467a94c0d9cf1ef75e48ba7514bcf21e793403a311e95c4f58a1d","observation_id":"817657eb-e1b1-467f-bd95-45bd30334ac2","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2205.15439/citation-record","integrity":"/paper/2205.15439/integrity","json":"/paper/2205.15439/citation-record.json","paper":"/paper/2205.15439"},"outbound":[],"paper":{"arxiv_id":"2205.15439","last_updated":"2023-11-20T04:31:13Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-13T15:33:42.741748Z","submitted_at":"2022-05-30T21:34:40Z","title":"StyleTTS: A Style-Based Generative Model for Natural and Diverse Text-to-Speech Synthesis"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2205.15439."}