{"as_of":"2026-08-07T09:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8aad012c091b24f6a4c6a61b72619e196d711a14d3766bc9ea40c9538f6346f7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:11:42.535892Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:08:37.814595Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.02285","last_updated":"2023-10-12T03:05:36Z","snapshot_observed_at":"2026-08-01T15:11:32.829718Z","submitted_at":"2023-09-05T14:45:27Z","title":"PromptTTS 2: Describing and Generating Voices with Text Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02285","snapshot_observed_at":"2026-08-06T23:11:42.535892Z","title":"Prompttts 2: Describing and generating voices with text prompt,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19446","last_updated":"2025-06-24T09:20:25Z","snapshot_observed_at":"2026-08-06T23:04:22.364744Z","submitted_at":"2025-06-24T09:20:25Z","title":"Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:42.535892Z"},"links":{"cited_paper":"/paper/2309.02285","citing_paper":"/paper/2506.19446"},"observation_digest":"sha256:bf6d04af7622bca977c6ff0444e6a51e9311a2509d6238a8af8c60393de2063e","observation_id":"7e391c06-70b0-455d-bc32-99a59adbf865","resolution":{"observed_at":"2026-08-06T23:11:42.535892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02285","last_updated":"2023-10-12T03:05:36Z","snapshot_observed_at":"2026-08-01T15:11:32.829718Z","submitted_at":"2023-09-05T14:45:27Z","title":"PromptTTS 2: Describing and Generating Voices with Text Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02285","snapshot_observed_at":"2026-08-06T11:22:26.482050Z","title":"Prompttts 2: Describing and generating voices with text prompt","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:26.482050Z"},"links":{"cited_paper":"/paper/2309.02285","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:d7de0dce6cde32bcabdf6dc6d585d7ffcb56a4110487502ccc6cfb0c2671b6a8","observation_id":"3763f71c-b841-4b96-8274-d7fe01dee4d1","resolution":{"observed_at":"2026-08-06T11:22:26.482050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02285","last_updated":"2023-10-12T03:05:36Z","snapshot_observed_at":"2026-08-01T15:11:32.829718Z","submitted_at":"2023-09-05T14:45:27Z","title":"PromptTTS 2: Describing and Generating Voices with Text Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02285","snapshot_observed_at":"2026-08-03T06:36:32.513360Z","title":"Prompttts 2: Describing and generating voices with text prompt.arXiv preprint arXiv:2309.02285,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-05T03:41:49.406487Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:32.513360Z"},"links":{"cited_paper":"/paper/2309.02285","citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:ebdc7381164d192283bd6cbda9dca94e61ab2f9552bb4682f19213242708cc42","observation_id":"41bc5a40-4de2-4557-a59c-22cda5da7818","resolution":{"observed_at":"2026-08-03T06:36:32.513360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02285","last_updated":"2023-10-12T03:05:36Z","snapshot_observed_at":"2026-08-01T15:11:32.829718Z","submitted_at":"2023-09-05T14:45:27Z","title":"PromptTTS 2: Describing and Generating Voices with Text Prompt","version":2},"cited_work":{"arxiv_id":"2309.02285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02285","snapshot_observed_at":"2026-07-03T16:08:37.814595Z","title":"Prompttts 2: Describing and generating voices with text prompt","venue":null,"work_id":"44c9a29d-f3a1-4509-9a66-bbb857c46489","year":2023},"citing_paper":{"arxiv_id":"2604.08363","last_updated":"2026-04-09T15:27:22Z","snapshot_observed_at":"2026-07-06T22:57:26.678728Z","submitted_at":"2026-04-09T15:27:22Z","title":"CapTalk: Unified Voice Design for Single-Utterance and Dialogue Speech Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T17:15:28.918204Z"},"links":{"cited_paper":"/paper/2309.02285","citing_paper":"/paper/2604.08363"},"observation_digest":"sha256:28992568508b1666d74c4924296291c30b593b365f5fc9e1709cce32854cc371","observation_id":"235566fd-adeb-44de-b4a2-47cfe5dc1572","resolution":{"observed_at":"2026-05-11T07:16:00.219554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02285","last_updated":"2023-10-12T03:05:36Z","snapshot_observed_at":"2026-08-01T15:11:32.829718Z","submitted_at":"2023-09-05T14:45:27Z","title":"PromptTTS 2: Describing and Generating Voices with Text Prompt","version":2},"cited_work":{"arxiv_id":"2309.02285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02285","snapshot_observed_at":"2026-07-03T16:08:37.814595Z","title":"Prompttts 2: Describing and generating voices with text prompt","venue":null,"work_id":"44c9a29d-f3a1-4509-9a66-bbb857c46489","year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2309.02285","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:da8fc5ff74bee0b3bd56582c1d5bd0d4f5cc3ff106d3ea258bc789aaf31b06aa","observation_id":"60548455-7c19-4ab1-bb7d-dc276ecff204","resolution":{"observed_at":"2026-05-11T08:30:57.019055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02285","last_updated":"2023-10-12T03:05:36Z","snapshot_observed_at":"2026-08-01T15:11:32.829718Z","submitted_at":"2023-09-05T14:45:27Z","title":"PromptTTS 2: Describing and Generating Voices with Text Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02285","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Prompttts 2: Describing and generating voices with text prompt,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2309.02285","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:e5c40232a014273e8daccdf0ae5af36ca61b1409f75c27de737ab42a23c9feb8","observation_id":"a850a614-1c5e-462a-93bb-3ff0952954d1","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02285","last_updated":"2023-10-12T03:05:36Z","snapshot_observed_at":"2026-08-01T15:11:32.829718Z","submitted_at":"2023-09-05T14:45:27Z","title":"PromptTTS 2: Describing and Generating Voices with Text Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02285","snapshot_observed_at":"2026-07-13T00:18:36.390365Z","title":"Rui Liu, Yifan Hu, Yi Ren, Xiang Yin, and Haizhou Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27376","last_updated":"2026-04-09T01:06:26Z","snapshot_observed_at":"2026-07-13T00:18:29.539736Z","submitted_at":"2026-04-09T01:06:26Z","title":"Unlocking Fine-Grained and Within-Utterance Speaking Style Control in Prompt-Based Text-to-Speech Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T00:18:36.390365Z"},"links":{"cited_paper":"/paper/2309.02285","citing_paper":"/paper/2605.27376"},"observation_digest":"sha256:8dd81f246d0503589e93702d47443a78dc44041d273d090f8b9dd7beff4e20a7","observation_id":"89af2b1a-379c-49d4-88b0-a7aee62f35b7","resolution":{"observed_at":"2026-07-13T00:18:36.390365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02285","last_updated":"2023-10-12T03:05:36Z","snapshot_observed_at":"2026-08-01T15:11:32.829718Z","submitted_at":"2023-09-05T14:45:27Z","title":"PromptTTS 2: Describing and Generating Voices with Text Prompt","version":2},"cited_work":{"arxiv_id":"2309.02285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02285","snapshot_observed_at":"2026-07-03T16:08:37.814595Z","title":"Prompttts 2: Describing and generating voices with text prompt","venue":null,"work_id":"44c9a29d-f3a1-4509-9a66-bbb857c46489","year":2023},"citing_paper":{"arxiv_id":"2606.03283","last_updated":"2026-06-28T12:59:22Z","snapshot_observed_at":"2026-08-06T09:40:23.957051Z","submitted_at":"2026-06-02T07:49:30Z","title":"SpeakerCard-1M: An Evidence-Grounded Corpus for In-the-Wild Speaker Verification","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T08:34:11.270002Z"},"links":{"cited_paper":"/paper/2309.02285","citing_paper":"/paper/2606.03283"},"observation_digest":"sha256:b2844840dc3198466c8e13e2298b764045babc53c987a276f68cf4322ea8a281","observation_id":"157cb041-7c17-4732-977b-e0c7de1aa602","resolution":{"observed_at":"2026-07-02T05:06:39.869866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02285","last_updated":"2023-10-12T03:05:36Z","snapshot_observed_at":"2026-08-01T15:11:32.829718Z","submitted_at":"2023-09-05T14:45:27Z","title":"PromptTTS 2: Describing and Generating Voices with Text Prompt","version":2},"cited_work":{"arxiv_id":"2309.02285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02285","snapshot_observed_at":"2026-07-03T16:08:37.814595Z","title":"Prompttts 2: Describing and generating voices with text prompt","venue":null,"work_id":"44c9a29d-f3a1-4509-9a66-bbb857c46489","year":2023},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"cited_paper":"/paper/2309.02285","citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:f3b7d93aa85055babf77a3c7803c66a83ee9317a2bab32b900df3ef5940d58a1","observation_id":"9ab35441-594c-4a66-83ec-51761a191242","resolution":{"observed_at":"2026-07-03T16:08:37.816124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02285","last_updated":"2023-10-12T03:05:36Z","snapshot_observed_at":"2026-08-01T15:11:32.829718Z","submitted_at":"2023-09-05T14:45:27Z","title":"PromptTTS 2: Describing and Generating Voices with Text Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02285","snapshot_observed_at":"2026-08-02T06:27:04.460152Z","title":"Prompttts 2: Describing and generating voices with text prompt.arXiv preprint arXiv:2309.02285, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.12706","last_updated":"2026-07-15T05:16:13Z","snapshot_observed_at":"2026-08-05T11:31:57.126951Z","submitted_at":"2026-07-14T12:28:43Z","title":"AutoSIFT: Automatic Style Sifting for Controllable Speech Generation with Arbitrary Style Infilling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T06:27:04.460152Z"},"links":{"cited_paper":"/paper/2309.02285","citing_paper":"/paper/2607.12706"},"observation_digest":"sha256:8cb4bac19c782d83643b69b993f2e0ba74bafa334a066053e494d70b5685c82c","observation_id":"5c302a9b-b499-4a7b-a88e-81c58eb5ab7f","resolution":{"observed_at":"2026-08-02T06:27:04.460152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2309.02285/citation-record","integrity":"/paper/2309.02285/integrity","json":"/paper/2309.02285/citation-record.json","paper":"/paper/2309.02285"},"outbound":[],"paper":{"arxiv_id":"2309.02285","last_updated":"2023-10-12T03:05:36Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-01T15:11:32.829718Z","submitted_at":"2023-09-05T14:45:27Z","title":"PromptTTS 2: Describing and Generating Voices with Text Prompt"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2309.02285."}