{"as_of":"2026-08-06T19:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3be4d4994b2089016a032cd6e1032a8b1bc35faed8cad1f719b3c0deeb7890cc","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:07:41.013784Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.06927/citation-record","integrity":"/paper/2510.06927/integrity","json":"/paper/2510.06927/citation-record.json","paper":"/paper/2510.06927"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.05370","last_updated":"2024-06-17T04:39:08Z","snapshot_observed_at":"2026-08-06T08:54:58.638188Z","submitted_at":"2024-06-08T06:31:03Z","title":"VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05370","snapshot_observed_at":"2026-08-04T11:07:39.647731Z","title":"Preprint, arXiv:2406.05370","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.06927","last_updated":"2026-05-25T16:15:03Z","snapshot_observed_at":"2026-08-06T09:42:01.216340Z","submitted_at":"2025-10-08T12:07:57Z","title":"Position: Towards Responsible Evaluation for Text-to-Speech","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T11:07:39.647731Z"},"links":{"cited_paper":"/paper/2406.05370","citing_paper":"/paper/2510.06927"},"observation_digest":"sha256:db696fa8965ac4883eca1befcc30ff8d1dc5568db55b35a3c7af902efdb335eb","observation_id":"35c49ad4-9c77-458f-b191-99ac9d25e756","resolution":{"observed_at":"2026-08-04T11:07:39.647731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:07:40.068223Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.06927","last_updated":"2026-05-25T16:15:03Z","snapshot_observed_at":"2026-08-06T09:42:01.216340Z","submitted_at":"2025-10-08T12:07:57Z","title":"Position: Towards Responsible Evaluation for Text-to-Speech","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T11:07:40.068223Z"},"links":{"citing_paper":"/paper/2510.06927"},"observation_digest":"sha256:21df636b7203e882b8e4de672ef30e13829be8579f7a0dd26264f7a42258f051","observation_id":"6e90f0df-fbd8-4676-a680-41d55117c078","resolution":{"observed_at":"2026-08-04T11:07:40.068223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:07:40.187430Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.06927","last_updated":"2026-05-25T16:15:03Z","snapshot_observed_at":"2026-08-06T09:42:01.216340Z","submitted_at":"2025-10-08T12:07:57Z","title":"Position: Towards Responsible Evaluation for Text-to-Speech","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T11:07:40.187430Z"},"links":{"citing_paper":"/paper/2510.06927"},"observation_digest":"sha256:113d93c645196ce208dc2ffb0acfb305342d81d63f7c6d6943b9c312a85fda64","observation_id":"fbf46c27-d224-4747-9b6c-b322288ebbd4","resolution":{"observed_at":"2026-08-04T11:07:40.187430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:07:40.282103Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2510.06927","last_updated":"2026-05-25T16:15:03Z","snapshot_observed_at":"2026-08-06T09:42:01.216340Z","submitted_at":"2025-10-08T12:07:57Z","title":"Position: Towards Responsible Evaluation for Text-to-Speech","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T11:07:40.282103Z"},"links":{"citing_paper":"/paper/2510.06927"},"observation_digest":"sha256:bd899c476f57484bd5124495e25ac28c9061d23f70d5c18bca5d2efd3002ec40","observation_id":"858f30da-0e74-4e67-be07-a543cd9af7ba","resolution":{"observed_at":"2026-08-04T11:07:40.282103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:07:40.484097Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.06927","last_updated":"2026-05-25T16:15:03Z","snapshot_observed_at":"2026-08-06T09:42:01.216340Z","submitted_at":"2025-10-08T12:07:57Z","title":"Position: Towards Responsible Evaluation for Text-to-Speech","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T11:07:40.484097Z"},"links":{"citing_paper":"/paper/2510.06927"},"observation_digest":"sha256:e2c8f0a5e7597e6884901ab17a14d4a259e13039cf364cedf1715acb626afaf2","observation_id":"ea1691e4-b6b1-4f47-a367-a42bc4f84c40","resolution":{"observed_at":"2026-08-04T11:07:40.484097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06602","last_updated":"2025-08-25T07:30:54Z","snapshot_observed_at":"2026-07-06T20:03:56.309640Z","submitted_at":"2024-12-09T15:50:25Z","title":"Towards Controllable Speech Synthesis in the Era of Large Language Models: A Systematic Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06602","snapshot_observed_at":"2026-08-04T11:07:41.013784Z","title":"Guanrou Yang, Chen Yang, Qian Chen, and 1 others","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.06927","last_updated":"2026-05-25T16:15:03Z","snapshot_observed_at":"2026-08-06T09:42:01.216340Z","submitted_at":"2025-10-08T12:07:57Z","title":"Position: Towards Responsible Evaluation for Text-to-Speech","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T11:07:41.013784Z"},"links":{"cited_paper":"/paper/2412.06602","citing_paper":"/paper/2510.06927"},"observation_digest":"sha256:f161955fc6eb701e95dacb51e45e8cd81d1415fec9662bd1f20590186e481cd2","observation_id":"6e27a746-8fdd-4de7-b05f-cdd5558197e6","resolution":{"observed_at":"2026-08-04T11:07:41.013784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T11:07:40.628752Z","title":"Babak Naderi and Ross Cutler","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.06927","last_updated":"2026-05-25T16:15:03Z","snapshot_observed_at":"2026-08-06T09:42:01.216340Z","submitted_at":"2025-10-08T12:07:57Z","title":"Position: Towards Responsible Evaluation for Text-to-Speech","version":3},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-04T11:07:40.628752Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2510.06927"},"observation_digest":"sha256:9b9ecc7928b7b1a99c2fdc013a178a3ec19862b6bb68d5efeebbc0f30ecbf379","observation_id":"4b731b22-2aff-42ce-95ec-debe4756c13c","resolution":{"observed_at":"2026-08-04T11:07:40.628752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:07:40.413986Z","title":"InInternational con- ference on learning representations","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.06927","last_updated":"2026-05-25T16:15:03Z","snapshot_observed_at":"2026-08-06T09:42:01.216340Z","submitted_at":"2025-10-08T12:07:57Z","title":"Position: Towards Responsible Evaluation for Text-to-Speech","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T11:07:40.413986Z"},"links":{"citing_paper":"/paper/2510.06927"},"observation_digest":"sha256:158756f0c1f8b0586e03005393d8e0b74a5f9ac9c68fdc14c8b300a4daace03e","observation_id":"8ae3fa7b-8a35-46f0-ac09-4527cd9fb7dd","resolution":{"observed_at":"2026-08-04T11:07:40.413986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:07:40.733136Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.06927","last_updated":"2026-05-25T16:15:03Z","snapshot_observed_at":"2026-08-06T09:42:01.216340Z","submitted_at":"2025-10-08T12:07:57Z","title":"Position: Towards Responsible Evaluation for Text-to-Speech","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T11:07:40.733136Z"},"links":{"citing_paper":"/paper/2510.06927"},"observation_digest":"sha256:7c0fafe9bbf572c0aab1b0fb576287b8444265e71d4b1839a30cb01221909458","observation_id":"38376347-bcbb-4cdb-9c67-f972629373dd","resolution":{"observed_at":"2026-08-04T11:07:40.733136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.15561","last_updated":"2021-07-23T12:32:52Z","snapshot_observed_at":"2026-07-06T11:24:19.530747Z","submitted_at":"2021-06-29T16:50:51Z","title":"A Survey on Neural Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.15561","snapshot_observed_at":"2026-08-04T11:07:40.885894Z","title":"835: A non-intrusive perceptual objective speech quality metric to evaluate noise sup- pressors","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.06927","last_updated":"2026-05-25T16:15:03Z","snapshot_observed_at":"2026-08-06T09:42:01.216340Z","submitted_at":"2025-10-08T12:07:57Z","title":"Position: Towards Responsible Evaluation for Text-to-Speech","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T11:07:40.885894Z"},"links":{"cited_paper":"/paper/2106.15561","citing_paper":"/paper/2510.06927"},"observation_digest":"sha256:3387c007965a58ef4dff375de879b369770ae8eb753dded9a99db5920ec8d710","observation_id":"06344a70-d8ad-4b3c-b0f9-1b6b7f8ad990","resolution":{"observed_at":"2026-08-04T11:07:40.885894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-04T11:07:39.982493Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.06927","last_updated":"2026-05-25T16:15:03Z","snapshot_observed_at":"2026-08-06T09:42:01.216340Z","submitted_at":"2025-10-08T12:07:57Z","title":"Position: Towards Responsible Evaluation for Text-to-Speech","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T11:07:39.982493Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2510.06927"},"observation_digest":"sha256:3361702b24b3261a6ce18d51978b8ab72fffa3254108e04de26adc1a73e4e881","observation_id":"db202ae6-8551-4665-9e9c-b22d501c5a5a","resolution":{"observed_at":"2026-08-04T11:07:39.982493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:07:39.512603Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.06927","last_updated":"2026-05-25T16:15:03Z","snapshot_observed_at":"2026-08-06T09:42:01.216340Z","submitted_at":"2025-10-08T12:07:57Z","title":"Position: Towards Responsible Evaluation for Text-to-Speech","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T11:07:39.512603Z"},"links":{"citing_paper":"/paper/2510.06927"},"observation_digest":"sha256:f855187679fa9d9d6ba1163d7f0184322fefc07f5119a7289bc20af2005fb514","observation_id":"a920e50e-cb4f-46e7-ab19-782fe5f8f9ad","resolution":{"observed_at":"2026-08-04T11:07:39.512603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:07:39.839286Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.06927","last_updated":"2026-05-25T16:15:03Z","snapshot_observed_at":"2026-08-06T09:42:01.216340Z","submitted_at":"2025-10-08T12:07:57Z","title":"Position: Towards Responsible Evaluation for Text-to-Speech","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T11:07:39.839286Z"},"links":{"citing_paper":"/paper/2510.06927"},"observation_digest":"sha256:17015f3c191b19f8e4070a516b1b73ad340326f3429f733b893f3dae99369b9e","observation_id":"6558bb5c-5c51-40a7-accb-5f985e23b924","resolution":{"observed_at":"2026-08-04T11:07:39.839286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.06927","last_updated":"2026-05-25T16:15:03Z","latest_version":3,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-06T09:42:01.216340Z","submitted_at":"2025-10-08T12:07:57Z","title":"Position: Towards Responsible Evaluation for Text-to-Speech"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2510.06927."}