{"as_of":"2026-08-08T05:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e7f36de9ce0247646914314e03bbf9a73f935acdbab0cd558067c7038466f443","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:19:53.043874Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T15:10:06.034541Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.00654","last_updated":"2024-06-02T07:54:33Z","snapshot_observed_at":"2026-07-06T18:23:57.071938Z","submitted_at":"2024-06-02T07:54:33Z","title":"Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00654","snapshot_observed_at":"2026-08-07T14:19:53.043874Z","title":"Enhancing zero-shot text-to-speech synthesis with human feedback.ArXiv, abs/2406.00654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:53.043874Z"},"links":{"cited_paper":"/paper/2406.00654","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:9b2d86a03bdfc2ec10b071b50b2af1489c2f690272ae84205a8f5da805c2212e","observation_id":"35f44ca9-e9d1-47d2-974d-62fe1ca1d699","resolution":{"observed_at":"2026-08-07T14:19:53.043874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00654","last_updated":"2024-06-02T07:54:33Z","snapshot_observed_at":"2026-07-06T18:23:57.071938Z","submitted_at":"2024-06-02T07:54:33Z","title":"Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00654","snapshot_observed_at":"2026-08-06T22:19:02.888700Z","title":"Enhancing zero-shot text-to- speech synthesis with human feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22023","last_updated":"2025-06-27T08:45:21Z","snapshot_observed_at":"2026-08-07T19:17:21.433342Z","submitted_at":"2025-06-27T08:45:21Z","title":"Robust and Efficient Autoregressive Speech Synthesis with Dynamic Chunk-wise Prediction Policy","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:19:02.888700Z"},"links":{"cited_paper":"/paper/2406.00654","citing_paper":"/paper/2506.22023"},"observation_digest":"sha256:450815a39f6ebf2b3241ede274d3830d34b49d37431471efd6f43222611a4c93","observation_id":"aff5959b-423b-4aed-a646-6c0e663d169a","resolution":{"observed_at":"2026-08-06T22:19:02.888700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00654","last_updated":"2024-06-02T07:54:33Z","snapshot_observed_at":"2026-07-06T18:23:57.071938Z","submitted_at":"2024-06-02T07:54:33Z","title":"Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00654","snapshot_observed_at":"2026-08-06T19:21:03.937201Z","title":"Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.937201Z"},"links":{"cited_paper":"/paper/2406.00654","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:6296bf6cd8f74899b0e189f256f4d320b4f3e9e78a2bf2da49c5b3d2d893f94f","observation_id":"ae14a623-b5bc-4baa-b660-2e36555c476f","resolution":{"observed_at":"2026-08-06T19:21:03.937201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00654","last_updated":"2024-06-02T07:54:33Z","snapshot_observed_at":"2026-07-06T18:23:57.071938Z","submitted_at":"2024-06-02T07:54:33Z","title":"Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00654","snapshot_observed_at":"2026-08-06T15:48:19.939041Z","title":"Enhancing zero-shot text-to-speech synthesis with human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-06T20:34:40.446355Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:19.939041Z"},"links":{"cited_paper":"/paper/2406.00654","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:e399f52a3774657dafa5e9b866d4cb918aa8a0b77b772b55644518156b2d30d2","observation_id":"85822a91-7e9e-4dcf-bcd2-6c853645dff4","resolution":{"observed_at":"2026-08-06T15:48:19.939041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00654","last_updated":"2024-06-02T07:54:33Z","snapshot_observed_at":"2026-07-06T18:23:57.071938Z","submitted_at":"2024-06-02T07:54:33Z","title":"Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00654","snapshot_observed_at":"2026-08-06T15:02:03.032073Z","title":"Enhancing zero-shot text-to-speech synthesis with human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-07T14:59:33.170172Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:03.032073Z"},"links":{"cited_paper":"/paper/2406.00654","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:2dda4c03aa4a04824c33788fc9f9d88330645a6891ad5c9747f8f8e5a3cf7701","observation_id":"3640e72a-bbf6-47a0-89f5-b238dca3c766","resolution":{"observed_at":"2026-08-06T15:02:03.032073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00654","last_updated":"2024-06-02T07:54:33Z","snapshot_observed_at":"2026-07-06T18:23:57.071938Z","submitted_at":"2024-06-02T07:54:33Z","title":"Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00654","snapshot_observed_at":"2026-08-05T23:43:03.356048Z","title":"S.; and Zhang, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05011","last_updated":"2025-08-07T03:49:18Z","snapshot_observed_at":"2026-08-06T05:37:26.433479Z","submitted_at":"2025-08-07T03:49:18Z","title":"Towards Hallucination-Free Music: A Reinforcement Learning Preference Optimization Framework for Reliable Song Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T23:43:03.356048Z"},"links":{"cited_paper":"/paper/2406.00654","citing_paper":"/paper/2508.05011"},"observation_digest":"sha256:ec4c298856d33f30ba21b8607502c0a88bcfafa678ff8b0a3d8490f6389a11fe","observation_id":"b300cbb7-17a0-49c3-9699-cca8e8a67038","resolution":{"observed_at":"2026-08-05T23:43:03.356048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00654","last_updated":"2024-06-02T07:54:33Z","snapshot_observed_at":"2026-07-06T18:23:57.071938Z","submitted_at":"2024-06-02T07:54:33Z","title":"Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00654","snapshot_observed_at":"2026-08-05T13:24:34.241314Z","title":"En- hancing zero-shot text-to-speech synthesis with human feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.241314Z"},"links":{"cited_paper":"/paper/2406.00654","citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:d29342ed7dd55c2b07b8081177615beaa08ed034991b27b1841e7ef5637beebf","observation_id":"d4cf35e4-5319-4912-bffc-3276d6180c0d","resolution":{"observed_at":"2026-08-05T13:24:34.241314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00654","last_updated":"2024-06-02T07:54:33Z","snapshot_observed_at":"2026-07-06T18:23:57.071938Z","submitted_at":"2024-06-02T07:54:33Z","title":"Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback","version":1},"cited_work":{"arxiv_id":"2406.00654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.00654","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"En- hancing zero-shot text-to-speech synthesis with human feedback","venue":null,"work_id":"597a8bda-7564-465e-bfae-82ac901b8684","year":2024},"citing_paper":{"arxiv_id":"2603.05373","last_updated":"2026-04-11T06:15:04Z","snapshot_observed_at":"2026-08-07T04:20:21.141625Z","submitted_at":"2026-03-05T16:59:26Z","title":"Hierarchical Decoding for Discrete Speech Synthesis with Multi-Resolution Spoof Detection","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T15:07:27.418534Z"},"links":{"cited_paper":"/paper/2406.00654","citing_paper":"/paper/2603.05373"},"observation_digest":"sha256:c0a5c3a8e5c12e8299b61f6d8fa9bd7ce7f7b8c6fb9416847db42afbb0297b2f","observation_id":"dbb72f53-8c5d-45aa-884a-576984578b72","resolution":{"observed_at":"2026-05-15T15:10:06.038248Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2406.00654/citation-record","integrity":"/paper/2406.00654/integrity","json":"/paper/2406.00654/citation-record.json","paper":"/paper/2406.00654"},"outbound":[],"paper":{"arxiv_id":"2406.00654","last_updated":"2024-06-02T07:54:33Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T18:23:57.071938Z","submitted_at":"2024-06-02T07:54:33Z","title":"Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2406.00654."}