{"as_of":"2026-08-04T00:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fabaa271d156a7077f26e4d9a1a8cd388b4f3f75f98ffd05cec425a6b8b679cc","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T03:50:26.873406Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T01:17:30.982050Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":"2402.08093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-07-03T01:17:30.982050Z","title":"Base tts: Lessons from building a billion-parameter text-to-speech model on 100k hours of data","venue":null,"work_id":"3cd5a31a-12e5-47a1-bd4a-1d7a9ed783ef","year":2024},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:4541d28fdd8709893ad4638d2094e60c5169d5871ac316eee29d278983c3ea1b","observation_id":"e2f60dc4-b155-4d77-ad62-d3f221336643","resolution":{"observed_at":"2026-05-15T12:26:37.337799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":"2402.08093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-07-03T01:17:30.982050Z","title":"Base tts: Lessons from building a billion-parameter text-to-speech model on 100k hours of data","venue":null,"work_id":"3cd5a31a-12e5-47a1-bd4a-1d7a9ed783ef","year":2024},"citing_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-07-06T20:06:30.732685Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T06:19:09.507440Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2412.10117"},"observation_digest":"sha256:d5979fd7103edd35556ddd53b342848c055f248d4d46886a8ab14fb4f873347c","observation_id":"16b1df01-f4af-463a-8651-d4611665133e","resolution":{"observed_at":"2026-05-13T06:19:09.589168Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":"2402.08093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-07-03T01:17:30.982050Z","title":"Base tts: Lessons from building a billion-parameter text-to-speech model on 100k hours of data","venue":null,"work_id":"3cd5a31a-12e5-47a1-bd4a-1d7a9ed783ef","year":2024},"citing_paper":{"arxiv_id":"2604.06327","last_updated":"2026-04-07T18:05:28Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T18:05:28Z","title":"A Novel Automatic Framework for Speaker Drift Detection in Synthesized Speech","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:54.627215Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2604.06327"},"observation_digest":"sha256:c68b3e511071d1378801a4b564616add3924363bdf107331a299e8e6cb97ccfd","observation_id":"5efae641-450d-46bb-b022-57e8b05441ae","resolution":{"observed_at":"2026-05-11T00:41:00.646707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":"2402.08093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-07-03T01:17:30.982050Z","title":"Base tts: Lessons from building a billion-parameter text-to-speech model on 100k hours of data","venue":null,"work_id":"3cd5a31a-12e5-47a1-bd4a-1d7a9ed783ef","year":2024},"citing_paper":{"arxiv_id":"2605.05611","last_updated":"2026-05-09T04:00:12Z","snapshot_observed_at":"2026-07-06T23:18:12.631820Z","submitted_at":"2026-05-07T02:57:53Z","title":"X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-08T04:35:58.032597Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2605.05611"},"observation_digest":"sha256:3509d8b95d6acb0897c11525c8972302d7cfa18866891d70aa34859fdf5a4894","observation_id":"6085b80e-e5f4-4942-a4ff-fce37384abb4","resolution":{"observed_at":"2026-05-11T21:41:16.018613Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":"2402.08093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-07-03T01:17:30.982050Z","title":"Base tts: Lessons from building a billion-parameter text-to-speech model on 100k hours of data","venue":null,"work_id":"3cd5a31a-12e5-47a1-bd4a-1d7a9ed783ef","year":2024},"citing_paper":{"arxiv_id":"2605.05611","last_updated":"2026-05-09T04:00:12Z","snapshot_observed_at":"2026-07-06T23:18:12.631820Z","submitted_at":"2026-05-07T02:57:53Z","title":"X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-12T01:43:48.555523Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2605.05611"},"observation_digest":"sha256:21c30b3f2d8fb87a2d5d22f2adc780f2e7002c0d892881652731461279f97a41","observation_id":"60e59582-95e9-4841-88cd-a75413769421","resolution":{"observed_at":"2026-05-12T01:46:13.907857Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":"2402.08093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-07-03T01:17:30.982050Z","title":"Base tts: Lessons from building a billion-parameter text-to-speech model on 100k hours of data","venue":null,"work_id":"3cd5a31a-12e5-47a1-bd4a-1d7a9ed783ef","year":2024},"citing_paper":{"arxiv_id":"2605.16964","last_updated":"2026-05-16T12:37:06Z","snapshot_observed_at":"2026-08-02T05:10:05.598125Z","submitted_at":"2026-05-16T12:37:06Z","title":"SemaVoice: Semantic-Aware Continuous Autoregressive Speech Synthesis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T18:58:15.288299Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2605.16964"},"observation_digest":"sha256:d878981b495286eb7d284fc9015f1ad2ed1955514a674c0c610c33ca3c658ebd","observation_id":"a2492884-b458-442f-8967-03ff1d21b029","resolution":{"observed_at":"2026-05-19T19:02:43.574934Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":"2402.08093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-07-03T01:17:30.982050Z","title":"Base tts: Lessons from building a billion-parameter text-to-speech model on 100k hours of data","venue":null,"work_id":"3cd5a31a-12e5-47a1-bd4a-1d7a9ed783ef","year":2024},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-01T22:05:42.692356Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:04d458ff39a02a66876e91ea4fbe8120964190f7c7ea7f9e3a960a477f4f4964","observation_id":"e5a1bf20-4e87-4599-a4e6-88cd7a38d279","resolution":{"observed_at":"2026-07-02T05:16:39.768082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":"2402.08093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-07-03T01:17:30.982050Z","title":"Base tts: Lessons from building a billion-parameter text-to-speech model on 100k hours of data","venue":null,"work_id":"3cd5a31a-12e5-47a1-bd4a-1d7a9ed783ef","year":2024},"citing_paper":{"arxiv_id":"2606.09295","last_updated":"2026-06-08T10:03:11Z","snapshot_observed_at":"2026-07-06T23:48:39.574979Z","submitted_at":"2026-06-08T10:03:11Z","title":"N\\\"ushuVoice: Reviving the Voice of Endangered N\\\"ushu with Pitch-Aware Text-to-Speech","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-27T16:39:49.263497Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2606.09295"},"observation_digest":"sha256:4479842331dcf8ae574396615c47b3a7f0d29a5d3101ce821a80817de5d7d0d3","observation_id":"185f221c-75e4-46f6-ad84-16083576bf82","resolution":{"observed_at":"2026-07-03T01:17:30.983342Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":"2402.08093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-07-03T01:17:30.982050Z","title":"Base tts: Lessons from building a billion-parameter text-to-speech model on 100k hours of data","venue":null,"work_id":"3cd5a31a-12e5-47a1-bd4a-1d7a9ed783ef","year":2024},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:710b178edfecae235d811355c2784a32484204b6529268257a3982282162a495","observation_id":"67d3e437-f0e2-419f-b999-9e21f8c6829e","resolution":{"observed_at":"2026-07-01T11:55:42.217957Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":"2402.08093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-07-03T01:17:30.982050Z","title":"Base tts: Lessons from building a billion-parameter text-to-speech model on 100k hours of data","venue":null,"work_id":"3cd5a31a-12e5-47a1-bd4a-1d7a9ed783ef","year":2024},"citing_paper":{"arxiv_id":"2606.31729","last_updated":"2026-06-30T14:28:41Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T14:28:41Z","title":"Is Natural Always Appropriate? Investigating Naturalness and Appropriateness Across Different Domains for TTS Evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-01T03:32:23.838961Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2606.31729"},"observation_digest":"sha256:130f857f8b8963572982b592c09cb7d019acf670df10305cc9766cc0c1a598e0","observation_id":"06b38db4-bca4-471f-b398-0ccac188d768","resolution":{"observed_at":"2026-07-01T11:55:42.974888Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2402.08093/citation-record","integrity":"/paper/2402.08093/integrity","json":"/paper/2402.08093/citation-record.json","paper":"/paper/2402.08093"},"outbound":[],"paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2402.08093."}