{"as_of":"2026-08-07T18:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6edab652ae2586db4d0690b85377df8ebe9acc3f41645548cfd2e32db14c5dab","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:12:56.625844Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:08:37.504398Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","snapshot_observed_at":"2026-07-06T18:25:09.965258Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02328","snapshot_observed_at":"2026-08-07T12:12:56.625844Z","title":"Simplespeech: Towards simple and efficient text-to-speech with scalar latent transformer diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T12:04:51.278220Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:56.625844Z"},"links":{"cited_paper":"/paper/2406.02328","citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:d2b5947406ab32d0d5ecef008c1a102d3a9d2f2ead52c5067aab5eb4bad82331","observation_id":"cb511548-a040-4418-975d-3dd8512cc73a","resolution":{"observed_at":"2026-08-07T12:12:56.625844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","snapshot_observed_at":"2026-07-06T18:25:09.965258Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02328","snapshot_observed_at":"2026-08-06T23:21:59.444748Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-07T04:02:25.950869Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:59.444748Z"},"links":{"cited_paper":"/paper/2406.02328","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:85c581bcf430f6a2e2db52e174c23594ad648010f6a8c747d10a2fed5065b726","observation_id":"3532d1ea-3948-4fe4-a0b4-111f73970903","resolution":{"observed_at":"2026-08-06T23:21:59.444748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","snapshot_observed_at":"2026-07-06T18:25:09.965258Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02328","snapshot_observed_at":"2026-08-06T11:34:09.476364Z","title":"Sim- plespeech: Towards simple and efficient text-to-speech with scalar latent transformer diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22612","last_updated":"2025-08-29T06:09:29Z","snapshot_observed_at":"2026-08-06T18:06:32.518742Z","submitted_at":"2025-07-30T12:31:11Z","title":"Adaptive Duration Model for Text Speech Alignment","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:09.476364Z"},"links":{"cited_paper":"/paper/2406.02328","citing_paper":"/paper/2507.22612"},"observation_digest":"sha256:c36c306b3deaff7512580fe2539c221249feecfe085e68814574b6b92b62ab97","observation_id":"9cb08e55-b39c-4f59-ab51-4d28892893d5","resolution":{"observed_at":"2026-08-06T11:34:09.476364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","snapshot_observed_at":"2026-07-06T18:25:09.965258Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02328","snapshot_observed_at":"2026-08-02T21:11:51.164939Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-07T08:21:33.678621Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:51.164939Z"},"links":{"cited_paper":"/paper/2406.02328","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:7daf59be418b5a55ded7ec2b687c347907592844e1302ba4b80eeac6d298b777","observation_id":"b78d2d07-028f-4631-9aff-1f837a23dda8","resolution":{"observed_at":"2026-08-02T21:11:51.164939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","snapshot_observed_at":"2026-07-06T18:25:09.965258Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models","version":3},"cited_work":{"arxiv_id":"2406.02328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.02328","snapshot_observed_at":"2026-07-03T16:08:37.504398Z","title":"Simplespeech: Towards simple and efficient text-to-speech with scalar latent transformer diffusion models","venue":null,"work_id":"8de4dfc4-a957-4a9b-8fdd-2810c0d53640","year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2406.02328","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:2df49027f21542604006aadd596ce571e04a01483c42a0fbd127b3e4dc0b4f88","observation_id":"ea9e05b2-2663-4396-bd66-7eaa480045e2","resolution":{"observed_at":"2026-05-11T08:30:57.175358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","snapshot_observed_at":"2026-07-06T18:25:09.965258Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models","version":3},"cited_work":{"arxiv_id":"2406.02328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.02328","snapshot_observed_at":"2026-07-03T16:08:37.504398Z","title":"Simplespeech: Towards simple and efficient text-to-speech with scalar latent transformer diffusion models","venue":null,"work_id":"8de4dfc4-a957-4a9b-8fdd-2810c0d53640","year":2024},"citing_paper":{"arxiv_id":"2606.12940","last_updated":"2026-06-11T06:06:02Z","snapshot_observed_at":"2026-07-06T23:51:45.306189Z","submitted_at":"2026-06-11T06:06:02Z","title":"Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-27T06:05:26.735340Z"},"links":{"cited_paper":"/paper/2406.02328","citing_paper":"/paper/2606.12940"},"observation_digest":"sha256:7cd0aeb0ca940ec278223df9e32468f90b8e5403905a16dca2d4bdbd72dcf9c5","observation_id":"5645eff3-53d7-43e8-8aae-52110c772c1a","resolution":{"observed_at":"2026-07-03T16:08:37.506013Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","snapshot_observed_at":"2026-07-06T18:25:09.965258Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models","version":3},"cited_work":{"arxiv_id":"2406.02328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.02328","snapshot_observed_at":"2026-07-03T16:08:37.504398Z","title":"Simplespeech: Towards simple and efficient text-to-speech with scalar latent transformer diffusion models","venue":null,"work_id":"8de4dfc4-a957-4a9b-8fdd-2810c0d53640","year":2024},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":180,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2406.02328","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:162c6377a407e26c418c91a16bae06bef4dcd2271032f1cb23a6b556c451042a","observation_id":"6ca38534-66b4-4f39-af00-cc40940c04a9","resolution":{"observed_at":"2026-07-01T11:45:47.163389Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2406.02328/citation-record","integrity":"/paper/2406.02328/integrity","json":"/paper/2406.02328/citation-record.json","paper":"/paper/2406.02328"},"outbound":[],"paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T18:25:09.965258Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:2406.02328."}