{"as_of":"2026-08-09T05:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2f196652f3085affcdfcc782ea9221cdda87a7747cfc566ae51e0c76e0ec2911","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:22:30.915758Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T23:59:06.138044Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.15835","last_updated":"2025-05-21T16:55:34Z","snapshot_observed_at":"2026-08-06T13:00:23.977679Z","submitted_at":"2024-07-22T17:51:53Z","title":"dMel: Speech Tokenization made Simple","version":3},"cited_work":{"arxiv_id":"2407.15835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15835","snapshot_observed_at":"2026-07-03T23:59:06.138044Z","title":"dmel: Speech tokenization made simple","venue":null,"work_id":"b196131d-713c-44ae-bab4-4d52a3a93b48","year":2024},"citing_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-16T06:06:41.348728Z"},"links":{"cited_paper":"/paper/2407.15835","citing_paper":"/paper/2410.06885"},"observation_digest":"sha256:7793949d198c7ea89445339baa89f75b07e4dc79aa10254c38332ba18971046a","observation_id":"bd46321d-de84-432d-9afc-2b9df90a991f","resolution":{"observed_at":"2026-05-16T06:06:41.561300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15835","last_updated":"2025-05-21T16:55:34Z","snapshot_observed_at":"2026-08-06T13:00:23.977679Z","submitted_at":"2024-07-22T17:51:53Z","title":"dMel: Speech Tokenization made Simple","version":3},"cited_work":{"arxiv_id":"2407.15835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15835","snapshot_observed_at":"2026-07-03T23:59:06.138044Z","title":"dmel: Speech tokenization made simple","venue":null,"work_id":"b196131d-713c-44ae-bab4-4d52a3a93b48","year":2024},"citing_paper":{"arxiv_id":"2411.17690","last_updated":"2026-04-20T17:56:40Z","snapshot_observed_at":"2026-08-02T10:11:40.015144Z","submitted_at":"2024-11-26T18:57:29Z","title":"Mechanisms of Multimodal Synchronization: Insights from Decoder-Based Video-Text-to-Speech Synthesis","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T17:22:23.797551Z"},"links":{"cited_paper":"/paper/2407.15835","citing_paper":"/paper/2411.17690"},"observation_digest":"sha256:6008740bd6c6d4e6f6dd7227eb123153706334c4f18281d7eac0457d867313c7","observation_id":"b53363a4-9702-4947-9971-64100fd7fb23","resolution":{"observed_at":"2026-05-23T17:23:15.052041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15835","last_updated":"2025-05-21T16:55:34Z","snapshot_observed_at":"2026-08-06T13:00:23.977679Z","submitted_at":"2024-07-22T17:51:53Z","title":"dMel: Speech Tokenization made Simple","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15835","snapshot_observed_at":"2026-08-07T14:22:30.915758Z","title":"dmel: Speech tokenization made simple,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19206","last_updated":"2025-05-25T16:11:10Z","snapshot_observed_at":"2026-08-09T00:38:20.526667Z","submitted_at":"2025-05-25T16:11:10Z","title":"SpeakStream: Streaming Text-to-Speech with Interleaved Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:30.915758Z"},"links":{"cited_paper":"/paper/2407.15835","citing_paper":"/paper/2505.19206"},"observation_digest":"sha256:8a636c30156b361081d9f5491f1b13f5523ee0d31593fde8a913c007099c109d","observation_id":"c136ad76-0c3f-424d-97f2-a7621681b0e8","resolution":{"observed_at":"2026-08-07T14:22:30.915758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15835","last_updated":"2025-05-21T16:55:34Z","snapshot_observed_at":"2026-08-06T13:00:23.977679Z","submitted_at":"2024-07-22T17:51:53Z","title":"dMel: Speech Tokenization made Simple","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15835","snapshot_observed_at":"2026-08-05T15:52:44.057119Z","title":"dmel: Speech tokenization made simple,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00078","last_updated":"2025-08-26T20:40:24Z","snapshot_observed_at":"2026-08-05T15:52:43.760838Z","submitted_at":"2025-08-26T20:40:24Z","title":"ChipChat: Low-Latency Cascaded Conversational Agent in MLX","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:44.057119Z"},"links":{"cited_paper":"/paper/2407.15835","citing_paper":"/paper/2509.00078"},"observation_digest":"sha256:ff7486001069551a69528bb783f54865d05f3d3114baafb7d3aa538fdc60d1ae","observation_id":"a7f4de98-71b0-488c-8cb7-8cc9426eef7a","resolution":{"observed_at":"2026-08-05T15:52:44.057119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15835","last_updated":"2025-05-21T16:55:34Z","snapshot_observed_at":"2026-08-06T13:00:23.977679Z","submitted_at":"2024-07-22T17:51:53Z","title":"dMel: Speech Tokenization made Simple","version":3},"cited_work":{"arxiv_id":"2407.15835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15835","snapshot_observed_at":"2026-07-03T23:59:06.138044Z","title":"dmel: Speech tokenization made simple","venue":null,"work_id":"b196131d-713c-44ae-bab4-4d52a3a93b48","year":2024},"citing_paper":{"arxiv_id":"2604.24416","last_updated":"2026-04-27T12:45:18Z","snapshot_observed_at":"2026-07-06T23:10:29.508602Z","submitted_at":"2026-04-27T12:45:18Z","title":"Scaling Properties of Continuous Diffusion Spoken Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-08T03:43:10.132447Z"},"links":{"cited_paper":"/paper/2407.15835","citing_paper":"/paper/2604.24416"},"observation_digest":"sha256:2e5a07d4ea86fb5aa8f05cc3608f86082ace2dff199bc98a5ee2ada42eeabbb7","observation_id":"7807fc17-60f1-4046-ae4a-a5ba5467bb18","resolution":{"observed_at":"2026-05-11T21:56:27.166368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15835","last_updated":"2025-05-21T16:55:34Z","snapshot_observed_at":"2026-08-06T13:00:23.977679Z","submitted_at":"2024-07-22T17:51:53Z","title":"dMel: Speech Tokenization made Simple","version":3},"cited_work":{"arxiv_id":"2407.15835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15835","snapshot_observed_at":"2026-07-03T23:59:06.138044Z","title":"dmel: Speech tokenization made simple","venue":null,"work_id":"b196131d-713c-44ae-bab4-4d52a3a93b48","year":2024},"citing_paper":{"arxiv_id":"2605.29859","last_updated":"2026-05-28T12:39:36Z","snapshot_observed_at":"2026-08-01T16:23:26.516252Z","submitted_at":"2026-05-28T12:39:36Z","title":"MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T05:34:55.822901Z"},"links":{"cited_paper":"/paper/2407.15835","citing_paper":"/paper/2605.29859"},"observation_digest":"sha256:8d21b18f7367db1499739c34c19d30ac6badeee42a3f47b23d2b14d75bf27483","observation_id":"00c8baf2-b53a-46d2-be24-2f63e2669dd0","resolution":{"observed_at":"2026-06-29T05:43:08.702843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15835","last_updated":"2025-05-21T16:55:34Z","snapshot_observed_at":"2026-08-06T13:00:23.977679Z","submitted_at":"2024-07-22T17:51:53Z","title":"dMel: Speech Tokenization made Simple","version":3},"cited_work":{"arxiv_id":"2407.15835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15835","snapshot_observed_at":"2026-07-03T23:59:06.138044Z","title":"dmel: Speech tokenization made simple","venue":null,"work_id":"b196131d-713c-44ae-bab4-4d52a3a93b48","year":2024},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-08-05T20:35:27.953841Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"cited_paper":"/paper/2407.15835","citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:65852316944bdc374d084e1a2fa4882fd31d7f69975ac633e653ccbb863bb23e","observation_id":"65fc4da2-194f-4003-9faf-ee978db382d8","resolution":{"observed_at":"2026-07-03T23:59:06.142179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15835","last_updated":"2025-05-21T16:55:34Z","snapshot_observed_at":"2026-08-06T13:00:23.977679Z","submitted_at":"2024-07-22T17:51:53Z","title":"dMel: Speech Tokenization made Simple","version":3},"cited_work":{"arxiv_id":"2407.15835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15835","snapshot_observed_at":"2026-07-03T23:59:06.138044Z","title":"dmel: Speech tokenization made simple","venue":null,"work_id":"b196131d-713c-44ae-bab4-4d52a3a93b48","year":2024},"citing_paper":{"arxiv_id":"2606.12940","last_updated":"2026-06-11T06:06:02Z","snapshot_observed_at":"2026-07-06T23:51:45.306189Z","submitted_at":"2026-06-11T06:06:02Z","title":"Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-27T06:05:26.735340Z"},"links":{"cited_paper":"/paper/2407.15835","citing_paper":"/paper/2606.12940"},"observation_digest":"sha256:2c3f0d836a34ca2576e8e1ba33eac5957340865ebaecf2e3ad9d7af8235298e2","observation_id":"43e669f9-7e96-42fb-930a-44150ee2a2ca","resolution":{"observed_at":"2026-07-03T16:08:37.535129Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2407.15835/citation-record","integrity":"/paper/2407.15835/integrity","json":"/paper/2407.15835/citation-record.json","paper":"/paper/2407.15835"},"outbound":[],"paper":{"arxiv_id":"2407.15835","last_updated":"2025-05-21T16:55:34Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T13:00:23.977679Z","submitted_at":"2024-07-22T17:51:53Z","title":"dMel: Speech Tokenization made Simple"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2407.15835."}