{"as_of":"2026-08-06T01:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3c2fe0621aa9f3f0153d5548ce4daaf05071932b3f71984fbeb86e60fc95e0dc","coverage":[{"denominator":11,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T05:34:55.822901Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-03T23:55:11.698728Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T23:59:06.127454Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.29859","last_updated":"2026-05-28T12:39:36Z","snapshot_observed_at":"2026-08-01T16:23:26.516252Z","submitted_at":"2026-05-28T12:39:36Z","title":"MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables","version":1},"cited_work":{"arxiv_id":"2605.29859","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.29859","snapshot_observed_at":"2026-07-03T23:59:06.127454Z","title":"MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables","venue":"eess.AS","work_id":"faafe19f-9d33-44b5-ab17-3579bf31935c","year":2026},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-08-05T20:35:27.953841Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T14:40:40.673091Z"},"links":{"cited_paper":"/paper/2605.29859","citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:1a10b20b8e6973d1765e2d7b5e3dc86b828940e892252d731cac7c44b1f1aa95","observation_id":"3d1f99b6-b0d9-42fe-87a0-ca67d8eb2b31","resolution":{"observed_at":"2026-07-03T03:47:35.725012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.29859","last_updated":"2026-05-28T12:39:36Z","snapshot_observed_at":"2026-08-01T16:23:26.516252Z","submitted_at":"2026-05-28T12:39:36Z","title":"MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables","version":1},"cited_work":{"arxiv_id":"2605.29859","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.29859","snapshot_observed_at":"2026-07-03T23:59:06.127454Z","title":"MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables","venue":"eess.AS","work_id":"faafe19f-9d33-44b5-ab17-3579bf31935c","year":2026},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-08-05T20:35:27.953841Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"cited_paper":"/paper/2605.29859","citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:eebd87bf2d8ab2caa5ac3d227a89bf1bc1a8c56ffe30741f0d9be3e88af6246c","observation_id":"2f1c0eac-61fb-4a84-a34d-5fead643ddc3","resolution":{"observed_at":"2026-07-03T23:59:06.129686Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.29859/citation-record","integrity":"/paper/2605.29859/integrity","json":"/paper/2605.29859/citation-record.json","paper":"/paper/2605.29859"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":"2504.08528","doi":"10.48550/arxiv.2504.08528","metadata_source":"pith","pith_arxiv_id":"2504.08528","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","venue":"cs.CL","work_id":"92746bbc-1fe6-410d-a1e9-8afab3e0a8e5","year":2025},"citing_paper":{"arxiv_id":"2605.29859","last_updated":"2026-05-28T12:39:36Z","snapshot_observed_at":"2026-08-01T16:23:26.516252Z","submitted_at":"2026-05-28T12:39:36Z","title":"MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T05:34:55.822901Z"},"links":{"cited_paper":"/paper/2504.08528","citing_paper":"/paper/2605.29859"},"observation_digest":"sha256:064eb4ccca96fda9535bdf8ed97e51c10d46cabe342350e51e91913ad649bc9f","observation_id":"148c29f7-02c0-4a98-8653-1cb760f799ce","resolution":{"observed_at":"2026-06-29T05:43:08.707279Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15835","last_updated":"2025-05-21T16:55:34Z","snapshot_observed_at":"2026-08-04T14:33:39.740706Z","submitted_at":"2024-07-22T17:51:53Z","title":"dMel: Speech Tokenization made Simple","version":3},"cited_work":{"arxiv_id":"2407.15835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15835","snapshot_observed_at":"2026-07-03T23:59:06.138044Z","title":"dmel: Speech tokenization made simple","venue":null,"work_id":"b196131d-713c-44ae-bab4-4d52a3a93b48","year":2024},"citing_paper":{"arxiv_id":"2605.29859","last_updated":"2026-05-28T12:39:36Z","snapshot_observed_at":"2026-08-01T16:23:26.516252Z","submitted_at":"2026-05-28T12:39:36Z","title":"MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T05:34:55.822901Z"},"links":{"cited_paper":"/paper/2407.15835","citing_paper":"/paper/2605.29859"},"observation_digest":"sha256:8be367a3d0e8f623e87115ce05a7877f1894714253b20f7c83f9cb688e4c4fbb","observation_id":"00c8baf2-b53a-46d2-be24-2f63e2669dd0","resolution":{"observed_at":"2026-06-29T05:43:08.702843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05370","last_updated":"2024-06-17T04:39:08Z","snapshot_observed_at":"2026-07-06T18:27:28.886692Z","submitted_at":"2024-06-08T06:31:03Z","title":"VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers","version":2},"cited_work":{"arxiv_id":"2406.05370","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.05370","snapshot_observed_at":"2026-07-08T00:04:22.411558Z","title":"Vall-e 2: Neural codec language models are human parity zero-shot text to speech synthesizers","venue":"cs.CL","work_id":"5de8849e-7ff0-45e8-ba28-c43c1dbe805a","year":2024},"citing_paper":{"arxiv_id":"2605.29859","last_updated":"2026-05-28T12:39:36Z","snapshot_observed_at":"2026-08-01T16:23:26.516252Z","submitted_at":"2026-05-28T12:39:36Z","title":"MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T05:34:55.822901Z"},"links":{"cited_paper":"/paper/2406.05370","citing_paper":"/paper/2605.29859"},"observation_digest":"sha256:69a5cd299e11f3e19aac9d1ca111c285946c6e0a351a61f283625aa9b5b67b89","observation_id":"e3030e54-10c4-45dd-9755-9e24c05f2cd1","resolution":{"observed_at":"2026-06-29T05:43:08.711740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":"2410.00037","doi":"10.1121/1.1906946","metadata_source":"pith","pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":"eess.AS","work_id":"3104332b-d279-44c8-aaa7-3d5a13c01832","year":2024},"citing_paper":{"arxiv_id":"2605.29859","last_updated":"2026-05-28T12:39:36Z","snapshot_observed_at":"2026-08-01T16:23:26.516252Z","submitted_at":"2026-05-28T12:39:36Z","title":"MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T05:34:55.822901Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2605.29859"},"observation_digest":"sha256:8fc2caa28d144ed6bcae0ce8efb6f69b95c4a89059b2d486c15d5e9881a2902b","observation_id":"b1e07ea0-3c3a-4a97-b250-231697e60be3","resolution":{"observed_at":"2026-06-29T05:43:08.697724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08635","last_updated":"2024-12-11T18:57:32Z","snapshot_observed_at":"2026-07-06T20:05:28.003434Z","submitted_at":"2024-12-11T18:57:32Z","title":"Multimodal Latent Language Modeling with Next-Token Diffusion","version":1},"cited_work":{"arxiv_id":"2412.08635","doi":"10.48550/arxiv.2412.08635","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08635","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal latent language modeling with next- token diffusion","venue":"arXiv (Cornell University)","work_id":"c031cf7f-98b5-48ae-97e2-3f49e949fdd1","year":2024},"citing_paper":{"arxiv_id":"2605.29859","last_updated":"2026-05-28T12:39:36Z","snapshot_observed_at":"2026-08-01T16:23:26.516252Z","submitted_at":"2026-05-28T12:39:36Z","title":"MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T05:34:55.822901Z"},"links":{"cited_paper":"/paper/2412.08635","citing_paper":"/paper/2605.29859"},"observation_digest":"sha256:5e265cd49eb361c58e29d555a6d6ee8eb96e7eee4744b00cbb77b92a0f37a580","observation_id":"0d600b63-8d33-4d4f-829b-c7393ee12ba6","resolution":{"observed_at":"2026-06-29T05:43:08.720503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.16048","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:43:08.689182Z","title":"Continuous speech synthesis using per-token latent diffusion.arXiv preprint arXiv:2410.16048,","venue":null,"work_id":"97718f31-0776-4790-b09a-7ccdee1478fa","year":null},"citing_paper":{"arxiv_id":"2605.29859","last_updated":"2026-05-28T12:39:36Z","snapshot_observed_at":"2026-08-01T16:23:26.516252Z","submitted_at":"2026-05-28T12:39:36Z","title":"MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T05:34:55.822901Z"},"links":{"citing_paper":"/paper/2605.29859"},"observation_digest":"sha256:344ee4dcf68a9a2594d18dc02e6a89b1768e7b436d7a34716dbb696a20f275ca","observation_id":"b1ce039b-1703-4f53-9ba7-8c7997e8f23a","resolution":{"observed_at":"2026-06-29T05:43:08.690897Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-02T20:06:32.256011Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2605.29859","last_updated":"2026-05-28T12:39:36Z","snapshot_observed_at":"2026-08-01T16:23:26.516252Z","submitted_at":"2026-05-28T12:39:36Z","title":"MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T05:34:55.822901Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2605.29859"},"observation_digest":"sha256:3f68d9a05013410498de9ea99ae92f1763b1be16982df55ef4caece1f6d6e5e3","observation_id":"e4863365-06c9-43c6-a734-a6bf1a9282b5","resolution":{"observed_at":"2026-06-29T05:43:08.690882Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.24650","doi":"10.48550/arxiv.2509.24650","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxcpm: Tokenizer-free tts for context-aware speech generation and true-to-life voice cloning","venue":"ArXiv.org","work_id":"191e619c-8028-43ca-952e-2aa85335d419","year":2025},"citing_paper":{"arxiv_id":"2605.29859","last_updated":"2026-05-28T12:39:36Z","snapshot_observed_at":"2026-08-01T16:23:26.516252Z","submitted_at":"2026-05-28T12:39:36Z","title":"MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T05:34:55.822901Z"},"links":{"citing_paper":"/paper/2605.29859"},"observation_digest":"sha256:3c321aa92ac9744f448f8c25f1ead5caaed8793df5e9bac830229db3e305cab2","observation_id":"51960991-28ba-47a1-a9de-170f3e11b8f8","resolution":{"observed_at":"2026-06-29T05:43:08.688017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:34:55.822901Z","title":"We also experiment with longer training steps, and we do not see notable improvements","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.29859","last_updated":"2026-05-28T12:39:36Z","snapshot_observed_at":"2026-08-01T16:23:26.516252Z","submitted_at":"2026-05-28T12:39:36Z","title":"MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T05:34:55.822901Z"},"links":{"citing_paper":"/paper/2605.29859"},"observation_digest":"sha256:d8e33a271401c9db3f7ff0cd8ec3a932adeee657c7f50e8a1cd62624d8c24195","observation_id":"6f5910bd-702b-4ba7-99fc-bc579802dd45","resolution":{"observed_at":"2026-06-29T05:34:55.822901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:34:55.822901Z","title":"continuous","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29859","last_updated":"2026-05-28T12:39:36Z","snapshot_observed_at":"2026-08-01T16:23:26.516252Z","submitted_at":"2026-05-28T12:39:36Z","title":"MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T05:34:55.822901Z"},"links":{"citing_paper":"/paper/2605.29859"},"observation_digest":"sha256:f51cf3c10418f5c410f95ea712a47c47dd8c0194a9b5995c7b0e20ffe50a4d50","observation_id":"c52ada6f-d857-453a-80f9-2b8352bbbfb5","resolution":{"observed_at":"2026-06-29T05:34:55.822901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:34:55.822901Z","title":"abnormal","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29859","last_updated":"2026-05-28T12:39:36Z","snapshot_observed_at":"2026-08-01T16:23:26.516252Z","submitted_at":"2026-05-28T12:39:36Z","title":"MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T05:34:55.822901Z"},"links":{"citing_paper":"/paper/2605.29859"},"observation_digest":"sha256:ed38a4028e4c000eae15c8525fadffe5230c257f43fd9105354cab813ea181f3","observation_id":"76e36608-8163-4944-9d5e-41409e48c074","resolution":{"observed_at":"2026-06-29T05:34:55.822901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.29859","last_updated":"2026-05-28T12:39:36Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-01T16:23:26.516252Z","submitted_at":"2026-05-28T12:39:36Z","title":"MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables"},"reference_resolution":{"displayed":11,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":8,"verified_fuzzy":0},"total_outbound_references":11},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 11 of 11 outbound references and 2 inbound Pith citation observations for arXiv:2605.29859."}