{"as_of":"2026-08-08T18:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:03e7c26d0a93a969fd295ef83f28a5238904aea3ac7715a48fa973dd1b730ff0","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:15:45.148144Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T22:36:21.635792Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T22:40:43.524737Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"cited_work":{"arxiv_id":"2506.14767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14767","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A Variational Framework for Im- proving Naturalness in Generative Spoken Language Models","venue":null,"work_id":"ca306ec8-2066-4932-9511-985348660300","year":2025},"citing_paper":{"arxiv_id":"2509.22061","last_updated":"2026-05-16T10:27:18Z","snapshot_observed_at":"2026-07-06T22:30:50.642382Z","submitted_at":"2025-09-26T08:43:25Z","title":"Speak Your Mind: The Speech Continuation Task as a Probe of Voice-Based Model Bias","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T22:36:21.635792Z"},"links":{"cited_paper":"/paper/2506.14767","citing_paper":"/paper/2509.22061"},"observation_digest":"sha256:e7ca08611c8799b96996cb0058887d931162e05d2b68a34bc1e37426691552c5","observation_id":"8206ffa6-12e9-41c5-88f8-80bacbdf1fd3","resolution":{"observed_at":"2026-05-21T22:40:43.526798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14767/citation-record","integrity":"/paper/2506.14767/integrity","json":"/paper/2506.14767/citation-record.json","paper":"/paper/2506.14767"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1806.09514","last_updated":"2018-06-25T15:01:54Z","snapshot_observed_at":"2026-07-06T06:46:39.730728Z","submitted_at":"2018-06-25T15:01:54Z","title":"The Emotional Voices Database: Towards Controlling the Emotion Dimension in Voice Generation Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.09514","snapshot_observed_at":"2026-08-07T00:15:44.678703Z","title":"E., Ostadabbas, S., and Dutoit, T","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.678703Z"},"links":{"cited_paper":"/paper/1806.09514","citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:ba3359b9eae816ffc0fae87b0855416c4959b4d06f7aaea574f006934860baa4","observation_id":"ba1e0b1e-8c72-470e-883e-3c2d34136503","resolution":{"observed_at":"2026-08-07T00:15:44.678703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:44.686691Z","title":"Audiolm: A language modeling approach to audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.686691Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:6bbb404d3ead7672b7f93b7266ce70706d03b4fedc5687d91f59b4b076d5c792","observation_id":"f2a6e95a-cd6c-44f3-852b-6107383c8b37","resolution":{"observed_at":"2026-08-07T00:15:44.686691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:44.694626Z","title":"R., Vilnis, L., Vinyals, O., Dai, A., Jozefowicz, R., and Bengio, S","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.694626Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:3dae70560c21a2f0d3b957499ee3a82248105d1d7a31780e23245502d3a0bb1d","observation_id":"7081adfd-e962-4bae-8224-f7250c0f310b","resolution":{"observed_at":"2026-08-07T00:15:44.694626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v37i11.26488","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:45.442507Z","title":"A vector quantized approach for text to speech synthesis on real-world spontaneous speech","venue":null,"work_id":"b09a1742-579b-4015-b579-26f2dcb0d6db","year":2023},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.706752Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:2070391d6f5d05310ae1f37635f260c15b9fe63168359b8d4900e82ce02d79b4","observation_id":"9f61c2dd-2a54-4237-a64a-74f2d07545c2","resolution":{"observed_at":"2026-08-07T00:15:45.456626Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:44.711037Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.711037Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:7ae2c4ec64d2fbfab75abc565a9711bcb33d7a106b629894b47941ea03a7ff44","observation_id":"b77a3c44-563f-4113-9052-de17d230f94b","resolution":{"observed_at":"2026-08-07T00:15:44.711037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05370","last_updated":"2024-06-17T04:39:08Z","snapshot_observed_at":"2026-08-08T07:23:06.245954Z","submitted_at":"2024-06-08T06:31:03Z","title":"VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05370","snapshot_observed_at":"2026-08-07T00:15:44.715062Z","title":"VALL-E 2: Neural codec language models are human parity zero-shot text to speech synthesizers, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.715062Z"},"links":{"cited_paper":"/paper/2406.05370","citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:26ebbd29e90bdcbc07a83574d5472ff2f0d12f0185f4969699f04348968b8d85","observation_id":"564ecf6b-fd82-4b41-b60e-b9bf15fb71bc","resolution":{"observed_at":"2026-08-07T00:15:44.715062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:44.719272Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.719272Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:487d767e5829712b31269b98ace9ada91042c31538fac103242c4c80bccd4e47","observation_id":"89de81df-8587-459f-866e-90107bc36d87","resolution":{"observed_at":"2026-08-07T00:15:44.719272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:47.242029Z","title":"High fidelity neural audio compression","venue":null,"work_id":"876dcf26-33ad-4e17-bf41-fe0dd799e374","year":2023},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.722483Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:82ce0b1c3f081d2db81014c8da1b5008c41d97378b728c4d91afbda3c97d8db1","observation_id":"1ebd119f-6a03-4b11-ad4e-e0f3d1dc3ba3","resolution":{"observed_at":"2026-08-07T00:15:47.246973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:47.226032Z","title":"Density estimation using real NVP","venue":null,"work_id":"94390584-2a06-4ab2-bebc-4109935e908c","year":2017},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.727952Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:ecdb15a83adf66bae847a0dfeee0554feac39ba79b38d20a0f36ba36535496ef","observation_id":"cde48c6a-a147-4d50-b57b-8ced722801bb","resolution":{"observed_at":"2026-08-07T00:15:47.230593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04673","last_updated":"2024-07-03T02:38:03Z","snapshot_observed_at":"2026-08-02T08:46:39.076208Z","submitted_at":"2023-10-07T03:17:59Z","title":"LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04673","snapshot_observed_at":"2026-08-07T00:15:44.732151Z","title":"LauraGPT : Listen, attend, understand, and regenerate audio with GPT , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.732151Z"},"links":{"cited_paper":"/paper/2310.04673","citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:6436844faf2c05b86e493362c18e6016fc6a31791c524da633351362c649df6b","observation_id":"76296d15-6b1d-4f77-a815-ea0fe44a5d52","resolution":{"observed_at":"2026-08-07T00:15:44.732151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T00:15:44.737743Z","title":"Moshi: a speech-text foundation model for real-time dialogue, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.737743Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:2a6c2cffe057fb068f148188ccbb27476bb6d8f0a82539af99b1346482da5152","observation_id":"0d48f864-0325-4e74-8888-1f56b95b740d","resolution":{"observed_at":"2026-08-07T00:15:44.737743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:47.212901Z","title":"R., Schuller, B","venue":null,"work_id":"97fe7595-8ab4-4d1d-96ed-1a79341594c4","year":2015},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.743777Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:adaab7ebfcc4b266cfb7785bcd263cb99c47287c975280ea72571e3bb2f8dc24","observation_id":"ca1acb72-cb5d-46c0-96ac-d265c4e1dacb","resolution":{"observed_at":"2026-08-07T00:15:47.218086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:44.747794Z","title":"Cyclical annealing schedule: A simple approach to mitigating KL vanishing","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.747794Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:002684b47c0172e158cb6ba675f6ad73b0d78733f7beca1295d7b768d4e357a1","observation_id":"d193aad3-7f07-40cc-8916-e05d2be7e331","resolution":{"observed_at":"2026-08-07T00:15:44.747794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:47.199279Z","title":"A., Gat, I., Conneau, A., Kreuk, F., Copet, J., Defossez, A., Synnaeve, G., Dupoux, E., Schwartz, R., and Adi, Y","venue":null,"work_id":"96f87124-0981-4df1-8c90-56286b070eac","year":2023},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.751608Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:6af18599a6a7145cc4623f328008a61dd6633bf6f454cc35f16e223b01b71e02","observation_id":"0d6769a3-93da-4b33-bb26-ed499e4c2394","resolution":{"observed_at":"2026-08-07T00:15:47.203129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:47.187362Z","title":"and Gimpel, K","venue":null,"work_id":"dea670fc-91fd-4e6f-bac7-66bc08810f2d","year":2017},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.755063Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:1427ac02a241887f36cecb5ada606a4a6432ea1a5b35069da1b67a35f908c2c0","observation_id":"b9c97a94-90df-4789-96a5-e8211f254aa4","resolution":{"observed_at":"2026-08-07T00:15:47.191551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:47.173673Z","title":"beta- VAE : Learning basic visual concepts with a constrained variational framework","venue":null,"work_id":"59bf524e-5eb9-4e33-a1c0-04569d1de00c","year":2017},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.759218Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:98195beb90345cea93575be894b7be54ed23d4a085ef42b66cec666ded4f7657","observation_id":"698c1489-ce5d-4a3d-ae2a-37e220a2dbb3","resolution":{"observed_at":"2026-08-07T00:15:47.178622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:47.158239Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"1ee1e57f-285b-449a-951d-568425870fe8","year":2020},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.763093Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:a0b86de35c64acac87556890df3352d3e339333f0e8e06def1c5de2a848ab107","observation_id":"93b6eb26-fadb-4ee1-86ed-11e7a50b624f","resolution":{"observed_at":"2026-08-07T00:15:47.163238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:44.767005Z","title":"H., Lakhotia, K., Salakhutdinov, R., and Mohamed, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.767005Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:a0e4cfbc360871c51f2b74b2bbaf28b5d4b51730cda7791d19e08810cfd9f8b3","observation_id":"5399a6ff-35fc-46a3-8a72-4035d2294f04","resolution":{"observed_at":"2026-08-07T00:15:44.767005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:47.143886Z","title":"Libri-light: A benchmark for ASR with limited or no supervision","venue":null,"work_id":"0d24df96-ca37-4b9e-9604-d0a68f207b0a","year":2020},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.771294Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:a62fd470d64d5660ce94468f29030efa3889fb07cd18f2709e220a1276b77a40","observation_id":"b4ff4c7b-9797-48ac-9d62-c757a7a281e6","resolution":{"observed_at":"2026-08-07T00:15:47.148703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:44.778686Z","title":"A., Riviere, M., Mohamed, A., Dupoux, E., and Hsu, W.-N","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.778686Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:dc4328926ed3f05a49447483593fe5fdfc98962ae9c6bd233ab37dfad611a212","observation_id":"3e0fef10-d4a0-4037-a8d8-1791feefc7c7","resolution":{"observed_at":"2026-08-07T00:15:44.778686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:47.118444Z","title":"Glow-tts: A generative flow for text-to-speech via monotonic alignment search","venue":null,"work_id":"b36e0e10-9e79-44ae-8019-2b8641900e67","year":2020},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.786060Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:5f0deed7fd262ee8a8323240d2bdb3d1446cb98a8e7a5147ef78f7ef6306339a","observation_id":"b25007a2-782c-44e2-aa25-61a3ed16ad22","resolution":{"observed_at":"2026-08-07T00:15:47.126895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:47.097204Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech","venue":null,"work_id":"da47c8cf-83d6-49a8-9fb4-6b42e96b070e","year":2021},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.807307Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:224cf866403417f4059b21081a6dfbec686cf119aa8b2f57624d8741d0ddf3c6","observation_id":"c3534bbe-3196-4cbc-a46a-2700ccb22eaf","resolution":{"observed_at":"2026-08-07T00:15:47.102107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:44.811638Z","title":"W., Salamon, J., Li, P., and Bello, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.811638Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:890d78fae48b4cd3cee9251129a5c8f2757f2445c89f0aaf7a93e672666bef60","observation_id":"ecd4c332-ee4b-450a-9065-e6a0a012edb8","resolution":{"observed_at":"2026-08-07T00:15:44.811638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:44.818856Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.818856Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:5e60a11df396369a66fbfc9f99eacc0f599b0a86f4ab8c008c5667381f1a2529","observation_id":"759585a2-6a73-4d2f-8e28-20e96b1913aa","resolution":{"observed_at":"2026-08-07T00:15:44.818856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:47.082766Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis","venue":null,"work_id":"5f87a510-a889-4102-8731-1ed38c6ba356","year":2020},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.832434Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:84da1cd53db26bdd40120b439b471e037ffa27977d62b428f250eb5e5dbe2bb3","observation_id":"9939882c-0785-4730-93e0-b7aec7842f83","resolution":{"observed_at":"2026-08-07T00:15:47.088472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:44.839065Z","title":"On generative spoken language modeling from raw audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.839065Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:275e7242f288d1913830ba2f4faed75a101feddd2b6baf1d35d6c5f0cd55b1a5","observation_id":"0c5aef27-0c33-4419-b661-b77d5c82c445","resolution":{"observed_at":"2026-08-07T00:15:44.839065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:44.847821Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.847821Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:35850069cc844b9a38f4ee516692b348a9d24fa39a76b050dca50e50a0cf7ff4","observation_id":"788a30d6-ce08-4c10-98e1-02cbc78266dc","resolution":{"observed_at":"2026-08-07T00:15:44.847821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:44.857666Z","title":"Voxtlm: Unified decoder-only models for consolidating speech recognition, synthesis and speech, text continuation tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.857666Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:f4433d1d35c8a3dfbed4be3443183af56c6e7931d5d6c57765492ea864ff64e4","observation_id":"09122a09-c6f1-4d73-bc4e-ac17bd61a597","resolution":{"observed_at":"2026-08-07T00:15:44.857666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.11588","last_updated":"2020-12-01T15:53:57Z","snapshot_observed_at":"2026-08-01T21:31:01.785578Z","submitted_at":"2020-11-23T18:01:37Z","title":"The Zero Resource Speech Benchmark 2021: Metrics and baselines for unsupervised spoken language modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.11588","snapshot_observed_at":"2026-08-07T00:15:44.865712Z","title":"A., de Seyssel, M., Rozé, P., Rivière, M., Kharitonov, E., Baevski, A., Dunbar, E., and Dupoux, E","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.865712Z"},"links":{"cited_paper":"/paper/2011.11588","citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:03483263dff6e846dc3b00124507e7e96bbd1d70d1eb7ac77e16c86371c2d231","observation_id":"b3dfe765-ef91-4123-97e4-f790772ba959","resolution":{"observed_at":"2026-08-07T00:15:44.865712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:15:44.894816Z","title":"GPT -4 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.894816Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:b066316ac90e62c6fba4df603fe5c735d4f19315323ff970960b9aaa2c81b416","observation_id":"b5b906e3-3692-4993-a309-9a45dc5f3820","resolution":{"observed_at":"2026-08-07T00:15:44.894816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:44.913607Z","title":"Librispeech: An ASR corpus based on public domain audio books","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.913607Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:45533bbe05f00cb33fd6cb26c1da86e9fa810f7b9e1afbe724892d125359807e","observation_id":"a40358ec-9d19-4c10-8439-2ee44a0c04d2","resolution":{"observed_at":"2026-08-07T00:15:44.913607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:44.917330Z","title":"FiLM : Visual reasoning with a general conditioning layer","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.917330Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:1e07aef3b7f92e4c1f59dd8aab64ac308088319634a5501b3104207130926bb4","observation_id":"f4f05302-5d31-4840-bb16-4c470fb3169e","resolution":{"observed_at":"2026-08-07T00:15:44.917330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:44.921466Z","title":"Train short, test long: Attention with linear biases enables input length extrapolation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.921466Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:36eb9d808246ed9002d50e37fc2a205b5815fffa9229788c3138765d6e4590ba","observation_id":"6161288b-832b-4021-8b9f-338a826f5ee1","resolution":{"observed_at":"2026-08-07T00:15:44.921466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:44.925313Z","title":"W., Xu, T., Brockman, G., Mcleavey, C., and Sutskever, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.925313Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:f06b2431a830d81b3944b52c4df5871e2a1ab6b483e6c2f0191c2d5e7f387df3","observation_id":"68b61674-7217-4229-8eb5-a2286a4006fa","resolution":{"observed_at":"2026-08-07T00:15:44.925313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:47.017528Z","title":"and Torre, R","venue":null,"work_id":"0881191d-b983-456f-ade8-7d47165016c1","year":2023},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.931413Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:e2d93bbcb6b602a175412e629b4237179cd2cd7f7c3b9d93ab53b880bc7a8c93","observation_id":"8d0a9955-4f6c-4e3b-b365-c57975b17953","resolution":{"observed_at":"2026-08-07T00:15:47.026292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:46.997219Z","title":"and Mohamed, S","venue":null,"work_id":"9c67e32f-13df-4142-a2bc-2b18f5d894d5","year":2015},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.936155Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:d0460811e746563a8560e90a18b8e064f1be2844e7f47d6f40e472ae6b06b8a6","observation_id":"1f065bbb-92a8-42b2-af87-0012358b00fb","resolution":{"observed_at":"2026-08-07T00:15:47.004749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:46.965515Z","title":"U-Net : Convolutional networks for biomedical image segmentation","venue":null,"work_id":"2cf1d641-4147-41a5-a60e-d46298c9caf8","year":2015},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.940000Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:4b81a354952d11ffffab76a44d484cf412416493fc6062f17f9b188b9e68a1e3","observation_id":"b6086208-4561-4e62-a19c-57ce05649417","resolution":{"observed_at":"2026-08-07T00:15:46.981677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-07T00:15:44.944189Z","title":"K., Asawaroengchai, C., Nguyen, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.944189Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:74ff19250581db5b8b13c51ae6330198938614dc0cb75e0b5a7a7f5daa33f118","observation_id":"250938e1-419f-42c5-8657-6eeebc8e36a0","resolution":{"observed_at":"2026-08-07T00:15:44.944189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2009-103","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:45.315082Z","title":"The interspeech 2009 emotion challenge","venue":null,"work_id":"6f9e0e1d-e050-45fc-879f-30b284ab58a1","year":2009},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.948242Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:732dd4cfa63835c45a47b666de6357425eaa84b451e9795ea8b3f5bc1b4785f7","observation_id":"ca725f33-4967-4d55-8d71-7663d8635d77","resolution":{"observed_at":"2026-08-07T00:15:45.321783Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:44.952054Z","title":"The interspeech 2013 computational paralinguistics challenge: social signals, conflict, emotion, autism","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.952054Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:466fdc0e5eb03fb36224dd009dd5ff3098416eb47af75628bf99ae67777e17bf","observation_id":"cf588aef-9ebe-4026-b8c7-f318b7b238e1","resolution":{"observed_at":"2026-08-07T00:15:44.952054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:46.940389Z","title":"Denoising diffusion implicit models","venue":null,"work_id":"40c7867c-111c-4657-876b-86cdff94c644","year":2021},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.957310Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:240e28f367281c759ba7916272c1766d84d61231ac696e4b639d9f510a15f093","observation_id":"50183299-26c3-43e0-956c-9f0784219d60","resolution":{"observed_at":"2026-08-07T00:15:46.948606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:44.963041Z","title":"J., Cao, Y., Zen, H., Rosenberg, A., Ramabhadran, B., and Wu, Y","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.963041Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:44341df3884823413719507fc3bae919813a64b64c51e205f883891972dd8fd8","observation_id":"5d9a725c-12f5-428e-a78a-29c0ef522c8a","resolution":{"observed_at":"2026-08-07T00:15:44.963041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.08022","last_updated":"2017-11-06T14:21:43Z","snapshot_observed_at":"2026-08-05T08:35:49.218794Z","submitted_at":"2016-07-27T10:23:00Z","title":"Instance Normalization: The Missing Ingredient for Fast Stylization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.08022","snapshot_observed_at":"2026-08-07T00:15:44.968933Z","title":"Instance normalization: The missing ingredient for fast stylization, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.968933Z"},"links":{"cited_paper":"/paper/1607.08022","citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:8f3fc9586346146ad7e930e25b0b851b9934dd6157609f6d5f8da98ffc10dbe8","observation_id":"50697df9-0e5b-420f-993f-35ef51bc8b7e","resolution":{"observed_at":"2026-08-07T00:15:44.968933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:46.925513Z","title":"and Kautz, J","venue":null,"work_id":"405a5612-1105-4f43-9c77-c4b9de3a98c6","year":2020},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.973522Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:262188c216e158ef33ef4261faa18c6791b005a5dc6b220224ad06ebf719988d","observation_id":"a02db15b-48f2-4f0c-9a22-08874b0ee3a5","resolution":{"observed_at":"2026-08-07T00:15:46.931145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:46.910869Z","title":"Learning de-identified representations of prosody from raw audio","venue":null,"work_id":"fa1d504a-cf20-4ccc-9b8d-92c94dfac533","year":2021},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.980070Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:01a3d372c394aa10d762e03f828e34b661f396b07c72d1d8dfc11e1c4c03bf71","observation_id":"b23bd89d-c775-4353-b9d6-bfd3ddf53469","resolution":{"observed_at":"2026-08-07T00:15:46.915433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:46.890512Z","title":"On layer normalization in the transformer architecture","venue":null,"work_id":"547f7f1d-77a9-472f-ac56-2357b7a00a89","year":2020},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.990676Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:4522c0a8d868899f07f3b8d878dc5c25ca22ebc6e08860a92a8165cd513812b4","observation_id":"0a438fe2-7ef9-48ee-9747-3270430b9103","resolution":{"observed_at":"2026-08-07T00:15:46.897756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:44.997848Z","title":"CSTR VCTK Corpus : English multi-speaker corpus for CSTR voice cloning toolkit (version 0.92), 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:44.997848Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:e302fe7781c08b5f18498397258b741c14e4dd0cd1a1bc3aa896f206d6fc999a","observation_id":"af5c8ce8-8abd-4d61-a155-cb6747b226f9","resolution":{"observed_at":"2026-08-07T00:15:44.997848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:46.875073Z","title":null,"venue":null,"work_id":"aff16931-a017-4653-a9c7-fdb0c8cf941d","year":2024},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:45.002990Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:04fc109a2812842bb5288169fc617a34b1c3ad983a509204a87cb2af635e514f","observation_id":"23b41b76-da0d-4cb5-84e0-be94071ce7f3","resolution":{"observed_at":"2026-08-07T00:15:46.880905Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:45.017442Z","title":"Soundstream: An end-to-end neural audio codec","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:45.017442Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:4e67ed827c019f8e8bbb0d8a01cbcceffde5fd60c8c4371e6b0360de298c5987","observation_id":"83211cda-db71-4d3b-9aac-3d338593031b","resolution":{"observed_at":"2026-08-07T00:15:45.017442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:46.859608Z","title":"and Sennrich, R","venue":null,"work_id":"ec3d52c9-49da-4083-96a4-8649e523d1dd","year":2019},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:45.044841Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:82ddd68e0b719777300f6473ccc5d442531fb208098df4e9b45210b692ec19f1","observation_id":"ff1b8f43-70e1-47ae-9c2b-1067a04d88a1","resolution":{"observed_at":"2026-08-07T00:15:46.864209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:46.842441Z","title":"SpeechTokenizer : Unified speech tokenizer for speech language models","venue":null,"work_id":"a737ee67-963d-4feb-a3ec-308217e3b6ef","year":2024},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:45.085676Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:8ce1d0e53d5b4cdd5285f986a114c07c66f340a871e81bb50cbc1e3597dc8f9a","observation_id":"c1c6ae91-4d1c-44e4-bfdb-9ac0a89cc508","resolution":{"observed_at":"2026-08-07T00:15:46.849087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:46.821909Z","title":"R., Kadav, A., and Graf, H","venue":null,"work_id":"a4998e43-87a5-424b-b452-1699a583ce08","year":2020},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:45.092264Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:6bd89408c846ddcf672939f49fef63ba63a9a3c1605b6f3b462ffb22ddfe409e","observation_id":"ccce29af-1127-41b4-a35f-07f657f13abb","resolution":{"observed_at":"2026-08-07T00:15:46.828978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:45.106503Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:45.106503Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:d6ab3fbe2a048933d785279505c389f5dfbc78fff6ca4333dc85362c22257595","observation_id":"82f83d34-0588-4528-8c2b-b1d7d84b1214","resolution":{"observed_at":"2026-08-07T00:15:45.106503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:45.135549Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:45.135549Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:f29a16b57ad7a8d8419adbf504e914318f32143a88f14a7f2487728d4e5709cc","observation_id":"17f572f4-8e35-4aa1-9047-dbed4a13db6d","resolution":{"observed_at":"2026-08-07T00:15:45.135549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:45.148144Z","title":"The evaluation metrics are detailed in Section ssec:eval-all","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:45.148144Z"},"links":{"citing_paper":"/paper/2506.14767"},"observation_digest":"sha256:db5afb7de598978221997c255daf7af7c2ec562e5d133ee2987467f731eb5d7b","observation_id":"0bee6347-6538-413a-968a-799224ee8119","resolution":{"observed_at":"2026-08-07T00:15:45.148144Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.14767","last_updated":"2025-06-17T17:58:17Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T01:19:24.864953Z","submitted_at":"2025-06-17T17:58:17Z","title":"A Variational Framework for Improving Naturalness in Generative Spoken Language Models"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":2,"verified_fuzzy":21},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2506.14767."}