{"as_of":"2026-08-17T19:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8f2bb4163529df3633c4ad368d69698aa47b8f3b66b9cd23d2a1302a1d539382","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:54:19.340049Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T00:49:26.507281Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T19:46:15.325325Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"cited_work":{"arxiv_id":"2507.20091","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20091","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"thinking","venue":null,"work_id":"fbda3465-4bbf-479f-ab53-8b96595f6453","year":2025},"citing_paper":{"arxiv_id":"2605.05927","last_updated":"2026-05-08T01:27:50Z","snapshot_observed_at":"2026-08-11T04:20:01.560211Z","submitted_at":"2026-05-07T09:32:05Z","title":"Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-08T11:00:52.196039Z"},"links":{"cited_paper":"/paper/2507.20091","citing_paper":"/paper/2605.05927"},"observation_digest":"sha256:87ae38dfc1a8d099a0fc3a90958c71e5d525625ff555f15ef76fe4e84d90e23d","observation_id":"f56f709b-b828-435b-b0ee-482180d02993","resolution":{"observed_at":"2026-05-11T19:46:15.327083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"cited_work":{"arxiv_id":"2507.20091","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20091","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"thinking","venue":null,"work_id":"fbda3465-4bbf-479f-ab53-8b96595f6453","year":2025},"citing_paper":{"arxiv_id":"2605.05927","last_updated":"2026-05-08T01:27:50Z","snapshot_observed_at":"2026-08-11T04:20:01.560211Z","submitted_at":"2026-05-07T09:32:05Z","title":"Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-11T00:49:26.507281Z"},"links":{"cited_paper":"/paper/2507.20091","citing_paper":"/paper/2605.05927"},"observation_digest":"sha256:9c7cfa525588b6a08c21ef35b12913f20aafbd762f9e8a0235bcac412397766d","observation_id":"73a32923-2621-4c7c-9c73-e2c763ebfd53","resolution":{"observed_at":"2026-05-11T00:50:49.643075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.20091/citation-record","integrity":"/paper/2507.20091/integrity","json":"/paper/2507.20091/citation-record.json","paper":"/paper/2507.20091"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.095238Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.095238Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:87e06f08704bec1e1cdad2898735b75e386fa1d3a99c84d379165563aa0ef134","observation_id":"dee9aa13-00b1-4644-b147-bbf0eba5df4f","resolution":{"observed_at":"2026-08-15T17:54:19.095238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.101576Z","title":"Dm-codec: Distilling multimodal representations for speech tokenization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.101576Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:fcfd00aaad69f55d2fa75031c5f943c7a1a1fb6c909b2b5daa5a23a61c410720","observation_id":"7d4af0ee-20f8-4091-a709-a63d1d3f8468","resolution":{"observed_at":"2026-08-15T17:54:19.101576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15835","last_updated":"2025-05-21T16:55:34Z","snapshot_observed_at":"2026-08-16T20:32:03.446600Z","submitted_at":"2024-07-22T17:51:53Z","title":"dMel: Speech Tokenization made Simple","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15835","snapshot_observed_at":"2026-08-15T17:54:19.106677Z","title":"dmel: Speech tokenization made simple","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.106677Z"},"links":{"cited_paper":"/paper/2407.15835","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:53c213e25e00cd7a9637257e727e8f90eab4da095ce9709aede0f642173179ce","observation_id":"c92597f9-8e37-453a-b3f5-2f29d8379e52","resolution":{"observed_at":"2026-08-15T17:54:19.106677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.112745Z","title":"Audiolm: a language modeling approach to audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.112745Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:c885663b899573d27aa69856523bc0953d85794f34c517fba841d1c91ca9b278","observation_id":"dddf75bb-7c71-40a6-9544-69c2e8c066c2","resolution":{"observed_at":"2026-08-15T17:54:19.112745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-08-16T15:32:35.509283Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-15T17:54:19.118430Z","title":"Soundstorm: Efficient parallel audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.118430Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:8c9eba13b87d76456e6aa40a4e235e5770f8ffe3902bbc6a0c6343946313589b","observation_id":"6d818c27-e966-48ff-85f2-dccce0497ae0","resolution":{"observed_at":"2026-08-15T17:54:19.118430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:20.206176Z","title":"Giveness, contrasitiveness, definiteness, subjects, topics, and point of view","venue":null,"work_id":"0bc7261c-e983-4c80-960d-e6cb73a42c6f","year":1976},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.123781Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:8c17e32d13888f3c132990c362000202bd8dec55adcdb690be79ce37b1244f23","observation_id":"0e085d97-ffc2-4cef-b51c-8f5fe7d5dae0","resolution":{"observed_at":"2026-08-15T17:54:20.212182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24177","last_updated":"2024-10-31T17:43:13Z","snapshot_observed_at":"2026-08-17T11:16:14.675895Z","submitted_at":"2024-10-31T17:43:13Z","title":"DC-Spin: A Speaker-invariant Speech Tokenizer for Spoken Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24177","snapshot_observed_at":"2026-08-15T17:54:19.129079Z","title":"Dc-spin: A speaker-invariant speech tokenizer for spoken language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.129079Z"},"links":{"cited_paper":"/paper/2410.24177","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:5726ca036f6a1e4eee74e7242ee0c3b40709647055fa9da25999089b46f0b687","observation_id":"3d1e0e8c-5558-49b9-85ea-5876e630df6e","resolution":{"observed_at":"2026-08-15T17:54:19.129079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04256","last_updated":"2025-01-08T03:47:54Z","snapshot_observed_at":"2026-08-10T21:35:22.314779Z","submitted_at":"2025-01-08T03:47:54Z","title":"DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04256","snapshot_observed_at":"2026-08-15T17:54:19.134392Z","title":"Drawspeech: Expressive speech synthesis using prosodic sketches as control conditions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.134392Z"},"links":{"cited_paper":"/paper/2501.04256","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:78d1b9f64f19a949bf8d968d4919fd5c9807eb6d116450122e3c5afaf5c29bde","observation_id":"ccb609e8-ddf5-4482-843d-273d1b8e377a","resolution":{"observed_at":"2026-08-15T17:54:19.134392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14069","last_updated":"2024-10-14T07:57:06Z","snapshot_observed_at":"2026-08-16T14:32:29.920505Z","submitted_at":"2023-12-21T17:47:33Z","title":"EmphAssess : a Prosodic Benchmark on Assessing Emphasis Transfer in Speech-to-Speech Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14069","snapshot_observed_at":"2026-08-15T17:54:19.140208Z","title":"Emphassess: a prosodic benchmark on assessing emphasis transfer in speech-to-speech models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.140208Z"},"links":{"cited_paper":"/paper/2312.14069","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:06c3dedc8ef085adb88ed02537cfc575a3c26844cd7de542802daccfb1dff93b","observation_id":"24823737-1366-4758-af51-1ecf7adb7e91","resolution":{"observed_at":"2026-08-15T17:54:19.140208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-15T04:43:16.361751Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-15T17:54:19.145484Z","title":"High fidelity neural audio compression","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.145484Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:cd4311dd09bbebfa42978438022822435dc06e497855c83b3201ffb5a13af406","observation_id":"713a6d3e-8e89-452f-9f2a-83960024e07b","resolution":{"observed_at":"2026-08-15T17:54:19.145484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-15T17:54:19.150827Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.150827Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:5860d4bb5d9cc2b3fed35a3520abfb0fc94aac0cfb17cd78d001d3f54d8fec77","observation_id":"7fccdd45-b965-454c-8f5b-97c77fc1e9f2","resolution":{"observed_at":"2026-08-15T17:54:19.150827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:20.190762Z","title":"Elevenlabs voice generation platform","venue":null,"work_id":"e85e30e2-acb0-4fc4-b9fb-51c710c9bce5","year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.156119Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:8484fdd55cee41db4111b9c234a014d6d819f927e8af83b34e192829c938ed81","observation_id":"e274388a-c2c9-48b9-8754-7b5b1eedbe3c","resolution":{"observed_at":"2026-08-15T17:54:20.195688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.161618Z","title":"Recent advances in discrete speech tokens: A review","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.161618Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:7c2977057b072c256478a212a1eb161e4ea409f8927affc35ba9b088489d119d","observation_id":"5612812a-b60a-4f0a-9d37-dae60a462b24","resolution":{"observed_at":"2026-08-15T17:54:19.161618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.166411Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.166411Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:63c331b6dc03586e8dce318398b0eb5c3ddec4d698514725ade43f3480e420f7","observation_id":"b0d96cdc-cac7-4247-9e64-4290d0ad8f7d","resolution":{"observed_at":"2026-08-15T17:54:19.166411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-12T20:35:16.024701Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-08-15T17:54:19.171625Z","title":"Step-audio: Unified understanding and generation in intelligent speech interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.171625Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:e787d8e0f7a0bb6d33a641d0ae45b963b3d78b1898cb8b2ba7f8dd6ba3630c6d","observation_id":"285c13b6-7cfc-4155-a2fc-72d0f0da6136","resolution":{"observed_at":"2026-08-15T17:54:19.171625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00169","last_updated":"2024-07-22T09:53:44Z","snapshot_observed_at":"2026-08-17T17:21:34.645323Z","submitted_at":"2023-08-31T23:26:10Z","title":"RepCodec: A Speech Representation Codec for Speech Tokenization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00169","snapshot_observed_at":"2026-08-15T17:54:19.176618Z","title":"Repcodec: A speech representation codec for speech tokenization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.176618Z"},"links":{"cited_paper":"/paper/2309.00169","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:0bef62527b9c2112925c8ebcd21b0ab93b689a161d9083066f2631f047a7c218","observation_id":"b2f588c9-eb8b-47b3-8819-c41769fd9cdc","resolution":{"observed_at":"2026-08-15T17:54:19.176618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:20.165165Z","title":"Crossing the uncanny valley of conversational voice, 2025","venue":null,"work_id":"9add4b0b-5ec0-482a-93ec-374268f57a00","year":2025},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.181649Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:8fe29b031d74c4042bf49b58b4405aee8c73d11f8205b638cd3e8fb7837ca2ba","observation_id":"73502204-a433-4ace-8bee-40ce7176eac5","resolution":{"observed_at":"2026-08-15T17:54:20.170020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.186416Z","title":"An open source emotional speech corpus for human robot interaction applications","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.186416Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:d8e4dbd2658d9f2523b9afa60c8a279e13c55e57ce7f362d584037db36deb451","observation_id":"357c6328-21d4-44b9-a094-d50b74a4d917","resolution":{"observed_at":"2026-08-15T17:54:19.186416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03637","last_updated":"2024-10-28T01:29:04Z","snapshot_observed_at":"2026-08-16T13:45:44.144951Z","submitted_at":"2024-06-05T22:17:47Z","title":"Style Mixture of Experts for Expressive Text-To-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03637","snapshot_observed_at":"2026-08-15T17:54:19.191217Z","title":"Style mixture of experts for expressive text-to-speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.191217Z"},"links":{"cited_paper":"/paper/2406.03637","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:1de25652af720848cc62a79b6ad41fee7437de32c9667c267acea643130fa0ec","observation_id":"e25b62d3-fec4-4b4c-aa00-4d0ed08db09c","resolution":{"observed_at":"2026-08-15T17:54:19.191217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-08-16T13:22:55.356873Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-15T17:54:19.196492Z","title":"Wavtokenizer: an efficient acoustic discrete codec tokenizer for audio language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.196492Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:c5193f4c2d853c53365a452622b1bfd03a15252b835f64fd45a9d17359d7c74f","observation_id":"4c2ec780-f37a-4266-a023-2e9471ff796d","resolution":{"observed_at":"2026-08-15T17:54:19.196492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.201637Z","title":"Libri-light: A benchmark for asr with limited or no supervision","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.201637Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:c069ffa397104f016f44a87eb9940996024cfe19099a4a9d4947ccb1b4bb2218","observation_id":"b7da3462-7686-40ce-81f2-9586298d6314","resolution":{"observed_at":"2026-08-15T17:54:19.201637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05706","last_updated":"2024-11-28T01:10:49Z","snapshot_observed_at":"2026-08-16T14:20:12.870542Z","submitted_at":"2024-02-08T14:35:09Z","title":"Paralinguistics-Aware Speech-Empowered Large Language Models for Natural Conversation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05706","snapshot_observed_at":"2026-08-15T17:54:19.206278Z","title":"Paralinguistics-aware speech-empowered large language models for natural conversation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.206278Z"},"links":{"cited_paper":"/paper/2402.05706","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:40990baefe8ab64165be9ea44c8e98d8c8791b2bbee3c86e45de145c8ac22dff","observation_id":"8995600a-5152-4815-b6a7-4fd51b794054","resolution":{"observed_at":"2026-08-15T17:54:19.206278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.211165Z","title":"On generative spoken language modeling from raw audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.211165Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:18e5235f91d46878760d4e03697a7fc85049f94bc5617ddfc0eb156665162b78","observation_id":"d243f73c-5256-410b-8999-06111fd74af7","resolution":{"observed_at":"2026-08-15T17:54:19.211165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:20.120514Z","title":"Whisma: A speech-llm to perform zero-shot spoken language understanding","venue":null,"work_id":"d7780312-e659-4681-bf6d-cf02916294e0","year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.215741Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:fd73f7563e15822b95ae79910d703ad754c8be562ae8ea3f064aa45bb5fe00f8","observation_id":"b6e6aa01-e127-43e4-b570-f2ed7cc28c2f","resolution":{"observed_at":"2026-08-15T17:54:20.125620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:20.104577Z","title":"Styletts 2: Towards human-level text-to-speech through style diffusion and adversarial training with large speech language models","venue":null,"work_id":"001441d5-4f72-4a42-8594-48e03c15e124","year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.220379Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:51f707f601361b84a56322c2793c225b3b136f38f8723ec21d0e839ebc0d9dfa","observation_id":"f5543cb5-b5ab-4813-95be-6a0a387dfe0b","resolution":{"observed_at":"2026-08-15T17:54:20.109798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:20.089163Z","title":"Generative spoken dialogue language modeling","venue":null,"work_id":"309043c0-faf0-4adb-ad5f-1d60cbc126bf","year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.225998Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:77cc9a1e062e79ba18f9c45f91aabd322fcd83d8bd97d4cbffefb90e2a866752","observation_id":"dae726de-a84f-464e-a818-55039915a068","resolution":{"observed_at":"2026-08-15T17:54:20.094079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:20.073178Z","title":"Spirit-lm: Interleaved spoken and written language model","venue":null,"work_id":"fb79c7ff-c3c2-4b4f-93c4-defdc357ceac","year":2025},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.230893Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:24ae00bcca12c471759aa9795a2ec592700ffcfe223a50d4ce1bf69fdaf4707a","observation_id":"f05a6762-2cf0-4e7b-a310-5d3613d603ee","resolution":{"observed_at":"2026-08-15T17:54:20.078237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18603","last_updated":"2025-07-10T17:52:43Z","snapshot_observed_at":"2026-08-16T12:59:56.684198Z","submitted_at":"2024-12-24T18:56:46Z","title":"Long-Form Speech Generation with Spoken Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18603","snapshot_observed_at":"2026-08-15T17:54:19.236403Z","title":"Long-form speech generation with spoken language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.236403Z"},"links":{"cited_paper":"/paper/2412.18603","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:cb2f9be534ff94b758bdd855d6820641c914ec4daeec13b196721f623e6a7ef3","observation_id":"1da4e900-f7a8-4349-9c57-8b093de1d1f8","resolution":{"observed_at":"2026-08-15T17:54:19.236403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.241198Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.241198Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:573239c5a60994b8705533b85803586f4e99c77d808584f40767def3f8c28342","observation_id":"d9db9bdc-d2cf-4d6a-bbd2-6002769aedf8","resolution":{"observed_at":"2026-08-15T17:54:19.241198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:20.047764Z","title":"Prosospeech: Enhancing prosody with quantized vector pre-training in text-to-speech","venue":null,"work_id":"9449af8b-0ff5-4e4d-91db-ac07d096562d","year":2022},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.246565Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:7e31651d89c7773f499a681ec96fa4b00ee9f21fffec8e54103de78ff5e5bcbc","observation_id":"912c46e5-47a8-4262-a262-cbcd8c6d09ab","resolution":{"observed_at":"2026-08-15T17:54:20.052853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-15T17:54:19.251401Z","title":"Audiopalm: A large language model that can speak and listen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.251401Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:bb824deb730b4077e321fd54a76c870202f63bcdd1d31c457334638276624d12","observation_id":"8c198c27-1d04-46e8-90d3-e93b341966b3","resolution":{"observed_at":"2026-08-15T17:54:19.251401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:20.031759Z","title":"Shechtman, S","venue":null,"work_id":"84676c07-da8e-4379-b9b2-b0f53a53dc25","year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.256580Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:586b9846961adc7e194a6b3c2759fb386a234f07c2f54500119296ad2fd18a33","observation_id":"57f1eb8c-049b-4b88-b50c-66b3bf03ffe1","resolution":{"observed_at":"2026-08-15T17:54:20.036673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09116","last_updated":"2023-05-30T16:09:10Z","snapshot_observed_at":"2026-08-16T15:39:31.485174Z","submitted_at":"2023-04-18T16:31:59Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09116","snapshot_observed_at":"2026-08-15T17:54:19.261079Z","title":"Naturalspeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.261079Z"},"links":{"cited_paper":"/paper/2304.09116","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:75be31050b29993fd2f0effd2342c0f6faefe3ca0a98a8ac607a1a03e381d650","observation_id":"6fd81e2d-7668-4d24-bc95-5e4ec3d86d5b","resolution":{"observed_at":"2026-08-15T17:54:19.261079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:20.013146Z","title":"An analysis of the use of qualifications on the amazon mechanical turk online labor market","venue":null,"work_id":"c6bc29af-22c0-4d1d-9885-a846eb0abc9f","year":2017},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.266649Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:e747491ad77eb2ff04fc50838b3523253250ec61112dde4fa7a983845fd700a5","observation_id":"5d103bf7-035d-42bb-9beb-54c4f55b5afa","resolution":{"observed_at":"2026-08-15T17:54:20.020204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03701","last_updated":"2024-09-10T14:45:15Z","snapshot_observed_at":"2026-08-16T13:20:59.520858Z","submitted_at":"2024-09-05T16:57:39Z","title":"LAST: Language Model Aware Speech Tokenization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03701","snapshot_observed_at":"2026-08-15T17:54:19.271586Z","title":"Last: Language model aware speech tokenization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.271586Z"},"links":{"cited_paper":"/paper/2409.03701","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:931383e34f691f59c97c2d7fa8e2093e65e0451d72aeeda26ff480ce03adcdf6","observation_id":"5e32e358-db83-4460-8e6b-db9fff747a62","resolution":{"observed_at":"2026-08-15T17:54:19.271586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-15T17:54:19.277804Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.277804Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:b7fcbb9b5acd6c222e33a08823f3922b42e2b39768a36aade5b3b98529717698","observation_id":"b94787c0-2378-45a2-b9a6-351247b3a200","resolution":{"observed_at":"2026-08-15T17:54:19.277804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-16T13:03:42.737566Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-15T17:54:19.282895Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.282895Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:af57ae3b329677e82a134b2fe6f9700b25a98908ab86b4b7abc82df3e4b69613","observation_id":"c4e6ed73-6450-4012-9043-9e684426521a","resolution":{"observed_at":"2026-08-15T17:54:19.282895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-08-16T13:22:50.721442Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-15T17:54:19.288620Z","title":"Mini-omni: Language models can hear, talk while thinking in streaming","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.288620Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:0885cbdc6d420ba6dc6087897dffa488223786fd3383a772c17627b3164d76ae","observation_id":"20da324c-57e1-408d-81d9-26b3b92de506","resolution":{"observed_at":"2026-08-15T17:54:19.288620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10763","last_updated":"2023-05-18T07:07:04Z","snapshot_observed_at":"2026-08-16T15:32:06.418190Z","submitted_at":"2023-05-18T07:07:04Z","title":"CLAPSpeech: Learning Prosody from Text Context with Contrastive Language-Audio Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10763","snapshot_observed_at":"2026-08-15T17:54:19.293507Z","title":"Clapspeech: Learning prosody from text context with contrastive language-audio pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.293507Z"},"links":{"cited_paper":"/paper/2305.10763","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:ac182c94577563e38023953f039f2377e2d5753b1397405e7d51f23c16675688","observation_id":"0ccb4176-9e30-49ea-9647-bda5a5e460e9","resolution":{"observed_at":"2026-08-15T17:54:19.293507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.298375Z","title":"Soundstream: An end-to-end neural audio codec","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.298375Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:ee1dfc4e871d557a3e8ff00b6cb2a24eda1a2991bc8fa996385467ed497c65ab","observation_id":"f66ab1d4-1d32-4423-afed-fe1d397bd964","resolution":{"observed_at":"2026-08-15T17:54:19.298375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-12T12:50:46.995038Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-15T17:54:19.303523Z","title":"Glm-4-voice: Towards intelligent and human-like end-to-end spoken chatbot","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.303523Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:715c996d67f0fa47dff2fe2555ca3e8ebe359fad223dd62f4a6af7498fb6d96c","observation_id":"fe38e239-0e49-4449-b1f2-25255f4a6132","resolution":{"observed_at":"2026-08-15T17:54:19.303523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17607","last_updated":"2024-12-02T16:13:24Z","snapshot_observed_at":"2026-08-15T07:00:11.522937Z","submitted_at":"2024-11-26T17:19:09Z","title":"Scaling Speech-Text Pre-training with Synthetic Interleaved Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17607","snapshot_observed_at":"2026-08-15T17:54:19.309151Z","title":"Scaling speech-text pre-training with synthetic interleaved data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.309151Z"},"links":{"cited_paper":"/paper/2411.17607","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:258d052715f5cc32eac205495adda98d6dcb20f499acca49670d240fee639fdd","observation_id":"f1f7c4c5-f1e1-4549-af60-efd7686a3e4c","resolution":{"observed_at":"2026-08-15T17:54:19.309151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-16T15:31:59.521123Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-15T17:54:19.319277Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.319277Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:d72c60ab81e1345bf13f6ad5d5a746d86a55c3d2ffaa4a059759d46fda04fa86","observation_id":"5b3a6cc5-aa00-47a4-b7af-0fbc3876389c","resolution":{"observed_at":"2026-08-15T17:54:19.319277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-16T15:04:18.834535Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-15T17:54:19.324529Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.324529Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:4412353332adc61530d68e7d0ce8087fb149e0357739c7272ca12cbf26fdc3b8","observation_id":"be3cf178-6cc1-4782-80f5-95f27d530a18","resolution":{"observed_at":"2026-08-15T17:54:19.324529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.330235Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.330235Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:cc14f536ebd9c311c82e41cbe445f9aa069f6bf002eb171f610c0ad6e40a5d7a","observation_id":"5429ead6-1b82-4c58-b02b-1dea3c8f39f5","resolution":{"observed_at":"2026-08-15T17:54:19.330235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.335195Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.335195Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:c11143d265617d619447e00ff72e56ac8708b8baed27f755345dec680bd76e3f","observation_id":"1c77e3bb-9bf3-4d61-80c0-397382e4feb9","resolution":{"observed_at":"2026-08-15T17:54:19.335195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.340049Z","title":"One key desirable capability for speech language models is the ability to capture the intricate interdependency between content and prosody","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.340049Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:7be81c71e875db2a02434e8ff54e6ec2607e4e0a10f8c8c54f75daf990e67a44","observation_id":"db04fd29-6e89-4cdd-9c95-6c6bac061f78","resolution":{"observed_at":"2026-08-15T17:54:19.340049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T18:24:24.554757Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 2 inbound Pith citation observations for arXiv:2507.20091."}