{"as_of":"2026-08-22T01:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d6ccf2f9cf3994d9ed0ff3669884c1cbaec351eb9305c3b080a6325b3dc19e52","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T23:22:40.218077Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:33:49.043236Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T22:33:49.485867Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"cited_work":{"arxiv_id":"2605.27383","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.27383","snapshot_observed_at":"2026-08-05T22:33:49.485867Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","venue":"cs.CL","work_id":"4d71db29-4dfa-4ff9-8310-dfd29989e804","year":2026},"citing_paper":{"arxiv_id":"2608.03253","last_updated":"2026-08-11T06:30:14Z","snapshot_observed_at":"2026-08-14T23:09:42.750027Z","submitted_at":"2026-08-04T07:24:14Z","title":"CLASVS: Continuous-Latent Autoregression for Melody-Preserving Lyric Editing in Singing Voice Synthesis","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T22:33:49.043236Z"},"links":{"cited_paper":"/paper/2605.27383","citing_paper":"/paper/2608.03253"},"observation_digest":"sha256:fe907b04619df5de461aca262746ca00c5479a1395f72412bb84c5347c8ca92c","observation_id":"aa1ea841-3d5a-4b35-9797-dc2bbfb5b45f","resolution":{"observed_at":"2026-08-05T22:33:49.597361Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.27383/citation-record","integrity":"/paper/2605.27383/integrity","json":"/paper/2605.27383/citation-record.json","paper":"/paper/2605.27383"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-08-16T15:06:35.991757Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"C., Dale, D., Dong, N., Duquenne, P.-A., Elsahar, H., Gong, H., Heffernan, K., Hoffman, J., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:99b66982d635a61b9afa92ff59075d906203ea677407c886d26eb3ca8756f8ce","observation_id":"4fa26187-00ca-4407-805d-c4a6d3e980c3","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"Tts- transducer: End-to-end speech synthesis with neural transducer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:5fbb5a6276615bc203459be3554e8ca5d88a3b0986e30ff41fc5005dbf9788f0","observation_id":"ffa327fc-97cd-48bc-8014-dbf8c4b1138f","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"Scaling low- resource mt via synthetic data generation with llms.arXiv preprint arXiv:2505.14423,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:4315c164483f1fab8a6f46c7c78b872ccad425cc02bebf36a099558e2477dbc8","observation_id":"9b7560a5-a2a8-40c9-8c07-0ba9161e44f6","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"and Yu, K","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:d32c01daf2644ef6e0b208923bb64cb3e41e57147936ce5265c85bcde96ccf6c","observation_id":"97b04e41-d6ae-4753-939f-41e7e5a0bb9e","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models.arXiv preprint arXiv:2412.10117,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:3f7b7d8f7ce29794ece1e233528d081f81ef7cdcec5500e9251153458514be1b","observation_id":"e2cb8323-c747-4ea7-a6ca-b0c5cb7e6824","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:651e00c247e3dc9cb5a78a94d4a6cf91cba646348e8f70044bd543a0426e2926","observation_id":"587866f2-c686-4c2b-8194-ca847afeaf2a","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"Surveying the technology support of languages","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:6892004060eaea634404351965f132aacf51754d9c5958e347094ec621b5ff32","observation_id":"674ddf21-7e01-4212-9653-48ef2ac92fd5","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-13T22:52:06.796347Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04593","snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"Univoice: Unifying autoregres- sive asr and flow-matching based tts with large language models.arXiv preprint arXiv:2510.04593,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"cited_paper":"/paper/2510.04593","citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:91164d60f5d195a221740e0d9e1ec9b9c51b872082c7430317d65b86a398ff0b","observation_id":"5f63ffd4-b4db-46af-bcd5-efd1c1592850","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"Low-resource expressive text-to- speech using data augmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:e64c158ee4a6ca3c31d5e17aebe4111b18707dfdd92d4b17633f0171a057b983","observation_id":"9d780fb8-2c7b-480a-96fb-68f09212fef2","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"J., Cao, Y ., Chiu, C.-C., Ari, N., Laurenzo, S., and Wu, Y","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:6476364db48f7f158cbbbdaafb18d45488841814a5e6b673b3302635fd6104d8","observation_id":"5007c5d8-f4a9-4ca6-8f73-c5946bbcc6c2","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-18T17:50:58.009731Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and dif- fusion models.arXiv preprint arXiv:2403.03100,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:7f32fa55c15249ab49c333c80e5386ce1e1dd3ed5ce216c35b42102821c45317","observation_id":"e47ccf1a-a9b7-4784-a477-cc112ae8cae5","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"Self-training for end- to-end speech recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:f64144f11cb726949ecca7037077c6f7b4e9d07cc7873cd4725690ad6e59f793","observation_id":"e46c3244-87d6-4e67-8202-da10ad8b1a64","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"Parameter-efficient fine-tuning for low-resource text-to-speech via cross- lingual continual learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:550ab003beba70426d8798317c5501d2e4d92363d6b8cc12d87d62ef9cd52592","observation_id":"42b528ab-bb88-4f92-a365-72f13a760b47","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"Disco-speech: Controllable zero-shot speech generation with a disentangled speech codec.arXiv preprint arXiv:2512.13251,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:acaa3d6e24128ca53ad41e7c653106a0a99bf9761e740c78ae8d15fbfa3972f1","observation_id":"a8e9aa74-563f-4cb0-be4e-7b8df58f7d9e","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"Lao-english code-switched speech synthesis via neural codec language modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:7e9d39aca8a815b805d4cb86dddbe3d0e68cb1490147b36cdb0ec60fd10027d6","observation_id":"4bf0c2af-694d-47ee-a2ec-df039d64ed13","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-17T17:34:05.592421Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00227","snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"cited_paper":"/paper/2507.00227","citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:5de14dd7c0897fd5fc2609fe6989bb12ad20e8120fe60c3b37c64e03dfc5aa11","observation_id":"f5e865ca-1348-4678-84c3-c0977397f6ec","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04531","last_updated":"2025-07-08T14:57:13Z","snapshot_observed_at":"2026-08-19T19:02:12.273049Z","submitted_at":"2025-05-07T16:04:45Z","title":"Overcoming Data Scarcity in Generative Language Modelling for Low-Resource Languages: A Systematic Review","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04531","snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"and Nikolov, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"cited_paper":"/paper/2505.04531","citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:5d981e1fa819ac2d4a4957006cbe59e434eb50f8fc661079e865edda30f77acd","observation_id":"32712e11-475e-4bcc-a39a-aa8a6b5bd5aa","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:0a0c52ebffc73d9855452e46f1b105249ffdc6c9e532a83314b744afbc8d4bb4","observation_id":"f677a92d-7855-4884-8152-9077a63cb311","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20212","last_updated":"2025-03-26T04:14:03Z","snapshot_observed_at":"2026-08-19T17:36:49.876148Z","submitted_at":"2025-03-26T04:14:03Z","title":"Dolphin: A Large-Scale Automatic Speech Recognition Model for Eastern Languages","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20212","snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"Dolphin: A large- scale automatic speech recognition model for eastern languages.arXiv preprint arXiv:2503.20212,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"cited_paper":"/paper/2503.20212","citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:e1005c7f0efa189ef468977f24186f57ecd2eef7e0109c083813ec540577664e","observation_id":"840f16de-833b-4a62-802f-0b80aaaab01b","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"Is synthetic data truly effective for training speech language models? InProc","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:2498495ab6bf35618bf4dbb1de974e1dc1a558c13fdb5c35d1d20b95d7845747","observation_id":"c8f369c3-483a-4ad8-b7d3-916453a1a098","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19462","snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"V oices- tar: Robust zero-shot autoregressive tts with duration con- trol and extrapolation.arXiv preprint arXiv:2505.19462,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"cited_paper":"/paper/2505.19462","citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:6c25ddc14d96c00bffa2118f58d11a7bdd9dabae9363303398e7f322cf5f6814","observation_id":"4a70ccd9-9a71-43f5-a190-b1e16e566dd0","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04649","last_updated":"2023-12-07T19:19:43Z","snapshot_observed_at":"2026-08-16T14:36:42.219638Z","submitted_at":"2023-12-07T19:19:43Z","title":"PyThaiNLP: Thai Natural Language Processing in Python","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04649","snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"Pythainlp: Thai natural language processing in python.arXiv preprint arXiv:2312.04649,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"cited_paper":"/paper/2312.04649","citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:69d9a83d6139c7074a554b576478bd32978f149019a9659b7870937abc923e0e","observation_id":"e9bd1dc6-d26d-46d9-868b-cfdd8533689f","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13702","last_updated":"2024-12-19T17:36:38Z","snapshot_observed_at":"2026-08-18T10:39:43.720912Z","submitted_at":"2024-12-18T10:45:24Z","title":"Typhoon 2: A Family of Open Text and Multimodal Thai Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13702","snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"Typhoon 2: A family of open text and multimodal thai large language models.arXiv preprint arXiv:2412.13702,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"cited_paper":"/paper/2412.13702","citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:6f8ec9807079e9e674d402d5d91146ed1bb57a6187ba55549375bd353ec53286","observation_id":"b612da92-67c7-438d-ab6d-48b0f42d664a","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"M., Rath, S","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:b52522f27c20c81f9ac1d0b5a19458788fcf646bc70254c867f2901414a31953","observation_id":"a50f25fd-bf8f-4ef4-94dc-22d87ae9cb24","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"Encoding of lexical tone in self-supervised models of spoken language","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:010d0bca066b00b5ac265ae06776e353bc0134628f8fe635ae2ea0ebd4ccf699","observation_id":"079264d7-a20e-480f-a1bc-fc98b826910f","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"V ., Montalan, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:51c4d116206297bf0f8ca407e44db0c4a57f2c48819a2a6ee9d9461e3aa16b93","observation_id":"8effd83b-ce1b-48ea-893c-66bd54962587","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:c7106947e977308705a9f3b2369f114316e7fa8f94664418745e212048ca0841","observation_id":"21d7e943-815b-4136-bfc0-c3f4d4ba9034","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14872","last_updated":"2025-05-19T12:48:01Z","snapshot_observed_at":"2026-08-15T16:07:43.509929Z","submitted_at":"2024-12-19T14:11:15Z","title":"Theoretical Proof that Auto-regressive Language Models Collapse when Real-world Data is a Finite Set","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14872","snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"Theoretical proof that auto-regressive language models collapse when real-world data is a finite set.arXiv preprint arXiv:2412.14872,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"cited_paper":"/paper/2412.14872","citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:4a8acbb09925d9887493bab19d2c130f6d0501d7ba97037ed9ca56e9e95af875","observation_id":"6a8cd09b-e550-44bf-ae45-8a3cc484b2f0","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"Speechalign: Aligning speech generation to human preferences.Advances in Neural Information Processing Systems, 37:50343–50360, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:4044ac41917fe55825a8cc826600543ff6d857e1f8eda6e0c4b1d23334a52ced","observation_id":"2ba1b052-2b71-40eb-9662-1d20a65d3f9c","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"and Maleki, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:22e754aebe8bc64ecfd3f8d0180db9d4b8a4541734c5dbd8c291729dff5d7ce9","observation_id":"0b40e008-94be-42c8-892c-44693658acbd","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"H., Yip, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:57e61a9d4a36eaebe1566ebd298a3f9833027893f60db8eb13a513abb1559ffb","observation_id":"36e13d81-5ccf-4e06-ba95-38fb2313201e","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:e1e1442cb5e9da4ee902d5251b0f82b8ffa8442723f54f6752861964bad21eb3","observation_id":"83ee14a3-95d2-4d98-9e1f-a50521d9375b","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"Table 11.General training hyperparameters across different stages","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:21ddc02de0b3730278baa21c5ce024f0647b46af1ef9a9af14dfe2a8bdd91662","observation_id":"95021f20-9325-447d-ae76-7452ed61dee5","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"Similarly, for Lao, we address its scriptio continua nature by employing the laonlp4 library for linguistic normalization and word segmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:8e308aad73f42efc27bc537bbf7ed6117c5f4356f2595564e211942131b807c8","observation_id":"fb7327e1-81f1-4f21-842e-4ec58a831baf","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 1 inbound Pith citation observation for arXiv:2605.27383."}