{"as_of":"2026-08-09T04:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3a4b0741b46542673b834c4f0de73a92e7af376528e4147b19257871f62bdc9c","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T22:51:44.257192Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T22:51:39.700059Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15537","snapshot_observed_at":"2026-08-02T22:51:39.700059Z","title":"Standard benchmarks have been developed that assess how well these models capture lexical, syntactic, and semantic properties [15, 16]","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:39.700059Z"},"links":{"cited_paper":"/paper/2602.15537","citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:90fb3086378a6895db0a8c7749d245d97f62f56dc26e90cb7f60d9d914739abf","observation_id":"9b5cc2af-be8c-460a-b457-bc1102c3223c","resolution":{"observed_at":"2026-08-02T22:51:39.700059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.15537/citation-record","integrity":"/paper/2602.15537/integrity","json":"/paper/2602.15537/citation-record.json","paper":"/paper/2602.15537"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:39.638708Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:39.638708Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:9badc686043a18b9bf255e01a612defef3be91dd477c87a5123f999b346ff099","observation_id":"5a2724dc-84b1-4933-b7fe-c1c7311ad345","resolution":{"observed_at":"2026-08-02T22:51:39.638708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15537","snapshot_observed_at":"2026-08-02T22:51:39.700059Z","title":"Standard benchmarks have been developed that assess how well these models capture lexical, syntactic, and semantic properties [15, 16]","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:39.700059Z"},"links":{"cited_paper":"/paper/2602.15537","citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:90fb3086378a6895db0a8c7749d245d97f62f56dc26e90cb7f60d9d914739abf","observation_id":"9b5cc2af-be8c-460a-b457-bc1102c3223c","resolution":{"observed_at":"2026-08-02T22:51:39.700059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:39.771347Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:39.771347Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:639fc5fa7227aa58158472ecc735dcb55f13e8f283fdf57c70c0b6b1a443d7b3","observation_id":"92db26e8-beb5-42a4-9182-7b9685a6fda5","resolution":{"observed_at":"2026-08-02T22:51:39.771347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:39.844483Z","title":"manufacturer,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:39.844483Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:916b9bebbd4ca935115d71ec088c017cf9ddc83f85dc17cf803f11e623e67f7f","observation_id":"ec4fd5b6-ea07-43fc-ba21-10a347b6c0d8","resolution":{"observed_at":"2026-08-02T22:51:39.844483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:39.941788Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:39.941788Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:a3505038de1ae28ed74f92f3ef498dd6ae0c07e00046c9e0316fb000c4e2d1e5","observation_id":"e05fd215-dba4-4471-88b0-8974fa6a0e51","resolution":{"observed_at":"2026-08-02T22:51:39.941788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:40.096092Z","title":"By leveraging feature norms from a frozen SSL model (WavLM Large), ZeroSyl eliminates the complex multi-stage methods required by prior state-of-the-art syllabic tokenizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:40.096092Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:75f1d7513d68578e4053df79e6b0acd0e2ab6c6348bf7687229c63261f380cdf","observation_id":"3a30aede-289b-4651-a82b-34ac4138aaf9","resolution":{"observed_at":"2026-08-02T22:51:40.096092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:40.232329Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:40.232329Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:f4ca9515cc6fd6a8f3a117e8847e9b7de8f7a7e50eb41a05822061adb9e52629","observation_id":"b11c5d75-e945-452c-a0e7-673b2a08cbfb","resolution":{"observed_at":"2026-08-02T22:51:40.232329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:40.378773Z","title":"Self-Supervised Speech Representation Learning: A Review,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:40.378773Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:e0b3b376bea46b77542200f4d181ca0a8375da548240d43cb2f0857b9b101928","observation_id":"569f43d8-3730-4256-8f51-f15529dc1e9a","resolution":{"observed_at":"2026-08-02T22:51:40.378773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:40.439700Z","title":"Self-Supervised Lan- guage Learning From Raw Audio: Lessons From the Zero Re- source Speech Challenge,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:40.439700Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:54033e6bd4d7d22f6d6841b5577ca55a6c9e92ca26792671ebcaf0129969fcec","observation_id":"908e30d1-0baf-4d96-ae02-b90bea9e758b","resolution":{"observed_at":"2026-08-02T22:51:40.439700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:40.575509Z","title":"On Generative Spoken Language Modeling from Raw Audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:40.575509Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:e43a97771e0836f3ad5ddb671338cdbe8bdd716bee09774cbed44089c88f1758","observation_id":"ddc974b0-e493-466c-80e5-82770f1dcff9","resolution":{"observed_at":"2026-08-02T22:51:40.575509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:40.729931Z","title":"AudioLM: A Language Modeling Approach to Audio Generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:40.729931Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:72c1407037d967c5d2b8b9e262882441b0f3a52b85726cbb25c0ac0bd4498f53","observation_id":"32cccbc6-6e68-4d98-a2c4-657dc92d64eb","resolution":{"observed_at":"2026-08-02T22:51:40.729931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:40.824151Z","title":"w2v-BERT: Combining Contrastive Learning and Masked Language Modeling for Self-Supervised Speech Pre-Training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:40.824151Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:95a94d7330a69d51a075ad4cb035b7ef6b48d3249ef146c52dc6226e03b4ffab","observation_id":"d607a998-43ce-4bd6-b252-28fd86e25d33","resolution":{"observed_at":"2026-08-02T22:51:40.824151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:41.017062Z","title":"Scaling Properties of Speech Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:41.017062Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:10073a66394959b52aae29cc1999dcc21d5189f90f89d3a36185a03ea31bbb6f","observation_id":"45d80510-7194-4ff1-ba8f-eacc82b5147e","resolution":{"observed_at":"2026-08-02T22:51:41.017062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:41.124518Z","title":"SpidR: Learning Fast and Stable Linguistic Units for Spoken Language Models Without Supervision,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:41.124518Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:9ae569acfda8acf486b25fcef79abfe02db08c817f570189c56474d06ade8e64","observation_id":"71cc6aa4-dd04-4e29-b051-ca84f09a0588","resolution":{"observed_at":"2026-08-02T22:51:41.124518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:41.236292Z","title":"Generative Spoken Language Model Based on Continuous Word-Sized Audio Tokens,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:41.236292Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:8787c91335c1e62a0f4ae8af6311fefea0d0544c46b4886bcaeee329c99eb1ec","observation_id":"634142eb-3115-4a54-baff-2656e5238e47","resolution":{"observed_at":"2026-08-02T22:51:41.236292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:41.325306Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:41.325306Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:a57f16524fda94c3439493ad65110a1c9bec0ce36d898eb3e8ce10406c55ffdb","observation_id":"3087aa99-0c39-492e-a3c1-32453587d80c","resolution":{"observed_at":"2026-08-02T22:51:41.325306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:41.513349Z","title":"Sylber: Syllabic Embedding Repre- sentation of Speech from Raw Audio,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:41.513349Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:8f5eb9b17a47f5687f1db142af3c5ee53f93edb785cac33e49ed13dd2253cf75","observation_id":"74d9ad02-41cb-49ec-a1f3-e0048a743bc9","resolution":{"observed_at":"2026-08-02T22:51:41.513349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:41.620796Z","title":"SyllableLM: Learning Coarse Semantic Units for Speech Language Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:41.620796Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:b6788fd7b450b75ebb43fc10db00e0abd0ca6ca2623ebf6250ba04fc5cd48b4d","observation_id":"cfa2ee3e-09a2-42c7-8e80-23e1283fb2cd","resolution":{"observed_at":"2026-08-02T22:51:41.620796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:41.743514Z","title":"WavLM: Large-Scale Self- Supervised Pre-Training for Full Stack Speech Processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:41.743514Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:194425bf43e039add6f4ae5c4e0c23dc246ab01ed846539715820af23cbe223e","observation_id":"36bf79a9-56e0-4c2e-a5e8-5c98b6828845","resolution":{"observed_at":"2026-08-02T22:51:41.743514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-02T22:51:41.884430Z","title":"OPT: Open Pre-trained Transformer Language Models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:41.884430Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:c3dbf603e6c22d0177c10968c7f3822cb8927bf7cb8481d0063292128d7a802e","observation_id":"80dcf8b2-1ed9-4bd5-9ff9-e2271e83f1b9","resolution":{"observed_at":"2026-08-02T22:51:41.884430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:41.994416Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Sur- vey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:41.994416Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:46b39e8b22e5c92106253f3f6e95b626b69082168f71003bbc88d208f818f985","observation_id":"c5244a5d-c6a9-4d7d-bf7f-20bab8e9abe9","resolution":{"observed_at":"2026-08-02T22:51:41.994416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:42.141907Z","title":"The Zero Resource Speech Challenge 2021: Spoken language modelling,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:42.141907Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:29b831fd2fe792f67ccb7e35c220fc4922e5562aa7ce8f3106e621565c205b82","observation_id":"b6389fb6-729c-4ed1-898d-2643d3c68e04","resolution":{"observed_at":"2026-08-02T22:51:42.141907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:42.260479Z","title":"Textually Pretrained Speech Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:42.260479Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:54a81324cafbd6a5650212c61ce3a7ebbc8f2d189425e4ebb5f4c03b285904ce","observation_id":"80109e63-1e86-4912-b113-114f201ff291","resolution":{"observed_at":"2026-08-02T22:51:42.260479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:42.457422Z","title":"SD-HuBERT: Sentence-Level Self-Distillation In- duces Syllabic Organization in HuBERT,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:42.457422Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:5087f817af074ed93e8a8aab9ceb35ab04c813db6e7bab9830b52aefc4b9c7f5","observation_id":"dbd0c015-949c-492d-8beb-dfef5a38e36c","resolution":{"observed_at":"2026-08-02T22:51:42.457422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:42.548204Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:42.548204Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:f89cdda777284f80c0960b4910410704b4edfa10677549590cc08c8a8d9af52b","observation_id":"20a65383-33bf-49b6-8e53-45620eee2b40","resolution":{"observed_at":"2026-08-02T22:51:42.548204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:42.654043Z","title":"What Do Self- Supervised Speech Models Know About Words?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:42.654043Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:f7fb56e170f6b6f4aecbb89f675189a02293295a0de682b4edf7198a87af6d6e","observation_id":"5335851a-71ee-4d93-a9f2-de01830d88dd","resolution":{"observed_at":"2026-08-02T22:51:42.654043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:42.771487Z","title":"A Computational Model for Unsuper- vised Word Discovery,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:42.771487Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:2fde8f6b58b0628885e7efa7aea7afc0405b971a4f5ea31e1fb8cd720baf94f6","observation_id":"b0c58d39-254d-4147-a4f8-6c619a44f3d5","resolution":{"observed_at":"2026-08-02T22:51:42.771487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:42.912427Z","title":"Unsupervised Word Discovery: Boundary Detection with Clustering vs. Dynamic Pro- gramming,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:42.912427Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:3db15c04ad5db40eb696acf8f53504d5a892ae1c76af48c54d66688902af12b5","observation_id":"41072480-7c04-4fc0-8890-61b690f5aa2b","resolution":{"observed_at":"2026-08-02T22:51:42.912427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19204","last_updated":"2025-07-28T14:43:23Z","snapshot_observed_at":"2026-08-06T14:24:56.139962Z","submitted_at":"2025-07-25T12:19:16Z","title":"Should Top-Down Clustering Affect Boundaries in Unsupervised Word Discovery?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19204","snapshot_observed_at":"2026-08-02T22:51:43.039657Z","title":"Should Top-Down Clustering Affect Boundaries in Unsupervised Word Discovery?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:43.039657Z"},"links":{"cited_paper":"/paper/2507.19204","citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:2f92c919773a1a188f9df9117b55e1fae6f705a7c6d66adc6b33db53d0670666","observation_id":"8ec74310-3cdb-4aec-b1cb-b84f63f40ed8","resolution":{"observed_at":"2026-08-02T22:51:43.039657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:43.152010Z","title":"Comparative layer-wise analysis of self-supervised speech models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:43.152010Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:87e95661698e875df61bfd50154fa6e36cf021d8c1c07129c434f16a5dfe4b13","observation_id":"a46740af-3a65-4d40-a6a9-919448b5c92f","resolution":{"observed_at":"2026-08-02T22:51:43.152010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:43.310477Z","title":"LibriSpeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:43.310477Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:752acde4b4d8b9061fff90ed3e4ded125b6022acafc10b3295dc02075097ed4f","observation_id":"58bab7bd-af8c-40c8-84e2-08472bda94e7","resolution":{"observed_at":"2026-08-02T22:51:43.310477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:43.507048Z","title":"The Faiss library,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:43.507048Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:d6c46c05975377a83cffe55273377d1e78c77fc9c984fec1c1b615520313a171","observation_id":"bcbe4188-94dd-482b-90cd-8be818211d98","resolution":{"observed_at":"2026-08-02T22:51:43.507048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:43.697544Z","title":"Libri-Light: A Benchmark for ASR with Limited or No Supervi- sion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:43.697544Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:f80429ba156673c6f0cb52e731de35e7554c0b2c1e089a527d828b5857328ead","observation_id":"644889f1-3634-4fff-8eb7-eddb31f40b7b","resolution":{"observed_at":"2026-08-02T22:51:43.697544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:43.800836Z","title":"Montreal Forced Aligner: Trainable Text-Speech Alignment Using Kaldi,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:43.800836Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:0d611b6a1c44d73e0fc6ab75e613d9a814c8a50fc9ddc69d2c19834b63061627","observation_id":"7bc85b8e-b30e-43db-ab9e-836171c13406","resolution":{"observed_at":"2026-08-02T22:51:43.800836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:43.899621Z","title":"Python module for syllabifying English ARPABET transcriptions,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:43.899621Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:eb818f90d7ff93be0042b0b0eba2037e5a03f2040531670b00d25db93890b187","observation_id":"3023e730-9ab6-4b94-a863-8880220d9770","resolution":{"observed_at":"2026-08-02T22:51:43.899621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:44.025746Z","title":"An improved speech segmentation quality measure: the R-value,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:44.025746Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:c8b0e9ff3881415d0f652fa6ba0710ff4c4f362b7e95535870b2fbf356e23947","observation_id":"e3e5fd01-f8f5-4690-bde1-31c4a5fcdb8a","resolution":{"observed_at":"2026-08-02T22:51:44.025746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:44.118442Z","title":"On the robust automatic segmentation of spontaneous speech,","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:44.118442Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:32db0fb3a8d95cc073cef2777019588032ded4bfbdf2b414d4e724ddfeb2e2a6","observation_id":"3a8a7031-b2e1-449b-b163-449ae689dd00","resolution":{"observed_at":"2026-08-02T22:51:44.118442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-02T22:51:44.257192Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:44.257192Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:0d199cbcf8b11f4c6228f84d9ad99ecad374cf5445bd43c382f09686e3861540","observation_id":"0905b55d-e95d-4f7f-be9b-717b67a9e59b","resolution":{"observed_at":"2026-08-02T22:51:44.257192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08281","last_updated":"2025-10-23T09:36:08Z","snapshot_observed_at":"2026-07-31T05:45:37.385210Z","submitted_at":"2024-01-16T11:12:36Z","title":"The Faiss library","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08281","snapshot_observed_at":"2026-08-02T22:51:43.594317Z","title":"Available: https://arxiv.org/abs/2401.08281","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:43.594317Z"},"links":{"cited_paper":"/paper/2401.08281","citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:bcef7bcc21d687caf4dd668c3659f87801509b28c92d2489354fcf0a64c1223f","observation_id":"1bd3368c-f93f-452e-bbe2-67be22b86ee2","resolution":{"observed_at":"2026-08-02T22:51:43.594317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-02T22:51:38.910400Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2602.15537."}