{"as_of":"2026-08-08T06:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc6b299abdfe2ad78693685edd4668a29f995fd5d649c6c4fec90fd3d927c731","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:50:24.419823Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:50:21.863037Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:50:24.579818Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"cited_work":{"arxiv_id":"2505.23494","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23494","snapshot_observed_at":"2026-08-07T12:50:24.579818Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","venue":"cs.CL","work_id":"dcbc06da-c8f6-4f9b-ba3b-310f81f4c2d1","year":2025},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:21.863037Z"},"links":{"cited_paper":"/paper/2505.23494","citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:c32be1d8a070025b121f97aeb8d5b8ee2aa506ee5d9ae45903563c5133ec453f","observation_id":"640436c9-b19f-4ec4-a88f-559e3845649b","resolution":{"observed_at":"2026-08-07T12:50:24.646105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23494/citation-record","integrity":"/paper/2505.23494/integrity","json":"/paper/2505.23494/citation-record.json","paper":"/paper/2505.23494"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:30.031665Z","title":"In contrast to models that combine speech and text [2, 3], SLMs do not use text data in any of their components","venue":null,"work_id":"3ce1d11d-5e09-4f69-b1e6-1df83cc86d23","year":null},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:21.791105Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:31e5b54aa5a0c1410445f5dc39d6b5fdd89a32467a34a69e1f69bc72e45c2677","observation_id":"06608138-857a-45c2-92e7-a53bdda93974","resolution":{"observed_at":"2026-08-07T12:50:30.109714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"cited_work":{"arxiv_id":"2505.23494","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23494","snapshot_observed_at":"2026-08-07T12:50:24.579818Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","venue":"cs.CL","work_id":"dcbc06da-c8f6-4f9b-ba3b-310f81f4c2d1","year":2025},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:21.863037Z"},"links":{"cited_paper":"/paper/2505.23494","citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:c32be1d8a070025b121f97aeb8d5b8ee2aa506ee5d9ae45903563c5133ec453f","observation_id":"640436c9-b19f-4ec4-a88f-559e3845649b","resolution":{"observed_at":"2026-08-07T12:50:24.646105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:29.827097Z","title":null,"venue":null,"work_id":"3e0bbe0d-2d9e-43ee-896e-1ff955128f34","year":null},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:21.932155Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:d727bcc03e56eaaf15bce665bcecbc12d863576feea13d608d1dac80a9aba2a8","observation_id":"3b814737-64e9-4771-bfa9-1716d8f4b7b4","resolution":{"observed_at":"2026-08-07T12:50:29.932442Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:29.407475Z","title":"Tak- ing the results together, it appears that coarser units are not bene- ficial at the lowest levels in discriminating between isolated units like phones or words","venue":null,"work_id":"25d8a37f-880b-4fc2-918c-01b79c9dea5b","year":null},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:22.106834Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:e159dabeec71f271ae8cb18d120099ee4dacfaa46241f8993c695d33e1fffe73","observation_id":"9ddfc6f1-54c3-4ce5-984a-6b91fadfea7b","resolution":{"observed_at":"2026-08-07T12:50:29.507973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:29.176856Z","title":null,"venue":null,"work_id":"d861035b-7212-4083-a281-7d2dee22d2ea","year":null},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:22.203345Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:944a0abb9e113ffde43bc53162e81b694c30c9ca8345d80ed29cc7306a449c2d","observation_id":"594ca001-9469-49ee-8a06-c06c3a00fe86","resolution":{"observed_at":"2026-08-07T12:50:29.282842Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:28.000912Z","title":"AudioLM: a Language Modeling Approach to Audio Generation,","venue":null,"work_id":"1617a316-9f24-48d2-a28c-5946f9292a43","year":2023},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:22.687822Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:fbf84b037e39ad8699fbce338727b7c06752546e59eda8e916b3ac760beadef9","observation_id":"7ef9514b-7589-429e-95e3-b4a64a36e061","resolution":{"observed_at":"2026-08-07T12:50:28.086194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:28.955958Z","title":"The Zero Resource Speech Challenge 2021: Spoken language modelling,","venue":null,"work_id":"bd5046e9-7f47-4305-9d04-c0646e44ccad","year":2021},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:22.306799Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:40d2d89bb39d096d420d41f25ebef5f41ea9734080457b99b91b9089ce61afa2","observation_id":"7db108b4-b79c-4495-8c00-142e86899e3b","resolution":{"observed_at":"2026-08-07T12:50:29.052936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:28.780567Z","title":"Spirit LM: In- terleaved Spoken and Written Language Model,","venue":null,"work_id":"9cc415f2-20d5-48fc-8b74-6b71ff136080","year":2024},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:22.386496Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:340e8accd680b5e62db8823ddf2ae1d19a52d14edf6f329d2651abbd144900a6","observation_id":"b188f64b-b08f-45b9-b9ef-3693ed0f1568","resolution":{"observed_at":"2026-08-07T12:50:28.872823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:28.571714Z","title":"Textually Pretrained Speech Language Models,","venue":null,"work_id":"d0358a39-a827-4ddf-978e-ce8ac6126b65","year":2023},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:22.456920Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:6c00164e0ff6fc6cac82cc592275ed9a7a691331ee4f2eeba40d2b375e6e019c","observation_id":"beded2c7-2ab5-4525-b284-217e82c78857","resolution":{"observed_at":"2026-08-07T12:50:28.668155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:28.319578Z","title":"Improving Spoken Language Modeling with Phoneme Classification: A Simple Fine-tuning Approach,","venue":null,"work_id":"45f52e2f-ab7b-4493-adb4-aa85ddd272aa","year":2024},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:22.546163Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:713e63dea8434ef1964daf00e18662d9037a094fbacf5d3ac398532a3a8f2348","observation_id":"758ef516-dc6d-45e4-b7a4-c25630680688","resolution":{"observed_at":"2026-08-07T12:50:28.424550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:28.145346Z","title":"Generative Spoken Language Modeling From Raw Audio,","venue":null,"work_id":"da4f94b6-9e00-4197-affc-cba27af2968c","year":2021},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:22.618879Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:1c7fc67f8db5a3e732286b892af4443f3f3315018f3fd106493c42c809af12b5","observation_id":"b33f50b6-8350-4658-8bbd-fddc890e4db7","resolution":{"observed_at":"2026-08-07T12:50:28.229727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:26.912785Z","title":"Word Segmentation on Discovered Phone Units With Dynamic Programming and Self-Supervised Scoring,","venue":null,"work_id":"82cbb252-f9f3-43dd-9243-0bc162da617e","year":2023},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:23.158666Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:478ba45f818486f1e1f35748a84353a617992015894b3507bd1f46b1174b52d4","observation_id":"f0ae4a99-49fc-45e4-bda1-d03e3914f1a8","resolution":{"observed_at":"2026-08-07T12:50:27.027150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:27.840196Z","title":"Generative Spoken Language Model based on continuous word-sized audio tokens,","venue":null,"work_id":"87ee6063-3d21-4662-a9da-a569e1e2d008","year":2023},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:22.764354Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:c00f45e5d0810319fbf173a3773dbceb42f85f9756098159ac426db207b15ac0","observation_id":"47717e75-0284-4bec-86a6-4659c215d4ef","resolution":{"observed_at":"2026-08-07T12:50:27.939433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:27.602184Z","title":"Towards Unsupervised Phone and Word Segmentation Using Self-Supervised Vector-Quantized Neural Networks,","venue":null,"work_id":"7c149a26-d49b-44f8-82b6-1f554f81600e","year":2021},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:22.836392Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:a9d4176533683a69d93cf017055ad7b1e043650f57f8c5f83d175602bf5e518b","observation_id":"9b06804b-c2d4-41b3-bd76-678d11e96552","resolution":{"observed_at":"2026-08-07T12:50:27.702573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:27.349508Z","title":"Unsupervised Speech Segmentation and Variable Rate Represen- tation Learning Using Segmental Contrastive Predictive Coding,","venue":null,"work_id":"2bd27842-b1fe-4960-9d58-3fddf6eb1ac6","year":2002},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:22.943981Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:c2380afaa3b0d86c25887621962039b379e639fcac1b84dcc7dc497428901d07","observation_id":"61a5832a-ad4d-4e37-88b5-a91674fd415c","resolution":{"observed_at":"2026-08-07T12:50:27.475713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:27.208964Z","title":"SyllableLM: Learning Coarse Semantic Units for Speech Language Models,","venue":null,"work_id":"bcf5e128-3724-4186-86e0-59a0769693d5","year":2025},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:23.014485Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:0e9b26af95bd3d73861c4761725847eecc991fce64c5dfe8069b6fd705f1d93d","observation_id":"7c268e06-e551-404f-9937-ba858723430e","resolution":{"observed_at":"2026-08-07T12:50:27.276551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:27.097107Z","title":"Acoustic BPE for Speech Generation with Discrete tokens,","venue":null,"work_id":"12213591-77a4-40ec-ab3f-0712eeb9dd28","year":2024},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:23.086981Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:513d5c8bef12de6def1f23d477cd7250f5fce1b09e0d9faadc66344248c80693","observation_id":"e7d2421c-bdcd-4b3f-8360-55ca2a4c5a25","resolution":{"observed_at":"2026-08-07T12:50:27.149143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:25.820320Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding,","venue":null,"work_id":"0b2406db-39aa-43fc-9e5a-aa5d860bd326","year":2024},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:23.725495Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:a5cf0deaebcefee7a55dd99a5e6fc144815b02fd0148f1e72dc8709a12c73d5f","observation_id":"b94e3f04-6fdd-4c3b-8868-ca3affeb4840","resolution":{"observed_at":"2026-08-07T12:50:25.950311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:26.691041Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units,","venue":null,"work_id":"b3db6fa5-ccbb-455a-8b23-3a775d709a44","year":2021},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:23.225585Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:4e6355259b7706968d69bc70ae2a0604885e3c803d7392eb0ead00e73ffae38b","observation_id":"817d80d3-99c0-48ea-b483-836c5d35d3a0","resolution":{"observed_at":"2026-08-07T12:50:26.792797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:26.411103Z","title":"Wavlm: Large-Scale Self- Supervised Pre-training for Full Stack Speech Processing,","venue":null,"work_id":"87468896-8ec2-46a5-97ca-f4b9f01c441b","year":2021},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:23.288383Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:493fcab428ad70d45a529abe622e0c49eb1e9b6c33aa621592f0f38c5fd1836e","observation_id":"8c120ed1-fc07-47aa-9436-a887fba37f76","resolution":{"observed_at":"2026-08-07T12:50:26.564096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:23.356942Z","title":"LibriSpeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:23.356942Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:05142be1b669c68346d45426d2259b8971a750f4ac05381814dce8ae8151e67c","observation_id":"90e56f44-1b75-499f-8e4f-1c35eadb1e42","resolution":{"observed_at":"2026-08-07T12:50:23.356942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:26.280619Z","title":"The Faiss library,","venue":null,"work_id":"8ce75d3e-3366-4886-9b08-da2af4125da6","year":null},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:23.417379Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:3fb61e7eb76e1beb1c2368a5bdf666332d1b1c9fe782c9ae699fdb45c0dc1fe1","observation_id":"9977a396-35fd-47c9-b20f-134a59c3be16","resolution":{"observed_at":"2026-08-07T12:50:26.377408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:25.025579Z","title":"Evaluating context- invariance in unsupervised speech representations,","venue":null,"work_id":"c616665f-255d-4380-9b66-b892f37871d5","year":2023},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:24.208275Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:606549419520cbb227acb31f453944b0f8a55ff4b342656c6d2d07c4956dea54","observation_id":"abf61174-cbd9-4425-9c65-9a5fc5b9cd5a","resolution":{"observed_at":"2026-08-07T12:50:25.112820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:26.060789Z","title":"Mistral 7B,","venue":null,"work_id":"117f724d-0d35-48c8-a9af-918ec849496d","year":null},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:23.566053Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:dc185ac3c44b9c577c6a9499a83e83c4dd2bd6a94b28263d07b1b74f7f0202b0","observation_id":"28368bce-e9c1-45ba-ba6c-c93255fa2da1","resolution":{"observed_at":"2026-08-07T12:50:26.174289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:24.727612Z","title":"Libri-Light: A Benchmark for ASR with Limited or No Supervi- sion,","venue":null,"work_id":"3c1aa8ff-8cbf-44a2-a34c-a98f17501876","year":2020},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:24.419823Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:07bed4bbd76a338100212692bf88197bdfc72136b20972eda790fd5f17568a12","observation_id":"19ffa97b-0239-4ee9-bde9-251cccdb3674","resolution":{"observed_at":"2026-08-07T12:50:24.815306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:25.623600Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling,","venue":null,"work_id":"13058374-dfd9-4140-8e71-c02eef7cc2cb","year":2025},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:23.812663Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:ea4ea542d5c8fbf41fa1fc45962c629d1523e7fa8e598cbcc615e83d6eaeaf78","observation_id":"0658866f-b870-4cb7-95e7-211c87262de0","resolution":{"observed_at":"2026-08-07T12:50:25.703153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:25.418869Z","title":"ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering,","venue":null,"work_id":"b6c4f171-5cc5-431a-b320-925ed71cc66d","year":2025},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:23.956477Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:221cd9a14a5f3201d304a2ab0b7d88f76a2a8cb4c133b18fb1b6e8aec8290490","observation_id":"16d728c9-29b5-4158-bbbf-c953547cb8ec","resolution":{"observed_at":"2026-08-07T12:50:25.475685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:25.298470Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers,","venue":null,"work_id":"e206097b-32f1-4111-9b04-47c634795208","year":2023},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:24.086601Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:5ecf0e59a8767638a2455f3d8c3befe1c53613b59670dde33e6642c7ea471a83","observation_id":"d5230d25-7278-4221-b2cd-a8084f5ad431","resolution":{"observed_at":"2026-08-07T12:50:25.351109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:25.164274Z","title":"Evaluating Speech Features with the Minimal-Pair ABX Task: Analysis of the Classical MFC/PLP Pipeline,","venue":null,"work_id":"9a38ce0d-1d46-48be-9ebf-a406386e5666","year":2013},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:24.146667Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:c0fd9473b35a557e97db48630a0598511c7de309f5be2ff68969b7063460595b","observation_id":"fba35b79-cc95-451e-bba0-ca94dd66fbb1","resolution":{"observed_at":"2026-08-07T12:50:25.226943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:24.903709Z","title":"Rapid Evaluation of Speech Representations for Spoken Term Discovery,","venue":null,"work_id":"afbb6445-dd8b-4df6-ba37-358b699a0f83","year":2011},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:24.294980Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:e922591f6183ab7bc23160a5a9c45211a180f306c83d0391ad48f1bb77e0a341","observation_id":"6b7b2e66-7507-4d55-9319-a3a5086ba823","resolution":{"observed_at":"2026-08-07T12:50:24.978118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:29.607156Z","title":"manu- facture","venue":null,"work_id":"a239ad50-99b5-4537-8cbc-fc1b8f512f88","year":null},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:22.019652Z"},"links":{"citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:113901f2805cd5a3f9c887c5470199c80cc8d4cde64a7fc8b4328956079730c9","observation_id":"9225c9b3-3786-4681-8f8b-8855d4f6e34c","resolution":{"observed_at":"2026-08-07T12:50:29.700297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T12:50:23.642487Z","title":"Available: https://arxiv.org/abs/2310.06825","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:23.642487Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:14550d640238c9937c37fc6ff4b2f74a2524ac2ecdff3cf34448c52b1617122d","observation_id":"e5ebe4c4-413c-4be0-862b-44f3b691c8cc","resolution":{"observed_at":"2026-08-07T12:50:23.642487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08281","last_updated":"2025-10-23T09:36:08Z","snapshot_observed_at":"2026-07-31T05:45:37.385210Z","submitted_at":"2024-01-16T11:12:36Z","title":"The Faiss library","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08281","snapshot_observed_at":"2026-08-07T12:50:23.487919Z","title":"Available: https://arxiv.org/abs/2401.08281","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:23.487919Z"},"links":{"cited_paper":"/paper/2401.08281","citing_paper":"/paper/2505.23494"},"observation_digest":"sha256:65d38af503cbcfc455f1efb2f6a33e24327248e7ca421d7f8b30bc85f09baab2","observation_id":"0b8a60cf-a6a6-4d63-b018-23c722a78db3","resolution":{"observed_at":"2026-08-07T12:50:23.487919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23494","last_updated":"2025-05-29T14:43:48Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T12:42:35.393833Z","submitted_at":"2025-05-29T14:43:48Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":1,"verified_fuzzy":27},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 1 inbound Pith citation observation for arXiv:2505.23494."}