{"as_of":"2026-08-15T05:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:311d9cdef188d38003dec56b6b7177e9fabe69b09de32234f52597fe18cd9c66","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:20:26.977695Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:27:05.187538Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T17:41:06.244426Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18843","snapshot_observed_at":"2026-08-04T07:27:05.187538Z","title":"Under review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.25955","last_updated":"2026-06-22T12:55:18Z","snapshot_observed_at":"2026-08-13T09:10:45.495148Z","submitted_at":"2025-10-29T20:53:12Z","title":"SPEAR: A Unified SSL Framework for Learning Speech and Audio Representations","version":4},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T07:27:05.187538Z"},"links":{"cited_paper":"/paper/2506.18843","citing_paper":"/paper/2510.25955"},"observation_digest":"sha256:2ecb7f2666642884cfdafce36699e2327072e6bb04a144a865327060df4d6ce3","observation_id":"509a8141-b875-4dfd-a562-9bf5547bf3f3","resolution":{"observed_at":"2026-08-04T07:27:05.187538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"cited_work":{"arxiv_id":"2506.18843","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18843","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Usad: Universal speech and audio representation via distillation.arXiv preprint arXiv:2506.18843","venue":null,"work_id":"7b36bf96-cc69-440d-93c0-c978e50e271f","year":null},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-14T05:00:21.860788Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2506.18843","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:877f1d06c0009de79db0e26f82b16c046a728a77833c32dc950cf7ef853d71e1","observation_id":"b3c39e7d-ebbd-417a-bfa5-7ab57dcca0a4","resolution":{"observed_at":"2026-05-11T15:41:33.721376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"cited_work":{"arxiv_id":"2506.18843","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18843","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Usad: Universal speech and audio representation via distillation.arXiv preprint arXiv:2506.18843","venue":null,"work_id":"7b36bf96-cc69-440d-93c0-c978e50e271f","year":null},"citing_paper":{"arxiv_id":"2605.04547","last_updated":"2026-05-06T06:54:00Z","snapshot_observed_at":"2026-08-11T13:48:17.888197Z","submitted_at":"2026-05-06T06:54:00Z","title":"Stage-adaptive audio diffusion modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T17:21:34.140699Z"},"links":{"cited_paper":"/paper/2506.18843","citing_paper":"/paper/2605.04547"},"observation_digest":"sha256:b557289c218cdb9996da757cf6bee1c0f206a8e452a6aa0db411f390037c26f1","observation_id":"adc33ca8-be64-4795-a30f-20f8f644cdb5","resolution":{"observed_at":"2026-05-11T17:41:06.248596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.18843/citation-record","integrity":"/paper/2506.18843/integrity","json":"/paper/2506.18843/citation-record.json","paper":"/paper/2506.18843"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:20.950820Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:20.950820Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:12bc09e36445ad7d8e990b9d01b7750281fefd9fbc83d169e93ff226c0eafa56","observation_id":"9803bd2d-a80e-4467-8fd1-1bf7fce1c619","resolution":{"observed_at":"2026-08-06T23:20:20.950820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:35.069775Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"eaf21982-197b-474e-bbba-ad30a26ccc06","year":2021},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:21.019181Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:b1683089ed63aad193432614f4f6a8eebe0e22098f761d7c133846635ef7fd5c","observation_id":"2857be56-1e71-4949-81eb-aaefadcbb708","resolution":{"observed_at":"2026-08-06T23:20:35.149503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:34.888524Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"98835d1b-dee8-4cc6-855f-9f8589683b48","year":2022},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:21.120019Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:06508b7846681ed76f56c0e4746d249cb05c2b45ca207b9d922a2da3ac6dc728","observation_id":"9580200e-b490-45ad-a885-d27f022ad6f8","resolution":{"observed_at":"2026-08-06T23:20:34.969084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:34.684928Z","title":"Ssast: Self-supervised audio spectrogram transformer,","venue":null,"work_id":"1965df61-8c43-4e38-b821-b14fbc116a70","year":2022},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:21.326189Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:e231354e122e43359fd053b26b484716fe23d29eeac0665e753d065ce4f27e4a","observation_id":"bd83d77f-d534-4744-998f-41adca1bfe1c","resolution":{"observed_at":"2026-08-06T23:20:34.783760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:34.435057Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":"6da7fbc4-3a7c-47ab-a90c-3b60a9e6f1d3","year":2022},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:21.493407Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:a6dc361281c5b86191e35c37687a3864ffa7cd86683078ca6c8410c8fd09dedd","observation_id":"96f93f5c-1c38-446e-9399-342e15204231","resolution":{"observed_at":"2026-08-06T23:20:34.540726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:34.296890Z","title":"Mert: Acoustic music understanding model with large-scale self-supervised training,","venue":null,"work_id":"3f30a481-b17b-4493-95db-49fed30ae319","year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:21.664948Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:d82a09d28b3322db2bb17c44eae845279b776f4419e55b061107879a9301a680","observation_id":"4aa95dd6-9ff3-465d-bed9-f5714ff419ff","resolution":{"observed_at":"2026-08-06T23:20:34.366351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:34.087640Z","title":"Listen, think, and understand,","venue":null,"work_id":"8dbe288e-091a-45c6-a34f-e45fe4aee806","year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:21.782308Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:f873a3b5aed38138b036df42a0233ce115fd0ff991d861973db9a7a618beefb7","observation_id":"0ac23d43-ed8b-4c66-b5d7-b980a7db7d3a","resolution":{"observed_at":"2026-08-06T23:20:34.178286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:33.929062Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":"89f77afe-06d5-41ae-a309-94baff9df690","year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:21.848096Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:cd8e7a4a19fb3807646c7cfc5759ae221a5e02cd86eec9f6fe75f8748482e8d7","observation_id":"2797e9a3-3d69-4259-a68d-31139cf72acc","resolution":{"observed_at":"2026-08-06T23:20:33.985657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:33.807713Z","title":"Qwen2-audio technical report,","venue":null,"work_id":"fbc7674e-4252-40d6-90e8-b5c839309459","year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:21.989905Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:49348e90aac0689608d2b7a8da62d262ea31de43a124edf8fd907761f3d41915","observation_id":"adf77828-8d75-4f97-ab06-0a5b90908caa","resolution":{"observed_at":"2026-08-06T23:20:33.868863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:33.644004Z","title":"Gama: A large audio- language model with advanced audio understanding and complex rea- soning abilities,","venue":null,"work_id":"891f07a1-e64a-4b4f-94ce-821efa419fdd","year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:22.121921Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:4039de3cf1030dcbea66b608aebd9c007cdf2ceebc3236ecc15d27e283d2f82a","observation_id":"830cc216-8902-46d8-85d0-feafef981276","resolution":{"observed_at":"2026-08-06T23:20:33.707482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:33.530458Z","title":"Google usm: Scaling automatic speech recognition beyond 100 languages,","venue":null,"work_id":"b5e94df6-0d98-4d93-ba73-b2e7f110d00d","year":2023},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:22.232038Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:8b46568c14b9f8fc71275ab272b07226532dbb0e4b0538f60100e82f23e0514e","observation_id":"ed7d1c45-9811-4b44-876c-b7527602b483","resolution":{"observed_at":"2026-08-06T23:20:33.583245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:33.420434Z","title":"Speechtokenizer: Unified speech tokenizer for speech language models,","venue":null,"work_id":"9bf884cd-6b1e-4bb9-b076-b467cd30b966","year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:22.385294Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:bee0940c9ca4d83b5569fb0b5250402197dd8a28aa24d85b0be8cd767cec3a96","observation_id":"9b99dd78-a658-4556-8360-1871eac56571","resolution":{"observed_at":"2026-08-06T23:20:33.479959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:33.286594Z","title":"Soundstorm: Efficient parallel audio generation,","venue":null,"work_id":"099ec325-eefa-4b75-998d-be093b413f07","year":2023},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:22.542181Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:4e3736391c703cc7cc2f4e260028b58032bfd4b2ed991d4464806f8db58ed5fa","observation_id":"1aeebdb9-51bb-4a6d-9d2e-f833a35391ac","resolution":{"observed_at":"2026-08-06T23:20:33.361483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:33.133728Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":"41205442-fb14-404c-94d0-99134c872f1a","year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:22.709397Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:d898e1ae94d51981972f38257a98e8c499d1f7d2c33b4f9bf36972a0e7dcdfc4","observation_id":"f1cb00c9-0acf-4673-8a29-054a36ec84dd","resolution":{"observed_at":"2026-08-06T23:20:33.210165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:33.012845Z","title":"Dc-spin: A speaker-invariant speech tokenizer for spoken language models,","venue":null,"work_id":"0f19fe1d-221e-4c79-adcd-2a7a0b793c6e","year":2025},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:22.906742Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:f74daed34ca30800aea601293dd9a922eb422116afe22e232ed716e21e615e98","observation_id":"d9e96910-e0ac-4769-896e-4ecfa949cbbd","resolution":{"observed_at":"2026-08-06T23:20:33.081468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:32.891455Z","title":"Joint audio and speech understanding,","venue":null,"work_id":"5170493c-d62f-4cba-8347-ef2000e7fba3","year":2023},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:22.997389Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:ff2ba76c97fc1aefbc23579297707338e0e90954a8c85cf3c18e5c98a7efe0f8","observation_id":"a0c42ab5-3310-4048-9006-6d2db6be8ec1","resolution":{"observed_at":"2026-08-06T23:20:32.962859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:32.749106Z","title":"U-sam: An audio language model for unified speech, audio, and music understanding,","venue":null,"work_id":"f643c56a-e779-475d-aac7-6509d9c5e34a","year":2025},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:23.094069Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:a0c6836827d5bd377dd660bf4fec22f4af5f3637d6152a52b0e91856ab7eb18f","observation_id":"af58277e-7e2c-4572-be75-91a401135ca4","resolution":{"observed_at":"2026-08-06T23:20:32.826324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:32.662665Z","title":"CoLLD: Contrastive layer-to-layer distillation for compressing multi- lingual pre-trained speech encoders,","venue":null,"work_id":"f1c73e8b-9e06-414f-9bfa-317aff9cddc9","year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:23.166044Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:02b917b68b7584a5533f12d45bd06fcabd9072c4369cb796c33215a760010742","observation_id":"c3385d0f-2302-49f3-b9cb-942180b51746","resolution":{"observed_at":"2026-08-06T23:20:32.702387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:32.569009Z","title":"Mae-ast: Masked autoencoding audio spectrogram transformer,","venue":null,"work_id":"294b124b-98f1-4386-a734-1bca45f76bea","year":2022},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:23.277080Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:3acde41efcd4f98b811aa50e88a419b8ce8030625820006c76f4057cc06ee8f4","observation_id":"b2340a75-f99a-4c4b-9cc9-130ac425ffb7","resolution":{"observed_at":"2026-08-06T23:20:32.622842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:32.456492Z","title":"Masked spectrogram modeling using masked autoencoders for learning general-purpose audio representation,","venue":null,"work_id":"d518f5c8-2d67-4441-8f77-c90392eb17f9","year":2021},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:23.390695Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:ad905c4ec1049c5bf2c44f492402ea5c0b6bd117953479ef129d0d6731f7a153","observation_id":"21f37735-0ccd-47d3-82be-a112d6de1950","resolution":{"observed_at":"2026-08-06T23:20:32.506691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:23.535235Z","title":"Masked autoencoders that listen,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:23.535235Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:3380a1c59e77c4d217ea296fa64ac60227492ac8de09f97a473fde1af9489a00","observation_id":"f0bd5528-3a08-4a0c-8b9b-690bcee749fe","resolution":{"observed_at":"2026-08-06T23:20:23.535235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:32.265977Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language,","venue":null,"work_id":"0215a831-6086-41a0-bdcf-5cc108a4c40f","year":2022},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:23.677938Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:6ddb7788e2d1a2891e69e1ade7805c31ad9f5a8b0a64abad91630cdce3cd90ae","observation_id":"b12c6f02-375e-4ffc-9089-6363a8b22cf3","resolution":{"observed_at":"2026-08-06T23:20:32.295570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:32.173069Z","title":"Efficient self-supervised learning with contextualized target representations for vision, speech and language,","venue":null,"work_id":"a611573c-02f2-4162-8177-86e79828e5ea","year":2023},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:23.826605Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:47e31b1cf156d9ec5fd270198950824a4745775cf0c6c68eee7760132ec329f3","observation_id":"e8a8dcea-19d2-47e1-980f-e119fa9246b5","resolution":{"observed_at":"2026-08-06T23:20:32.234671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:32.075595Z","title":"Dinosr: Self-distillation and online clustering for self-supervised speech repre- sentation learning,","venue":null,"work_id":"4026f84a-70e1-45fa-b01f-b577d317fe81","year":2023},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:23.957169Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:d0dd6c875ad01842d1b817ef9dcc11e1c49375fc460c7578fa6942864662789c","observation_id":"cb9532be-b1a9-42b2-bd44-e3c451245d5b","resolution":{"observed_at":"2026-08-06T23:20:32.101137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:31.975810Z","title":"Eat: Self-supervised pre-training with efficient audio transformer,","venue":null,"work_id":"f205baa1-24c3-4b7c-8198-c983f9007985","year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:24.031734Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:baa0b7f1a42530669cef892bb32498ef49ab3c642a9c923b7d5c724838361c1a","observation_id":"2681e63e-d579-4757-b997-a9e21f2a0df1","resolution":{"observed_at":"2026-08-06T23:20:32.015670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:31.795491Z","title":"Sslam: Enhancing self-supervised models with audio mixtures for polyphonic soundscapes,","venue":null,"work_id":"e7d00f28-c0bb-4932-ba33-0d1f9564923a","year":2025},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:24.185064Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:56f9409a5b1fa46af2b8beda3c3fa909b0e030ee6b8300aba977b411c34b2363","observation_id":"59f5c611-2488-44ba-9586-f5601e530526","resolution":{"observed_at":"2026-08-06T23:20:31.851676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:31.623505Z","title":"Byol for audio: Self-supervised learning for general-purpose audio representation,","venue":null,"work_id":"437d8696-8407-4eab-9c48-a31d8f5907c9","year":2021},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:24.281964Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:4e70eccf383b0c955d7ae20a3b606cf6c814a89c42dee4daa918f48f969538e4","observation_id":"5afdf0c6-b789-492e-9204-ea3c020b92c7","resolution":{"observed_at":"2026-08-06T23:20:31.704745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:31.496132Z","title":"Self-supervised audio teacher-student transformer for both clip-level and frame-level tasks,","venue":null,"work_id":"86cc1dab-4320-4d40-8ebc-4997c4ca7014","year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:24.398795Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:80f53b8f64f30cb562cae806fc9634597bfd8cc11780d138ecd76c19c9483822","observation_id":"0f8249ce-4a93-4bc8-a80e-58a6b4792f51","resolution":{"observed_at":"2026-08-06T23:20:31.535281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:31.371052Z","title":"Masked modeling duo: Learning representations by encouraging both networks to model the input,","venue":null,"work_id":"a0ded82f-05ae-494c-a12e-7fb6319b717c","year":2023},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:24.493746Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:bffc65f5383de5ab6c1f0908c56494c639a96db92e4c43ab05e890aed401f464","observation_id":"4c8d1068-292d-4fbe-b655-ae6e422b240e","resolution":{"observed_at":"2026-08-06T23:20:31.423539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:31.270780Z","title":"DistilHuBERT: Speech rep- resentation learning by layer-wise distillation of hidden-unit bert,","venue":null,"work_id":"dcc2ff11-e84a-4203-8982-34a85fd7c280","year":2022},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:24.560928Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:36feddbf881ca0925d35ae0f11c9e98228c34c758e8d9a4548e3a3a3f5008cd4","observation_id":"349d3f1f-58f9-4cf5-b2b9-7b3a0324ee33","resolution":{"observed_at":"2026-08-06T23:20:31.310082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:31.171466Z","title":"Dphubert: Joint dis- tillation and pruning of self-supervised speech models,","venue":null,"work_id":"732c1b3f-20d3-4f8b-b724-77a1ee266ab3","year":2023},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:24.625963Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:23535bb03af6bba6c92165671260c0a549f221c2286042339cc094446a264a9e","observation_id":"13ca0c5e-f154-42ec-af26-02292cf4c903","resolution":{"observed_at":"2026-08-06T23:20:31.214849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:24.692213Z","title":"Dass: Distilled audio state space models are stronger and more duration- scalable learners,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:24.692213Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:db131ccc1259817890618574ab88d1dc51a541e34057f168cfb71587aee3b85c","observation_id":"8ce43848-a607-4024-8e75-8d684c6286a3","resolution":{"observed_at":"2026-08-06T23:20:24.692213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:31.015079Z","title":"Ensemble knowledge distillation of self- supervised speech models,","venue":null,"work_id":"1d68abb1-155f-4897-8e39-ee04382f1d53","year":2023},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:24.808046Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:e9f30ab564f1e4e3dd11463d1c02b672801082662e3af4ed02cb7d2daa6c9f62","observation_id":"03653dc8-1f29-4cfd-b528-f408fdcac4a2","resolution":{"observed_at":"2026-08-06T23:20:31.064742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:30.775585Z","title":"Distilling a speech and music encoder with task arithmetic,","venue":null,"work_id":"2b651899-0d7f-4e97-93e7-1001f53af6d9","year":2025},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:24.906549Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:35189f7bbff37bd3ffb9df7703030bb658d47df3143db918daf86927ce0130bc","observation_id":"71239d75-3b5b-4d83-bd53-4739d01a2d80","resolution":{"observed_at":"2026-08-06T23:20:30.875657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:30.585055Z","title":"Attention is all you need,","venue":null,"work_id":"191b8dce-38cc-4ff9-b363-c7e19bcb94e6","year":2017},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:24.997035Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:d238b15461adab963d9f1a1633675aff09a31d27dda92cc24e29cade9b005917","observation_id":"d0d6e2be-b8f1-4a92-a866-ce4130a97cdd","resolution":{"observed_at":"2026-08-06T23:20:30.686734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:30.339234Z","title":"Layer-wise analysis of a self- supervised speech representation model,","venue":null,"work_id":"6c784bb5-6cc9-4c6e-bc60-f6058768d0b1","year":2021},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:25.069275Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:98de49fa8946f98e9026a54a2b3379676d5c502e3aeb78550eb8295ab149f033","observation_id":"72a0f1f2-8997-4bd1-9b7f-1fa8c5e77264","resolution":{"observed_at":"2026-08-06T23:20:30.422581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:25.144389Z","title":"Robust speech recognition via large-scale weak super- vision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:25.144389Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:d3a3c3be403174db409c73a1c63633a2d97fa4bbe4b03fbb906b7c00b7576c8e","observation_id":"29cf1ab6-5aec-43ce-ae48-0e3f82afb655","resolution":{"observed_at":"2026-08-06T23:20:25.144389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:30.233084Z","title":"Librispeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":"6a6adc34-ca65-4a21-ad2e-068a40fdcb37","year":2015},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:25.242305Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:2859e2dceaaacf93451e9d0529b8c5d3dd4f943fc6bcff7c69fd7f4ac323e5c9","observation_id":"aa963bdb-c1a6-4c9b-b94b-0cc331f22410","resolution":{"observed_at":"2026-08-06T23:20:30.306828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:30.087314Z","title":"Libri-light: A benchmark for asr with limited or no supervision,","venue":null,"work_id":"fa189f52-80b0-493f-be2d-9484f48391df","year":2020},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:25.364102Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:6f1ca8f022a683fa81382a4570bc4ffcdc3e39883681c17512a8f3278e1c6202","observation_id":"5b88cdb2-f84d-4909-a1e6-5f15722888ad","resolution":{"observed_at":"2026-08-06T23:20:30.157667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:29.871642Z","title":"Mls: A large-scale multilingual dataset for speech research,","venue":null,"work_id":"bca072c0-5b84-4fe6-8497-a79e85cc6eab","year":2020},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:25.477593Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:0b057173b1f24ec9e8b635565398a9b49b2cfc6ea46ac7f155928d545debca2d","observation_id":"c24b73c5-4638-4bc6-8cc4-095b73dbadd2","resolution":{"observed_at":"2026-08-06T23:20:29.984380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:29.621087Z","title":"V oxPopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation,","venue":null,"work_id":"448175eb-a34c-4165-b3df-591df0c23851","year":2021},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:25.592409Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:9341cfeb2d2ad7fb2db82e86971b69baebac326f44f581e354c879a17e9bd5ac","observation_id":"70e7d4af-fe2e-449f-ab09-05f17da6fb30","resolution":{"observed_at":"2026-08-06T23:20:29.730479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:29.376298Z","title":"Gigaspeech: An evolving, multi- domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":"dba9aa3f-2158-421a-8382-bc8ad28213da","year":2021},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:25.710394Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:387627ba9c3a4287c506398868855101c6d9ab164dbf173f12ce70b9981644bc","observation_id":"d3bd4328-5d1c-4bef-9692-8674e551f07c","resolution":{"observed_at":"2026-08-06T23:20:29.469585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:29.233273Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":"4249f5e2-4e24-4013-a841-34c5fdd4dbda","year":2020},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:25.805425Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:fe0562aefe4a5e8741186b935a2df7ef0b6b9561c22646c584b27e9fdb203757","observation_id":"7a3a4c6c-d745-42b7-8974-4864d027eae2","resolution":{"observed_at":"2026-08-06T23:20:29.309280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:29.023196Z","title":"The fisher corpus: A resource for the next generations of speech-to-text","venue":null,"work_id":"b85408cc-db9c-4e96-a128-b4747af1d6f8","year":2004},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:25.937214Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:5e3f9140004dc42cd9762543aa0d8e0f1fee13f0cb6b6b81127a3037776755e3","observation_id":"3c27e679-e562-4d1b-a244-f98e5a118880","resolution":{"observed_at":"2026-08-06T23:20:29.137544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:28.859127Z","title":"V oxlingua107: a dataset for spoken language recognition,","venue":null,"work_id":"e5616a61-cf21-48a4-bde9-feadce0b1f4d","year":2021},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.051603Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:c259dec24e1101a804cc7dd37a471cec8671654c8943d40dee679d1a289b0117","observation_id":"287d4539-4ada-4f48-945e-e56defe31875","resolution":{"observed_at":"2026-08-06T23:20:28.955667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:26.141172Z","title":"Audio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.141172Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:a65e44a1133a1539aedee6d143c311576c459d81a914f6fb66c76a6e5d20f21e","observation_id":"ec99ff25-39c1-479f-af6c-f5297ae458f4","resolution":{"observed_at":"2026-08-06T23:20:26.141172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:28.712047Z","title":"Soundnet: Learning sound representations from unlabeled video,","venue":null,"work_id":"c3d92730-5ece-43f4-97bb-61063e778fe2","year":2016},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.187046Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:e6ac1138b5deee2cc12a2933cefbe0276475c950d3d323c37ab77ff3460755e0","observation_id":"5bfdbea0-dfaa-491d-b550-6c3049143255","resolution":{"observed_at":"2026-08-06T23:20:28.794265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:26.234805Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.234805Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:a536363418fa20cfdd0510c9d6bea6f94bce60af7713e05d051c5afc5270aaac","observation_id":"cde9ede7-e5e0-4ccd-87d9-c4566b585fc0","resolution":{"observed_at":"2026-08-06T23:20:26.234805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:28.592629Z","title":"Music4all: A new music database and its applications,","venue":null,"work_id":"3282bd68-5b06-494c-ac5c-92dc17d647d6","year":2020},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.272726Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:0dd9598183a6de026339c5a0e1f0bb99a5cfc1e1481c217f85ca066dc3caf0a6","observation_id":"10effc48-0b51-4139-aa79-29293a9bee66","resolution":{"observed_at":"2026-08-06T23:20:28.652831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:28.493843Z","title":"fairseq: A fast, extensible toolkit for sequence modeling,","venue":null,"work_id":"e6a426b2-9c8c-4d2f-ba49-f387cb9c36f7","year":2019},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.352239Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:f02167b698deaa782944e4266adb34107acd392f8816d4ac385d1bcb727c8684","observation_id":"38c9d75c-da90-4391-b0db-e86f3fa19f13","resolution":{"observed_at":"2026-08-06T23:20:28.543437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:28.339492Z","title":"Layer normalization,","venue":null,"work_id":"88f95174-82f2-40c4-a4fc-55d411c61628","year":2016},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.409954Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:01503faa275960bbe002a1c1a506dc353510fb8c73c2c87bf8f8ed25a1c87868","observation_id":"f5a81b72-a1be-4027-a593-5ac2b613813c","resolution":{"observed_at":"2026-08-06T23:20:28.411742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:28.204577Z","title":"Self-attention with relative position representations,","venue":null,"work_id":"60626736-c25d-4d79-9137-f3ce0c5149af","year":2018},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.471051Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:f1edee50b4a1f809981da586b85429d25f7e4dab3a67572afb948433860edf44","observation_id":"b6dc93b6-4b9d-40c9-afe1-92e3732586c1","resolution":{"observed_at":"2026-08-06T23:20:28.264759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:28.059651Z","title":"Speech commands: A dataset for limited-vocabulary speech recognition,","venue":null,"work_id":"683de712-1699-4911-9b0b-066f218785f5","year":2018},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.529521Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:02f1767a3cea9d9746c32a9859b04a5e92dded9e23feacdabe2a839c97757c6b","observation_id":"8f1808d9-5252-4f93-bbdd-6ed5c959396b","resolution":{"observed_at":"2026-08-06T23:20:28.140213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:27.843334Z","title":"SUPERB: Speech processing universal performance benchmark,","venue":null,"work_id":"a336cb31-8baa-43c9-898e-7f5fa6a6c3a9","year":2021},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.600823Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:3e9f168ed114a3e72c1f6913d1eea223d5b5c3b525bce5467010577b4957c7b6","observation_id":"b16ec7cc-281d-45e9-b90e-a5bac8a52c51","resolution":{"observed_at":"2026-08-06T23:20:27.959384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:27.664437Z","title":"SUPERB-SG: Enhanced speech processing universal PERformance benchmark for semantic and generative capabilities,","venue":null,"work_id":"f259e5e8-64f1-4b57-aba3-26a5911ef48e","year":2022},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.658300Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:4567d95731b3fc210ba845ccec4bd75f46a16303b5d9b83476dbd7cf09c8be68","observation_id":"4926ca56-4405-4134-acab-f5b787454b07","resolution":{"observed_at":"2026-08-06T23:20:27.723306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:27.542220Z","title":"A large-scale evaluation of speech foundation models,","venue":null,"work_id":"adb3c223-9e09-47e8-8a39-bee1a1b93123","year":2024},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.722253Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:4580a143b0f3c181d0d02d91a2eccc9d87442751cfe269f0a9766353d7f95c22","observation_id":"eb20a4d8-dfbf-478c-834c-61c39d3e8eea","resolution":{"observed_at":"2026-08-06T23:20:27.603002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:27.410228Z","title":"Hear: Holistic evaluation of audio representations,","venue":null,"work_id":"c6589f07-c50f-4207-bde6-e5c1b69cd3cb","year":2021},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.790110Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:514386855ede2878c2daec4a44586c8dd10e6d848ea98b4b1591b8250bd48cbd","observation_id":"3ef690ab-d0ea-4524-b326-34161c0a3c03","resolution":{"observed_at":"2026-08-06T23:20:27.479424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:27.241621Z","title":"ESC: Dataset for Environmental Sound Classification,","venue":null,"work_id":"78a22770-a19a-4cd1-a737-4f0b53ac76e1","year":2015},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.882696Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:b11c5afc507d630dcb91f18bf67c5ecd69645a18bd08d369951d68f0280ab712","observation_id":"20dcce66-1464-49a9-a821-5d5ab6a1bc5f","resolution":{"observed_at":"2026-08-06T23:20:27.325179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:27.061381Z","title":"Superb@ slt 2022: Challenge on generalization and efficiency of self-supervised speech representation learning,","venue":null,"work_id":"fc2278e5-e996-482c-87e3-364149045c0e","year":2022},"citing_paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:26.977695Z"},"links":{"citing_paper":"/paper/2506.18843"},"observation_digest":"sha256:d88c9e3fbca69f5ef23701af63c331a75ed2f55ffafd5acb36a7ff795ec2b21e","observation_id":"1c975ef0-3fe5-43a6-bd22-1e4d3b6f7699","resolution":{"observed_at":"2026-08-06T23:20:27.152485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.18843","last_updated":"2025-08-18T15:16:20Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-12T19:55:57.112671Z","submitted_at":"2025-06-23T17:02:00Z","title":"USAD: Universal Speech and Audio Representation via Distillation"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":53},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 3 inbound Pith citation observations for arXiv:2506.18843."}