{"as_of":"2026-08-16T13:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:02ac4edf42d35e882427642adadb8791cfa832f583054a3dc6c2a5ca8a9c416b","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T13:47:17.319518Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.16131/citation-record","integrity":"/paper/2501.16131/integrity","json":"/paper/2501.16131/citation-record.json","paper":"/paper/2501.16131"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:17.598271Z","title":"Dimensionality reduction by learning an invariant mapping,","venue":null,"work_id":"726d12c9-1676-4a15-a262-d94f9dacebad","year":2006},"citing_paper":{"arxiv_id":"2501.16131","last_updated":"2025-01-27T15:20:50Z","snapshot_observed_at":"2026-08-16T11:26:50.860751Z","submitted_at":"2025-01-27T15:20:50Z","title":"Optimized Self-supervised Training with BEST-RQ for Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:17.243630Z"},"links":{"citing_paper":"/paper/2501.16131"},"observation_digest":"sha256:eed8a54505a8638633fea6232382678c3d1348ae11d86025fdf2c275f8072be0","observation_id":"a96fabe4-bc40-43d8-9635-47cb881872ad","resolution":{"observed_at":"2026-08-10T13:47:17.603753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:17.581591Z","title":"BERT: Pre- training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"7dd3b6d2-354b-4b81-b72c-adfd9698e82a","year":2019},"citing_paper":{"arxiv_id":"2501.16131","last_updated":"2025-01-27T15:20:50Z","snapshot_observed_at":"2026-08-16T11:26:50.860751Z","submitted_at":"2025-01-27T15:20:50Z","title":"Optimized Self-supervised Training with BEST-RQ for Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:17.249219Z"},"links":{"citing_paper":"/paper/2501.16131"},"observation_digest":"sha256:3fab9109cf67a3abb58c6eb921467d58ba31a6df8772a350082d76934b75420f","observation_id":"aff1bf93-d8ed-4166-871d-c23091c0d72a","resolution":{"observed_at":"2026-08-10T13:47:17.586921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:17.565241Z","title":"wav2vec 2.0: a framework for self-supervised learning of speech representations,","venue":null,"work_id":"deb69d8e-c520-4e0a-a157-b8e7e84db9b4","year":2020},"citing_paper":{"arxiv_id":"2501.16131","last_updated":"2025-01-27T15:20:50Z","snapshot_observed_at":"2026-08-16T11:26:50.860751Z","submitted_at":"2025-01-27T15:20:50Z","title":"Optimized Self-supervised Training with BEST-RQ for Speech Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:17.254391Z"},"links":{"citing_paper":"/paper/2501.16131"},"observation_digest":"sha256:272a5021f64660e10baf7b7c8320da16fa3f0c5518f69cb5582e9e15e55a6eb4","observation_id":"d789b403-8e51-4569-943e-ce6f0987d45d","resolution":{"observed_at":"2026-08-10T13:47:17.570600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:17.548337Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"24df74d8-3bde-47e6-a5aa-0ef3bfaf7808","year":2021},"citing_paper":{"arxiv_id":"2501.16131","last_updated":"2025-01-27T15:20:50Z","snapshot_observed_at":"2026-08-16T11:26:50.860751Z","submitted_at":"2025-01-27T15:20:50Z","title":"Optimized Self-supervised Training with BEST-RQ for Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:17.259748Z"},"links":{"citing_paper":"/paper/2501.16131"},"observation_digest":"sha256:165e9fdeffa33b3bb43224c0a9e09316946516257f2507fa94fa60a83f5ad02d","observation_id":"725ebc9e-3e5d-46e7-97b4-1e3ff03a5a1f","resolution":{"observed_at":"2026-08-10T13:47:17.553824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:17.265186Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16131","last_updated":"2025-01-27T15:20:50Z","snapshot_observed_at":"2026-08-16T11:26:50.860751Z","submitted_at":"2025-01-27T15:20:50Z","title":"Optimized Self-supervised Training with BEST-RQ for Speech Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:17.265186Z"},"links":{"citing_paper":"/paper/2501.16131"},"observation_digest":"sha256:51091e1efe8d22f2b204f686c4223f865dbfab77179c7e74333d8120edf112be","observation_id":"85051f18-8a61-470f-99b9-b8b9af738568","resolution":{"observed_at":"2026-08-10T13:47:17.265186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:17.520301Z","title":"w2v-bert: Combining contrastive learning and masked language modeling for self-supervised speech pre-training,","venue":null,"work_id":"7357e00d-b0c7-4d1a-8829-cf8cdb1028dd","year":2021},"citing_paper":{"arxiv_id":"2501.16131","last_updated":"2025-01-27T15:20:50Z","snapshot_observed_at":"2026-08-16T11:26:50.860751Z","submitted_at":"2025-01-27T15:20:50Z","title":"Optimized Self-supervised Training with BEST-RQ for Speech Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:17.270491Z"},"links":{"citing_paper":"/paper/2501.16131"},"observation_digest":"sha256:4e15cd92cffdf683cd2c5a4dbdd98cc86bfb27e4880cf48e7f8c405200be9894","observation_id":"60a3f2e3-d435-4d38-9d9e-a1da5fe54704","resolution":{"observed_at":"2026-08-10T13:47:17.526007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:17.504229Z","title":"Self-supervised learning with random-projection quantizer for speech recognition,","venue":null,"work_id":"34e52426-0a5a-4efb-9d71-45f91b79132c","year":2022},"citing_paper":{"arxiv_id":"2501.16131","last_updated":"2025-01-27T15:20:50Z","snapshot_observed_at":"2026-08-16T11:26:50.860751Z","submitted_at":"2025-01-27T15:20:50Z","title":"Optimized Self-supervised Training with BEST-RQ for Speech Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:17.275913Z"},"links":{"citing_paper":"/paper/2501.16131"},"observation_digest":"sha256:cde618d31b6b4f187633c11e6b3226cc995885dfa8591de0b42a1450137e0be4","observation_id":"97264ef8-6afa-4330-865e-c6b785768671","resolution":{"observed_at":"2026-08-10T13:47:17.509306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:17.486227Z","title":"Accented speech recognition with accent-specific codebooks,","venue":null,"work_id":"d7a1ca61-b077-4d60-8b60-740e742e63ae","year":2023},"citing_paper":{"arxiv_id":"2501.16131","last_updated":"2025-01-27T15:20:50Z","snapshot_observed_at":"2026-08-16T11:26:50.860751Z","submitted_at":"2025-01-27T15:20:50Z","title":"Optimized Self-supervised Training with BEST-RQ for Speech Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:17.280931Z"},"links":{"citing_paper":"/paper/2501.16131"},"observation_digest":"sha256:6eed74196ef908b5349935431ce73636a0b8a4e7699327d039774bfacb0cbc93","observation_id":"0ad1cff6-a138-4fcb-88c5-b416468683e7","resolution":{"observed_at":"2026-08-10T13:47:17.491993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:17.467432Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":"7fb7d247-d7b0-478a-9af2-65f3a37ab2d9","year":2020},"citing_paper":{"arxiv_id":"2501.16131","last_updated":"2025-01-27T15:20:50Z","snapshot_observed_at":"2026-08-16T11:26:50.860751Z","submitted_at":"2025-01-27T15:20:50Z","title":"Optimized Self-supervised Training with BEST-RQ for Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:17.285620Z"},"links":{"citing_paper":"/paper/2501.16131"},"observation_digest":"sha256:a01f63c847f90671208345bb5e24441c12f26a6a61a93a1a8387a9904b5b78d5","observation_id":"3e719735-0d6e-485e-b694-54f129509594","resolution":{"observed_at":"2026-08-10T13:47:17.473170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-13T12:33:46.085209Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-10T13:47:17.290335Z","title":"Google usm: Scaling automatic speech recognition beyond 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16131","last_updated":"2025-01-27T15:20:50Z","snapshot_observed_at":"2026-08-16T11:26:50.860751Z","submitted_at":"2025-01-27T15:20:50Z","title":"Optimized Self-supervised Training with BEST-RQ for Speech Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:17.290335Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2501.16131"},"observation_digest":"sha256:d4d6007cc9d9d5cf7e94263c7b574f5bccba61af67bc9c961d541d5aa5bf0346","observation_id":"5f973d7c-9d6b-406d-b372-1ed5cbc720f6","resolution":{"observed_at":"2026-08-10T13:47:17.290335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:17.449803Z","title":"Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences,","venue":null,"work_id":"a4ce70e5-b5ee-4726-a8f6-2a8bc7a14963","year":1980},"citing_paper":{"arxiv_id":"2501.16131","last_updated":"2025-01-27T15:20:50Z","snapshot_observed_at":"2026-08-16T11:26:50.860751Z","submitted_at":"2025-01-27T15:20:50Z","title":"Optimized Self-supervised Training with BEST-RQ for Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:17.295339Z"},"links":{"citing_paper":"/paper/2501.16131"},"observation_digest":"sha256:589093494a8b4646c49cd3039ad798a8117197fea0a00df10a4c0b2f065c6595","observation_id":"8e98a78f-249c-413a-800e-98f62d2a6e4c","resolution":{"observed_at":"2026-08-10T13:47:17.455374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:17.432667Z","title":"Music type classification by spectral contrast feature,","venue":null,"work_id":"5205117a-821e-4e26-a238-eb2a6e7a7818","year":2002},"citing_paper":{"arxiv_id":"2501.16131","last_updated":"2025-01-27T15:20:50Z","snapshot_observed_at":"2026-08-16T11:26:50.860751Z","submitted_at":"2025-01-27T15:20:50Z","title":"Optimized Self-supervised Training with BEST-RQ for Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:17.300055Z"},"links":{"citing_paper":"/paper/2501.16131"},"observation_digest":"sha256:b65c25b17f91fbac45f3a7a2d5f51d3f6b36ebd53196e9e84908d44ddb54afb7","observation_id":"521f2622-3fb5-4a68-b9e1-21d54b2c21e4","resolution":{"observed_at":"2026-08-10T13:47:17.438158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:17.415915Z","title":"Open imple- mentation and study of best-rq for speech processing,","venue":null,"work_id":"e3f10c40-39e5-4fba-a407-eeee46012791","year":2024},"citing_paper":{"arxiv_id":"2501.16131","last_updated":"2025-01-27T15:20:50Z","snapshot_observed_at":"2026-08-16T11:26:50.860751Z","submitted_at":"2025-01-27T15:20:50Z","title":"Optimized Self-supervised Training with BEST-RQ for Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:17.304882Z"},"links":{"citing_paper":"/paper/2501.16131"},"observation_digest":"sha256:647927b77fbea5adc37b87c425c766059b04dc15f3934eeff2b400c6d691ad77","observation_id":"77dc82c6-5b12-4629-a2ac-e051cacc9bcc","resolution":{"observed_at":"2026-08-10T13:47:17.421102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-14T05:20:02.331354Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-10T13:47:17.309498Z","title":"SpeechBrain: A general- purpose speech toolkit,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.16131","last_updated":"2025-01-27T15:20:50Z","snapshot_observed_at":"2026-08-16T11:26:50.860751Z","submitted_at":"2025-01-27T15:20:50Z","title":"Optimized Self-supervised Training with BEST-RQ for Speech Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:17.309498Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2501.16131"},"observation_digest":"sha256:46580da119b04f94596088914446cfff541ba7adf0bab456a8b4878a0891091c","observation_id":"a5002357-695d-46a3-b381-d84be581b932","resolution":{"observed_at":"2026-08-10T13:47:17.309498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:17.396517Z","title":"Open-source conversational ai with speechbrain 1.0,","venue":null,"work_id":"97af7bfa-aa32-47bb-96e4-49d52ccf584f","year":2024},"citing_paper":{"arxiv_id":"2501.16131","last_updated":"2025-01-27T15:20:50Z","snapshot_observed_at":"2026-08-16T11:26:50.860751Z","submitted_at":"2025-01-27T15:20:50Z","title":"Optimized Self-supervised Training with BEST-RQ for Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:17.314656Z"},"links":{"citing_paper":"/paper/2501.16131"},"observation_digest":"sha256:213e861e58fffc266f6cff0f2d87fbef1a08925f633b305eb1da1cc10ab7790e","observation_id":"d0119ed0-8355-4fca-9a92-4cc59d0ee36b","resolution":{"observed_at":"2026-08-10T13:47:17.403654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:47:17.319518Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.16131","last_updated":"2025-01-27T15:20:50Z","snapshot_observed_at":"2026-08-16T11:26:50.860751Z","submitted_at":"2025-01-27T15:20:50Z","title":"Optimized Self-supervised Training with BEST-RQ for Speech Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T13:47:17.319518Z"},"links":{"citing_paper":"/paper/2501.16131"},"observation_digest":"sha256:99e17e4e306ee436102f0132b611d7466c3b0b21446194be7220586e607901db","observation_id":"59e97340-7e2e-4222-97d9-8a31ca8cd48a","resolution":{"observed_at":"2026-08-10T13:47:17.319518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.16131","last_updated":"2025-01-27T15:20:50Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T11:26:50.860751Z","submitted_at":"2025-01-27T15:20:50Z","title":"Optimized Self-supervised Training with BEST-RQ for Speech Recognition"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 0 inbound Pith citation observations for arXiv:2501.16131."}