{"as_of":"2026-08-10T03:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eead275d6371e81dc8288a6135dfcbd8aca42db44a80afcfcaca11b1a62d66e2","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T12:27:19.487461Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.02366/citation-record","integrity":"/paper/2502.02366/integrity","json":"/paper/2502.02366/citation-record.json","paper":"/paper/2502.02366"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.256603Z","title":"PANNs: Large-Scale Pretrained Audio Neural Networks for Audio Pattern Recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.256603Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:67f209325cd87b3d2b6171ea48310b2bd2f0cf62542e6d6530418a7154e71e13","observation_id":"f22b93c6-b266-49fe-8059-01aa1f00697d","resolution":{"observed_at":"2026-08-09T12:27:19.256603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:21.154400Z","title":"Embeddings for up to 2000 random samples from the validation partition of select datasets representing speech, non-speech and VAD audio domains","venue":null,"work_id":"5155e186-110b-4e65-8752-bf4fa5b75a12","year":2000},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.250437Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:97af2c4b966ca6e0feba98f798acb239ffcece7f670f140666179fe88f2f7a1d","observation_id":"42358cba-21a7-4453-9d26-22cddc5d4bff","resolution":{"observed_at":"2026-08-09T12:27:21.159538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.271776Z","title":"Using State of the Art Speaker Recognition and Natural Language Processing Technologies to Detect Alzheimer’s Disease and Assess its Severity,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.271776Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:9b45e328dbabb27882eee6771b8687164b3c00ee08e6b3ac98681dff0deddedb","observation_id":"e57ecd9a-7554-4c9d-bcd5-aafea976dbb3","resolution":{"observed_at":"2026-08-09T12:27:19.271776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:21.137813Z","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations,","venue":null,"work_id":"27b7f179-f0aa-4757-913e-92307aefa3b3","year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.261659Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:d852a29b28eb461e61ad959aa98b9f485e16be2fdef6acaead637d76478e7d55","observation_id":"dc4165f4-1aa9-41f7-bc33-719a3bbcde75","resolution":{"observed_at":"2026-08-09T12:27:21.143137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1073/pnas.2004702117","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:20.045767Z","title":"Characterizing soundscapes across diverse ecosystems using a universal acoustic feature set,","venue":null,"work_id":"6f3bb9c0-a8d0-4d10-bfc7-b4bd7d0878ba","year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.282694Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:9b2ac129e477871f8ea5551ff942676d0079839b8f2e567cfbea065fea1e269d","observation_id":"d362b1a4-41e5-4904-8248-60c7a41cf417","resolution":{"observed_at":"2026-08-09T12:27:20.051458Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.287723Z","title":"Soundscapes and deep learning enable tracking biodiversity recovery in tropical forests,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.287723Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:9227fe256f329434d0282d8f61ffea92367d371b380a4a7e49fc0beeada31f3f","observation_id":"26e6edd9-68e2-4b4d-b8e1-86c32ed79e01","resolution":{"observed_at":"2026-08-09T12:27:19.287723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.277150Z","title":"Using X-Vectors to Automatically Detect Parkinson’s Disease from Speech,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.277150Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:cee8057ee58c9905012834ce2a84bd8ef036154d9a011a949e95fcf7d3676993","observation_id":"0ed909f8-a55a-4391-8c4e-b41ddafeec3d","resolution":{"observed_at":"2026-08-09T12:27:19.277150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-09T12:27:19.297365Z","title":"Representation Learning with Contrastive Predictive Coding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.297365Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:308b9ddcf7942ec229e08e6be48982d5836c4aa0aa279966b886bedc2ff7629a","observation_id":"249558b5-4a6a-4e15-af5e-751f385b1726","resolution":{"observed_at":"2026-08-09T12:27:19.297365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.13979","last_updated":"2020-12-15T23:19:19Z","snapshot_observed_at":"2026-08-09T01:00:21.805016Z","submitted_at":"2020-06-24T18:25:05Z","title":"Unsupervised Cross-lingual Representation Learning for Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.13979","snapshot_observed_at":"2026-08-09T12:27:19.302520Z","title":"Unsupervised Cross-lingual Representation Learning for Speech Recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.302520Z"},"links":{"cited_paper":"/paper/2006.13979","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:8958ebdf41c37585dde72b7f28c13217f607f8b3509fc1663a0fa28d7b422c7f","observation_id":"53867186-9827-4bb7-a66c-f5990b2fb264","resolution":{"observed_at":"2026-08-09T12:27:19.302520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01027","last_updated":"2021-09-08T04:12:36Z","snapshot_observed_at":"2026-08-04T09:17:59.235960Z","submitted_at":"2021-04-02T12:53:15Z","title":"Robust wav2vec 2.0: Analyzing Domain Shift in Self-Supervised Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01027","snapshot_observed_at":"2026-08-09T12:27:19.292513Z","title":"Robust wav2vec 2.0: Analyzing Domain Shift in Self-Supervised Pre-Training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.292513Z"},"links":{"cited_paper":"/paper/2104.01027","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:8b15c4cc61f4d62e2756e932daa93110c9522e6d55b1b772102f7f5c7e5a330f","observation_id":"6293db8b-5677-47ad-92ae-2d5f5b9d0681","resolution":{"observed_at":"2026-08-09T12:27:19.292513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.312022Z","title":"BYOL for Audio: Exploring Pre-Trained General-Purpose Audio Representations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.312022Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:dcabce0216351b56ec51dc1d05350c8a3b11510d24e1b0f996ac54f2c14059d3","observation_id":"7cf3e73f-78d9-450d-b054-e0a62a91c99a","resolution":{"observed_at":"2026-08-09T12:27:19.312022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06695","last_updated":"2021-04-21T01:06:44Z","snapshot_observed_at":"2026-08-10T02:30:45.002129Z","submitted_at":"2021-03-11T14:32:33Z","title":"BYOL for Audio: Self-Supervised Learning for General-Purpose Audio Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.06695","snapshot_observed_at":"2026-08-09T12:27:19.316685Z","title":"BYOL for Audio: Self-Supervised Learning for General-Purpose Audio Representation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.316685Z"},"links":{"cited_paper":"/paper/2103.06695","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:bc5a5fc01344881ff4eb82e51f8e0dca7c44bfcb7bbd4ed7a8e18918c2d6fcdc","observation_id":"fd418345-df05-42d9-9378-9c66edf65639","resolution":{"observed_at":"2026-08-09T12:27:19.316685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2110.13900","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.967104Z","title":"WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing,","venue":null,"work_id":"7b3b9b7f-e7a5-43f6-a4ff-71be1c0859dc","year":2022},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.307198Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:ddc9eba021b23446db2b4abada62b9424796c1cbba14b401df04777a2d361cd2","observation_id":"ff44cd45-6874-4b15-ba76-f18e5df4f0e0","resolution":{"observed_at":"2026-08-09T12:27:19.973418Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10609","last_updated":"2018-03-28T13:51:09Z","snapshot_observed_at":"2026-07-06T06:30:40.639595Z","submitted_at":"2018-03-28T13:51:09Z","title":"The fifth 'CHiME' Speech Separation and Recognition Challenge: Dataset, task and baselines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10609","snapshot_observed_at":"2026-08-09T12:27:19.333240Z","title":"The fifth ‘CHiME’ Speech Separation and Recognition Challenge: Dataset, task and baselines,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.333240Z"},"links":{"cited_paper":"/paper/1803.10609","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:71e4e848d435ba640059089863882a0e129a708dc372fd2f09d654c8e986f472","observation_id":"1f9be9d3-9ac4-4bfe-8c11-f17534111143","resolution":{"observed_at":"2026-08-09T12:27:19.333240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10579-007-9040-x","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.851978Z","title":"Unleashing the killer corpus: experiences in creating the multi-everything AMI Meeting Corpus,","venue":null,"work_id":"57917be8-708d-429e-bb5b-5090ddf29eee","year":2007},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.339153Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:56e507059e868143ea25a1fa4dc8d8e38ee40fdba061c4df8fd119ac1f245dac","observation_id":"e7bbcfef-e100-4020-833b-67ce9bf0711c","resolution":{"observed_at":"2026-08-09T12:27:19.857230Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:21.103054Z","title":"Common Voice: A Massively-Multilingual Speech Corpus,","venue":null,"work_id":"7e48aef2-7961-460d-8382-dba34af9a01f","year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.322091Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:a74dc3e89e04ca3152523cea9e04da67bdbd1d895fdacf32c33187c974ee9db4","observation_id":"ff13feae-5940-4199-94fc-d8c14ac8c2c5","resolution":{"observed_at":"2026-08-09T12:27:21.108393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:21.086851Z","title":"Available: https://aclanthology.org/2020.lrec-1.520","venue":null,"work_id":"cc2353dc-b61a-4f5b-ae06-be6811b69517","year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.326958Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:96d7f355160ef7ae7c2ab90e1d5acc0a48f7c0adf3b3d77b63489f3d00454894","observation_id":"0b8535c4-248a-4dd8-b80e-e720f53b3633","resolution":{"observed_at":"2026-08-09T12:27:21.092504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2007.44301","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:20.649830Z","title":"Recognition and understanding of meetings the AMI and AMIDA projects,","venue":null,"work_id":"589ba9c8-158d-4032-87be-1e63f05c7c6d","year":2007},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.353246Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:4ec9543f6381772cc90b3aae592512158a8053cf268a4185cb83198662da3968","observation_id":"520a4489-9a03-4f98-a9f0-79822b649030","resolution":{"observed_at":"2026-08-09T12:27:20.657531Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:21.070181Z","title":"Enhancing the TED-LIUM Corpus with Selected Data for Language Modeling and More TED Talks,","venue":null,"work_id":"48f73ca2-3295-4520-94e8-7ed86b85b02f","year":2014},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.358039Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:6a4bb6788a1a993f267868149780b581f1fc7ed338037e101403be7368eafb14","observation_id":"74dc6609-6f2d-4697-a419-2495e7c30850","resolution":{"observed_at":"2026-08-09T12:27:21.075801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.343966Z","title":"VoxCeleb: A Large-Scale Speaker Identification Dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.343966Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:03023d6360f3e7afeb56c385b0591d3030019936d9cb43bf6990e6d8dcd5ddda","observation_id":"314f1b96-be1f-498b-bb11-68e5e25b1745","resolution":{"observed_at":"2026-08-09T12:27:19.343966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.348655Z","title":"Librispeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.348655Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:b8df70dc2128da941b29161157a9ac50ec8de9e2894fe5af2ff27080a5cd8895","observation_id":"b2a82536-1475-4947-9d6a-5802f59c35bd","resolution":{"observed_at":"2026-08-09T12:27:19.348655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.09902","last_updated":"2018-10-07T02:25:28Z","snapshot_observed_at":"2026-07-06T06:52:21.185384Z","submitted_at":"2018-07-26T00:30:54Z","title":"General-purpose Tagging of Freesound Audio with AudioSet Labels: Task Description, Dataset, and Baseline","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.09902","snapshot_observed_at":"2026-08-09T12:27:19.373247Z","title":"General-purpose Tagging of Freesound Audio with AudioSet Labels: Task Description, Dataset, and Baseline,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.373247Z"},"links":{"cited_paper":"/paper/1807.09902","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:af059f8fc8dbec5f3a5ae411587ce71ff904d87bf9885d30e628f8dc42c2e02e","observation_id":"c0bbf53d-9141-497d-9450-cb929aabf208","resolution":{"observed_at":"2026-08-09T12:27:19.373247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02975","last_updated":"2020-01-20T00:26:57Z","snapshot_observed_at":"2026-07-06T07:58:39.570955Z","submitted_at":"2019-06-07T09:09:56Z","title":"Audio tagging with noisy labels and minimal supervision","version":4},"cited_work":{"arxiv_id":"1906.02975","doi":"10.48550/arxiv.1906.02975","metadata_source":"pith","pith_arxiv_id":"1906.02975","snapshot_observed_at":"2026-08-09T18:16:18.150856Z","title":"Audio tagging with noisy labels and minimal supervision","venue":"cs.SD","work_id":"3a39602d-c009-4ed3-8fb2-5a07bda8c5ab","year":2019},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.378879Z"},"links":{"cited_paper":"/paper/1906.02975","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:1cf24a1e13bd794898d948cd58ab6fb0ba1410038e751c607983958f5d6d1816","observation_id":"86254a16-ab1c-4f01-99ba-f180d0b9b32a","resolution":{"observed_at":"2026-08-09T12:27:19.765128Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01757","last_updated":"2021-06-15T03:36:12Z","snapshot_observed_at":"2026-08-09T01:10:51.705655Z","submitted_at":"2021-02-02T21:16:25Z","title":"The Multilingual TEDx Corpus for Speech Recognition and Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.01757","snapshot_observed_at":"2026-08-09T12:27:19.362872Z","title":"The Multilingual TEDx Corpus for Speech Recognition and Translation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.362872Z"},"links":{"cited_paper":"/paper/2102.01757","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:62fa4022913207931dee1551b9fbc6f964b55887e58b90060d285cbe86afe858","observation_id":"36c1e223-ea52-4c08-8b1e-ae6e318c66bd","resolution":{"observed_at":"2026-08-09T12:27:19.362872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.05188","last_updated":"2020-09-11T01:19:12Z","snapshot_observed_at":"2026-08-06T18:07:52.239882Z","submitted_at":"2020-09-11T01:19:12Z","title":"SONYC-UST-V2: An Urban Sound Tagging Dataset with Spatiotemporal Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.05188","snapshot_observed_at":"2026-08-09T12:27:19.367959Z","title":"SONYC-UST-V2: An Urban Sound Tagging Dataset with Spatiotemporal Context,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.367959Z"},"links":{"cited_paper":"/paper/2009.05188","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:5385881788baa77cecab2b13b368280c8d1aebb2d03b8505490c4c892e8a7089","observation_id":"2d3bd654-f1e8-4874-a971-b446dc5715f2","resolution":{"observed_at":"2026-08-09T12:27:19.367959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-07-06T04:34:36.474437Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-08-09T12:27:19.393622Z","title":"MUSAN: A Music, Speech, and Noise Corpus,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.393622Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:3578d50c841c13e64c12e8bf3b230f2789785f12c14ed8e44e30d952a445d7e9","observation_id":"c54c481e-8447-4f99-aa94-9734d26c196a","resolution":{"observed_at":"2026-08-09T12:27:19.393622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1309.5275","last_updated":"2013-10-01T21:29:13Z","snapshot_observed_at":"2026-07-06T03:23:33.025529Z","submitted_at":"2013-09-20T14:12:04Z","title":"An open dataset for research on audio field recording archives: freefield1010","version":2},"cited_work":{"arxiv_id":"1309.5275","doi":"10.48550/arxiv.1309.5275","metadata_source":"pith","pith_arxiv_id":"1309.5275","snapshot_observed_at":"2026-08-09T18:16:18.150856Z","title":"An open dataset for research on audio field recording archives: freefield1010","venue":"cs.SD","work_id":"4f8722e1-0aea-4692-92bc-46d9b203e2de","year":2013},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.399285Z"},"links":{"cited_paper":"/paper/1309.5275","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:b34cb5d648b9ac33307908a48dd3d33fd00f6679bb677fee5762d2935d2c5187","observation_id":"14668544-0e06-48e2-a15d-8450110aadbb","resolution":{"observed_at":"2026-08-09T12:27:19.720639Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.384159Z","title":"FSD50K: An Open Dataset of Human-Labeled Sound Events,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.384159Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:c34b829585b593034649ad3b48dab8a985ba552c20cc4c4897043ee5d13de3e3","observation_id":"110d69d4-f231-4a14-aa5d-bfa7b7d19866","resolution":{"observed_at":"2026-08-09T12:27:19.384159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:21.171913Z","title":null,"venue":null,"work_id":"1a448f2b-9fdc-4889-abd8-18da215a5530","year":null},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.244016Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:af687e195e6b334989d78e5ee9df637982aa84423906f550c22eee22b50b05c9","observation_id":"1b64d332-ca61-423a-9c36-6ce02c484be4","resolution":{"observed_at":"2026-08-09T12:27:21.176477Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.388827Z","title":"Audio Set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.388827Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:23096330a743d7f29f06f4230052ac784d13cbfddd411024a1f464ed4601c4a4","observation_id":"9b592abc-a6af-4bd6-a354-5a2856c81cb5","resolution":{"observed_at":"2026-08-09T12:27:19.388827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.418526Z","title":"CNN architectures for large-scale audio classification,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.418526Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:bb473df1821a61f8b55826cee3d74d49deb3735a18eb1cf776b6e00b45b339e1","observation_id":"20a62922-1eda-4a1f-ae5d-c67e70a5b59f","resolution":{"observed_at":"2026-08-09T12:27:19.418526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.01160","last_updated":"2019-07-02T04:27:55Z","snapshot_observed_at":"2026-07-06T08:04:17.909965Z","submitted_at":"2019-07-02T04:27:55Z","title":"WHAM!: Extending Speech Separation to Noisy Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.01160","snapshot_observed_at":"2026-08-09T12:27:19.404632Z","title":"WHAM!: Extending Speech Separation to Noisy Environments,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.404632Z"},"links":{"cited_paper":"/paper/1907.01160","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:0cca9f39c78b95001f1e9df514544e5f34cc430ffff9435b248509e00e3f7110","observation_id":"fb81c49d-4cbf-4b1e-9247-254b030e661e","resolution":{"observed_at":"2026-08-09T12:27:19.404632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:21.052252Z","title":"Bootstrap your own latent a new approach to self-supervised learning,","venue":null,"work_id":"c6052e01-2377-420b-bc64-57f16deec155","year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.409636Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:36e6dde41435a69d84afb0dede95fc5beb7737961df0bac0251698b74ecda848","observation_id":"8433630e-532e-4569-8d87-47c260851edb","resolution":{"observed_at":"2026-08-09T12:27:21.057812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.413855Z","title":"MatchboxNet: 1D Time-Channel Separable Convolutional Neural Network Architecture for Speech Commands Recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.413855Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:f11880979854f3ede0bb1738f460951d704e6b1a3d7794f9a2810eee95474a23","observation_id":"ec4dd20b-a7e9-4b7e-95c4-6c7677caec9e","resolution":{"observed_at":"2026-08-09T12:27:19.413855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03209","last_updated":"2018-04-09T19:58:17Z","snapshot_observed_at":"2026-07-06T06:32:32.083176Z","submitted_at":"2018-04-09T19:58:17Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03209","snapshot_observed_at":"2026-08-09T12:27:19.436477Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.436477Z"},"links":{"cited_paper":"/paper/1804.03209","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:8d04d0efe3cedfb32f486c41a348e970bd6987438b796c7fbaa48acd9d0e3db7","observation_id":"074a7df4-19ee-43f9-94eb-87bcdb907136","resolution":{"observed_at":"2026-08-09T12:27:19.436477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2015.73243","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:20.313976Z","title":"Environmental sound classification with convolutional neural networks,","venue":null,"work_id":"92384e6a-3ae0-40ea-88f0-7e00686a9fa1","year":2015},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.422945Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:1107783db6b2285ae0ecc5fbfd5621e57559621ff87dc81c88a1043dbf0f1f72","observation_id":"acd3b149-c1c7-4a2a-ab38-61d016f7b473","resolution":{"observed_at":"2026-08-09T12:27:20.321447Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.427052Z","title":"A Dataset and Taxonomy for Urban Sound Research,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.427052Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:67815e967ca40bb1d172e42b2725105192a9284d5f0c4d2b3c03a11a34103924","observation_id":"fe80b230-89ce-445f-9f8f-7be5761927af","resolution":{"observed_at":"2026-08-09T12:27:19.427052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:21.034787Z","title":"Neural Audio Synthesis of Musical Notes with WaveNet Autoencoders,","venue":null,"work_id":"d217edef-1ef2-4d95-8051-af070f0378a7","year":2017},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.431944Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:ab8d0a540eb739ddca5b5cbe547e6022707edf6bac26dfe01703af1fe25ba8dc","observation_id":"0ca4c5ec-044d-4176-8293-d70414a0651d","resolution":{"observed_at":"2026-08-09T12:27:21.040629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.441197Z","title":"CSTR VCTK Corpus: English Multi-speaker Corpus for CSTR Voice Cloning Toolkit (version 0.92),","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.441197Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:16be64e56cae4fa58f6ba1555d96d46ca2396c1208191a1656501778f16246ed","observation_id":"53af1c20-6702-4b24-af27-330b3785cc1b","resolution":{"observed_at":"2026-08-09T12:27:19.441197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.00606","last_updated":"2018-08-23T23:28:38Z","snapshot_observed_at":"2026-07-06T06:53:36.501032Z","submitted_at":"2018-08-02T00:13:11Z","title":"AVA-Speech: A Densely Labeled Dataset of Speech Activity in Movies","version":2},"cited_work":{"arxiv_id":"1808.00606","doi":"10.48550/arxiv.1808.00606","metadata_source":"pith","pith_arxiv_id":"1808.00606","snapshot_observed_at":"2026-08-09T18:16:18.150856Z","title":"AVA-Speech: A Densely Labeled Dataset of Speech Activity in Movies","venue":"cs.SD","work_id":"34ebf499-f10c-46c2-9b4a-3ef4a9534ce8","year":2018},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.446594Z"},"links":{"cited_paper":"/paper/1808.00606","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:c22be643196963196d5bbaac2aa7364055241787e856c2c30731fd58cb1c8234","observation_id":"4c5150ae-374a-4d78-a102-d8f1a92e5417","resolution":{"observed_at":"2026-08-09T12:27:19.631797Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.451806Z","title":"Representational geometry: integrating cognition, computation, and the brain,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.451806Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:519f0fffb83eba4140cc4eb0ffc0e5ce116005e988bfcf06b7f38dfe8ea5b491","observation_id":"956c6d5a-f35a-423e-912e-b1bfa9ea51ad","resolution":{"observed_at":"2026-08-09T12:27:19.451806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.456940Z","title":"The Timbre Toolbox: Extracting audio descriptors from musical signals,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.456940Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:b4eea6bb19bbb6eeceee1d195b2a500e09b48a1db0886dae1680c4c09f77302d","observation_id":"9a4ce4d0-467c-4015-a675-305a16683bf3","resolution":{"observed_at":"2026-08-09T12:27:19.456940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1371/journal.pcbi.1000302","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.578579Z","title":"The Modulation Transfer Function for Speech Intelligibility,","venue":null,"work_id":"e6557f39-2b94-4426-b04b-c315f64d8650","year":2009},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.462136Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:d494db74886f16cd1ea2cb455bf21f8c0c0229a8fe2e5164e6eb35c746cac397","observation_id":"d43fedd3-434b-4923-a10c-709ec2a3479b","resolution":{"observed_at":"2026-08-09T12:27:19.586295Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.467070Z","title":"YIN, a fundamental frequency estimator for speech and music,","venue":null,"work_id":null,"year":1917},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.467070Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:0b7c27defccc9bffa12b5ea497be1ae771edd756e9f81b9df27f9f8af30f5ab1","observation_id":"8992706d-8d5d-49cc-bf50-e2ddb1370209","resolution":{"observed_at":"2026-08-09T12:27:19.467070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:19.472186Z","title":"Acoustic Event Detection Using Speaker Recognition Techniques: Model Optimization and Explainable Features,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.472186Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:8e0a15a2c5fbbc74d7b4e036fbd8b20c64bae54ee53f8e52c61fca4597934a16","observation_id":"6fdc6041-464b-43b8-8394-9cc7d6ab7f27","resolution":{"observed_at":"2026-08-09T12:27:19.472186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.01594","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:20.142002Z","title":"Acoustic Correlates of Auditory Object and Event Perception: Speakers, Musical Timbres, and Environmental Sounds,","venue":null,"work_id":"2dd9da46-eff0-4981-867a-d9729abcf003","year":2019},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.477019Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:4457b0925f35819d12d5fe673e39da25d04d7644c06eb3e93a2f0ab6ee2017d2","observation_id":"4323c434-8026-43df-94e6-1aba819f9913","resolution":{"observed_at":"2026-08-09T12:27:20.150848Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14493","last_updated":"2022-10-26T05:38:50Z","snapshot_observed_at":"2026-07-06T14:10:32.433250Z","submitted_at":"2022-10-26T05:38:50Z","title":"AVES: Animal Vocalization Encoder based on Self-Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14493","snapshot_observed_at":"2026-08-09T12:27:19.482197Z","title":"AVES: Animal Vocalization Encoder based on Self-Supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.482197Z"},"links":{"cited_paper":"/paper/2210.14493","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:56e8eb4512e79871abce6c2308e7f53f6584bf7651cb09cce99ca270a4a243d0","observation_id":"aca9b87a-2b79-439c-849e-90e5273d74cb","resolution":{"observed_at":"2026-08-09T12:27:19.482197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02133","last_updated":"2021-04-27T13:23:27Z","snapshot_observed_at":"2026-08-09T12:00:34.585038Z","submitted_at":"2021-04-05T20:13:36Z","title":"SpeechStew: Simply Mix All Available Speech Recognition Data to Train One Large Neural Network","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.02133","snapshot_observed_at":"2026-08-09T12:27:19.487461Z","title":"SpeechStew: Simply Mix All Available Speech Recognition Data to Train One Large Neural Network,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.487461Z"},"links":{"cited_paper":"/paper/2104.02133","citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:dce9297ad0bd91039db86137f411d689291c658e30f71963d5e25085d22924f1","observation_id":"1d76a4ec-b7cf-4bbe-82ce-6e655527bbe9","resolution":{"observed_at":"2026-08-09T12:27:19.487461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:27:21.120552Z","title":"Available: https://proceedings.neurips.cc/paper/2020/hash/92d1e1eb1cd6f9fba3227870bb6d7f07-Abstract.html","venue":null,"work_id":"5401b0fe-83b7-4627-9e0f-966c7297449b","year":2020},"citing_paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T12:27:19.266785Z"},"links":{"citing_paper":"/paper/2502.02366"},"observation_digest":"sha256:97428c705b307639afd87ce124a806d0d260caecd17889d7a2742ebe715d20ee","observation_id":"a6dbf56d-3d40-4535-a098-7f095a33addc","resolution":{"observed_at":"2026-08-09T12:27:21.126288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.02366","last_updated":"2025-02-04T14:50:12Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-09T18:49:27.826019Z","submitted_at":"2025-02-04T14:50:12Z","title":"Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":31,"verified_exact":8,"verified_fuzzy":8},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2502.02366."}