{"as_of":"2026-08-08T16:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e3f81d7d8d9a8af7d25af179ff00958e44052cb3f0e9a41f36c6ac6333d0dfe8","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:26:15.094318Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:26:13.455801Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T14:26:15.140016Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"cited_work":{"arxiv_id":"2505.18984","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18984","snapshot_observed_at":"2026-08-07T14:26:15.140016Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","venue":"cs.SD","work_id":"b8bdbc55-6606-468f-b087-f782302ce0e3","year":2025},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:13.455801Z"},"links":{"cited_paper":"/paper/2505.18984","citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:0a402f95b9bd126784dd9912fd4df46723902c91427271fce3b254ab7823280f","observation_id":"48b46bf4-b2c4-416a-ba41-4483c963d721","resolution":{"observed_at":"2026-08-07T14:26:15.146229Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18984/citation-record","integrity":"/paper/2505.18984/integrity","json":"/paper/2505.18984/citation-record.json","paper":"/paper/2505.18984"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"cited_work":{"arxiv_id":"2505.18984","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18984","snapshot_observed_at":"2026-08-07T14:26:15.140016Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","venue":"cs.SD","work_id":"b8bdbc55-6606-468f-b087-f782302ce0e3","year":2025},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:13.455801Z"},"links":{"cited_paper":"/paper/2505.18984","citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:0a402f95b9bd126784dd9912fd4df46723902c91427271fce3b254ab7823280f","observation_id":"48b46bf4-b2c4-416a-ba41-4483c963d721","resolution":{"observed_at":"2026-08-07T14:26:15.146229Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.470385Z","title":null,"venue":null,"work_id":"5db4cb25-c4e4-470a-bddd-d70dec4d3715","year":null},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:13.522458Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:543810bf3ac384e061c3b1bc1510439a77643265da924b9f85ab2ca7602c39f8","observation_id":"1d365e53-61e9-47cd-a079-47686ed747c0","resolution":{"observed_at":"2026-08-07T14:26:15.473825Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.461050Z","title":null,"venue":null,"work_id":"1ec45eed-a44b-438f-9aa9-4df6129dcc69","year":null},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:13.596456Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:becf612a1ff714672ebce769710da2c790c9ec31b4a095cb8780201688c210cf","observation_id":"ecf4b75a-3130-4d09-9856-f5da78ec815b","resolution":{"observed_at":"2026-08-07T14:26:15.464221Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.451002Z","title":null,"venue":null,"work_id":"8924a5f4-2269-4a4e-9457-65a0f9d2b68b","year":2016},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:13.717712Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:f5ca2deb44db02eab37d765e5fff94e53cf7d097bc085281318f0d5d01d25a16","observation_id":"7d23d873-1395-4f19-95d9-d6c6627e9ec1","resolution":{"observed_at":"2026-08-07T14:26:15.455145Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.441090Z","title":"Our method improves the performance of all tasks compared to existing methods in the experiment of the subset of Audioset","venue":null,"work_id":"acfba1eb-ceef-424d-b19f-b261129bbbab","year":null},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:13.856526Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:e8b0869c55119914db904e965ad63e29182188173aa50d3261e1839c61b24e20","observation_id":"1f11e76a-f560-4804-a45b-3c62de208ae4","resolution":{"observed_at":"2026-08-07T14:26:15.444845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.430948Z","title":"Zhang, J","venue":null,"work_id":"f41d7b28-b1bb-4e9c-85e5-24b8210268b3","year":2020},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:13.964205Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:b756f6f82bfd0328c6fad3a510ef7eb3bdcb9230d202724a5bd6721131234214","observation_id":"6e6c43ae-0e3b-42bf-90e3-daab6052f574","resolution":{"observed_at":"2026-08-07T14:26:15.434624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.421419Z","title":"V oxCeleb2: Deep Speaker Recognition,","venue":null,"work_id":"6b4e7f8a-713c-4977-b62a-18738d30dd10","year":2018},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:14.125586Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:76f0b4a3ce34206e499e97f09a447ed59609cd18c2f3940bdf480bbbf15cc53a","observation_id":"8cf1eabf-32f1-4f57-87bd-db48d3abf6f8","resolution":{"observed_at":"2026-08-07T14:26:15.424791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.410428Z","title":"Broadcasted Resid- ual Learning for Efficient Keyword Spotting,","venue":null,"work_id":"8408cb2b-edb1-43a5-a733-cc2368cd9018","year":2021},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:14.205583Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:f838d5e894a3d3e8729e9559ff609992a63bad4656a1aa0884457d0f447092f9","observation_id":"b6cc71bd-6a73-4439-9b19-e67a166e88ab","resolution":{"observed_at":"2026-08-07T14:26:15.414577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.400357Z","title":"Acous- tic Event Detection Method Using Semi-Supervised Non- Negative Matrix Factorization with Mixtures of Local Dictio- naries,","venue":null,"work_id":"3abd70cc-0e5f-4fc6-8951-2da6bced0227","year":2016},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:14.292479Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:b5e2c71f4e72472ebc370459c9ab6ece523e3f6f9f1a81c5825251d1ac7dd533","observation_id":"cc1bcaec-6077-4705-9f60-e47444a973e4","resolution":{"observed_at":"2026-08-07T14:26:15.404451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.390382Z","title":"Crepe: A Convolutional Representation for Pitch Estimation,","venue":null,"work_id":"8cda6e26-4a9e-49d6-8cc0-d7c39aa96775","year":2018},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:14.421892Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:e0121240332aebb1396ba751de7339d1b699b7ac3552fc5af2ab3da40372a44a","observation_id":"1d5e790f-2b66-47be-9af5-b4792fcac3de","resolution":{"observed_at":"2026-08-07T14:26:15.394428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.380089Z","title":"PANNs: Large-scale pre- trained audio neural networks for audio pattern recognition,","venue":null,"work_id":"7962e71d-0d33-4dc7-8b67-413fa9e96585","year":2020},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:14.452385Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:fdcf9259b131101ab0715f8be43ed2733c0bff53b75c4cb124e3f1e2ea0942ca","observation_id":"271aff89-e090-484e-9276-2133fc6a1935","resolution":{"observed_at":"2026-08-07T14:26:15.383661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.370417Z","title":"Audio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":"662a920b-3e70-4842-a077-07707e697648","year":2017},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:14.463942Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:386a96659f06d7f085bddd756900782d91796e4deaeeb73294c0f9000281aab0","observation_id":"eb5f3bcf-9037-43ff-9499-4981d1a64270","resolution":{"observed_at":"2026-08-07T14:26:15.374236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.360253Z","title":"Language models are few-shot learners,","venue":null,"work_id":"14d22ecb-2d9b-4545-8ca9-1e9c304f179f","year":2020},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:14.499846Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:001502e9763c53c2a17d53d0d9202a3d57eaa09ae5aa1fb3b234357796190c9c","observation_id":"fa39727f-bf1f-453e-8145-6cec55c245f3","resolution":{"observed_at":"2026-08-07T14:26:15.364561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.350204Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"0a03922f-1806-4651-a2d9-1a15da4242da","year":2019},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:14.538877Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:5d9651c07996571491f295633967421f79ef9d16792fc35349d4ba5089d8fb52","observation_id":"2a765ba9-705f-44e3-8df0-30025229487f","resolution":{"observed_at":"2026-08-07T14:26:15.353992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.340842Z","title":"van den Oord, Y","venue":null,"work_id":"0c09deac-e0df-4785-a12b-02c9e14e62a9","year":2019},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:14.576176Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:f1891f788a5f3a5074aeeac15ab9223f498aedd3a55e94fb92b6294bdea3d9f5","observation_id":"9dfdb037-9d11-4739-9a84-b2bfcb93c3d6","resolution":{"observed_at":"2026-08-07T14:26:15.343929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.331594Z","title":"Spatiotemporal con- trastive video representation learning,","venue":null,"work_id":"b30fa9cf-af46-4bd8-8295-ae607eb8abc2","year":2021},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:14.611759Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:17eba92459b8040a3250ffd0ad5c69affd7b7df15a20eb8b54e15bd6fe8d8d07","observation_id":"e785da60-2e2f-4746-a0d1-1ecf54df335f","resolution":{"observed_at":"2026-08-07T14:26:15.335105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.321655Z","title":"Momentum contrast for unsupervised visual representation learning,","venue":null,"work_id":"7f28a67a-07e4-4418-b7eb-424f36e2eee0","year":2020},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:14.684273Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:e9ebfece3ff696b9dc7cec6aebef5b588a214c9641380c31a8748a1c232111f3","observation_id":"875a203f-6db4-4d08-a62a-c8a8a6123d2b","resolution":{"observed_at":"2026-08-07T14:26:15.325640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.04136","last_updated":"2020-09-21T15:34:30Z","snapshot_observed_at":"2026-08-08T04:10:15.931449Z","submitted_at":"2020-04-08T17:40:43Z","title":"CURL: Contrastive Unsupervised Representations for Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.04136","snapshot_observed_at":"2026-08-07T14:26:14.769986Z","title":"Curl: Contrastive unsupervised representations for reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:14.769986Z"},"links":{"cited_paper":"/paper/2004.04136","citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:b4b3107f35df0f9e872d6ff6cf47372d13a818fc7670d70d415fb2a2ca3c1db2","observation_id":"b4135544-6834-4e57-aa62-4f5d9e78f94d","resolution":{"observed_at":"2026-08-07T14:26:14.769986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.312282Z","title":"Data aug- menting contrastive learning of speech representations in the time domain,","venue":null,"work_id":"97dc9267-90c5-47c2-b395-63d29eaa63fc","year":2021},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:14.842785Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:281ddae3f098522245d7b8f67c3317f232bdde39fed2414528f936ee97d2c058","observation_id":"b692c067-3335-431a-87f7-a97e44c6312b","resolution":{"observed_at":"2026-08-07T14:26:15.315626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.301645Z","title":"Un- supervised pretraining transfers well across languages,","venue":null,"work_id":"b4bdb352-b580-4efd-a644-fb9365cd8da3","year":2020},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:14.922554Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:20f175c393a2ea261ef63220a05f68a16d86dbbbb5ef8d22f7eb3e03b8b02b29","observation_id":"59b0cce2-ceb8-43a8-91c5-3eee57250880","resolution":{"observed_at":"2026-08-07T14:26:15.305950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.291728Z","title":"Vq-wav2vec: Self- supervised learning of discrete speech representations,","venue":null,"work_id":"60648b07-d79b-4150-a3df-8e7084c1e8c2","year":2020},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:14.983591Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:61d72713d65db8d9a587ff16bf1906fdd83b46aaac8561a79a140441f7fc72f4","observation_id":"d515b184-3187-4d3d-b367-45ffb719a087","resolution":{"observed_at":"2026-08-07T14:26:15.295581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.281867Z","title":"Towards Learning a Uni- versal Non-Semantic Representation of Speech,","venue":null,"work_id":"cabd6a89-340a-47ea-813a-8883c97ba414","year":2020},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:15.019483Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:54801d6777e19397240a2204451596d94c45138f6aa8b15d87f57c6d6cfc7494","observation_id":"378785f9-1a3f-429e-9821-9f05fcd1a878","resolution":{"observed_at":"2026-08-07T14:26:15.285790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.272415Z","title":"Unsupervised learn- ing of semantic audio representations,","venue":null,"work_id":"fc5289f5-1b3d-4283-b660-9f82d6dd0e0f","year":2018},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:15.032551Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:db2d303d27b07b52ef72be7cee16f039009480c73a3717278d76dab769a74a4c","observation_id":"7fdff210-619f-4579-9761-6314246933fe","resolution":{"observed_at":"2026-08-07T14:26:15.275794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.262923Z","title":"Contrastive learning of general-purpose audio representations,","venue":null,"work_id":"43bd7dde-7a7e-4b32-9780-b627c61931a9","year":2021},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:15.038803Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:434c4265a1bf88c031f099b9b5991ab394d53ece36ec54ca6ec99b6f64e7e9fe","observation_id":"1c684355-4e1b-416c-98a5-c0a4e876d0fc","resolution":{"observed_at":"2026-08-07T14:26:15.266366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.252546Z","title":"Speech Commands: A Dataset for Limited- V ocabulary Speech Recognition,","venue":null,"work_id":"a54112a9-7bd8-42d0-952f-6cb6999a9a9f","year":2018},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:15.045522Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:74f10722bad7e5db3a8b3316ad88874680ce890013e792e391c3dc050c37125f","observation_id":"a1f249f7-88e6-4ee0-ad61-eeb72e973e28","resolution":{"observed_at":"2026-08-07T14:26:15.256554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.242206Z","title":"Detection and classification of acoustic scenes and events: Outcome of the DCASE 2016 challenge,","venue":null,"work_id":"9f18ec93-9b90-4a8d-aeeb-30f59d56ee90","year":2016},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:15.050539Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:dc9da3cd02d09a18a3ff8116382784cb67fa5dfc8382a904738f2b25ea4a9289","observation_id":"2bde6d46-b343-4d3f-9d5f-97ad3700ed27","resolution":{"observed_at":"2026-08-07T14:26:15.246276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.231707Z","title":"Sound event de- tection in synthetic audio: Analysis of the DCASE 2016 task results,","venue":null,"work_id":"ba53e3f2-0e6f-4287-ac59-9899849a743a","year":2016},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:15.058282Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:94078fb7071353e73fcb5fa61e78b83e4795169a6a1c502a57345f7335103e38","observation_id":"c18c0708-47a8-4b94-8ee3-6b515452dd27","resolution":{"observed_at":"2026-08-07T14:26:15.236043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.221234Z","title":"Neural audio syn- thesis of musical notes with wavenet autoencoders,","venue":null,"work_id":"0bb13e39-23c3-474b-8eb0-d74f1d8d81b1","year":2017},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:15.064430Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:9f78ae6ba1c84b9529eeaf83e18a23ee1b30d795b08721267ae8a221e6f279d6","observation_id":"85cd9a4a-1503-44f9-929f-a47320bc853d","resolution":{"observed_at":"2026-08-07T14:26:15.225323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.211311Z","title":"Crepe: A convo- lutional representation for pitch estimation,","venue":null,"work_id":"05092a49-3d13-43a4-90f1-a76816e038aa","year":2018},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:15.071478Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:e208e260d06d4a1d4706e0f7833b82fcce3dc69c44247fe0022c5ca99ef8be67","observation_id":"2ab1526b-ed67-48f7-b827-42d9e438671a","resolution":{"observed_at":"2026-08-07T14:26:15.214614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.200022Z","title":"EfficientNet: Rethinking model scaling for convolutional neural networks,","venue":null,"work_id":"50e7976a-02ed-44cf-9fb3-2c04e650f19c","year":2019},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:15.075322Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:2d377ed319a85fb9d9b1257313f434de3547dd4acedc7d358271ef54c009b682","observation_id":"fef3c815-c64d-4fda-8226-fe579a862e91","resolution":{"observed_at":"2026-08-07T14:26:15.204775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-07T14:26:15.079404Z","title":"Layer normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:15.079404Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:1a7818042edbd65322b929268019519d1f115b2abb1b6952ba2bfb561591e7f6","observation_id":"ee623c89-baf4-4df3-afc2-a2cc622df993","resolution":{"observed_at":"2026-08-07T14:26:15.079404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.188893Z","title":"Adam: A method for stochastic op- timization,","venue":null,"work_id":"fb79084d-2785-4691-a80c-f4cf953d559d","year":2015},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:15.083555Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:8eaf65f808d4e817743db9024f6673039b06d18ffac39f381b35bdc60667d9eb","observation_id":"1a08c4ff-ea39-4cda-afa8-d243f55b969a","resolution":{"observed_at":"2026-08-07T14:26:15.193151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.178714Z","title":"Tagliasacchi, B","venue":null,"work_id":"40dd7349-7d31-4b3f-b745-37fd2569ab67","year":2019},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:15.087529Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:9ce784cae1d1645e167890f838befb62f490ee26b51f0b95a15283dfcaa78928","observation_id":"d8909262-716a-4fa9-8160-8cc1eeb391d2","resolution":{"observed_at":"2026-08-07T14:26:15.181985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.165436Z","title":"A simple framework for contrastive learning of visual representations,","venue":null,"work_id":"87da3874-1ba0-48ba-a9e5-77d225709414","year":2020},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:15.091212Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:3535c07617bf494f777a25e6e08c5d9e4b5698bdb00ae75982191b91507bf54c","observation_id":"9ec2a0ce-34a3-4a42-91b9-06c3e843fc90","resolution":{"observed_at":"2026-08-07T14:26:15.170421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:15.153965Z","title":"Seeing voices and hearing voices: Learning discriminative embeddings us- ing cross-modal self-supervision,","venue":null,"work_id":"07a8d9c1-a2f3-48aa-aa56-4ae1a5b02c3e","year":2020},"citing_paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:15.094318Z"},"links":{"citing_paper":"/paper/2505.18984"},"observation_digest":"sha256:db8d7e4f08cd2607ece012d0c080c6c8fe72e84c5cb4278a5c135043b3805c7d","observation_id":"0a1819fe-7103-42a9-a291-f07153c04876","resolution":{"observed_at":"2026-08-07T14:26:15.157936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18984","last_updated":"2025-05-25T05:36:26Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T14:20:14.638152Z","submitted_at":"2025-05-25T05:36:26Z","title":"Self-supervised learning method using multiple sampling strategies for general-purpose audio representation"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2505.18984."}