{"as_of":"2026-08-07T07:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:23b2841834b7c38b1f4f58a67bd4e44d67a8d8b5fecef182ba2ef724e0e3a008","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T20:16:26.731092Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T20:16:22.578854Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.16688","snapshot_observed_at":"2026-08-01T20:16:22.578854Z","title":"In this paper, we focus arXiv:2607.16688v1 [eess.AS] 18 Jul 2026 on the case where the reference noise is obtained from a different time segment from the same recording","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:22.578854Z"},"links":{"cited_paper":"/paper/2607.16688","citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:e3982ca3d0a90a77028df50cdc4971394c33fba651e4e27e6085ec627f17a138","observation_id":"0be39ce1-3592-4cd6-bb39-5d910c632907","resolution":{"observed_at":"2026-08-01T20:16:22.578854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.16688/citation-record","integrity":"/paper/2607.16688/integrity","json":"/paper/2607.16688/citation-record.json","paper":"/paper/2607.16688"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:22.461399Z","title":"These models learn general- purpose representations from large amounts of unlabeled audio data, enabling transfer to various downstream tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:22.461399Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:afb9fbce96e4d1581cdc6c9ab3ab3897780e4fb7ae7b371ee8a0eeea22da7bbf","observation_id":"6530b898-6d16-4eb3-8309-12a06e4b38d5","resolution":{"observed_at":"2026-08-01T20:16:22.461399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.16688","snapshot_observed_at":"2026-08-01T20:16:22.578854Z","title":"In this paper, we focus arXiv:2607.16688v1 [eess.AS] 18 Jul 2026 on the case where the reference noise is obtained from a different time segment from the same recording","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:22.578854Z"},"links":{"cited_paper":"/paper/2607.16688","citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:e3982ca3d0a90a77028df50cdc4971394c33fba651e4e27e6085ec627f17a138","observation_id":"0be39ce1-3592-4cd6-bb39-5d910c632907","resolution":{"observed_at":"2026-08-01T20:16:22.578854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:22.638708Z","title":"First, in Section 4, we evalu- ate performance on various downstream tasks under simulated noisy conditions using a custom-designed setup","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:22.638708Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:2c6002cd32ad5c47cbe7e0ec2370ede38f0279337e0791080876b7be7819e48b","observation_id":"935c3b38-bfd9-4cb7-a0ff-726ebf2e96a9","resolution":{"observed_at":"2026-08-01T20:16:22.638708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:22.720317Z","title":"Setups We conducted evaluation on various downstream tasks according to [5, 6]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:22.720317Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:9be180eb8cfb29f3e4f20df0006a187bbc52cefa30a85327ca4309e13cf936fb","observation_id":"6ff14538-4508-4f18-b871-9b4f82f654c2","resolution":{"observed_at":"2026-08-01T20:16:22.720317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:22.802816Z","title":"This dataset contains 15 machine types, each with 1000 normal training samples and 200 test samples including normal and anomalous samples","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:22.802816Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:cc24fa4b40fb45289a25bafad8f82397171f33d5a4d34831f2d93bc5f7f6c850","observation_id":"b28dcd8d-f6b9-4816-a677-ddaee13bce0a","resolution":{"observed_at":"2026-08-01T20:16:22.802816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:22.867369Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:22.867369Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:c915ea6f321a04d4aee2fb6bcc93af5de87a6cf356c29fbaf806e6ba8223464e","observation_id":"82b812f4-eb97-4733-b8ee-3c5bbdd16e91","resolution":{"observed_at":"2026-08-01T20:16:22.867369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:22.965415Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:22.965415Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:80f70c547164bb56adf8902b87c08a27515b52530c49d900a282da6dffd58b7b","observation_id":"89f60ad8-4659-458a-9554-95c7237c7e37","resolution":{"observed_at":"2026-08-01T20:16:22.965415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:23.060134Z","title":"Wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:23.060134Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:df69239db1a84e2fd0afc914d7817b4427698fd2d530814781d8800939638884","observation_id":"638d1d3a-18dd-4ddf-bb2e-8b69b9e00cc7","resolution":{"observed_at":"2026-08-01T20:16:23.060134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:23.144534Z","title":"SUPERB: Speech Processing Universal PERfor- mance Benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:23.144534Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:c579212eec33f2f98bd2d3d9878204f1d01a84d8a0fae3bcc39719a171bf71ff","observation_id":"0906312f-f869-4462-b093-95513daf5724","resolution":{"observed_at":"2026-08-01T20:16:23.144534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:23.220858Z","title":"BEATs: Audio pre-training with acoustic tokeniz- ers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:23.220858Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:2ac6934bd9b453195d7b751df12b502eb5853aef77bfb876197224d3242cce4b","observation_id":"f811b048-91f5-4d2e-af30-7a19d854438c","resolution":{"observed_at":"2026-08-01T20:16:23.220858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:23.297273Z","title":"BYOL for Audio: Exploring pre-trained general-purpose audio representations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:23.297273Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:d329cb7787c949b2b13927fc261299971b15f4490d27871b88c468b49013abe1","observation_id":"638e6ad8-3499-4060-8411-3b0032341e3b","resolution":{"observed_at":"2026-08-01T20:16:23.297273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:23.347310Z","title":"Masked Modeling Duo: Towards a universal audio pre-training framework,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:23.347310Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:4a86b1ed4764d9ce064d7525c35da09af336a5035b996676b729cd06af6563da","observation_id":"da92d352-f22c-4973-bb0c-54875c2242c6","resolution":{"observed_at":"2026-08-01T20:16:23.347310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:23.418413Z","title":"SSAST: Self- supervised audio spectrogram transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:23.418413Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:4a092ca8a6a0051d653af0a3857e23c8f5b747af179aab60382ce1124679954f","observation_id":"22e87656-fd49-488c-94ac-c72cafbdf840","resolution":{"observed_at":"2026-08-01T20:16:23.418413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:23.529959Z","title":"Single channel target speaker extraction and recognition with speaker beam,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:23.529959Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:295b354ad93272fc162a4d0ed99024cb7b94cf65a9295ca552919cb033629ebd","observation_id":"473254e8-748f-48c4-9400-fd0a1207a7bf","resolution":{"observed_at":"2026-08-01T20:16:23.529959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:23.654179Z","title":"Separate anything you describe,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:23.654179Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:f41231654e773aaf26b85695fcbdc61ed5f06a9d296bf21be181b599e37c7a7d","observation_id":"4fc543ee-ac86-43d4-b6e5-01db2bdc1141","resolution":{"observed_at":"2026-08-01T20:16:23.654179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:23.749977Z","title":"Self-guided target sound extraction and classification through universal sound separa- tion model and multiple clues,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:23.749977Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:f6567f79ce01063a7f7e4d84dc367df1859f45bf9326944cdfeef2671a9e0c41","observation_id":"fd9c3248-6acb-40dd-a147-738377383531","resolution":{"observed_at":"2026-08-01T20:16:23.749977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:23.865253Z","title":"WavLM: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:23.865253Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:f0daa537e5f3287ea848d0fe87dd3265e4114d236fb5646322c4ec801c18f1a4","observation_id":"8414f13f-3882-4e25-8a77-433bc5fe6ba9","resolution":{"observed_at":"2026-08-01T20:16:23.865253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:23.982545Z","title":"Cocktail HuBERT: Generalized self-supervised pre-training for mixture and single-source speech,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:23.982545Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:e85e598afab9535cf3ef6c306f3ad26a21fd30e18ecd2148107c48e6bd314880","observation_id":"92625cb3-882b-4a0e-a80a-2f20c4e77eeb","resolution":{"observed_at":"2026-08-01T20:16:23.982545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:24.109982Z","title":"An adapter based multi-label pre-training for speech separation and enhancement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:24.109982Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:f9df2dd43777e504ece1e402b44de59651530b89954d0531861ed0d009a229d9","observation_id":"53564007-da13-4ab1-814c-9d56e5c799e3","resolution":{"observed_at":"2026-08-01T20:16:24.109982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:24.225917Z","title":"Weakly-Supervised Speech Pre-training: A Case Study on Target Speech Recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:24.225917Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:8c2bbd6eaead586327ca0f0043e347c5decb15dc0dbfeaf880655c0b7fe085ee","observation_id":"7962de11-ffca-4182-b497-e79338a576bc","resolution":{"observed_at":"2026-08-01T20:16:24.225917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:24.320226Z","title":"Adapting self- supervised models to multi-talker speech recognition using speaker embeddings,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:24.320226Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:72ea6b1ee8e4e0c1588036fd76db22e737807abcd2639e0f2706b40601175772","observation_id":"2f35ad3e-bcd4-46a0-a7ec-64e198324d65","resolution":{"observed_at":"2026-08-01T20:16:24.320226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:24.433704Z","title":"SA-WavLM: Speaker-aware self-supervised pre-training for mixture speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:24.433704Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:bbfdda438219df53e5d53f3da11ef4423ba06a15127ca342e12d83d4714c6166","observation_id":"4df20d3f-a0f0-48ad-8c2b-78536824ab73","resolution":{"observed_at":"2026-08-01T20:16:24.433704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:24.540050Z","title":"Suppression of acoustic noise in speech using spectral sub- traction,","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:24.540050Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:366942db6c21c725369fd75e3b853708b7ac8dd0848953d86940517c88f960d4","observation_id":"a9f753d3-9d21-4688-925a-e088aaf2a005","resolution":{"observed_at":"2026-08-01T20:16:24.540050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:24.658196Z","title":"Whisper-Flamingo: Integrating visual features into whisper for audio-visual speech recognition and translation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:24.658196Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:22a58a9f279cf30a8e48e43d39ad9a09863d7a5c903e9b648f51abe5ac80cc2c","observation_id":"7e04660b-3adc-45f5-990e-a09835d02177","resolution":{"observed_at":"2026-08-01T20:16:24.658196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:24.774156Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:24.774156Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:09834ffe9cf6387a8ecfc413c4c322c2e33e9d35b4399d3ce13cfd68c2c80993","observation_id":"e2a33b81-bfb2-409a-a0fc-cca8e6075463","resolution":{"observed_at":"2026-08-01T20:16:24.774156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:24.889169Z","title":"Root mean square layer normalization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:24.889169Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:bde4ac4b3256eb8a84a0c198fe2c0face954dd6fe57c3fd69180ded06d2a7677","observation_id":"684dcb22-48ef-423c-a989-b35b2e66a150","resolution":{"observed_at":"2026-08-01T20:16:24.889169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-01T20:16:24.998866Z","title":"GLU variants improve transformer,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:24.998866Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:30131ac60e56074f9667ffad4986af2146f590b22230af1fdea278d0760e9377","observation_id":"797b2a49-c0ec-47c6-bd61-0a5981b9d04e","resolution":{"observed_at":"2026-08-01T20:16:24.998866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:25.115580Z","title":"FiLM: Visual reasoning with a general conditioning layer,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:25.115580Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:4910a9c955b4cfb1eae2b915c4678c31a6a7113a6993baf44bab33c8a388906d","observation_id":"35ccb02a-3cf8-4364-abbf-84a5c89773c0","resolution":{"observed_at":"2026-08-01T20:16:25.115580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:25.230863Z","title":"SUNAC: Source-aware unified neural audio codec,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:25.230863Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:7dcaf6ed774442311798440b033bb4df4360c6adfe6f5114ca671cf232605616","observation_id":"99506ee8-102e-4ffa-8675-89454e635e5c","resolution":{"observed_at":"2026-08-01T20:16:25.230863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:25.343082Z","title":"Description and discussion on DCASE 2025 chal- lenge task 2: First-shot unsupervised anomalous sound detection for machine condition monitoring,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:25.343082Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:c4837e3aeb9174df1e848341f463360ed19600dd7aff6f2a6f8757f0d02866d8","observation_id":"386133aa-953b-4ece-a09d-1981d7a2c07d","resolution":{"observed_at":"2026-08-01T20:16:25.343082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:25.467772Z","title":"FSD50K: An open dataset of human-labeled sound events,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:25.467772Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:90ce3d6459f1d90ddc86fb5a1e7f25bb9d4125efc1bf73dcacbf3971348fbd5d","observation_id":"175b8a7d-c736-476b-95f7-69d1e95dd3e4","resolution":{"observed_at":"2026-08-01T20:16:25.467772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:25.583090Z","title":"Audio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:25.583090Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:831bb62357f5c9437fa43b57bb1a717664500964a4771c7352ed28113231f8b9","observation_id":"ec52901c-1614-4503-a369-aa8de0670231","resolution":{"observed_at":"2026-08-01T20:16:25.583090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:25.689349Z","title":"WHAM!: Extending speech separation to noisy environments,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:25.689349Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:38241f23df107148278d33e7bd9c912cc5cde784f7042692c3608e55a85e6737","observation_id":"e1aaecc4-d15c-4373-a38a-64062a8cc677","resolution":{"observed_at":"2026-08-01T20:16:25.689349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:25.779447Z","title":"The Diverse Environments Multi-channel Acoustic Noise Database (DEMAND): A database of multichannel environmental noise recordings,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:25.779447Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:d37bdb2d28429f111bf4a6ee7b36136e648687edaa3c7b23c6723c0f21754a8a","observation_id":"e21b7d3c-55fa-47ff-bfff-e29ab653bb26","resolution":{"observed_at":"2026-08-01T20:16:25.779447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:25.840626Z","title":"The QUT-NOISE- TIMIT corpus for the evaluation of voice activity detection algo- rithms,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:25.840626Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:0f7425d8eaba29cf252e68c6fb566ca94dd3b1f38dc35e577c43d2d4d87b6db0","observation_id":"f870dc26-7d5a-4684-a5da-f6d3c471408b","resolution":{"observed_at":"2026-08-01T20:16:25.840626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:25.893544Z","title":"A dataset and taxonomy for urban sound research,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:25.893544Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:b5440432be0c1a1f985df0e9cc23ae3da339da09f711f5c698c50e9dd1cbc29e","observation_id":"b0578b45-398a-485e-a73e-bcb5fa888252","resolution":{"observed_at":"2026-08-01T20:16:25.893544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03209","last_updated":"2018-04-09T19:58:17Z","snapshot_observed_at":"2026-07-06T06:32:32.083176Z","submitted_at":"2018-04-09T19:58:17Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03209","snapshot_observed_at":"2026-08-01T20:16:25.952887Z","title":"Speech Commands: A dataset for limited-vocabulary speech recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:25.952887Z"},"links":{"cited_paper":"/paper/1804.03209","citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:b21fefc5095048b36ba6023e3b60531e37e83f7949dff92dcefb652bce9f22d8","observation_id":"0a4f97c0-848f-4068-a454-19adfcabb356","resolution":{"observed_at":"2026-08-01T20:16:25.952887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:25.999729Z","title":"CREMA-D: Crowd-sourced emotional multimodal actors dataset,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:25.999729Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:b6ac82a1c864b396b292fee9235e8f47bc23435d3a59f25754a3973eb26b6d95","observation_id":"454d5976-327d-4713-82e7-2ba7b7b8071d","resolution":{"observed_at":"2026-08-01T20:16:25.999729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:26.081750Z","title":"Neural audio synthesis of musical notes with wavenet autoencoders,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:26.081750Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:47c320b3b1bbe8b6dc7f4545ac6e7f13fcea680f6bcb95479295ec5426643cbe","observation_id":"cfa18884-04fb-4f4f-91f2-69e659f4a039","resolution":{"observed_at":"2026-08-01T20:16:26.081750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:26.145112Z","title":"One billion audio sounds from GPU-enabled modular synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:26.145112Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:e27eab0c80e0c7e12ffa9d90c88ceaafa1136c26f14c2207c08194f953805fad","observation_id":"48c4ffd4-02e1-4edc-93bf-abdd3859a882","resolution":{"observed_at":"2026-08-01T20:16:26.145112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:26.198595Z","title":"The third ‘CHiME’ speech separation and recognition challenge: Dataset, task and baselines,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:26.198595Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:41da33299c486ca5a949326573f66c396e4acbb3b905e34ddbe5821e2571c245","observation_id":"899ef544-ad3e-4808-a9cf-5acbcef71c54","resolution":{"observed_at":"2026-08-01T20:16:26.198595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:26.251084Z","title":"Rafii, A","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:26.251084Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:303fe401fc191fc8a440939e0c9a04637e61e017f87ef87be62b354d83b39fae","observation_id":"05c7c3ae-09a6-4438-a388-6ed18b0797c4","resolution":{"observed_at":"2026-08-01T20:16:26.251084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:26.303501Z","title":"Visualizing data using t-SNE,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:26.303501Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:a5c249c3cadea5d83fb5752a74a2b25f9c995be41b23faeb877ed6a77ea16720","observation_id":"4b7417d5-3387-4413-9e4a-422959c8060f","resolution":{"observed_at":"2026-08-01T20:16:26.303501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:26.352977Z","title":"ToyADMOS2: Another dataset of miniature-machine operat- ing sounds for anomalous sound detection under domain shift condi- tions,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:26.352977Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:a8a19094a03f376de7612a1283d137853b7a389895aed1aa750f4242429b1f5f","observation_id":"ba6fbb41-9b97-4510-bb77-edb849c13772","resolution":{"observed_at":"2026-08-01T20:16:26.352977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:26.408995Z","title":"MIMII DG: Sound dataset for mal- functioning industrial machine investigation and inspection for do- main generalization task,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:26.408995Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:be349d267714a8ae946e9a582d6ed7877e96e59fe9175066d310e00b85fc55d7","observation_id":"f3bdad16-a684-4fa9-8c01-cd33190ecc08","resolution":{"observed_at":"2026-08-01T20:16:26.408995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:26.507632Z","title":"Toy- ADMOS2025: The evaluation dataset for the DCASE2025T2 first- shot unsupervised anomalous sound detection for machine condition monitoring,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:26.507632Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:3ebf8cdf0605919f75f78477becdaa481e8968ba60f5dceec4bcd1b8772f8372","observation_id":"0d60689f-516b-4cef-a353-442ff695107a","resolution":{"observed_at":"2026-08-01T20:16:26.507632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:26.571209Z","title":"Deep generic representations for domain-generalized anomalous sound detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:26.571209Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:27b3b9b9db6c04e50ab027625735ec974b78bede877016e62a6a9949dfee95c5","observation_id":"a47bee83-edb3-4d6d-9150-a47a0726d828","resolution":{"observed_at":"2026-08-01T20:16:26.571209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:26.619882Z","title":"SMOTE: Synthetic minority over-sampling technique,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:26.619882Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:219c630674e1997ae35883c3f30afc39fe1e6b2f734558edc6f12ffa0130ad05","observation_id":"b78dd777-191f-4350-a701-6aac6c0cd90b","resolution":{"observed_at":"2026-08-01T20:16:26.619882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:26.680751Z","title":"ASDKit: A toolkit for comprehensive evaluation of anomalous sound detection methods,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:26.680751Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:72799aa74926470655731c9a6a511dcfc750a28611f106dda2e00b0aebac87ee","observation_id":"b5a773c7-0c7e-4d69-a048-c8bd5fb4e574","resolution":{"observed_at":"2026-08-01T20:16:26.680751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:16:26.731092Z","title":"Adaptive prototype learning for anomalous sound detection with partially known attributes,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T20:16:26.731092Z"},"links":{"citing_paper":"/paper/2607.16688"},"observation_digest":"sha256:265d5af6e7265a1bb5345c4b962819b44786620d4c5a65d53cf94c471c330c82","observation_id":"5682ae64-41a5-446d-bc9a-2bad735475e1","resolution":{"observed_at":"2026-08-01T20:16:26.731092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16688","last_updated":"2026-07-18T07:43:00Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-01T20:16:22.023774Z","submitted_at":"2026-07-18T07:43:00Z","title":"NABEATs: Noise-Aware Audio Representation Learning"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2607.16688."}