{"as_of":"2026-08-12T16:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:648c098d4a1a50a49a80d67117fbd8183d3a52b3eb12d5d88e07733cd9ad5fd8","coverage":[{"denominator":145,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:49:00.214066Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:55:00.075447Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T21:55:00.763800Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"cited_work":{"arxiv_id":"2506.12785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.12785","snapshot_observed_at":"2026-08-05T21:55:00.763800Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","venue":"eess.AS","work_id":"dc43963d-3864-4bf9-bec7-a9e062074257","year":2025},"citing_paper":{"arxiv_id":"2508.07829","last_updated":"2025-08-11T10:25:58Z","snapshot_observed_at":"2026-08-07T23:23:56.713686Z","submitted_at":"2025-08-11T10:25:58Z","title":"Auditory Intelligence: Understanding the World Through Sound","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:00.075447Z"},"links":{"cited_paper":"/paper/2506.12785","citing_paper":"/paper/2508.07829"},"observation_digest":"sha256:060793b8260fc79eba0bd71a489a0b37c8ac825c96b9d1fc50cbdf2278044cf4","observation_id":"773b6fc6-25d1-44e5-86c6-7f4ef1b8a7d8","resolution":{"observed_at":"2026-08-05T21:55:00.851246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12785/citation-record","integrity":"/paper/2506.12785/integrity","json":"/paper/2506.12785/citation-record.json","paper":"/paper/2506.12785"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:48.929412Z","title":"Virtanen, M","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:48.929412Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:8121c451742895345c31471154591c6928b05437db8a2fa0e3d0fd17cf4e6827","observation_id":"539661d7-a3e5-4e90-9b0c-5f95a67c4e14","resolution":{"observed_at":"2026-08-07T00:48:48.929412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:49.028538Z","title":"Sound event detection in domestic environ- ments with weakly labeled data and soundscape synthesis,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:49.028538Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:b8321dd4b1d47d20da4e9b880e1a0b30109a3200a08e5a130f953a066fd28da9","observation_id":"009ef111-9c0e-48ea-addf-e2cf7a9f0f9a","resolution":{"observed_at":"2026-08-07T00:48:49.028538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:49.135308Z","title":"Convolutional Recurrent Neural Networks for Polyphonic Sound Event Detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:49.135308Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:8f9c123cc65b2dfa2b8cbf3360ba0a4bb2986c8ce12a11689c137b4c0e4fc2bf","observation_id":"d5863fd5-0920-4c1f-8dc9-c3aa8e8e5e32","resolution":{"observed_at":"2026-08-07T00:48:49.135308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/app6060162","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Metrics for Polyphonic Sound Event Detection,","venue":"Applied Sciences","work_id":"fa762b20-ebca-4141-938f-3968e4a3d31e","year":2016},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:49.215355Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:694a5991226bc50fb760ce4afaee0595616e9c633e249c787053b514819ebe5a","observation_id":"baf657a8-564c-425f-ade3-8c74096c6731","resolution":{"observed_at":"2026-08-07T00:49:06.110521Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:49.421142Z","title":"Scaper: A library for soundscape synthesis and augmentation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:49.421142Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:b925979b3134720ba11fdb067dc3c32a0fbcc9b1350c8c2a37de53e38a3d754e","observation_id":"b698f6a4-51d7-4cc4-ad3f-dd26681dfc21","resolution":{"observed_at":"2026-08-07T00:48:49.421142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:49.490376Z","title":"Study on Frequency Dependent Convolution Methods for Sound Event Detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:49.490376Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:42bfec29ee12909b7ab89f92cdfa7b6b7f8ef3fa16c7740438a629e8f7a79126","observation_id":"bd49262b-7575-4dfb-bb24-997b33b1fb4d","resolution":{"observed_at":"2026-08-07T00:48:49.490376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:49.646307Z","title":"SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:49.646307Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:49e91d952528ea961582ca969061b6ba80e50200bacf8ab3018bf90aeaef3703","observation_id":"8f6a84cc-8e1a-4027-aa10-b4e2c3453f8c","resolution":{"observed_at":"2026-08-07T00:48:49.646307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:49.729709Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:49.729709Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:aa45903e3a011a290f18b90e8515a4e77d0844c34daf4645d4e446ec880c806d","observation_id":"b3829ef3-f868-41f5-a815-d801968543df","resolution":{"observed_at":"2026-08-07T00:48:49.729709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:49.806183Z","title":"Coherence-Based Phonemic Analysis on the Effect of Reverberation to Practical Automatic Speech Recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:49.806183Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:889dadaf35d117bc08ec7f628ec9d421634500a12d1e63f0970a9abf1d6ae972","observation_id":"25971b3c-4244-4ef1-95cd-98e32d4284f6","resolution":{"observed_at":"2026-08-07T00:48:49.806183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:49.865503Z","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:49.865503Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:a87163ed4cdda03071f6f8f2b36e0c2847653da0bed90b613a633aa0f086517b","observation_id":"543d5265-b066-4211-8671-e584c7ae4fe7","resolution":{"observed_at":"2026-08-07T00:48:49.865503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:49.989039Z","title":"Hu- BERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:49.989039Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:ebc96a3dd284512fd2a9a65782359c3dda982258ab6e9e6020982f6b7b0d7ce3","observation_id":"a1ab2f71-6425-44aa-ab16-1a6d510e50b4","resolution":{"observed_at":"2026-08-07T00:48:49.989039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:50.120642Z","title":"Attentive Statistics Pooling for Deep Speaker Embed- ding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:50.120642Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:fc389fc24042f6466197d24d9c42d042f0e19f602cc3adfca0d9638d114922fb","observation_id":"93aafc42-d3db-482b-bce1-3a066d83cf67","resolution":{"observed_at":"2026-08-07T00:48:50.120642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:50.178270Z","title":"Exploring the Encoding Layer and Loss Function in End-to-End Speaker and Language Recognition System,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:50.178270Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:5a25e496a2684bb9e7d9968da6235d1e12a1403719840fcc31dd6a7479268050","observation_id":"50d10190-faf3-4754-8aa8-425b654076d8","resolution":{"observed_at":"2026-08-07T00:48:50.178270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:50.290418Z","title":"Analysis-Based Optimization of Temporal Dynamic Convo- lutional Neural Network for Text-Independent Speaker Verification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:50.290418Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:63f34d33c08808f43955d5a54a2065ab2eff792546ad72a244324eab63c15cf8","observation_id":"d0702bd7-df97-45b6-b5b0-62281568aa1d","resolution":{"observed_at":"2026-08-07T00:48:50.290418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:50.382625Z","title":"Integrating Frequency Translational Invariance in TDNNs and Frequency Positional Information in 2D ResNets to Enhance Speaker Verification,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:50.382625Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:04b559500dc09d2519731a8f66c60b4f8031af2acd4379f468db09f6e6570704","observation_id":"f9c91ecd-ca29-4e94-a001-8f477756c92a","resolution":{"observed_at":"2026-08-07T00:48:50.382625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:50.465188Z","title":"Convolution-Based Channel-Frequency Attention for Text-Independent Speaker Verification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:50.465188Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:a696576fd033401ccd625869de1b4352273c5aafb51ceabb1f7c445e9c01bd15","observation_id":"0ce2a84c-7945-4549-8601-af9f9daaec9f","resolution":{"observed_at":"2026-08-07T00:48:50.465188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:50.576650Z","title":"PANNs: Large-Scale Pretrained Audio Neural Networks for Audio Pattern Recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:50.576650Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:e745a625868e38f572b433b3d963e90ebc958c5db192b58007cdc8d93ead437c","observation_id":"8735e0cd-1a57-46b6-827e-e66c07bcbc4c","resolution":{"observed_at":"2026-08-07T00:48:50.576650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.11781","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:07.787608Z","title":"Deep Learning Based Cough Detection Camera Using Enhanced Features,","venue":null,"work_id":"60f59c9a-8755-4687-acbb-6eb35144f8a5","year":2022},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:50.681470Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:39a3bbec38776c2e372215cdc74f12c79f2ad3edc245e61526abcb4581551232","observation_id":"3c071d20-36b5-4aee-94aa-7d47e032ecdd","resolution":{"observed_at":"2026-08-07T00:49:07.919297Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:50.719614Z","title":"Real-Time Sound Recognition System for Human Care Robot Considering Custom Sound Events,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:50.719614Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:c06bf0b9c4cb2a28e652ce4b1e94312f581d1eb1256f0e84885959c2987df3aa","observation_id":"a6bc8ebe-b381-46a5-b0bc-e4ac7885d74e","resolution":{"observed_at":"2026-08-07T00:48:50.719614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:50.852033Z","title":"AST: Audio Spectrogram Transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:50.852033Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:372c77d09deef03371e000d98c6c4a73a8e4e2eb166bba86509eef742e9388ff","observation_id":"c8dfdb10-6b0b-4d7a-af0a-da9b0c2221b5","resolution":{"observed_at":"2026-08-07T00:48:50.852033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:50.942043Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:50.942043Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:729fd08b589887f16e3e5efbbf2ce12e66a45acf6c4150dc0d489986437d740e","observation_id":"03bbcb73-7b85-4ab6-834a-d7ff71fb0197","resolution":{"observed_at":"2026-08-07T00:48:50.942043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:51.042475Z","title":"Overview and Evaluation of Sound Event Localization and Detection in DCASE 2019,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:51.042475Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:dcdb0a49be22d2dd79926d5c63a08efb94f4dee688988401d9cc9084e255744b","observation_id":"af00f5f9-75ce-4cba-b4e5-a9c454df266e","resolution":{"observed_at":"2026-08-07T00:48:51.042475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:51.149327Z","title":"STARSS22: A Dataset of Spatial Recordings of Real Scenes with Spatiotemporal Annotations of Sound Events,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:51.149327Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:577a7e8e7e494523e2ff593cac0af0a81ed52b6775cfbcfc3ea4e0c9daa4cee4","observation_id":"588e050b-c07c-4627-9df0-39bb83c073a4","resolution":{"observed_at":"2026-08-07T00:48:51.149327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:51.234638Z","title":"Data Augmentation and Squeeze-and-Excitation Network on Multiple Dimension for Sound Event Localization and Detection in Real Scenes,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:51.234638Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:47bbbe50144454d2755b6b70bbc12f1ed9889e7c1ea0d4287ba2bab6e6877457","observation_id":"025c7a72-26c1-493c-b6f2-0bda529915da","resolution":{"observed_at":"2026-08-07T00:48:51.234638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:51.360647Z","title":"Automated Audio Captioning with Recurrent Neural Networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:51.360647Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:3a27ab42277ae9d7b8cd9d3c75948c419fd8540058813d2a3d7a3e99f771f02b","observation_id":"36b643bd-7e4e-41c8-b955-7a66ffd24e78","resolution":{"observed_at":"2026-08-07T00:48:51.360647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:51.441687Z","title":"Clotho: An Audio Captioning Dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:51.441687Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:3c31f6b6864fb55de752e38793b0c794c8eeb66c8ca5f88e3576ead4464c642d","observation_id":"7006ec6c-f6e2-4d8b-87d9-e8cd8a19b6bc","resolution":{"observed_at":"2026-08-07T00:48:51.441687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:51.519482Z","title":"ChatGPT Caption Paraphrasing and FENSE-Based Caption Filtering for Automated Audio Captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:51.519482Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:d62d0a0093bbe5f4beeb7b88f3ad986a0f8ef6921653e4826220455bc9c5883d","observation_id":"af296f04-7ddf-45d0-9ad4-3ac66604e07b","resolution":{"observed_at":"2026-08-07T00:48:51.519482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18638","last_updated":"2024-03-27T14:44:24Z","snapshot_observed_at":"2026-07-06T17:52:00.714976Z","submitted_at":"2024-03-27T14:44:24Z","title":"Mind the Domain Gap: a Systematic Analysis on Bioacoustic Sound Event Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18638","snapshot_observed_at":"2026-08-07T00:48:51.639019Z","title":"Mind the Domain Gap: A Systematic Analysis on Bioacoustic Sound Event Detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:51.639019Z"},"links":{"cited_paper":"/paper/2403.18638","citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:5522aac7b6dcff1f7120dcd3ebcb94f6237dc4855927bb6669a30c8256d0360a","observation_id":"1b6587ba-1f49-480a-9e20-210606e30101","resolution":{"observed_at":"2026-08-07T00:48:51.639019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:51.738495Z","title":"Few-Shot Bioacoustic Event Detection Utilizing Spectro- Temporal Receptive Field,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:51.738495Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:b5d2040188b99902472027e2bb36641b1b64cfe25b7d59c3429b5a928869c1a9","observation_id":"17ad86ee-8566-4ad5-863b-f8680a4f79b2","resolution":{"observed_at":"2026-08-07T00:48:51.738495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:51.852790Z","title":"PRTFNet: HRTF Individualization for Accurate Spectral Cues Using a Compact PRTF,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:51.852790Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:4530f4fbe851d3680d2e0f6b4b7bd1fd54ab62ef6c545431128717840f8e0321","observation_id":"50138c18-555b-429d-ace1-6d8ed3057757","resolution":{"observed_at":"2026-08-07T00:48:51.852790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:51.945743Z","title":"FilterAugment: An Acoustic Environmental Data Augmentation Method,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:51.945743Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:fe9a520948dd8e88b80228c336513330aab6123ea7a983352d5c67051a8dd5bc","observation_id":"77be3d1d-84d7-411d-a82a-4cf4cbff3180","resolution":{"observed_at":"2026-08-07T00:48:51.945743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:52.089579Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:52.089579Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:3295edc4c0c3c8183be4f97ecf97c6c2d33c862614245bf79cf3ac2171a2ed3c","observation_id":"0907f3aa-a798-490d-83ac-8dce902108fe","resolution":{"observed_at":"2026-08-07T00:48:52.089579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:52.177252Z","title":"AudioGen: Textually Guided Audio Generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:52.177252Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:0976d1e4631ff52405914496c5452feff3d9c64a743cbb1279858434485936fe","observation_id":"a14bed1b-37af-44b5-bbf7-37f8f58e66a6","resolution":{"observed_at":"2026-08-07T00:48:52.177252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:52.287249Z","title":"VIFS: An End-to-End Variational Inference for Foley Sound Synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:52.287249Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:0c3b6fafe02cdd0d039d5a127cad0cf9b9dd87063abf71fc2cc81328d0d10dd7","observation_id":"f6779d7c-020d-46bb-9cb3-d052f200cfd9","resolution":{"observed_at":"2026-08-07T00:48:52.287249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:52.394553Z","title":"mixup: Beyond Empirical Risk Minimiza- tion,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:52.394553Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:2ee6c0c1c0b81362dcc71feee811344c8272c0de94cac7f69378f10628ca5b19","observation_id":"b4c09c97-5adc-4de2-9fd9-ac57f1a29050","resolution":{"observed_at":"2026-08-07T00:48:52.394553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:52.541804Z","title":"Training sound event detection on a heterogeneous dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:52.541804Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:0772f74cd047568348023f3c33053f1c2cab91fae70c43559a8f5744db14b2d5","observation_id":"e8a71842-8079-41f1-9f04-ccf6057dd2d5","resolution":{"observed_at":"2026-08-07T00:48:52.541804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:52.641479Z","title":"Analysis of weak labels for sound event tagging,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:52.641479Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:c29a92ea04dfcc0ba0fb3b1b30b43d8e8110c17d83c92bcfd1ead8b62b64396b","observation_id":"fff92f36-5be2-48b4-ab32-2e11f7c78f6d","resolution":{"observed_at":"2026-08-07T00:48:52.641479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:52.768458Z","title":"Dynamic Convolution: Attention Over Convolution Kernels,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:52.768458Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:b95304961255e3ce906b524425f7e96cf290c6e69f8f53b2b1c65562ee8ef1fa","observation_id":"0a815ef5-a924-4bc5-9ee4-31c94e73ff45","resolution":{"observed_at":"2026-08-07T00:48:52.768458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:52.896907Z","title":"Attention is All you Need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:52.896907Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:80c7e4979dabfce6524fdb1f0344fbae247f32874db956fb9d3ac1a7c72b83df","observation_id":"b05d9815-b2d9-4937-a63e-3c139e363e1c","resolution":{"observed_at":"2026-08-07T00:48:52.896907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:53.110217Z","title":"Mean teachers are better role models: Weight-averaged consistency targets improve semi-supervised deep learning results,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:53.110217Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:f46ccfb422b8c9fb5503a2673d8d592abc2b107630057f61c405e44a4a158090","observation_id":"de71caf9-122b-4640-bbd3-c92ec1a7d138","resolution":{"observed_at":"2026-08-07T00:48:53.110217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:53.238103Z","title":"Multi-Dimensional Frequency Dynamic Convolution with Con- fident Mean Teacher for Sound Event Detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:53.238103Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:747f70a3a8f8fa3e52fc23b9221cc3c542d372739ff5b09aa7e52299d38e84de","observation_id":"1fbbbf31-12a2-4dc3-ad0b-dbf47f529fcd","resolution":{"observed_at":"2026-08-07T00:48:53.238103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:53.351756Z","title":"AST-SED: An Effective Sound Event Detection Method Based on Audio Spectrogram Transformer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:53.351756Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:b1d4d90d96774d8550aa425108c0460ed81488b976e5f767c58a9ff4d6ed1456","observation_id":"8dd12da7-9011-48f5-a0c1-d7e8de9cb0eb","resolution":{"observed_at":"2026-08-07T00:48:53.351756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:53.468657Z","title":"Fine-Tune the Pretrained ATST Model for Sound Event Detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:53.468657Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:b19421d262a9c8d58f2bdf6cbab9ba435224f84c88024ee58da914367302af90","observation_id":"03104088-1234-43a0-8d58-dc3f0cf0eebf","resolution":{"observed_at":"2026-08-07T00:48:53.468657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:53.580545Z","title":"Squeeze-and-Excitation Networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:53.580545Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:1087b731f22fc310bac689a2c6462edb0fbc631ad64580e275cf05ed9f627975","observation_id":"31fbc260-106f-4357-a427-03a7acd400b3","resolution":{"observed_at":"2026-08-07T00:48:53.580545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:53.663826Z","title":"Learnable Sparse Filterbank for Speaker Verification,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:53.663826Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:85d3ab2c19a468e6c12c7b5725bd910601c369bb6685b6f31b0695a6061b73d3","observation_id":"7c80d2b2-325c-4a46-a991-88186ba45a95","resolution":{"observed_at":"2026-08-07T00:48:53.663826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:53.776576Z","title":"Selective Kernel Networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:53.776576Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:dbfc02e5aa2e28609290bb46c3213be4723f6e8e8ae71209b87fb5e7854a1302","observation_id":"0dc8b012-bfc2-40cb-b6b3-1651a5f9d0dd","resolution":{"observed_at":"2026-08-07T00:48:53.776576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:53.886070Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:53.886070Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:f8a9eedd6bb27b50b0afb0f7cb865365904f865f55a584dc6013b89f75375c76","observation_id":"1879d434-8163-4089-ba53-5c9242459792","resolution":{"observed_at":"2026-08-07T00:48:53.886070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:53.982180Z","title":"Audio Set: An Ontology and Human-Labeled Dataset for Audio Events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:53.982180Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:524d8ba66832d78da6b9871cb1664b53225cf80db3974e110b9ed269a4fca8e7","observation_id":"4e88fa42-4170-4696-8c22-6937e95a92bc","resolution":{"observed_at":"2026-08-07T00:48:53.982180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:54.091369Z","title":"Convolution- Augmented Transformer for Semi-Supervised Sound Event Detection,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:54.091369Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:be6016a2adf5db3e31d598d04197d9da2e3ac2125049851c98e3bc126eb8ae0a","observation_id":"3c310007-1b36-420d-a64a-a0ab95b30592","resolution":{"observed_at":"2026-08-07T00:48:54.091369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:54.196641Z","title":"Zheng USTC Team’s Submission for DCASE2021 Task4 – Semi- Supervised Sound Event Detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:54.196641Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:3bf490034a285f2eed32a9dfe3cc3f5a31c6b3274c9c52c54e12424991d3c19d","observation_id":"ad92f792-98ee-479d-a73e-9ff0ca7670a3","resolution":{"observed_at":"2026-08-07T00:48:54.196641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:54.348164Z","title":"Pre-Training and Self-Training for Sound Event Detection in Domestic Environments,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:54.348164Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:262c4c4e80e52632e5ce48653e2f0a93393f8d8ec41d72f5b07ba584aa7b2cb7","observation_id":"8525dc14-3a82-45bc-8a07-0a2325c11a30","resolution":{"observed_at":"2026-08-07T00:48:54.348164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:54.468430Z","title":"Semi-Supervised Sound Event Detection System for DCASE 2022 Task 4,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:54.468430Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:6f5ede644592aa51d89eb12f5048338dc9993bf837df28bece7747aa055113b7","observation_id":"548cadaa-9e97-460f-a8ce-c8ee991120fd","resolution":{"observed_at":"2026-08-07T00:48:54.468430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:54.575467Z","title":"Data Engineering for Noisy Student Model in Sound Event Detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:54.575467Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:6760354d44eff609345b2be1c43eaa112068fffe14466fe48a99b4902f3111e4","observation_id":"eb34a07e-d00c-4b89-87dc-dc2b119579b3","resolution":{"observed_at":"2026-08-07T00:48:54.575467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:54.675730Z","title":"Pretrained Models in Sound Event Detection for DCASE 2022 Challenge Task4,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:54.675730Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:7e1023d08a850fd03556c4af357ea091ab0f5b5566f417c09d75edb642905a97","observation_id":"88f87b0f-6ee1-4d55-b479-f599487b1434","resolution":{"observed_at":"2026-08-07T00:48:54.675730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:54.785567Z","title":"Semi-Supervised Learning- Based Sound Event Detection Using Frequency Dynamic Convolution with Large Kernel Attention for DCASE Challenge 2023 Task 4,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:54.785567Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:6a5d335cd75cda4b19cc3fae9015ce84402d337f9fd03e14f9a05832cfa4a49f","observation_id":"3c528f63-c202-4aa1-8724-66a92e1114a4","resolution":{"observed_at":"2026-08-07T00:48:54.785567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:54.884923Z","title":"How Information on Soft Labels and Hard Labels Mutually Benefits Sound Event Detection Tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:54.884923Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:c067a64e632190ada49f1cdae132d6edbf459b946d5d554eb33b8929bf2206a2","observation_id":"e073c72b-671b-4c0c-869e-f5f199eb4ac7","resolution":{"observed_at":"2026-08-07T00:48:54.884923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:55.021297Z","title":"Sound Event Detection with Weak Prediction for DCASE 2023 Challenge Task4A,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:55.021297Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:6e67e78f796d6447357b362056b4b0544954d6535d054fc26e0cf07bfe5c0242","observation_id":"b9feec31-4096-4bda-be2e-046b6f56f864","resolution":{"observed_at":"2026-08-07T00:48:55.021297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:55.126449Z","title":"CHT+NSYSU Sound Event Detection System With Multiscale Channel Attention And Multiple Consistency Training For DCASE 2021 Task 4,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:55.126449Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:0631e000ee10adc5eedd09d84a76fff1ae0a66d658c8b8bff141913d6f7728eb","observation_id":"062a91e2-47ca-4ebe-92a3-fba57722d0a7","resolution":{"observed_at":"2026-08-07T00:48:55.126449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:55.263627Z","title":"Sound Event Detection Based on Self-Supervised Learning of Wav2vec 2.0,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:55.263627Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:0e8ace9292c4b38b844c53908f19f5b39787797c954c44e58a1f8c5201393b6d","observation_id":"3a3e0468-bf84-4561-a73f-cb3c8117da9a","resolution":{"observed_at":"2026-08-07T00:48:55.263627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:55.359735Z","title":"Convolution-Augmented Conformer for Sound Event Detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:55.359735Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:61ddd210c28e8d0cfe64e9138b19920852b844de4b85956c5b8edefdf68d8f31","observation_id":"e266989d-f469-4232-8195-774fccff0fde","resolution":{"observed_at":"2026-08-07T00:48:55.359735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:55.476794Z","title":"Convolutional Network with Conformer for Semi-Supervised Sound Event Detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:55.476794Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:ee02712f4ab5c9a136ebe918e40a91aca4188af3b71593d2db7b85ff2981ef54","observation_id":"e4fda926-78d6-4ca5-8da1-05562365d70c","resolution":{"observed_at":"2026-08-07T00:48:55.476794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:55.551242Z","title":"Integrating Advantages of Recurrent and Transformer Struc- tures for Sound Event Detection in Multiple Scenarios,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:55.551242Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:c41d0f93a75d64d1f1abef1e30953c2306475d072718ae76447352f5eb807ec0","observation_id":"601fbe49-1a2d-4fdd-a870-40443814e014","resolution":{"observed_at":"2026-08-07T00:48:55.551242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12688","last_updated":"2023-04-25T09:43:40Z","snapshot_observed_at":"2026-07-06T15:19:42.790821Z","submitted_at":"2023-04-25T09:43:40Z","title":"Leveraging Audio-Tagging Assisted Sound Event Detection using Weakified Strong Labels and Frequency Dynamic Convolutions","version":1},"cited_work":{"arxiv_id":"2304.12688","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.12688","snapshot_observed_at":"2026-08-07T00:49:07.358624Z","title":"Leveraging Audio-Tagging Assisted Sound Event Detection using Weakified Strong Labels and Frequency Dynamic Convolutions","venue":"eess.AS","work_id":"2b6d47dc-b419-4512-bfff-ffaae3c767ac","year":2023},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:55.648253Z"},"links":{"cited_paper":"/paper/2304.12688","citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:8f32ec24d294f1b53c3555690fb5b3e2f83851eef722007c23c4f865e70b82ab","observation_id":"2d899e46-bd84-4a33-b855-eb7dad8974e3","resolution":{"observed_at":"2026-08-07T00:49:07.491883Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:55.746826Z","title":"Semi-Supervised Sound Event Detection with Pre- Trained Model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:55.746826Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:6ef7c0c2624a79abd99d89c1d1c59210bb4ffcc59df90c5d0e0fffd4bda76223","observation_id":"e0c1ae3a-6404-4775-a04b-f94a0cb11d95","resolution":{"observed_at":"2026-08-07T00:48:55.746826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:55.844003Z","title":"ATST: Audio Representation Learning with Teacher-Student Transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:55.844003Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:7b8fbc0ffbb2079123442ad84567aa63f8d2455e5d78bb4eb8db6672163eee37","observation_id":"368fe549-5815-4b60-af6b-0ad2d66c631f","resolution":{"observed_at":"2026-08-07T00:48:55.844003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:55.950439Z","title":"Self-Supervised Audio Teacher-Student Transformer for Both Clip-Level and Frame-Level Tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:55.950439Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:b08291d600c1ecdb45fa25957b9328c1e59202a4fb91002d30cf5ee42e331fc7","observation_id":"a3bbbb66-4277-45d6-b6a0-e22dffd6e4aa","resolution":{"observed_at":"2026-08-07T00:48:55.950439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:56.053610Z","title":"Multi-Scale Context Aggregation by Dilated Convolutions,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:56.053610Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:3fcae234cd1d4a136653f990ca43ead08f4ee54ef8c76e1a490f50551fd86908","observation_id":"c0e64447-78b3-4a82-ba6c-01a37139f9be","resolution":{"observed_at":"2026-08-07T00:48:56.053610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:56.212286Z","title":"Sound Event Detection with Depth- wise Separable and Dilated Convolutions,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:56.212286Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:808c89f8709f70f78cc9aaf19609ab478fda3b6c04a9e63d85f8b1d086d71d2b","observation_id":"43f6041a-e12f-4145-89d6-3ab2c2e72947","resolution":{"observed_at":"2026-08-07T00:48:56.212286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:56.327640Z","title":"Sound Event Detection Via Dilated Convolutional Recurrent Neural Networks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:56.327640Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:d9f48c309729f0e329e53f490f18ebdc05da55929af6728562cd93443f229bb5","observation_id":"597134ed-69c5-49e6-bfe4-47073dd38cff","resolution":{"observed_at":"2026-08-07T00:48:56.327640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2017.80961","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:07.043230Z","title":"Dilated Convolution Neural Network with LeakyReLU for Envi- ronmental Sound Classification,","venue":null,"work_id":"083a6271-93fe-4d7c-8dd5-266866cfd0e5","year":2017},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:56.441395Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:e40ecaa8d83d09f00f4519c6c439e51343913825e288676ad667c678820f4afe","observation_id":"59a3bbd8-cd61-4e8f-9e59-cb3922725008","resolution":{"observed_at":"2026-08-07T00:49:07.129979Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:56.558004Z","title":"Efficient Large-Scale Audio Tagging Via Transformer-to- CNN Knowledge Distillation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:56.558004Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:f75ac4eae7e0b5d90563f3f0a473d25c3c806da829dc8d1e9642add81d1879f5","observation_id":"25674e0f-e48d-45dd-81d3-1e5c5c3e047b","resolution":{"observed_at":"2026-08-07T00:48:56.558004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:56.657474Z","title":"Dynamic Convolutional Neural Networks as Efficient Pre-Trained Audio Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:56.657474Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:a67fce686ef33f3aabce3b5e0684ade7eab63775fb1ece40a2f9e1a7929317f8","observation_id":"814b4f09-2190-453e-b875-30f8e84190c5","resolution":{"observed_at":"2026-08-07T00:48:56.657474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:56.790749Z","title":"BERT: Pre-training of Deep Bidirec- tional Transformers for Language Understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:56.790749Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:c6aa6d947d187094edd219284f6525f89edba3e6853a91242554db4563a00b2c","observation_id":"471a936c-4d3a-4262-ad4a-ed40f7c8fdc3","resolution":{"observed_at":"2026-08-07T00:48:56.790749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:56.902037Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:56.902037Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:47796de109d2d05d63839816d23c1b8ce87a79f18f9fae8cd2b72dcc7f72e178","observation_id":"959557c2-1a47-44b0-befc-d8e6b4c6cc8b","resolution":{"observed_at":"2026-08-07T00:48:56.902037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:56.988292Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:56.988292Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:70292b7214317bf021817f60f066709e1fcdd41b3735c0edc3244107e857d4b1","observation_id":"f604eba2-0bc7-4612-80a7-9d909eadbedd","resolution":{"observed_at":"2026-08-07T00:48:56.988292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:22.728134Z","title":null,"venue":null,"work_id":"a57fc734-e9cd-4905-8c1f-3f7e1196a33d","year":2011},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:57.090674Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:8fc1107e208b30140184725ab6d4216bab415f23162fb48cea05b85d57177e46","observation_id":"b2d4df3e-386f-43ea-a41c-754f65ca3dd1","resolution":{"observed_at":"2026-08-07T00:49:22.858215Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:22.589724Z","title":null,"venue":null,"work_id":"f838df13-4eeb-4d22-a770-c9ed26d63143","year":2013},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:57.257002Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:e0e4718764ecbb320ef96776432f73f3930f5394bd9dea115a5127dbfb0586f6","observation_id":"167e565a-458f-4ce2-879c-3e1a388627cb","resolution":{"observed_at":"2026-08-07T00:49:22.655940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:22.469203Z","title":"Rabiner and R","venue":null,"work_id":"536cbe81-67b9-4fa0-9176-3b8b392314a7","year":2010},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:57.411586Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:58fa3aea85d71f0c406fc4b59d79cdc274c8364bbdf125daa2124be5f1f3e37d","observation_id":"5d4d6799-5fe6-4f6a-9a74-9a67b56fd0c9","resolution":{"observed_at":"2026-08-07T00:49:22.515991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:22.235020Z","title":"DCASE2021 Task4 Baseline,","venue":null,"work_id":"5b96d05e-4427-4b81-802a-702aeb77d0d8","year":null},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:57.511691Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:6143f700b69c66bfa94806c4834c73e6109cdd90a03c28277e503b9837189ef6","observation_id":"1914e889-473d-4cc1-a04a-10a4ae2fe6e9","resolution":{"observed_at":"2026-08-07T00:49:22.360628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:21.980008Z","title":"DCASE 2021 Challenge Task4: Sound event detection and separation in domestic environments,","venue":null,"work_id":"fce5292d-6d85-481d-b6d7-740e1681009a","year":2021},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:57.644192Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:9197776ace623598d1febde15f91655eabcc6396fcdb633f87d7743a6a571f5b","observation_id":"a78996bd-12d3-4910-9df4-272abdadc4f9","resolution":{"observed_at":"2026-08-07T00:49:22.115001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:21.784023Z","title":"Threshold Independent Evaluation of Sound Event Detection Scores,","venue":null,"work_id":"4723f939-6e38-46dc-8a2c-7bff62a202ff","year":2022},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:57.736201Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:2ce094a292f01c89ab6525e973c8d2dea8880f62aeb13720271af12162c06c8f","observation_id":"d196e834-0104-4b61-bb37-97753596fce9","resolution":{"observed_at":"2026-08-07T00:49:21.846053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:21.624879Z","title":"MAT-SED: A Masked Audio Transformer with Masked-Reconstruction Based Pre-training for Sound Event Detection,","venue":null,"work_id":"24a73eda-81d0-4286-bfbd-a0c9c0ccb7f6","year":2024},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:57.847739Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:a8c613bf566c9b7a807258e934ca7b1870106d9c1f581dc5ef49aaf518075f6b","observation_id":"f6fa45d7-4688-4a2a-858a-99c4e5a5e662","resolution":{"observed_at":"2026-08-07T00:49:21.690040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:21.488420Z","title":"Sound Event Bounding Boxes,","venue":null,"work_id":"25c2ca35-8287-43f3-ae73-a2d05f7a3883","year":2024},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:58.015459Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:d2a7ee59ce3b0ac366c427a2d89a83ca91ca8c092ab343a8a83d43b3b1ad2365","observation_id":"cf60ad4f-7d8a-4f7d-a929-beb878c8033b","resolution":{"observed_at":"2026-08-07T00:49:21.553296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17656","last_updated":"2024-09-26T09:07:20Z","snapshot_observed_at":"2026-08-01T15:02:35.186680Z","submitted_at":"2024-09-26T09:07:20Z","title":"Prototype based Masked Audio Model for Self-Supervised Learning of Sound Event Detection","version":1},"cited_work":{"arxiv_id":"2409.17656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.17656","snapshot_observed_at":"2026-08-07T00:49:06.783026Z","title":"Prototype based Masked Audio Model for Self-Supervised Learning of Sound Event Detection","venue":"cs.SD","work_id":"dd8050e8-3f26-4c78-9670-7fa723021657","year":2024},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:58.115642Z"},"links":{"cited_paper":"/paper/2409.17656","citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:52d46d3c45a8c3431dd55ff482b5bfbff33fd71ea9be6b22fa860b3f720e37ee","observation_id":"39b50c4d-6254-4c9a-8ae0-fad303a797de","resolution":{"observed_at":"2026-08-07T00:49:06.862041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:21.274883Z","title":"Efficient Training of Audio Transformers with Patchout,","venue":null,"work_id":"5abf3111-8bda-46d3-bf4c-06110cec29bc","year":2022},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:58.243154Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:e5e181da2a07aaa31b334393cb9a08badd895684260726b9e22c3dc1cd1225c0","observation_id":"41a08306-86a5-43f6-ac29-7a8e1cba8bef","resolution":{"observed_at":"2026-08-07T00:49:21.330693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:20.980915Z","title":"IMPROVING AUDIO SPECTRO- GRAM TRANSFORMERS FOR SOUND EVENT DETECTION THROUGH MULTI-STAGE TRAINING,","venue":null,"work_id":"192795a4-3425-4ec0-b56a-509e2aaed72b","year":2024},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:58.346322Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:f419b1127d5eb04232617318215dc2a29d23b6cbe2ce37b3131bd7b108f866f4","observation_id":"6c7b03a0-1238-41c2-b87f-a2944c085284","resolution":{"observed_at":"2026-08-07T00:49:21.105017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:58.482585Z","title":"The Ins and Outs of Speaker Recognition: Lessons from VoxSRC 2020,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:58.482585Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:88e3e00ea2193e82219b7359ef4c39f4aec3d76b0f09f46ac3948da51c9279d5","observation_id":"69faafe9-73e2-422b-9915-3f0ff8e4d52c","resolution":{"observed_at":"2026-08-07T00:48:58.482585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:20.658313Z","title":"In Defence of Metric Learning for Speaker Recognition,","venue":null,"work_id":"8485a094-9779-4e09-96a5-320f32c8a231","year":2020},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:58.612610Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:dac245d0807c93cf7baf5701a6a67dbb5088e37110e5a14cd8159e763c426b88","observation_id":"87888996-d384-417a-8aeb-c053485142b3","resolution":{"observed_at":"2026-08-07T00:49:20.814887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:20.333271Z","title":"SSAST: Self-Supervised Audio Spectrogram Trans- former,","venue":null,"work_id":"ed22164d-df63-487d-8c48-516d84813a1d","year":2022},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:58.734731Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:dd09e6beda3af7d2918f41fa0ddedd7257d90f586dfe5fdb896e3d29775b4985","observation_id":"2d237795-2a10-4df8-86eb-1a45731034a6","resolution":{"observed_at":"2026-08-07T00:49:20.475394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:20.079333Z","title":"Masked Autoencoders that Listen,","venue":null,"work_id":"53b24a62-904b-405a-b139-89c2a55c23f2","year":2022},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:58.882829Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:ea6c68fa4886a770f343e950ea7bb92034f65f31f9d7ec8bbd836d19e480bbc2","observation_id":"15331e17-cbb3-4afb-b3a0-2f0b3836315f","resolution":{"observed_at":"2026-08-07T00:49:20.198194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:19.742259Z","title":"BYOL for Audio: Self-Supervised Learning for General-Purpose Audio Representation,","venue":null,"work_id":"938f4d3a-f832-4bbd-831b-29550da562ce","year":2021},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:59.031693Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:a3dde81070aaa65a36c698d375f7acc11e6882121d0fec9c182c9e69044376e4","observation_id":"2cc1a712-d31e-4484-9f2a-5c1fd8484874","resolution":{"observed_at":"2026-08-07T00:49:19.903177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:19.492645Z","title":"Jigsaw Clustering for Unsupervised Visual Representation Learning,","venue":null,"work_id":"2f55b0b5-e9e7-48bb-895b-8de3035ce9d1","year":2021},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:59.139343Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:a750f992800a5ae8f8a238a3ec5683129aff412e94fb807330c42026b96ffb15","observation_id":"17a07bb4-e422-481f-ac03-4572f39d178f","resolution":{"observed_at":"2026-08-07T00:49:19.580119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:19.327628Z","title":"Jigsaw-ViT: Learning Jigsaw Puzzles in Vision Transformer,","venue":null,"work_id":"3b393e45-4d02-4cef-977f-257a32fa4508","year":2023},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:59.274502Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:bae5330ac69af50e106b4ad7af3a828acee18727065f20f3975063094f3c6f16","observation_id":"7037ad4d-860f-4b90-9259-0a2c473e453b","resolution":{"observed_at":"2026-08-07T00:49:19.394286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:19.143241Z","title":"Shuffle and Learn: Unsupervised Learning Using Temporal Order Verification,","venue":null,"work_id":"c0287221-258d-40fd-9e17-6fdd2bca96b2","year":2016},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:59.388624Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:68c03561685371ad8337035c5eb6eab823300c764b4e833baaee1a24a9ad443a","observation_id":"e68d9227-2c4b-46d5-a492-b66be2bd6216","resolution":{"observed_at":"2026-08-07T00:49:19.255891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:18.950441Z","title":"TERA: Self-Supervised Learning of Transformer Encoder Representation for Speech,","venue":null,"work_id":"4f80d593-c98b-4c8d-a6e7-7ae3471b8f20","year":2021},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:59.515530Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:705d2c4bfc6b32f1930973379ccefa93a1ff55984896d209e63d8bf03a54dfc4","observation_id":"37390c97-23fd-4638-a759-cb8189fe4e54","resolution":{"observed_at":"2026-08-07T00:49:19.006200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:18.708869Z","title":"Transformer-XL: Language Modeling with Longer-Term Dependency,","venue":null,"work_id":"9242995b-af29-4ec8-89ff-3f67524b69cb","year":2019},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:59.623284Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:132dbb58774f914c402e56ca63ca0e1354b9f7ee6c332652c3685333e1560f5e","observation_id":"e9d7e153-c5c0-4574-9891-b0ce5a30571a","resolution":{"observed_at":"2026-08-07T00:49:18.808956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:18.587921Z","title":"You Only Hear Once: A YOLO-Like Algorithm for Audio Segmentation and Sound Event Detection,","venue":null,"work_id":"5567b3ae-76cc-4ff8-94d2-048e84a2701a","year":2022},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:59.703616Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:4fda7595613635df11ec2952683d8a4deb6c9074f7afd856a64df0f5adff5415","observation_id":"750a43e0-989b-4cd2-9b2a-4d9fb449565d","resolution":{"observed_at":"2026-08-07T00:49:18.660937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:18.404925Z","title":"Adaptive Convolutional Neural Network for Text-Independent Speaker Recognition,","venue":null,"work_id":"8bcde1cd-9a28-48b6-8690-dcea948163e0","year":2021},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:59.792347Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:fb299607fa5646fd23616ad6b968fb84cee7354de96cda34885076ea7b69ee10","observation_id":"b8c74fac-ef19-4f14-be1a-4be3064dd5ff","resolution":{"observed_at":"2026-08-07T00:49:18.482031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:49:18.277470Z","title":"Temporal Dynamic Convolutional Neural Network for Text- Independent Speaker Verification and Phonemetic Analysis,","venue":null,"work_id":"1813df9a-42ff-4cf4-b9bc-65a40d7e33f5","year":2022},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:59.970395Z"},"links":{"citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:4fcaec7d27a0945b786215da271057b662d1b8d03bbd0ae2b196449863a2c437","observation_id":"c41fd78a-b033-4d62-9a10-ee39757ea5f5","resolution":{"observed_at":"2026-08-07T00:49:18.345383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15277","last_updated":"2022-10-27T11:58:35Z","snapshot_observed_at":"2026-08-12T13:11:21.519250Z","submitted_at":"2022-03-29T06:46:53Z","title":"Decomposed Temporal Dynamic CNN: Efficient Time-Adaptive Network for Text-Independent Speaker Verification Explained with Speaker Activation Map","version":2},"cited_work":{"arxiv_id":"2203.15277","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.15277","snapshot_observed_at":"2026-08-07T00:49:06.630328Z","title":"Decomposed Temporal Dynamic CNN: Efficient Time-Adaptive Network for Text-Independent Speaker Verification Explained with Speaker Activation Map","venue":"eess.AS","work_id":"ee447685-0a22-4157-a2dc-b458f0365c83","year":2022},"citing_paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:00.214066Z"},"links":{"cited_paper":"/paper/2203.15277","citing_paper":"/paper/2506.12785"},"observation_digest":"sha256:5d9d6ea55ea57d4992452110bc51e574f76ec551ec304b2017def25dccea21ac","observation_id":"d1ee8a92-291b-4ea0-8345-2989f0f605b8","resolution":{"observed_at":"2026-08-07T00:49:06.683409Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12785","last_updated":"2025-06-15T09:32:16Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T00:40:07.029946Z","submitted_at":"2025-06-15T09:32:16Z","title":"Frequency Dynamic Convolutions for Sound Event Detection"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":74,"verified_exact":4,"verified_fuzzy":20},"total_outbound_references":145},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 100 of 145 outbound references and 1 inbound Pith citation observation for arXiv:2506.12785."}