{"as_of":"2026-08-07T10:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f465a9499d0cc5ee236b6b296c35fb80c179ad375ca9b657acfdf065d5afb5fa","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:54:58.313374Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:54:55.658293Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.10391","snapshot_observed_at":"2026-08-04T17:54:55.658293Z","title":"Supervised methods such as RDrop [22] and cosub [23] have demonstrated the advantage of CR by encouraging agreement between model predictions on different augmentations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:55.658293Z"},"links":{"cited_paper":"/paper/2509.10391","citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:f2f2b5bedf9126c036232e1045eaa6763a5506320bdaaffa0a91caecc7c70a7d","observation_id":"41cbc572-9de4-4bf3-9aa5-b599c347ad15","resolution":{"observed_at":"2026-08-04T17:54:55.658293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.10391/citation-record","integrity":"/paper/2509.10391/integrity","json":"/paper/2509.10391/citation-record.json","paper":"/paper/2509.10391"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:55.572272Z","title":"Many se- tups, including supervised and self-supervised audio representation learning, have shown significant results on AER datasets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:55.572272Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:2fa99862fac22ef7cc0535d57e5adae1e365be7fe6398679483933493bbdd01a","observation_id":"5fab59f5-cb00-403f-8630-707cb6cc7490","resolution":{"observed_at":"2026-08-04T17:54:55.572272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.10391","snapshot_observed_at":"2026-08-04T17:54:55.658293Z","title":"Supervised methods such as RDrop [22] and cosub [23] have demonstrated the advantage of CR by encouraging agreement between model predictions on different augmentations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:55.658293Z"},"links":{"cited_paper":"/paper/2509.10391","citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:f2f2b5bedf9126c036232e1045eaa6763a5506320bdaaffa0a91caecc7c70a7d","observation_id":"41cbc572-9de4-4bf3-9aa5-b599c347ad15","resolution":{"observed_at":"2026-08-04T17:54:55.658293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:55.731836Z","title":"pseudo-label","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:55.731836Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:e4c27f21d13f0ed4479b2e0e5575e615ff2304c15055248cb90fb55b6adc5fb9","observation_id":"df7df6db-3906-4f02-bdfb-7828e8505070","resolution":{"observed_at":"2026-08-04T17:54:55.731836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:55.799201Z","title":"Experimental Setup AudioSet:AudioSet [33] is a multi-label audio dataset with 2 mil- lion audio clips of length 10 seconds, totalling to 5,800 hours","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:55.799201Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:f5d5f5b8b583723ef96b53b439eff9ca6511276fbc3884432e11e8e3a7eaa92a","observation_id":"9cb17ecf-091a-4572-ab33-a769680aab6e","resolution":{"observed_at":"2026-08-04T17:54:55.799201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:55.873977Z","title":"Additionally, we apply consistency regularization to a semi-supervised setting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:55.873977Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:a0efa519d22826a893962e7fbac89da7ee80ad3904e8766256f278f6185739fd","observation_id":"775da48e-e088-4064-9bfa-c7e0e679a1b9","resolution":{"observed_at":"2026-08-04T17:54:55.873977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:55.913886Z","title":"Cr-ctc: Consistency regularization on ctc for improved speech recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:55.913886Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:94097a1169cf4f64d7db2cf03a891de9e5e20dfb4280c0ae5599cbcdf8403736","observation_id":"7c13b5ea-4cf9-45d2-b0b2-ff7a588d3a70","resolution":{"observed_at":"2026-08-04T17:54:55.913886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08907","last_updated":"2025-04-25T15:21:54Z","snapshot_observed_at":"2026-07-06T21:08:10.094049Z","submitted_at":"2025-04-11T18:19:59Z","title":"Spatial Audio Processing with Large Language Model on Wearable Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08907","snapshot_observed_at":"2026-08-04T17:54:55.978834Z","title":"Spatial audio processing with large language model on wear- able devices,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:55.978834Z"},"links":{"cited_paper":"/paper/2504.08907","citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:196c8eb7fadf685b041722598662de01ecd5b0960f60f2479789e74292a27ae5","observation_id":"8c72077b-f085-4b3e-aeac-18747d273cfe","resolution":{"observed_at":"2026-08-04T17:54:55.978834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.038170Z","title":"Audio-based event recognition system for smart homes,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.038170Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:ce2940c1b9a2671f7dd8371c49e2a1d2a3a0d22cf7f7e3fa071b874ac6b8b97e","observation_id":"84465527-f406-42cc-8385-921fe031e341","resolution":{"observed_at":"2026-08-04T17:54:56.038170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.127391Z","title":"homesound: Real-time audio event detection based on high performance computing for behaviour and surveillance remote monitoring,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.127391Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:29de425ed28d2008c5a2ef37928ca748f28bcb12f1ff40aa49aa5d4493199392","observation_id":"5d9b7153-dbed-428f-86fe-3a59e9d21402","resolution":{"observed_at":"2026-08-04T17:54:56.127391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.202835Z","title":"Audio-assisted smart home security monitor- ing with few samples,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.202835Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:76754eb8ab56478b0d8f760bb87cf61e08e1064832f6164e71082f9d8921b428","observation_id":"61af8ba0-259c-4757-8bcf-c416105a1793","resolution":{"observed_at":"2026-08-04T17:54:56.202835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.237233Z","title":"Smart home security through real-time audio event detection systems using convo- lutional neural network (cnn),","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.237233Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:4de7954e8af3d5acdd7b59b3fed125070b0a57ede6e0842cb4270fbc6b3e84b0","observation_id":"dd575010-e277-4372-a837-9c637068adf0","resolution":{"observed_at":"2026-08-04T17:54:56.237233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.300609Z","title":"Real-time sound event classification for human activity of daily living using deep neural network,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.300609Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:ac2387d4c357bb4d6c874f6a9bd6b36df270ee81229556bc445fe19384a455b4","observation_id":"f8932d10-baf1-4465-82ba-1cda6eb16532","resolution":{"observed_at":"2026-08-04T17:54:56.300609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.379270Z","title":"Occupant behavior monitoring and emergency event detection in single-person households using deep learning-based sound recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.379270Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:00c6cd335a5071de6aba04d2c6f2e955f0e52c8335bdbb8fec528b8c822e003f","observation_id":"64ebe1bb-7f89-4ea6-8cd6-657ab172bf9e","resolution":{"observed_at":"2026-08-04T17:54:56.379270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.520887Z","title":"Cnn architectures for large-scale audio clas- sification,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.520887Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:1ba2fb8697fd6038abd2ea188eaf3fbbb109b2a6f98066f48469e6e8901d55c5","observation_id":"1378a346-3243-4f3d-a2b7-04a48250434e","resolution":{"observed_at":"2026-08-04T17:54:56.520887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.595990Z","title":"Panns: Large-scale pretrained audio neural net- works for audio pattern recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.595990Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:63ddd338ae5f7b90198ad76b55f21fa0a16429d063f3372c17af5ae78e500309","observation_id":"41102d5d-64fa-41cf-a591-8a6fc4740735","resolution":{"observed_at":"2026-08-04T17:54:56.595990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.634845Z","title":"Contrastive audio-visual masked autoencoder,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.634845Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:318a0472f0e5032eb87a3b94f80bf730382b002d17bb6f72d00ddeb2264f37f1","observation_id":"79b91458-5449-44f5-b5c9-3ccc0a77a1e2","resolution":{"observed_at":"2026-08-04T17:54:56.634845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.706804Z","title":"Masked autoencoders that listen,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.706804Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:e74d9bdb991a1ce6cdff095d56c990a5fa7a2dc650db0a4bae57359161da7478","observation_id":"b29ba5f3-9719-4979-8d5c-7c683345e8d0","resolution":{"observed_at":"2026-08-04T17:54:56.706804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.779425Z","title":"Clap learning audio concepts from natural language supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.779425Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:8e0b77a6199610e5168cdf6e45aa180632653d30515b7da2f490dcfb79db90a0","observation_id":"1685133c-6c83-4731-bd50-adfb2e3439a5","resolution":{"observed_at":"2026-08-04T17:54:56.779425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.945663Z","title":"Ast: audio spectrogram transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.945663Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:9e2984e00a599e18cd4d64334c8d55d55b63727501b41bb4ef2b1379244f30e3","observation_id":"746e463a-996a-4d3f-92df-312166d3562e","resolution":{"observed_at":"2026-08-04T17:54:56.945663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09502","last_updated":"2024-06-20T06:23:16Z","snapshot_observed_at":"2026-07-06T17:44:41.822709Z","submitted_at":"2024-03-14T15:44:19Z","title":"EquiAV: Leveraging Equivariance for Audio-Visual Contrastive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09502","snapshot_observed_at":"2026-08-04T17:54:56.999046Z","title":"Equiav: Leveraging equivariance for audio-visual contrastive learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.999046Z"},"links":{"cited_paper":"/paper/2403.09502","citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:d8f555d270a5ceeb679dc5b14b3811bf6172446bdcd9bf0755388022fdb4296b","observation_id":"a0c86cee-3235-40d1-a4f9-d7d346f5ebc2","resolution":{"observed_at":"2026-08-04T17:54:56.999046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-04T17:54:57.049705Z","title":"Lis- ten, think, and understand,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.049705Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:137222ff58b0e3c424a791c0a20823b081eaeadfc736681169f1fc1ba84ba288","observation_id":"bac6bdd2-ca36-427f-a2f2-b3064ac08d97","resolution":{"observed_at":"2026-08-04T17:54:57.049705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-04T17:54:57.124210Z","title":"Gama: A large audio-language model with ad- vanced audio understanding and complex reasoning abilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.124210Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:3b1ecf889141c2dc7ebbbc221355a22cf54dca25854fff0d1a32378bc438c143","observation_id":"aaef49ed-b065-46dc-bb5a-1772b68ba670","resolution":{"observed_at":"2026-08-04T17:54:57.124210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.197440Z","title":"A simple framework for contrastive learning of visual representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.197440Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:1722ad0204188ab97e94554c121bd5a5051fc69976da08c191c0203c5f89d347","observation_id":"15ae1774-7b0f-4977-9df4-8ac50f2cc36c","resolution":{"observed_at":"2026-08-04T17:54:57.197440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.234879Z","title":"Bootstrap your own latent-a new approach to self-supervised learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.234879Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:2d626a25951c1a7794971c1cdd779997a3ded62c85d2b183291569e7bb889222","observation_id":"e34d7145-6e28-455f-8c31-199fcb2ffb43","resolution":{"observed_at":"2026-08-04T17:54:57.234879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.303026Z","title":"Momentum contrast for unsupervised visual repre- sentation learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.303026Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:3830a6e0e669b157680c5ad6ebad65f69dff9adcb4496b6a9ac022946d9fc58a","observation_id":"b36e53a4-e120-4453-bf76-8e56fb5c5cd3","resolution":{"observed_at":"2026-08-04T17:54:57.303026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.376908Z","title":"Exploring simple siamese rep- resentation learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.376908Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:2ed5b760fe3fad7d30f166581ffacff48009ca3c540e4297bff7f134a0dc3418","observation_id":"b82042f3-51f5-431d-9aa3-ded83a0f0004","resolution":{"observed_at":"2026-08-04T17:54:57.376908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.395393Z","title":"R-drop: Regularized dropout for neural networks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.395393Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:cd658830ce1713e0ea89ace7040c4f44747ab27efaa20d033aa507b746418e23","observation_id":"1c1bfa2c-31ff-476b-8b82-2abaddfa1008","resolution":{"observed_at":"2026-08-04T17:54:57.395393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.452260Z","title":"Co-training 2l submodels for visual recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.452260Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:1ea2bd694899922c5f734c2980a3ff1d90a26d3184a23f93a937935d6654457e","observation_id":"a8e1e356-eed7-4b77-9273-4974853e7509","resolution":{"observed_at":"2026-08-04T17:54:57.452260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.490188Z","title":"Deep convolutional neural net- works and data augmentation for environmental sound classi- fication,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.490188Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:6dd3843f5a1baab2ffcca7d115d7dfbab7738e72f73f3e1d801f7e64f2401140","observation_id":"5eed9c7e-bce0-4f0b-a2b9-c5c5ae3783f2","resolution":{"observed_at":"2026-08-04T17:54:57.490188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.567030Z","title":"Random erasing data augmentation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.567030Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:8ab93f9fc19fc945aba9f84cb84687853b6a667dbd89729037b06895e3dbb2cd","observation_id":"66daf5af-67e0-466f-9886-2e2b8fdd52fe","resolution":{"observed_at":"2026-08-04T17:54:57.567030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.637876Z","title":"V ocal tract length perturbation (vtlp) improves speech recognition,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.637876Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:cece2283d02a0ccc3029522c646ff161813e021aa2548192a8b34ad4f26c222d","observation_id":"1c0c0a2b-2802-4aab-8af6-6b57bcd4d1b9","resolution":{"observed_at":"2026-08-04T17:54:57.637876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.707699Z","title":"Audio aug- mentation for speech recognition,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.707699Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:bcb23484b6e94c681fb4d709a03b08e4bcbf6dfddf0ab6df177b1d271c41ceca","observation_id":"36559119-e772-4285-a058-2c22718db8ce","resolution":{"observed_at":"2026-08-04T17:54:57.707699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-07-06T06:06:04.571585Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-04T17:54:57.774269Z","title":"mixup: Beyond empirical risk minimization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.774269Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:64d407f1aef8d3eb8022ede1b621a1c95715f06f7a40baa93dfc8489c49aa332","observation_id":"d452d497-5849-48dd-acb7-15891240bf6e","resolution":{"observed_at":"2026-08-04T17:54:57.774269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-04T17:54:57.852370Z","title":"Bert: Pre- training of deep bidirectional transformers for language under- standing,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.852370Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:ee04ed5c210e2a23dfb82a2a3b852420b37cbc08853cf688678167b2ff39c657","observation_id":"10c7888f-8269-40c4-bc91-54f388d1bc81","resolution":{"observed_at":"2026-08-04T17:54:57.852370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.894992Z","title":"Masked autoencoders are scalable vision learners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.894992Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:f52a8ad611c370b354fc41c1d751a1acb9b2c974f5e2d25847aac792e28da925","observation_id":"ed96774f-5476-4466-be92-594222c1916c","resolution":{"observed_at":"2026-08-04T17:54:57.894992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.990296Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.990296Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:01f386f27dd4aa3b5e0da626395f5cbb8e8c8586a9c5e91d99f22ed18964ab92","observation_id":"16ca6a12-9148-4908-93e8-76e934bee121","resolution":{"observed_at":"2026-08-04T17:54:57.990296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:58.039016Z","title":"Specaugment: A simple data augmentation method for automatic speech recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:58.039016Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:5c90e8261a4ebab9cb172e9c26f7fee30f027de7e1979f651a119692350d2c9d","observation_id":"96e63ba2-f83e-4b94-829d-12f1f14f5314","resolution":{"observed_at":"2026-08-04T17:54:58.039016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:58.087215Z","title":"Audio set: An ontology and human- labeled dataset for audio events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:58.087215Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:caf9d4231ddc002429c7b2d71a80eb12400cfc806abd22bdeeacaced5e99d65f","observation_id":"962a4e47-9ec5-4509-97bc-1f7571441f72","resolution":{"observed_at":"2026-08-04T17:54:58.087215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:58.199273Z","title":"Ss- lam: Enhancing self-supervised models with audio mixtures for polyphonic soundscapes,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:58.199273Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:644d1a386894b340f102aedd71ec843086f5fc17d72918ae4282c564f0129d15","observation_id":"a0caf519-07e0-4992-901a-91802b48bf1d","resolution":{"observed_at":"2026-08-04T17:54:58.199273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:58.255522Z","title":"Salmonn: Towards generic hearing abilities for large language models.,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:58.255522Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:9e79350d394742107f94097922a71cafe1f1adf652752037b48c58b1f08989ea","observation_id":"1c86ccf6-0e39-439b-b93f-a9feb8e60acb","resolution":{"observed_at":"2026-08-04T17:54:58.255522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-04T17:54:58.313374Z","title":"Qwen- audio: Advancing universal audio understanding via uni- fied large-scale audiolanguage models.,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:58.313374Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:97c130da76280c82631e3f13914bf28c7349852d8c04f2743d26d91ecb77cf89","observation_id":"208ad9f5-e36e-4155-b04d-dc81513863e4","resolution":{"observed_at":"2026-08-04T17:54:58.313374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2509.10391."}