{"as_of":"2026-08-24T02:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6013735eea860934d728543541c0529091b04c4d91998dc4f2f0906db6865516","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:56:00.959111Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:55:57.464669Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T13:56:00.980511Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"cited_work":{"arxiv_id":"2507.20036","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.20036","snapshot_observed_at":"2026-08-06T13:56:00.980511Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","venue":"cs.SD","work_id":"e4224099-0600-4281-a3d7-2b3422aa6ea1","year":2025},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:55:57.464669Z"},"links":{"cited_paper":"/paper/2507.20036","citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:3690cc75b14a5e7d7e0f5289327696327ff9b31cd169ab52bb9f7b31f6e0ffa1","observation_id":"25ff1e03-5199-47c7-afda-8bfde9958495","resolution":{"observed_at":"2026-08-06T13:56:00.985665Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.20036/citation-record","integrity":"/paper/2507.20036/integrity","json":"/paper/2507.20036/citation-record.json","paper":"/paper/2507.20036"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.292196Z","title":"Competitions like DCASE [1] and accompanying datasets like TUT [2] and CochlScene [3] showcase the importance and interest in acous- tic scene classification and event detection","venue":null,"work_id":"2a9f96e9-3e0d-4c5d-865e-8846c30cb5c5","year":null},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:55:57.417938Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:ba9df7d72b552da409a16808be213228341717f98b365de96c69a3208b4cb9a4","observation_id":"3c7b0233-dc6d-426a-873f-3fac62f97c2d","resolution":{"observed_at":"2026-08-06T13:56:01.295329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"cited_work":{"arxiv_id":"2507.20036","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.20036","snapshot_observed_at":"2026-08-06T13:56:00.980511Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","venue":"cs.SD","work_id":"e4224099-0600-4281-a3d7-2b3422aa6ea1","year":2025},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:55:57.464669Z"},"links":{"cited_paper":"/paper/2507.20036","citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:3690cc75b14a5e7d7e0f5289327696327ff9b31cd169ab52bb9f7b31f6e0ffa1","observation_id":"25ff1e03-5199-47c7-afda-8bfde9958495","resolution":{"observed_at":"2026-08-06T13:56:00.985665Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.284507Z","title":null,"venue":null,"work_id":"26e192a1-b6db-4805-aabd-4ee43a2243aa","year":null},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:55:57.603123Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:7555eee58c42d436d59cc7801c70fcb2d22a2d6e096d4ded98ded4c13236f78a","observation_id":"53578a95-e264-4e44-8eda-1eddd994389f","resolution":{"observed_at":"2026-08-06T13:56:01.287027Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.277287Z","title":"Data The performance evaluation is based on three datasets: BBL (internal), ESC-50, and FSD50K","venue":null,"work_id":"d8129388-e9f5-45f9-ab1c-77c2d97241b1","year":2000},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:55:57.741015Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:d2db1b5c33b37fcf9e327ca578c9a5c5f1f4594ce085877773d7a05b61fe8084","observation_id":"0b06484c-cd06-4e27-8e72-8882be3c8e65","resolution":{"observed_at":"2026-08-06T13:56:01.279903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.269562Z","title":"For ESC-50 and FSD50K, results are obtained from the respective papers","venue":null,"work_id":"67652974-2ba0-417e-9d80-7365f4b753f4","year":null},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:55:57.830040Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:466eb67349dc0668519efd3990d4a781c94621f870402d248ca2b8909a6e266e","observation_id":"9d95c1aa-c5db-43bb-b6c3-6cd294223879","resolution":{"observed_at":"2026-08-06T13:56:01.272383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.261652Z","title":"Our few-shot approach, uti- lizing a small number of audio samples, consistently outper- formed zero-shot classifiers on different datasets by 2 to 10 % points in accuracy","venue":null,"work_id":"a7f81578-b985-490e-ab54-a2f1f45cba5d","year":null},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:55:57.907142Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:a2b316b6142103d3e72702c8a3975910c38a1ab6cbd3981d68a25c1f7993bf28","observation_id":"d197fded-a107-4617-b5f7-6d6448472ff3","resolution":{"observed_at":"2026-08-06T13:56:01.264562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.253539Z","title":"Sound Event Detection in the DCASE 2017 Challenge,","venue":null,"work_id":"8f3a7011-edcd-4bde-ac5d-1b9c26746d28","year":2017},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:55:57.986893Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:4f2e2fffd5f4bbf4fb7bebb5fd6ab8c07f7405fc12549cbef86439b088428d2f","observation_id":"3eba4646-2e12-4709-9253-0240c9fe1c84","resolution":{"observed_at":"2026-08-06T13:56:01.256544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.245390Z","title":"TUT database for acoustic scene classification and sound event detection,","venue":null,"work_id":"a08a6203-60ba-400c-9453-fdf5a5e385ce","year":2016},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:55:58.097980Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:0267c56dadf5a6ad99f88d1d993def1cf86582be22861dd6865070ea726c6015","observation_id":"8cef8d3d-1f9c-4905-a693-41a48bc219e4","resolution":{"observed_at":"2026-08-06T13:56:01.248829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.237107Z","title":"CochlScene: Acquisition of acoustic scene data using crowdsourcing,","venue":null,"work_id":"946c0f64-e884-4c4f-bbb9-f3a19e470a6e","year":2022},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:55:58.279813Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:36e28b06e297caae23fc662aded1dccd67944b372679f06414be4d683cad0bf5","observation_id":"8c0dadef-6ba6-4097-8dfb-3ab0c3f07f3a","resolution":{"observed_at":"2026-08-06T13:56:01.239952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.229577Z","title":"A dataset and taxonomy for urban sound research,","venue":null,"work_id":"74adab78-81d3-487e-9cc3-62e3b8d5b805","year":2014},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:55:58.416000Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:644ea9ef665a63c36145b16b703b1f81b2998279e8ae349e063be8a32b0a758f","observation_id":"db171a95-dedf-47c8-8460-94672db29cb7","resolution":{"observed_at":"2026-08-06T13:56:01.232163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.222506Z","title":"AI-Based Acoustic Surveillance System for Smart Cities,","venue":null,"work_id":"322b4bca-c90b-4cf7-b23e-49df341f2aa3","year":2024},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:55:58.495691Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:5ba897434f9cbd684e6dbf8459b8ea3820eda65e733455da206d879bd85a5ac5","observation_id":"e682b72d-556d-4167-a532-1256359f8444","resolution":{"observed_at":"2026-08-06T13:56:01.225041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.215009Z","title":"Acoustic monitoring in- tegrated with electronic care planning,","venue":null,"work_id":"43f1bed0-ed5a-43e1-a960-e4a876ed1987","year":2020},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:55:58.696179Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:04ddfaa779a998672fdeecadbb98e4a0bb9c622624f24f901cef9a7f5f7d3924","observation_id":"e57da17f-93f1-48fb-83f7-352b518068ed","resolution":{"observed_at":"2026-08-06T13:56:01.217777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.207405Z","title":"Passive acoustic monitoring in ecology and conserva- tion,","venue":null,"work_id":"21f9f929-f8ee-46f5-9012-5087ac7bbd35","year":2017},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:55:58.880001Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:bfb2821160759824d81cc51b8d4a954e715d240935027bbf0e376a8800347c54","observation_id":"ea2128f1-2b5c-448b-89bf-c309e730a82c","resolution":{"observed_at":"2026-08-06T13:56:01.210278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.200023Z","title":"SECP: A Speech Enhancement-Based Curation Pipeline for Scalable Acquisition of Clean Speech,","venue":null,"work_id":"ed32f7c7-07d6-4a38-aa34-55c97edfda2d","year":2024},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:55:59.081755Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:6fac21f62d6cedf8d01e454bfb840d685a23f4792217d1c085e87683073c06c3","observation_id":"e43daeb5-c9e0-4e46-8f0a-e9fd75f3f879","resolution":{"observed_at":"2026-08-06T13:56:01.202878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.191992Z","title":"Environmental sound classification with convolu- tional neural networks,","venue":null,"work_id":"c46bf93d-cfdc-4c3d-9a8a-0a171f8bcf55","year":2015},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:55:59.270391Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:98703c6b07c05e4f26c57408a1bdc8ab9d11f27355de80126226330d34ba6eaa","observation_id":"0d79dbb0-f3f8-4304-88ef-5f5e7d401b8b","resolution":{"observed_at":"2026-08-06T13:56:01.195277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.183706Z","title":"Ro- bust sound event classification using deep neural networks,","venue":null,"work_id":"3ccf97f8-10c9-4f6e-a19a-260d85bb417a","year":2015},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:55:59.386755Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:384ff49ddd35f787dee58df379db98e91067b1bb00424a903bacd19e8431bd1a","observation_id":"7d22bdf3-224e-4c5b-a71c-2128c33cc4df","resolution":{"observed_at":"2026-08-06T13:56:01.187312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.175927Z","title":"DCasenet: An integrated pretrained deep neural network for detecting and clas- sifying acoustic scenes and events,","venue":null,"work_id":"9bfc17e0-2b1d-4aa9-b4e2-5ea6b145a875","year":2021},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:55:59.463651Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:740b4000efea49f7b43a98fe1af2fd09a024f618d5e8029c4999c3e9d9a8bfa7","observation_id":"33f1aa01-cb0e-42c6-b664-be0015fdaac3","resolution":{"observed_at":"2026-08-06T13:56:01.178688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.168553Z","title":"Few-shot continual learning for audio classification,","venue":null,"work_id":"d4fe53e0-2874-4d02-9341-51389f940aac","year":2021},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:55:59.571925Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:f9060803dbac7edcadf204879c5d0373ff5451c55f637474a85c164e4146a94c","observation_id":"cd8dcf45-ec0c-4d26-87c9-cdfd90672397","resolution":{"observed_at":"2026-08-06T13:56:01.171022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.160802Z","title":"Towards Robust Few-shot Class Incremental Learning in Audio Classification using Con- trastive Representation,","venue":null,"work_id":"96f45e36-109d-4432-b0b1-a54f0f98227c","year":2024},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:55:59.677911Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:a237b96cfa88aa9b44f79f65dda067b72c7843951759aa94d430dbc327b8b20e","observation_id":"65d0e0a7-4804-4308-9cae-35ea3c211b01","resolution":{"observed_at":"2026-08-06T13:56:01.163659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.152919Z","title":"Multi-label Few-shot Learning for Sound Event Recognition,","venue":null,"work_id":"a634a137-0115-40bf-b92c-a8b3f8a5129d","year":2019},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:55:59.781697Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:307e05534a7a6748c2c857f5dd0a80c8701469dbfbabba40be566c4d50ec14da","observation_id":"878cb629-db78-4adb-96c9-077dacd89154","resolution":{"observed_at":"2026-08-06T13:56:01.155703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.144596Z","title":"Learning From Taxonomy: Multi-Label Few-Shot Classification for Everyday Sound Recog- nition,","venue":null,"work_id":"17ab683b-5247-49bf-b952-36105972a8a7","year":2024},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:55:59.874286Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:3bce12229dd7efbe86e05ff87ddca1d6a0797cab5e0daa6b0580515ee5bd2811","observation_id":"aafd797c-96c9-436e-a3cf-45c4704fdbc3","resolution":{"observed_at":"2026-08-06T13:56:01.147295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.132344Z","title":"Learning Transferable Visual Models From Natu- ral Language Supervision,","venue":null,"work_id":"d50ece5f-1217-4f5d-9af7-d13b892cd684","year":2021},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:00.034030Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:3c60827f8156b61025bcbdd6266678bca5b260ffa34d08d8ccfee22d5742e2a8","observation_id":"8d1f07f0-8259-402a-9fbc-8f63eac042b9","resolution":{"observed_at":"2026-08-06T13:56:01.139722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.115350Z","title":"Wav2Clip: Learning Robust Audio Representations From Clip,","venue":null,"work_id":"263654ff-9030-4fcf-b180-651e4bb301e1","year":2022},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:00.206044Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:713809754ff61dbf42ae692af8c345af352498d7d3ce78787a455549518fa2a5","observation_id":"62cb8127-9e30-45a3-82cb-e9b87ae64b2a","resolution":{"observed_at":"2026-08-06T13:56:01.118309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.107238Z","title":"Audioclip: Extend- ing Clip To Image, Text and Audio,","venue":null,"work_id":"ba79dfdf-37e9-4d0b-867d-f4372a1e3ea5","year":2022},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:00.210874Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:e87ebc43155acf6e1331c4950d148165404830914c14613546ba7e9cc3788ab8","observation_id":"275ecc51-f59d-4202-baef-a6b31f14ccb7","resolution":{"observed_at":"2026-08-06T13:56:01.110520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.099232Z","title":"CLAP Learning Audio Concepts from Natural Language Supervision,","venue":null,"work_id":"5cc908de-535e-4ba6-bc7c-93da69615167","year":2023},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:00.288959Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:15a67db2604364cea17f89cf26dd4f2d9df835ba1f520afa6e3421dc420bc6e2","observation_id":"3680d20d-f856-4182-9460-785de1b90c2d","resolution":{"observed_at":"2026-08-06T13:56:01.102229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.090926Z","title":"M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation,","venue":null,"work_id":"c9ca86c1-3d5a-46c1-838d-d6a3492d9a11","year":2024},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:00.424593Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:ffc41f4fe9150593556516073ef54169d840f244a25728ed42d8ba3d6ccc8585","observation_id":"e9c9c3d1-ff68-4f6a-92b2-15f2e6aa52a6","resolution":{"observed_at":"2026-08-06T13:56:01.094257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.083108Z","title":"Large-Scale Contrastive Language-Audio Pretrain- ing with Feature Fusion and Keyword-to-Caption Augmentation,","venue":null,"work_id":"3378211f-7f84-4774-8ccd-8cbf1334eab2","year":2023},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:00.511495Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:591672c4b9ae02330344833c1d97dbcdaf77ba2ff788ae96fde0cc209c654b8a","observation_id":"ae5ed3de-f4e8-4a70-9644-52b0e9cff862","resolution":{"observed_at":"2026-08-06T13:56:01.086044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.074669Z","title":"Natural Language Supervision For General-Purpose Audio Representations,","venue":null,"work_id":"ea0fc816-8f8d-4c27-9169-e48c3ad95960","year":2024},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:00.624072Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:783589819d3d8ad8cb84608d5f0af179321270e073eafdb9c574b3673faae0a4","observation_id":"ead8258e-6f76-4d66-b669-c57daf0f1fd2","resolution":{"observed_at":"2026-08-06T13:56:01.077737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.066509Z","title":"Audio-Text Models Do Not Yet Leverage Natural Language,","venue":null,"work_id":"72c6e93f-cf95-488b-be50-ccbe4d97ade3","year":2023},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:00.687167Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:f5e8b30cb76671613da6c48b015555b084e736b00398c623a508077884a5e295","observation_id":"97a7dea8-3560-4ea9-8c0d-f029d1ef3897","resolution":{"observed_at":"2026-08-06T13:56:01.069753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.057040Z","title":"Pengi: An Audio Language Model for Audio Tasks,","venue":null,"work_id":"70f6b908-247c-4828-9ed9-4a6f999c57e5","year":2023},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:00.752506Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:6d49a9bdd94f0f0b3bfe78b560b3274beca75a1fb1d11720716f7b47c6759d38","observation_id":"f70d964f-19c0-46d3-baec-f9e941f03046","resolution":{"observed_at":"2026-08-06T13:56:01.059777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.047939Z","title":"Audio Flamingo: A Novel Audio Language Model with Few- Shot Learning and Dialogue Abilities,","venue":null,"work_id":"3fbe2335-6894-4343-b877-39516438d07f","year":2024},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:00.828009Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:950001a7b121236b439f490b0964a3d60d8e3486cd7e6cda33775e2a638e40d6","observation_id":"9a4b42f8-bf65-40b4-8aad-f2824df0ae16","resolution":{"observed_at":"2026-08-06T13:56:01.051247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.040496Z","title":null,"venue":null,"work_id":"16fb20f7-8ed8-4d20-836c-1aed1ed5a1d0","year":2014},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:00.901471Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:04c2d5c602ac32711ba674b5fd99b306ce9c72ab22262f197f933530d5e3d898","observation_id":"9c654a83-6817-4b70-92d6-94326abc0b7a","resolution":{"observed_at":"2026-08-06T13:56:01.042900Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.033009Z","title":"Conceptual and empirical comparison of dimensionality reduction algorithms (PCA, KPCA, LDA, MDS, SVD, LLE, ISOMAP, LE, ICA, t-SNE),","venue":null,"work_id":"8f49713f-b49f-45a0-b4fb-f3713bf668d1","year":2021},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:00.918845Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:74ed2b8bbd8ab13bcbaa1b4c2c9b2ce029fb1076575b128217b4c200bef73ca4","observation_id":"c1873420-4353-4f0e-9b1e-e28e0190f750","resolution":{"observed_at":"2026-08-06T13:56:01.035782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.024267Z","title":"Using Mutual Information for Selecting Features in Supervised Neural Net Learning,","venue":null,"work_id":"805a2ca3-4902-4164-b7bc-a990fe32c7bb","year":1994},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:00.935191Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:15ef5d9492028e370f19f222a2b0ed1abbf869b1fc91140666e9a4ccef5e9a87","observation_id":"5d19d051-23d9-4a23-9abb-63005e9f7dcf","resolution":{"observed_at":"2026-08-06T13:56:01.027171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.015826Z","title":"A review of feature selection methods based on mutual information,","venue":null,"work_id":"803320f1-ceef-4ab3-a3ec-b012404c35c0","year":2014},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:00.952000Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:0adfce5e0624bd9c4e1c0cb6135f95b9a1c97f7166a5728411e9c30fb3d9eb60","observation_id":"9acb9c03-688b-4639-87b3-fd162e5939a0","resolution":{"observed_at":"2026-08-06T13:56:01.018768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:01.007921Z","title":"Audio Set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":"d0e4b840-d718-4970-9947-b039b2bffbe9","year":2017},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:00.954428Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:95eda0bba7219513cb2e3aaf94ed93bb4ee9ba52f4f54b3a7b73b27f51297015","observation_id":"6780ce1d-4624-4f09-b1f4-a66e96f13fc6","resolution":{"observed_at":"2026-08-06T13:56:01.010697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:00.999854Z","title":"ESC: Dataset for environmental sound classifica- tion,","venue":null,"work_id":"ea2c5b53-2701-4611-90f6-27e4b8a81405","year":2015},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:00.956976Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:81c4e672373d53f5ddc8cff356405c4f6bb1522545358bcf31d8b768a3ecd567","observation_id":"ba659608-11ac-4f75-86bc-dfe63b9e516f","resolution":{"observed_at":"2026-08-06T13:56:01.002614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:56:00.992050Z","title":"FSD50K: An Open Dataset of Human-Labeled Sound Events,","venue":null,"work_id":"a37e1b4e-ad2f-41a2-a270-ffec5020ea29","year":2022},"citing_paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:00.959111Z"},"links":{"citing_paper":"/paper/2507.20036"},"observation_digest":"sha256:38ac203dda1cb74b2f098bbb862cdcc083e6ac56d7846ed7cc91eb226d326fa7","observation_id":"308ed1da-6f7d-4489-948c-c463838c22a0","resolution":{"observed_at":"2026-08-06T13:56:00.994784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20036","last_updated":"2025-07-26T18:40:09Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T13:55:56.225375Z","submitted_at":"2025-07-26T18:40:09Z","title":"Improving Audio Classification by Transitioning from Zero- to Few-Shot"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":2,"verified_exact":0,"verified_fuzzy":35},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 1 inbound Pith citation observation for arXiv:2507.20036."}