{"as_of":"2026-08-07T01:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1a551151ee3c3d005e24a93157f605901bb0dd5b7752382e6b2278ab4038295","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T18:59:47.482800Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.09526/citation-record","integrity":"/paper/2509.09526/integrity","json":"/paper/2509.09526/citation-record.json","paper":"/paper/2509.09526"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.103509Z","title":"Detection and classification of acoustic scenes and events,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.103509Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:8595f35c97429b3cf5349800810a52be973623d38c4626ed95bf7dc70d9755ff","observation_id":"b4b9ed7e-00c9-43f4-b6ef-adc17de4eaac","resolution":{"observed_at":"2026-08-04T18:59:47.103509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.257145Z","title":"Content-based classifica- tion, search, and retrieval of audio,","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.257145Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:fd38c967880bb3686a3dc62ccd6592572db43700af4802a736751ef3079eed08","observation_id":"8a256b64-9371-4932-a70b-331b73718d1f","resolution":{"observed_at":"2026-08-04T18:59:47.257145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.343451Z","title":"PANNs: Large-scale pretrained audio neural networks for audio pattern recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.343451Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:a5dd50c21704bba9c0322472f61254ae6ed4e44395f8f60798cd4e6f00dab54f","observation_id":"67da912f-0a0a-43f5-aeba-b003cef2e562","resolution":{"observed_at":"2026-08-04T18:59:47.343451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.392927Z","title":"AudioSet: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.392927Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:794865c0e07498847a9ff7cae20898c846b68bcc03158173977acbcb111fd6d5","observation_id":"feadea4a-b609-4e21-98dd-f1c2e65508da","resolution":{"observed_at":"2026-08-04T18:59:47.392927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.398015Z","title":"PSLA: Improving audio tagging with pretraining, sampling, labeling, and aggregation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.398015Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:f7757b6486d587da2aacda51c5f59b68b271ac18da99508fe3dc9efdc2606c6d","observation_id":"a9c8d0b1-e03e-4830-9deb-d4597ce11aae","resolution":{"observed_at":"2026-08-04T18:59:47.398015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.402778Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.402778Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:e7aa0e25a03114b73ac3f3abadec50674d2f951869efa556e3293194ee3cd876","observation_id":"b19fc332-93a0-4913-a7d7-db09a651e11a","resolution":{"observed_at":"2026-08-04T18:59:47.402778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-03T23:00:35.904734Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-04T18:59:47.408023Z","title":"AST: Audio spectrogram trans- former,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.408023Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:358cc54b134268947d557c411538b8536dce6603fc5d8790f3c449cb06f6e921","observation_id":"5454e27e-3978-4895-b890-ff6d4fdc329f","resolution":{"observed_at":"2026-08-04T18:59:47.408023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-04T18:59:47.412515Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.412515Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:8e88fb6a58e63285899948dd0b56bda7f86009e99c31b8e14ac21c2ec3d7e5e3","observation_id":"8d944e94-3c4e-4ec2-9e2c-cded43bc4387","resolution":{"observed_at":"2026-08-04T18:59:47.412515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.417193Z","title":"Convolutional gated recurrent neural network incorporating spatial features for audio tagging,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.417193Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:ca2476e1339a5c0c2df945bd9861dce5afeccaa4a7beba656879f9dbaa14a462","observation_id":"fc43762f-5867-44e0-9ce4-19e789c00a44","resolution":{"observed_at":"2026-08-04T18:59:47.417193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.421506Z","title":"ATGNN: Audio tagging graph neural network,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.421506Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:5f84f4516961179094982f4d6079e964937c6743653d118f7c29345b975bef96","observation_id":"427de625-b76a-4e05-8d1f-c001433714fb","resolution":{"observed_at":"2026-08-04T18:59:47.421506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.425516Z","title":"Multi- channel overlapped speech recognition with location guided speech extraction network,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.425516Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:fa88684a12ab2dbc4703d6cb96bcf644f84c01aaeafa9b8f231c90b0dfc44d5a","observation_id":"19565f10-8b12-40c8-b725-d8d1b23ca474","resolution":{"observed_at":"2026-08-04T18:59:47.425516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.430054Z","title":"Multi-modal multi-channel target speech separation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.430054Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:a09f6bc3c6c57600a1a97aab00dbb507245741ba2936052811be20c697cf5a57","observation_id":"25ea4942-8741-4c56-816c-dca06507c3d2","resolution":{"observed_at":"2026-08-04T18:59:47.430054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.434776Z","title":"Rezero: Region-customizable sound extraction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.434776Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:5a23a667062f681e6f7b21bd0101ac761111d3abe5d272121a1e5bc70220a3e3","observation_id":"5b6a0c2d-20bd-41fd-a358-8761ca12071f","resolution":{"observed_at":"2026-08-04T18:59:47.434776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.439308Z","title":"An alternative approach to linearly constrained adaptive beamforming,","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.439308Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:3f070020595d0e6ade25aa0768519793b71d0f5827d4487d39a84739881dd969","observation_id":"805b8483-e4c6-42c2-bf69-6905c359c229","resolution":{"observed_at":"2026-08-04T18:59:47.439308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13075","last_updated":"2023-11-22T00:38:06Z","snapshot_observed_at":"2026-07-06T16:50:54.684296Z","submitted_at":"2023-11-22T00:38:06Z","title":"Deep Audio Zooming: Beamwidth-Controllable Neural Beamformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13075","snapshot_observed_at":"2026-08-04T18:59:47.443777Z","title":"Deep audio zooming: Beamwidth-controllable neural beamformer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.443777Z"},"links":{"cited_paper":"/paper/2311.13075","citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:b7f139ae773878115a52c6363e4ee361b5607e0cf0883a42fedb61a819f1f374","observation_id":"038c2aed-3dd6-4f0d-8f6a-0deabb13dc60","resolution":{"observed_at":"2026-08-04T18:59:47.443777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.448029Z","title":"Audio inputs for active speaker detection and localization via microphone array,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.448029Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:60e9f63cbf92acd5c8c79325563a0961ce2e9841268b80a31847965b5ab14817","observation_id":"e132a566-944f-463a-8b7c-8ab2eca1612f","resolution":{"observed_at":"2026-08-04T18:59:47.448029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14778","last_updated":"2025-04-13T08:28:06Z","snapshot_observed_at":"2026-08-01T21:27:02.095539Z","submitted_at":"2023-10-23T10:29:33Z","title":"Audio-Visual Speaker Tracking: Progress, Challenges, and Future Directions","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14778","snapshot_observed_at":"2026-08-04T18:59:47.452738Z","title":"Audio-visual speaker tracking: Progress, challenges, and future directions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.452738Z"},"links":{"cited_paper":"/paper/2310.14778","citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:dd5daf53e527246c06b517f9d55f0451cecaa63441642b49512a76f0be99f4ab","observation_id":"df0f26ab-47a0-4a07-a444-b77d99b1b78a","resolution":{"observed_at":"2026-08-04T18:59:47.452738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.457412Z","title":"Attention- based end-to-end differentiable particle filter for audio speaker tracking,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.457412Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:b14de41bb46887e5f10e1f1248aa1f8cceaad505ac91cdfbcba791e83c9a0bbf","observation_id":"11f7db23-3624-43f7-a300-c48d0c5c438c","resolution":{"observed_at":"2026-08-04T18:59:47.457412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.461347Z","title":"On spatial features for supervised speech separation and its application to beamforming and robust ASR,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.461347Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:e7eecef70780406699b54c43d7756be72540c6bf0f199c2b18b4c13d5272aa85","observation_id":"6362540d-588f-4ca0-aefe-cad83289415c","resolution":{"observed_at":"2026-08-04T18:59:47.461347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.466371Z","title":"STARSS23: An audio-visual dataset of spatial recordings of real scenes with spatiotemporal annotations of sound events,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.466371Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:e56ea693a4f73e1a3694de57da024d89cfb439a57f23f2fb0f221796f12ba161","observation_id":"474eef67-3cb4-4aa6-be91-b5c383bfdcd4","resolution":{"observed_at":"2026-08-04T18:59:47.466371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.470748Z","title":"Spatial Scaper: a library to simulate and augment soundscapes for sound event localization and detection in realistic rooms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.470748Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:ff87dbcb1bd0f35bb75d82f7d93a835e107075b93059776a177e54d1b3ec7289","observation_id":"c8935f05-da37-4449-8816-5f0468b5db27","resolution":{"observed_at":"2026-08-04T18:59:47.470748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.474786Z","title":"FSD50K: An open dataset of human-labeled sound events,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.474786Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:0c0136b313882b77229b373238849c53a7b32c1f0fd89494b76fd0c52442945e","observation_id":"3908851e-6ad5-4e12-b93d-f8dc334bbaf6","resolution":{"observed_at":"2026-08-04T18:59:47.474786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.478930Z","title":"A four- stage data augmentation approach to ResNet-Conformer based acoustic modeling for sound event localization and detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.478930Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:cfe6ab60930267946ff4647b52c3fc8c9f39068e85cbf7fb63cad8a35ccaf2d1","observation_id":"08c98658-c91f-4489-b3e2-d495da8069a2","resolution":{"observed_at":"2026-08-04T18:59:47.478930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:59:47.482800Z","title":"SALSA: Spatial cue-augmented log-spectrogram features for polyphonic sound event localization and detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T18:59:47.482800Z"},"links":{"citing_paper":"/paper/2509.09526"},"observation_digest":"sha256:decc3d25841badfe21f22facd399a0135384c2e6c268be024586405050e2e973","observation_id":"fccffcaa-9720-41b1-b5d0-5a0c6e5455c9","resolution":{"observed_at":"2026-08-04T18:59:47.482800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.09526","last_updated":"2025-09-11T15:08:09Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-04T18:59:46.609389Z","submitted_at":"2025-09-11T15:08:09Z","title":"Region-Specific Audio Tagging for Spatial Sound"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2509.09526."}