{"as_of":"2026-08-08T21:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:079f298a4f049cec67def90a39e9dfa940c796a3da011ddb3b0da08fef3aaf5a","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:54:44.832800Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:54:44.760115Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T11:54:44.959776Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"cited_work":{"arxiv_id":"2507.22322","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.22322","snapshot_observed_at":"2026-08-06T11:54:44.959776Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","venue":"cs.SD","work_id":"57b50ea1-6d78-4684-b394-35156465be8a","year":2025},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.760115Z"},"links":{"cited_paper":"/paper/2507.22322","citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:191bf6b5736d5454e147c44ea9e868f92c88fe77f30257a74fd3e166e4484add","observation_id":"d14a321f-502e-45e1-b4aa-14a8a68cc68c","resolution":{"observed_at":"2026-08-06T11:54:44.962468Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.22322/citation-record","integrity":"/paper/2507.22322/integrity","json":"/paper/2507.22322/citation-record.json","paper":"/paper/2507.22322"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.121831Z","title":null,"venue":null,"work_id":"fb3e023c-c149-4f45-b5e1-23c68b0d9408","year":2019},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.757445Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:402ad031d8901ba5b8ee5aeb9e60212bb9dc45be97b0059f3a453d6a2de3ff0c","observation_id":"0c9fef52-330c-4162-b1e0-083eb29874e2","resolution":{"observed_at":"2026-08-06T11:54:45.123888Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"cited_work":{"arxiv_id":"2507.22322","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.22322","snapshot_observed_at":"2026-08-06T11:54:44.959776Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","venue":"cs.SD","work_id":"57b50ea1-6d78-4684-b394-35156465be8a","year":2025},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.760115Z"},"links":{"cited_paper":"/paper/2507.22322","citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:191bf6b5736d5454e147c44ea9e868f92c88fe77f30257a74fd3e166e4484add","observation_id":"d14a321f-502e-45e1-b4aa-14a8a68cc68c","resolution":{"observed_at":"2026-08-06T11:54:44.962468Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.114410Z","title":"Implementation Details For training, we utilized the STARSS23[25] dev-set-train and a synthetic dataset, while evaluation was conducted on the dev- set-test","venue":null,"work_id":"67201d56-e253-4ac6-bdb5-95bf362c9ec8","year":2023},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.762785Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:db595390c13869e80f34cd0d8f0b5d2d2bd9e0096e8d066b55e3a81947da925c","observation_id":"11bb52f6-dba9-4061-9a3f-f49e5d9627f1","resolution":{"observed_at":"2026-08-06T11:54:45.117151Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.108101Z","title":"The trackwise reordering format and beamformed spatial features enhance temporal consistency and localization accuracy","venue":null,"work_id":"5e0e3809-db8e-49e7-9bbb-07461dd90ddf","year":2023},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.765298Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:345a5f95a9bcc78be8c11768c18f18bd340619c15ef80922f0c98a0beea1fe3b","observation_id":"a2201a4d-4bba-4c52-9dd5-3e98b363cba4","resolution":{"observed_at":"2026-08-06T11:54:45.110391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.101120Z","title":"Sound event localization and detection of overlapping sources using con- volutional recurrent neural networks,","venue":null,"work_id":"a4c56d78-c4a7-4f65-84e3-d3f8bd3986c5","year":2018},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.768398Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:9d647e010464ff1fdca019fc9f490571c15a6af1e053ae2417768bc81ec8654d","observation_id":"6a2ae811-790d-4c1f-ac08-bec0f1798d20","resolution":{"observed_at":"2026-08-06T11:54:45.103931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.094206Z","title":"The ustc-iflytek system for sound event localization and detection of dcase2020 challenge,","venue":null,"work_id":"a588972b-5d50-46dc-b752-2979ec5cbcca","year":2020},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.771412Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:8d3785b0689441587d28c112750d3e8c908d8d175176b9faae60bdad9e05a10c","observation_id":"7e19f8aa-dfba-466b-8c6c-c6551c22d1f9","resolution":{"observed_at":"2026-08-06T11:54:45.096828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.088137Z","title":"Overview and evaluation of sound event localization and detec- tion in dcase 2019,","venue":null,"work_id":"2b0871ba-41ca-4f54-94b9-6e6b87ad6ce2","year":2019},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.773942Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:be49aed5ec104319170b4a5b112035425221babccf7c52e7308af6f2f2a4ea7d","observation_id":"86739d06-1a94-442c-9e43-ee9d4538e234","resolution":{"observed_at":"2026-08-06T11:54:45.090336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.082027Z","title":"Seld-tcn: Sound event localization & detection via temporal con- volutional networks,","venue":null,"work_id":"aa7a0eaa-6387-4614-92a9-3ebb8e2f4c51","year":2020},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.776372Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:2296e83f19198225d568d79fd5887e71d0ca0120bf132371eb938def0d8ad7fc","observation_id":"4f9130b7-05d4-4e08-a8b9-d766d1aa9e57","resolution":{"observed_at":"2026-08-06T11:54:45.084202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.075484Z","title":"An improved event-independent network for polyphonic sound event localization and detection,","venue":null,"work_id":"2e5534bd-75bb-4732-aa00-dea6efa059ea","year":2021},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.778770Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:06efde5beafd8caa831b1324337ce665905353d87eee1a0b79b64eebde1a5d94","observation_id":"4fdfcabd-cae1-424c-a146-9727a8b7b774","resolution":{"observed_at":"2026-08-06T11:54:45.077729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.067556Z","title":"A track-wise ensemble event independent network for polyphonic sound event localization and detection,","venue":null,"work_id":"91090a17-7ef5-46a5-943d-6d2908d2a41c","year":2022},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.781052Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:dc5771299f384e40b1ba36ca9e19e1d775f9185dc97c9edd47d9cdf546b1d807","observation_id":"6bdec6d4-f55c-4061-bb25-c7d9423b586f","resolution":{"observed_at":"2026-08-06T11:54:45.070927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.01802","last_updated":"2022-09-09T10:06:29Z","snapshot_observed_at":"2026-07-06T13:48:51.381686Z","submitted_at":"2022-09-05T07:30:06Z","title":"Sound Event Localization and Detection for Real Spatial Sound Scenes: Event-Independent Network and Data Augmentation Chains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.01802","snapshot_observed_at":"2026-08-06T11:54:44.783031Z","title":"Sound event localization and detection for real spatial sound scenes: Event-independent network and data augmentation chains,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.783031Z"},"links":{"cited_paper":"/paper/2209.01802","citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:078b1693e347103b593c7cf0b83753a6456188554982706a5d0a3e5d57a513d1","observation_id":"c02b05be-dd03-48ef-8247-bb025a35044f","resolution":{"observed_at":"2026-08-06T11:54:44.783031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08771","last_updated":"2024-06-15T11:52:49Z","snapshot_observed_at":"2026-07-06T18:30:02.349638Z","submitted_at":"2024-06-13T03:03:02Z","title":"MFF-EINV2: Multi-scale Feature Fusion across Spectral-Spatial-Temporal Domains for Sound Event Localization and Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08771","snapshot_observed_at":"2026-08-06T11:54:44.785286Z","title":"Mff-einv2: Multi-scale feature fu- sion across spectral-spatial-temporal domains for sound event lo- calization and detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.785286Z"},"links":{"cited_paper":"/paper/2406.08771","citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:6d8b85d66d7e14b0399442473812a718855edca9030c56330bf2ba655ddaf395","observation_id":"7612de79-7b3c-4007-a895-a452d929c543","resolution":{"observed_at":"2026-08-06T11:54:44.785286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05057","last_updated":"2024-08-09T13:26:08Z","snapshot_observed_at":"2026-08-04T23:08:13.853275Z","submitted_at":"2024-08-09T13:26:08Z","title":"SELD-Mamba: Selective State-Space Model for Sound Event Localization and Detection with Source Distance Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05057","snapshot_observed_at":"2026-08-06T11:54:44.788732Z","title":"Seld- mamba: Selective state-space model for sound event localization and detection with source distance estimation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.788732Z"},"links":{"cited_paper":"/paper/2408.05057","citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:ec002955edde987e5a834e20ce5bed509d38d7a4ae25d6a34d08d825bff6baa9","observation_id":"b060a719-66b5-4885-bf6b-bdd26ad9aa7c","resolution":{"observed_at":"2026-08-06T11:54:44.788732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.060431Z","title":"Accdoa: Activity-coupled cartesian direction of arrival representation for sound event localization and detection,","venue":null,"work_id":"f78f5d39-f78a-4e35-9026-9c85e449f798","year":2021},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.792295Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:78cefe6048d87921ad685f6be2c4a333c45c45103bbc5960b71f3997b0050fe3","observation_id":"2a0af112-3444-4a88-ba60-d135c6a520bf","resolution":{"observed_at":"2026-08-06T11:54:45.062696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.053914Z","title":"Multi-accdoa: Localizing and detecting over- lapping sounds from the same class with auxiliary duplicating per- mutation invariant training,","venue":null,"work_id":"3bf890d8-5d0b-4af1-9337-df2ecba0d626","year":2022},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.794213Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:b68f413ef6d832285053653a3580eeaa9208f46fe9b72b379b35d8971e44ada7","observation_id":"936d9315-898d-498b-ad71-91a127cba43c","resolution":{"observed_at":"2026-08-06T11:54:45.056267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.045132Z","title":"An experimental study on sound event localization and detection under realistic testing conditions,","venue":null,"work_id":"eeec34f0-477f-48ea-8527-7e9de36151d3","year":2023},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.796783Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:83b7a2bc674d7fb85a80d0871ebfa3ccf4b76cf3823363fd5200d2189c5cc604","observation_id":"cc9f7f24-d510-4276-9cb8-e21825a952b2","resolution":{"observed_at":"2026-08-06T11:54:45.048498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.039518Z","title":"Cst-former: Transformer with channel- spectro-temporal attention for sound event localization and detec- tion,","venue":null,"work_id":"7d6f8046-7442-4b15-8f59-49502b962e87","year":2024},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.800106Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:463a702dc82ee10a10c5cd0759ef11a0caa496769037a864d0f433b7089b3d37","observation_id":"66fe431f-2cbe-431f-8110-0123a1c87b14","resolution":{"observed_at":"2026-08-06T11:54:45.041694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.034248Z","title":"The cocktail party problem,","venue":null,"work_id":"f2e885a5-a11c-4faf-b147-49b152126826","year":1902},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.801980Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:dcb3ecfa7e9ca65c757e33b16289cbe43f7ed89b8f274ebe1d71359f6f20243f","observation_id":"7353efaf-37fd-45c1-a043-9b959490cdbc","resolution":{"observed_at":"2026-08-06T11:54:45.036180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.028168Z","title":"Doa and event guidance system for sound event localiza- tion and detection with source distance estimation,","venue":null,"work_id":"1d15cd3c-6477-4d77-804c-ecca3745be65","year":2024},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.804397Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:cb4d3f880ec3492b9d528932352af8740c24091ebd066ab162976bc760ec3258","observation_id":"511ab1bd-5468-4f6f-bd4c-f90c9d419d62","resolution":{"observed_at":"2026-08-06T11:54:45.030384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07021","last_updated":"2024-05-11T14:02:15Z","snapshot_observed_at":"2026-08-02T19:32:56.580283Z","submitted_at":"2024-05-11T14:02:15Z","title":"IPDnet: A Universal Direct-Path IPD Estimation Network for Sound Source Localization","version":1},"cited_work":{"arxiv_id":"2405.07021","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.07021","snapshot_observed_at":"2026-08-06T11:54:44.933974Z","title":"IPDnet: A Universal Direct-Path IPD Estimation Network for Sound Source Localization","venue":"eess.AS","work_id":"8dbd6988-b5f6-41af-b741-377c929e9f77","year":2024},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.806457Z"},"links":{"cited_paper":"/paper/2405.07021","citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:448da0d2a617eda421b14544fe2549f47bb9f9f679cc713aec76cc26834ae447","observation_id":"9e0daaad-51a5-4692-af4b-e68dec8c8b41","resolution":{"observed_at":"2026-08-06T11:54:44.936724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.022135Z","title":"Fine-tune the pretrained atst model for sound event detection,","venue":null,"work_id":"d6dc15d2-3e20-4d0e-844e-dbdaf1b7a250","year":2024},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.809610Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:39c879c482aebaa15485e6d89a971bdcd8d29921f81e0bb2ae28ceee7ee49d39","observation_id":"fa6a3738-c484-4213-a16d-5935aa78cbc1","resolution":{"observed_at":"2026-08-06T11:54:45.024294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.014881Z","title":"The cone of silence: Speech separation by local- ization,","venue":null,"work_id":"b5c01d65-890e-4af2-96ef-b5d9b05a3875","year":2020},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.811492Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:f925e3e4241e5609e044137bcbb55e189ea5687962a566330882f2d27be0f16c","observation_id":"55908158-4fbf-437c-b237-63b1b3d3eefa","resolution":{"observed_at":"2026-08-06T11:54:45.017386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.008612Z","title":"Rezero: Region-customizable sound extrac- tion,","venue":null,"work_id":"ac41b7f2-5581-45bd-adbd-e42b8c330991","year":2024},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.813382Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:477c870e7c812b8cb98d23fb5c161f1f0f3382a797fb2b6fc20eecfd6295ff55","observation_id":"58d510f3-690c-4dbf-bc85-e016330c3aaf","resolution":{"observed_at":"2026-08-06T11:54:45.010876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:45.001122Z","title":"Lavt: Language-aware vision transformer for referring image segmentation,","venue":null,"work_id":"b0b61183-1396-4b2c-9fe2-5b923f6c3d7b","year":2022},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.815724Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:5dbf6f363f7df7514dbc425b3cfaa49fef388b8dc545966f6c7f9bbaf0392f6f","observation_id":"b0627f7f-0797-4eed-9d21-b8fdb97182a2","resolution":{"observed_at":"2026-08-06T11:54:45.003267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:44.817951Z","title":"Separate and re- construct: Asymmetric encoder-decoder for speech separation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.817951Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:fde8063cd989547e37755e12e8c039d9f0df7617171b4638126f571e94adf648","observation_id":"4e097c79-af86-4a4f-a9c5-b25607286b1b","resolution":{"observed_at":"2026-08-06T11:54:44.817951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:44.993849Z","title":"[dcase2022 task 3] synthetic seld mixtures for baseline training,","venue":null,"work_id":"950c323b-4cee-4808-a322-70b494e813cc","year":2022},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.819856Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:d0dfa470041cd350f97d9b682c23f44001bba305cf668291b959749080144f5c","observation_id":"cf153140-18a1-4d6b-b640-de3ac9365d2e","resolution":{"observed_at":"2026-08-06T11:54:44.996824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:44.987750Z","title":"Conformer-based sound event detection with semi- supervised learning and data augmentation,","venue":null,"work_id":"81280353-ba12-4066-b5d1-b0ad8d7f0afd","year":2020},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.821604Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:bd55d86f40d7d97e58a3e6c6d3038026cde69b69fd61280a9e1bdef078b8d14a","observation_id":"e851e7ac-f7a7-4e67-a3cd-14bd834be6a2","resolution":{"observed_at":"2026-08-06T11:54:44.990011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-08T11:33:21.735489Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-06T11:54:44.824499Z","title":"Ast: Audio spectrogram transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.824499Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:9a2c5a40ba0614c21196ab282897de66721aea75462dc7fdf02acf4ec1ac21cd","observation_id":"ec3e673b-b559-47b2-9a43-6d0e13f0a606","resolution":{"observed_at":"2026-08-06T11:54:44.824499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:44.981174Z","title":"Starss23: Sony-tau realistic spatial soundscapes 2023,","venue":null,"work_id":"5bcfa75c-22c5-4ef6-9123-45ebf139c3a7","year":2023},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.827133Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:6eb89cc8505a1eebb48cc789d3f57923c775621c4e7d18be88cda459482e94e1","observation_id":"413bcc7e-40ee-467e-956c-eb13dba0422a","resolution":{"observed_at":"2026-08-06T11:54:44.983670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:44.974499Z","title":"Permutation invari- ant training of deep models for speaker-independent multi-talker speech separation,","venue":null,"work_id":"1022394f-00ff-42dd-9d43-8c0ed432b5e4","year":2017},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.828973Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:f6f6935bedc50ae0d841e3809cc18ae8f61c943cf51668374a1489c375b2889f","observation_id":"aef31444-26f5-453f-bcde-c688d9e3f0f3","resolution":{"observed_at":"2026-08-06T11:54:44.976916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:54:44.967561Z","title":"Starss23: An audio-visual dataset of spatial recordings of real scenes with spatiotemporal annotations of sound events,","venue":null,"work_id":"6dfa1a49-e977-4224-9c50-46613cadf595","year":2024},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.830920Z"},"links":{"citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:157d32111bc2a626e6f4d506101a7d8e8530c15173a135c54e4ecf872a7ecfa4","observation_id":"0bc018a2-f39f-4455-85e4-b8d9bb23eea3","resolution":{"observed_at":"2026-08-06T11:54:44.970337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02591","last_updated":"2023-06-05T04:39:34Z","snapshot_observed_at":"2026-08-08T19:19:50.941531Z","submitted_at":"2023-06-05T04:39:34Z","title":"Divided spectro-temporal attention for sound event localization and detection in real scenes for DCASE2023 challenge","version":1},"cited_work":{"arxiv_id":"2306.02591","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02591","snapshot_observed_at":"2026-08-06T11:54:44.853028Z","title":"Divided spectro-temporal attention for sound event localization and detection in real scenes for DCASE2023 challenge","venue":"eess.AS","work_id":"04c5f578-4d72-4f43-8724-f04de89126d3","year":2023},"citing_paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:44.832800Z"},"links":{"cited_paper":"/paper/2306.02591","citing_paper":"/paper/2507.22322"},"observation_digest":"sha256:45689c6eb5334b57869426a0c0e55bcb57799b4ec637dd476583aafea8948499","observation_id":"a6c897a5-0b8f-4715-9f72-523eb7f94064","resolution":{"observed_at":"2026-08-06T11:54:44.858193Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.22322","last_updated":"2025-07-30T01:51:38Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T11:54:44.578832Z","submitted_at":"2025-07-30T01:51:38Z","title":"A Two-Step Learning Framework for Enhancing Sound Event Localization and Detection"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":3,"verified_fuzzy":22},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 1 inbound Pith citation observation for arXiv:2507.22322."}