{"as_of":"2026-08-08T16:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b6a6e6725a79072f314e5c4ac66852b1db4da13e52cca41f83b8add5edceb579","coverage":[{"denominator":6,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:49:34.869698Z","state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.07384/citation-record","integrity":"/paper/2507.07384/integrity","json":"/paper/2507.07384/citation-record.json","paper":"/paper/2507.07384"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T18:49:34.717782Z","title":"Dosovitskiy, A.; Beyer, L.; Kolesnikov, A.; Weissenborn, D.; Zhai, X.; Unterthiner, T.; Dehghani, M.; Minderer, M.; Heigold, G.; Gelly, S.; et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07384","last_updated":"2025-08-06T08:07:42Z","snapshot_observed_at":"2026-08-06T18:40:02.894719Z","submitted_at":"2025-07-10T02:49:56Z","title":"AV-SSAN: Audio-Visual Selective DoA Estimation through Explicit Multi-Band Semantic-Spatial Alignment","version":2},"reference_index":180,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:34.717782Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.07384"},"observation_digest":"sha256:0e38b85d891addd4a522ca04e52d18354c4ee1be612e50dcff177b77179173c2","observation_id":"0db64603-9054-464c-a716-0d641f2c3625","resolution":{"observed_at":"2026-08-06T18:49:34.717782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05034","last_updated":"2025-05-20T16:53:31Z","snapshot_observed_at":"2026-07-06T19:12:06.671181Z","submitted_at":"2024-09-08T09:20:04Z","title":"TF-Mamba: A Time-Frequency Network for Sound Source Localization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05034","snapshot_observed_at":"2026-08-06T18:49:34.869698Z","title":"van der Heijden, K.; Rauschecker, J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.07384","last_updated":"2025-08-06T08:07:42Z","snapshot_observed_at":"2026-08-06T18:40:02.894719Z","submitted_at":"2025-07-10T02:49:56Z","title":"AV-SSAN: Audio-Visual Selective DoA Estimation through Explicit Multi-Band Semantic-Spatial Alignment","version":2},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:34.869698Z"},"links":{"cited_paper":"/paper/2409.05034","citing_paper":"/paper/2507.07384"},"observation_digest":"sha256:77272db330cd6b2a124222ea0c3dfe17e2665b71d0bfea767262458f119bb8b1","observation_id":"f0fa9516-0925-4016-a583-8259a476388b","resolution":{"observed_at":"2026-08-06T18:49:34.869698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:49:35.609252Z","title":"IEEE Journal of Selected Topics in Signal Processing, 13(1): 34–48","venue":null,"work_id":"fa03a20b-2f22-4558-9d4e-4014eb7594ca","year":null},"citing_paper":{"arxiv_id":"2507.07384","last_updated":"2025-08-06T08:07:42Z","snapshot_observed_at":"2026-08-06T18:40:02.894719Z","submitted_at":"2025-07-10T02:49:56Z","title":"AV-SSAN: Audio-Visual Selective DoA Estimation through Explicit Multi-Band Semantic-Spatial Alignment","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:34.468699Z"},"links":{"citing_paper":"/paper/2507.07384"},"observation_digest":"sha256:4411abecc4c0648c97b3150f106f517fda317b5a60fe8a014be9f823f904c550","observation_id":"56dc8c25-29fc-4a77-a50b-5c4618a4c196","resolution":{"observed_at":"2026-08-06T18:49:35.691276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:49:35.021490Z","title":"InIEEE International Conference on Acous- tics, Speech and Signal Processing, 711–715","venue":null,"work_id":"dbbe2955-ef5b-4c7b-a6ef-940c95223850","year":1907},"citing_paper":{"arxiv_id":"2507.07384","last_updated":"2025-08-06T08:07:42Z","snapshot_observed_at":"2026-08-06T18:40:02.894719Z","submitted_at":"2025-07-10T02:49:56Z","title":"AV-SSAN: Audio-Visual Selective DoA Estimation through Explicit Multi-Band Semantic-Spatial Alignment","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:34.807328Z"},"links":{"citing_paper":"/paper/2507.07384"},"observation_digest":"sha256:86f68efb1798f4164681ab6980250fd7274f57dddfdad948524ff0909fb6bbc6","observation_id":"9a70fd59-015a-4e90-b0a6-90841acc93cb","resolution":{"observed_at":"2026-08-06T18:49:35.117019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:49:35.406200Z","title":"InIEEE International Con- ference on Acoustics, Speech and Signal Processing, 8816–","venue":null,"work_id":"3d69d9a6-6e55-4112-8635-bf5cba9d8ab6","year":null},"citing_paper":{"arxiv_id":"2507.07384","last_updated":"2025-08-06T08:07:42Z","snapshot_observed_at":"2026-08-06T18:40:02.894719Z","submitted_at":"2025-07-10T02:49:56Z","title":"AV-SSAN: Audio-Visual Selective DoA Estimation through Explicit Multi-Band Semantic-Spatial Alignment","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:34.538810Z"},"links":{"citing_paper":"/paper/2507.07384"},"observation_digest":"sha256:cc37465c7c6b66d4ab8f4540d1a4c7d6f5a7ad7d554a4ecfc72e2b5db3d8f04a","observation_id":"5f1ce1ed-ab54-49a1-a183-ce90a165a054","resolution":{"observed_at":"2026-08-06T18:49:35.497914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:49:35.189423Z","title":"Brughera, A.; Dunai, L.; and Hartmann, W","venue":null,"work_id":"513f8f85-bcc0-47e2-89aa-127888c21a7f","year":2013},"citing_paper":{"arxiv_id":"2507.07384","last_updated":"2025-08-06T08:07:42Z","snapshot_observed_at":"2026-08-06T18:40:02.894719Z","submitted_at":"2025-07-10T02:49:56Z","title":"AV-SSAN: Audio-Visual Selective DoA Estimation through Explicit Multi-Band Semantic-Spatial Alignment","version":2},"reference_index":8820,"source":"pdf_text","source_observed_at":"2026-08-06T18:49:34.632628Z"},"links":{"citing_paper":"/paper/2507.07384"},"observation_digest":"sha256:eae942f6c0ce8ac1a26e6eca9e2ebbd33b2d5f4b878196402c7b43427ca9d673","observation_id":"7dcfca33-01fd-4075-b953-5cde9d1e556b","resolution":{"observed_at":"2026-08-06T18:49:35.283643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.07384","last_updated":"2025-08-06T08:07:42Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T18:40:02.894719Z","submitted_at":"2025-07-10T02:49:56Z","title":"AV-SSAN: Audio-Visual Selective DoA Estimation through Explicit Multi-Band Semantic-Spatial Alignment"},"reference_resolution":{"displayed":6,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":6},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 6 of 6 outbound references and 0 inbound Pith citation observations for arXiv:2507.07384."}