{"as_of":"2026-08-18T16:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7e0a6570809fc5a3b77c43ff3df8765c5e1f17a92a4111f0740b6a6d8133fb4d","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:20:26.277030Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.06598/citation-record","integrity":"/paper/2509.06598/integrity","json":"/paper/2509.06598/citation-record.json","paper":"/paper/2509.06598"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:27.111284Z","title":"Sound event localization and detection of overlapping sources using convolutional recurrent neural networks,","venue":null,"work_id":"1fe510e4-f6ff-44d9-b703-0a80ba7f0969","year":2019},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:25.992222Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:92dd4b8b337b960cd340945355ec3b7b8ec80cd43883f4bfe5c9e9c3d0e6259f","observation_id":"717dc653-dcb5-4a9b-a15b-b89707de34e6","resolution":{"observed_at":"2026-08-15T16:20:27.116950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.000903Z","title":"Sound event detection using spatial features and convolutional recurrent neural network,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.000903Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:453b897807d00a3ebf2df2907a5986a9d3610a6f571b7cfd46fdfcaea942f97e","observation_id":"efc66f0c-9853-4752-9710-df2f62b370bd","resolution":{"observed_at":"2026-08-15T16:20:26.000903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:27.083406Z","title":"Direction of arrival estimation for multiple sound sources using convolutional recurrent neural network,","venue":null,"work_id":"f463d826-d555-42e0-a589-1744c2206b6f","year":2018},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.008226Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:1e68f330c4faaf07e81d28080fa59aa7e629e14ebcf421aea3dbed7e640b49e0","observation_id":"c4f6c75e-6ad8-4076-a51f-04d37152eac8","resolution":{"observed_at":"2026-08-15T16:20:27.088733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:27.066905Z","title":"Audio-visual cross-attention network for robotic speaker tracking,","venue":null,"work_id":"6f195b1d-39a5-4013-a5d0-5e4cc3034245","year":2023},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.014976Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:c4c6d81c30aed9e0d62de602ff55ade82de632096e530e0a73f853ea42d46265","observation_id":"871bd6ef-d684-4771-b974-3da2dee6d683","resolution":{"observed_at":"2026-08-15T16:20:27.072489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:27.049273Z","title":"ForecasterFlexOBM: A multi-view audio-visual dataset for flexible object-based media production,","venue":null,"work_id":"399ea2c3-3f98-49ff-99cc-8f12be0b341a","year":2024},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.021408Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:204550348f0192fcd2843fedc2490de67046bed5309676b00d574e7767c1c2d0","observation_id":"b5aa4c96-1db3-42d6-9605-d63a1bfa2142","resolution":{"observed_at":"2026-08-15T16:20:27.054568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.028240Z","title":"A dataset of reverberant spatial sound scenes with moving sources for sound event localization and detection,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.028240Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:e18a869a3db9aae4866829c5b279f4772565063cec7ef75ae921982d94365c37","observation_id":"da999789-f30d-4509-956b-7830c019d74c","resolution":{"observed_at":"2026-08-15T16:20:26.028240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.034382Z","title":"A dataset of dynamic reverberant sound scenes with directional interferers for sound event localization and detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.034382Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:d1744ef40003a06e5f0a581bcaafaa8ce609dd79de6bce9dd205f14a6bdda9a9","observation_id":"8dc4ebf0-2a35-49b0-9c88-6461e54295cc","resolution":{"observed_at":"2026-08-15T16:20:26.034382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:27.009906Z","title":"STARSS23: An audio-visual dataset of spatial recordings of real scenes with spatiotemporal annotations of sound events,","venue":null,"work_id":"5d0846e0-07db-4bc9-85e5-7d578bd4436e","year":2023},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.039701Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:bcf9b2c1e99c7f305f43c28ef786bd97ab1eaced2593e08edc8d5ffa5031568e","observation_id":"3959c53e-2137-4f0e-8f92-32eb3f23b6ac","resolution":{"observed_at":"2026-08-15T16:20:27.015370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.991327Z","title":"Baseline models and evaluation of sound event localization and detection with distance estimation in DCASE 2024 Challenge,","venue":null,"work_id":"3fc248a4-6baa-4280-9b36-b97879f4484d","year":2024},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.044985Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:90c7af37eb4d0805727e7a0bd5e4799a418b63759860568f5914d4b590e74de3","observation_id":"94edd777-9b6d-46aa-908e-e6b092f772eb","resolution":{"observed_at":"2026-08-15T16:20:26.997322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.050624Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.050624Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:edb51357ec89b4a25b311af06dcb0a247c8098bb3caddc9d38d6d04fcd5fafe4","observation_id":"7cd18648-6a47-4d9b-b2fd-804253aacbfc","resolution":{"observed_at":"2026-08-15T16:20:26.050624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.963014Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"df60c8c2-f3f7-48e6-953e-f69b8faca6f0","year":2021},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.055882Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:04dd70a37ff27666f26340838d9b2e71a4afe3798e3454b00128b896d3daf2d0","observation_id":"89b8c069-ea46-4aee-b5bc-c5f406e7446e","resolution":{"observed_at":"2026-08-15T16:20:26.969019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.945407Z","title":"AudioGPT: understanding and generating speech, music, sound, and talking head,","venue":null,"work_id":"fe18edef-25a5-40f0-aef5-d72017ee8735","year":2024},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.063029Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:83f66de948360881d28e132d4b71d53c68ab16fe2749f6e7d60a7761deea0f00","observation_id":"dc2f758c-5300-49a6-bd4e-ef62ddb48c6c","resolution":{"observed_at":"2026-08-15T16:20:26.951517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.929847Z","title":"Spatial Scaper: A library to simulate and augment soundscapes for sound event localization and detection in realistic rooms,","venue":null,"work_id":"19c74faf-d90b-41be-898d-181375592cb7","year":2024},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.070406Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:0fbca2e3a16b49f9a2039d7d5c223a5b961627f2cb8f52d96acb34bc5f88577f","observation_id":"10c1e2bd-73c0-463a-b710-0fbb193c26dc","resolution":{"observed_at":"2026-08-15T16:20:26.934840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02988","last_updated":"2025-04-03T19:27:43Z","snapshot_observed_at":"2026-08-16T12:44:08.995884Z","submitted_at":"2025-04-03T19:27:43Z","title":"Generating Diverse Audio-Visual 360 Soundscapes for Sound Event Localization and Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02988","snapshot_observed_at":"2026-08-15T16:20:26.076560Z","title":"Generating diverse audio-visual 360 ◦ soundscapes for sound event localization and detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.076560Z"},"links":{"cited_paper":"/paper/2504.02988","citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:69d0ae051d3b4fb1bd77747a0a538f85b4c11566decfbbbba8d5bdb9f8c88627","observation_id":"5bdc6356-1549-408f-831f-579150bb835e","resolution":{"observed_at":"2026-08-15T16:20:26.076560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.914572Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"e5166487-704e-4819-99f1-028363bfc4bc","year":2023},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.082798Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:5b1f516c9b43d954296506574587dcaa79ca1f4d42a7c13491b96aa98fff1f04","observation_id":"c16ebc99-9fca-4b1f-b315-747623857095","resolution":{"observed_at":"2026-08-15T16:20:26.919602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.898836Z","title":"Simple open-vocabulary object detection,","venue":null,"work_id":"0a5d61f9-9bde-4cdb-bfcd-d1e4aae817b3","year":2022},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.087922Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:242b46325a059c4e9a92e2002d2ec633cf55b34c11ad223d4eaae3825589f234","observation_id":"a24d2e78-9f8b-4db4-af75-847ef7e82cc3","resolution":{"observed_at":"2026-08-15T16:20:26.904164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.881164Z","title":"A four-stage data augmentation approach to ResNet- Conformer based acoustic modeling for sound event localization and detection,","venue":null,"work_id":"1992d29b-4e51-4709-ba16-28cde85c31af","year":2023},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.093357Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:81fa76e875753aabb455940a85e68e897a81e80de0b3fe69a29c60ac5ba453d6","observation_id":"efee31b4-db14-4eee-bf38-71b21b21a6ea","resolution":{"observed_at":"2026-08-15T16:20:26.886566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.861762Z","title":"Fusion of audio and visual embeddings for sound event localization and detection,","venue":null,"work_id":"e2207948-21ad-4392-88f7-dd3df0cb7569","year":2024},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.099136Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:b8f2a34ea7f06c5c1280ad0f9687b37f1203c6ba1ffd403d206edee0581a3953","observation_id":"961f47cf-8196-48a0-9a59-c9722e43f5c1","resolution":{"observed_at":"2026-08-15T16:20:26.869001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.843470Z","title":"ResNet-Conformer network using multi-scale channel attention for sound event localization and detection in real scenes,","venue":null,"work_id":"44fa3b12-f1e7-434c-b2be-6f5fc6035473","year":2023},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.104484Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:2b5e3b101a227fda4595d6a5a13f902bc6107ab7010ef3fe8f1e88a56a6e7fdb","observation_id":"2350f4c6-86d6-4e95-a30a-b523e622f57b","resolution":{"observed_at":"2026-08-15T16:20:26.849644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.826577Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":"0b369d25-8a5b-4d83-b724-872c91abfa3d","year":2020},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.109410Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:0095e9f0c3f82a13605c27c6a99f91750b968f251ca19cdb0d9e0e117b6b14ee","observation_id":"a07f6357-459e-417a-b3ec-a8d769b87fd9","resolution":{"observed_at":"2026-08-15T16:20:26.832458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08644","last_updated":"2026-04-20T08:35:46Z","snapshot_observed_at":"2026-08-16T08:11:32.317130Z","submitted_at":"2025-04-11T15:43:13Z","title":"Reverberation-based Features for Sound Event Localization and Detection with Distance Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08644","snapshot_observed_at":"2026-08-15T16:20:26.114644Z","title":"Reverberation-based features for sound event localization and detection with distance estimation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.114644Z"},"links":{"cited_paper":"/paper/2504.08644","citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:5e24d983a20ffdbb14aa7045c518882eef823b8c372b84fe91b01156d2c27733","observation_id":"48fb1ec3-0d0f-42a5-b2e2-380430fc0c8a","resolution":{"observed_at":"2026-08-15T16:20:26.114644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.809262Z","title":"Sound event detection and localization with distance estimation,","venue":null,"work_id":"2b54fcef-6efc-4070-8c1d-0da3332bf2bc","year":2024},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.119981Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:bb57111f4d08fbd7ea45a1fc57fd3c06f32f0f5afacd3195204d690560e227d8","observation_id":"c55a3c78-f111-4169-b77d-7dc2336c0546","resolution":{"observed_at":"2026-08-15T16:20:26.815408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.793339Z","title":"Multi-ACCDOA: Localizing and detecting overlapping sounds from the same class with auxiliary duplicating permutation invariant training,","venue":null,"work_id":"da423872-36b2-415d-8912-e73571e61e1c","year":2022},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.126239Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:ecb7314a45095d14bae1a51a76a4f3c759729a1c92be45c241ce64436fac5908","observation_id":"90dae102-c6ac-424b-9462-acfd887a2e2d","resolution":{"observed_at":"2026-08-15T16:20:26.798151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.775627Z","title":"Event-independent network for polyphonic sound event localization and detection,","venue":null,"work_id":"7411ada1-9c3d-4c40-8dc9-8131c58e8740","year":2020},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.133127Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:c6dff4e48d91f567ee2de240d869440674d525fdebcb5508b02d0119805d32cc","observation_id":"b5f54483-1d76-47f0-bdd6-69266a570005","resolution":{"observed_at":"2026-08-15T16:20:26.780902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.757030Z","title":"An improved event-independent network for polyphonic sound event localization and detection,","venue":null,"work_id":"637bc32c-c41b-4729-b2c2-588f0d2f1262","year":2021},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.140607Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:077ef7bf9ad679bf287372f5e6709b9580d17d645733c643a01f94ebcb17e30b","observation_id":"41925959-3ab8-49d2-af86-f76d1ec225e1","resolution":{"observed_at":"2026-08-15T16:20:26.762834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.738950Z","title":"Batch normalization: Accelerating deep network training by reducing internal covariate shift,","venue":null,"work_id":"b50eb7c3-60eb-4799-85ce-7d5dadea3a33","year":2015},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.147492Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:9038415a0011baf560c3ba67e32b0a65223128e5f5806332cfb376b580c68a2d","observation_id":"6fd0329e-74e0-4715-8bec-d1a10d8c887b","resolution":{"observed_at":"2026-08-15T16:20:26.744698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.721571Z","title":"Leveraging reverberation and visual depth cues for sound event localization and detection with distance estimation,","venue":null,"work_id":"4145df8b-ca34-40ca-876a-01388fe3d978","year":2024},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.154995Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:f8ab59f5843e9738e885cab4cb0f00a981e390ab0e95cc0f0aa8b5d362aa565d","observation_id":"4ee9defa-e2bb-41b6-a784-1afd404679cd","resolution":{"observed_at":"2026-08-15T16:20:26.726953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.705385Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":"48d72d49-d29f-473e-8548-67306c101e60","year":2016},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.160374Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:16aeaf71cdbcdbdd1a00198cc832a51ae37f29f6a858fdd54d664541d3f1ce67","observation_id":"0dc3e205-2536-4b06-bc35-85bf41d066e9","resolution":{"observed_at":"2026-08-15T16:20:26.710972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14153","last_updated":"2024-11-21T14:18:10Z","snapshot_observed_at":"2026-08-18T08:25:32.432321Z","submitted_at":"2024-11-21T14:18:10Z","title":"MVANet: Multi-Stage Video Attention Network for Sound Event Localization and Detection with Source Distance Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14153","snapshot_observed_at":"2026-08-15T16:20:26.167344Z","title":"MV ANet: Multi-stage video attention network for sound event localization and detection with source distance estimation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.167344Z"},"links":{"cited_paper":"/paper/2411.14153","citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:90ff76c65bbf7f9d969942a9b26e2cdbce00a1dd89bd1d250ea1bda9e9d5931c","observation_id":"2063501a-bcec-44db-b833-e0abb2e2fd5f","resolution":{"observed_at":"2026-08-15T16:20:26.167344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.688022Z","title":"First order ambisonics domain spatial augmentation for DNN-based direction of arrival estimation,","venue":null,"work_id":"23867904-dc89-427f-a3c8-54c2debda4c3","year":2019},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.173194Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:f6d1bdb13599e1943303165918b38d3a6aad6216381e557cd627dd563ec3824b","observation_id":"1cb8c0f1-82a7-461d-9bf0-3e90bb9639e1","resolution":{"observed_at":"2026-08-15T16:20:26.693783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.668125Z","title":"Two vs. four-channel sound event localization and detection,","venue":null,"work_id":"e53aa36f-de27-434f-8dcb-c2c6e5fc8bc7","year":2023},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.178590Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:b812fbd711d212065d8ac11b1baa29c3374d5c694627644c34690256c424d4c7","observation_id":"5668bffe-c0a6-4460-b8dd-06e50cbd59de","resolution":{"observed_at":"2026-08-15T16:20:26.674329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.183848Z","title":"SA VGBench: Benchmarking spatially aligned audio- video generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.183848Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:5cd7132fb7094ee76dc577fd3b3e2a23426b735cca6e5b0cab8bff1ed7fe8cd6","observation_id":"f70447c0-af57-4036-b9b7-3d5059a7396d","resolution":{"observed_at":"2026-08-15T16:20:26.183848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.648269Z","title":"FSD50K: an open dataset of human-labeled sound events,","venue":null,"work_id":"2f418b15-8ebf-42fb-b053-ea400d468444","year":2022},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.190775Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:c9394db162d7b28bf6ef75a31fe8d074bcfed5a3fe39a0149dd069d4b40f8507","observation_id":"52f7f504-579c-4010-9722-3107a059133f","resolution":{"observed_at":"2026-08-15T16:20:26.653966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.196104Z","title":"METU SPARG Eigenmike em32 Acoustic Impulse Response Dataset v0.1.0,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.196104Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:822ed87a1d8cb13c4f616dfebf18b59ed36c932d7bf534add9d2270d999d4c62","observation_id":"a96ca6c1-a3ef-4752-bc3b-4749b2f20353","resolution":{"observed_at":"2026-08-15T16:20:26.196104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11882","last_updated":"2021-11-23T13:51:17Z","snapshot_observed_at":"2026-08-18T14:00:38.897561Z","submitted_at":"2021-11-23T13:51:17Z","title":"Dataset of Spatial Room Impulse Responses in a Variable Acoustics Room for Six Degrees-of-Freedom Rendering and Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11882","snapshot_observed_at":"2026-08-15T16:20:26.202670Z","title":"Dataset of spatial room impulse responses in a variable acoustics room for six degrees-of-freedom rendering and analysis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.202670Z"},"links":{"cited_paper":"/paper/2111.11882","citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:1926ff04507cf29af6be63bf8f7360392aece68ebe2b22ba81a3f66ce5b056a5","observation_id":"269cc86a-24bc-433c-94b8-c19bc38a3317","resolution":{"observed_at":"2026-08-15T16:20:26.202670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01840","last_updated":"2017-09-05T18:38:33Z","snapshot_observed_at":"2026-08-14T21:26:53.042056Z","submitted_at":"2016-12-06T14:58:59Z","title":"FMA: A Dataset For Music Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.01840","snapshot_observed_at":"2026-08-15T16:20:26.209072Z","title":"FMA: A dataset for music analysis,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.209072Z"},"links":{"cited_paper":"/paper/1612.01840","citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:f0256d295a72faa8ecf35188104268aad07744cbe303bd3ce4745796bea9a2e0","observation_id":"9a63cdae-413a-41d1-aadf-f6fb1e82b8a5","resolution":{"observed_at":"2026-08-15T16:20:26.209072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.631162Z","title":"A dataset of higher-order ambisonic room impulse responses and 3D models measured in a room with varying furniture,","venue":null,"work_id":"ebde19de-01af-4723-abce-4101cfa7049c","year":2021},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.216117Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:2e981962244f4641ebed27351b61f585d4325a3251831120a3c152744d2c1643","observation_id":"b171a275-06e1-4b51-9a68-36ac27346591","resolution":{"observed_at":"2026-08-15T16:20:26.636485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.612193Z","title":"Room impulse response dataset of a recording studio with variable wall paneling measured using a 32-channel spherical microphone array and a B-format microphone array,","venue":null,"work_id":"248fd320-20b8-4b11-87cf-33df1350a55d","year":2024},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.221936Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:c577d8bd091babc9c01bcc018c42d86b7ff2d047cad2428c8dc34ce9f3ff63d3","observation_id":"6df205fc-0694-4fdf-86c0-07cf3b1ba0eb","resolution":{"observed_at":"2026-08-15T16:20:26.619045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.594750Z","title":"Data set: Eigenmike-DRIRs, KEMAR 45BA- BRIRs, RIRs and 360° pictures captured at five positions of a small conference room,","venue":null,"work_id":"0009f2f6-cd67-430d-a3fc-5f46a98341a9","year":2019},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.228679Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:25a1dd475c9370329012bff181ad4f992cdc83a4b92f2c461690738218b665e0","observation_id":"24973a5f-79bb-48e4-851d-c359a3c19546","resolution":{"observed_at":"2026-08-15T16:20:26.600407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.235728Z","title":"Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.235728Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:d63d81bb01211f8729b1afd6e2886070fc372afcd47b305052b45478c3b57eab","observation_id":"a495c67d-47a8-4e94-ba60-85a7ef97dba8","resolution":{"observed_at":"2026-08-15T16:20:26.235728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.567129Z","title":"Robust and adaptive door operation with a mobile robot,","venue":null,"work_id":"0c76206c-5b09-4298-b65d-3e8cc4222781","year":2021},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.243849Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:a6cd36e325099182e5f43e73f1b99c44bb5d9449fdf47d27b0815dc8989f911a","observation_id":"aa6a57c2-8fcb-4f2b-ae23-c2d076c5a4b2","resolution":{"observed_at":"2026-08-15T16:20:26.572613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02030","last_updated":"2024-12-06T11:22:17Z","snapshot_observed_at":"2026-08-17T21:27:31.930644Z","submitted_at":"2024-12-02T23:20:35Z","title":"NitroFusion: High-Fidelity Single-Step Diffusion through Dynamic Adversarial Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02030","snapshot_observed_at":"2026-08-15T16:20:26.250262Z","title":"NitroFusion: High-fidelity single-step diffusion through dynamic adversarial training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.250262Z"},"links":{"cited_paper":"/paper/2412.02030","citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:cbb8e076a0e8edea81a488072a7f8b5be1b6f61a2adee4be6b9884c1ac7362d3","observation_id":"ee962070-176f-46dc-8979-f83872b3d4ee","resolution":{"observed_at":"2026-08-15T16:20:26.250262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.546132Z","title":"360-Indoor: Towards learning real-world objects in 360° indoor equirectangular images,","venue":null,"work_id":"1fd9e180-eae5-40ba-8a1d-497225c18436","year":2020},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.256514Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:18c848bb1f59d88b504bffd6775bf5fca303b66e8672dc4bb1a137336029d069","observation_id":"1762f3d2-57b5-481d-a120-4d4546c03c9a","resolution":{"observed_at":"2026-08-15T16:20:26.553388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.263411Z","title":"Exploring audio-visual information fusion for sound event localization and detection in low-resource realistic scenarios,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.263411Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:a1ec8ffbf758f1eef0f65add9fe6febdf0e8d3a9bc60511e58924a0753b99647","observation_id":"9f761f45-58e0-4ff3-9d9d-019324b9090d","resolution":{"observed_at":"2026-08-15T16:20:26.263411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17129","last_updated":"2024-01-29T06:05:23Z","snapshot_observed_at":"2026-08-16T14:23:46.827475Z","submitted_at":"2024-01-29T06:05:23Z","title":"Enhanced Sound Event Localization and Detection in Real 360-degree audio-visual soundscapes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17129","snapshot_observed_at":"2026-08-15T16:20:26.270256Z","title":"Enhanced sound event localization and detection in real 360-degree audio-visual soundscapes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.270256Z"},"links":{"cited_paper":"/paper/2401.17129","citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:8e9ad76ccc2bf9ea93a9f2beba3a8f3d77f793694693b13e3aed70963a9d5b59","observation_id":"b44a45b8-5f6b-4126-bf41-83a793d296e3","resolution":{"observed_at":"2026-08-15T16:20:26.270256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:20:26.277030Z","title":"Ultralytics YOLO,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T16:20:26.277030Z"},"links":{"citing_paper":"/paper/2509.06598"},"observation_digest":"sha256:25cb9d639d9b93f0b99d9fab2860b6daf4722ee125ead7ad7b25219cc8fa3d8b","observation_id":"e70b2a99-5b28-4cc0-8309-cfd4e3a9f569","resolution":{"observed_at":"2026-08-15T16:20:26.277030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.06598","last_updated":"2025-09-08T12:07:32Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-17T18:40:11.499169Z","submitted_at":"2025-09-08T12:07:32Z","title":"Integrating Spatial and Semantic Embeddings for Stereo Sound Event Localization in Videos"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2509.06598."}