{"as_of":"2026-08-07T09:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e460054c722f4eca6e6d4f02365aa9d094986a4cfdb7c106e428324f8b3f492a","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:03:22.242986Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.21761/citation-record","integrity":"/paper/2508.21761/integrity","json":"/paper/2508.21761/citation-record.json","paper":"/paper/2508.21761"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:34.892373Z","title":"Adobe audition sound effects, 2023","venue":null,"work_id":"192e25fc-0ddb-489b-84e1-e38041f5cd52","year":2023},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:15.918896Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:9aa581eb35223d3c1bcbd2ccca10a7dabf5b12ce010470b2ed20e18aa2a27eb1","observation_id":"3e4a7fab-55d5-457f-86a4-8f3593837185","resolution":{"observed_at":"2026-08-05T14:03:34.971984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:34.726592Z","title":"Self- supervised learning of audio-visual objects from video","venue":null,"work_id":"f520e76b-9039-45bf-ba55-8b037119cac3","year":2020},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:16.037998Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:942d418693e5bc72346e0f6abaa838fa75933e2ab349e2a8092ff665871b6211","observation_id":"2487fb81-ca58-4a6e-9bbc-3c103ff6edd9","resolution":{"observed_at":"2026-08-05T14:03:34.794728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:34.521493Z","title":"Look, listen and learn","venue":null,"work_id":"6ccc8bfe-d219-43f7-b0ca-e3d6d100a5fc","year":2017},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:16.212958Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:72300c96503f7d0435f501787529cdef99aff79efa0bb30cafc6f3954a910db5","observation_id":"167a7fe3-becb-4103-88ac-23a71fd954ee","resolution":{"observed_at":"2026-08-05T14:03:34.604618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:34.284783Z","title":"Objects that sound","venue":null,"work_id":"7bed885b-93ee-431b-ac53-d9422478dd40","year":2018},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:16.317154Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:579c0c1475ee68c4685d2bce51434e49283833eb3cceb635dcbf1071e0a62bde","observation_id":"36d7af9e-35fc-4dd2-a2c6-11d63e7e929c","resolution":{"observed_at":"2026-08-05T14:03:34.384136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:34.027677Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"16174d9b-7007-41a5-a855-4fcea9ace903","year":2020},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:16.462096Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:e17555ab8f0c093e7a11a5b5be06c8c3fbd2aa9360e577d1bad7e960717422cb","observation_id":"06da2763-a6f0-434b-915e-20afb4a4cf7f","resolution":{"observed_at":"2026-08-05T14:03:34.185269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:33.755733Z","title":"Localizing visual sounds the hard way","venue":null,"work_id":"054ad0ef-6927-4c7f-96bf-6c5d8415f507","year":2021},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:16.662025Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:940cb2e7883919870a6d6aa08c3c373976616c01645e686580db08a20f84f23c","observation_id":"8f8dccc0-9e7d-48aa-8820-e48257bbecff","resolution":{"observed_at":"2026-08-05T14:03:33.877814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:16.836987Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:16.836987Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:ffd75ef921646e8bd9ad4067c7dbb87088ac8331807273a463f39001802504df","observation_id":"ce4379dd-7053-4613-9993-a857258bcb61","resolution":{"observed_at":"2026-08-05T14:03:16.836987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:33.585678Z","title":"Exploring simple siamese representation learning","venue":null,"work_id":"6ff5f9e2-ea95-406f-b04e-95a823fa26f7","year":2021},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:16.989821Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:ee012bea3991f0eadd2cfd5c06ab82784bfc63241c6aec6915ac1988979919e7","observation_id":"9612ced4-e39e-4d8f-98e7-88a8bb288676","resolution":{"observed_at":"2026-08-05T14:03:33.654480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12102","last_updated":"2024-08-22T03:34:03Z","snapshot_observed_at":"2026-08-06T14:46:32.213787Z","submitted_at":"2024-08-22T03:34:03Z","title":"Integrating Audio, Visual, and Semantic Information for Enhanced Multimodal Speaker Diarization","version":1},"cited_work":{"arxiv_id":"2408.12102","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.12102","snapshot_observed_at":"2026-08-05T14:03:23.702312Z","title":"Integrating Audio, Visual, and Semantic Information for Enhanced Multimodal Speaker Diarization","venue":"cs.LG","work_id":"9e879b76-c8a9-4c23-9e47-2a5f64fb1e88","year":2024},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:17.100791Z"},"links":{"cited_paper":"/paper/2408.12102","citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:f3e5091bcc4cb879b729ef8d48ee4302dbec8094b573b5e075cc67fb69e129a1","observation_id":"18f1a1bf-66a1-46a6-84d2-e8af7158bfb4","resolution":{"observed_at":"2026-08-05T14:03:23.762550Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:33.416848Z","title":"Learning a similarity metric discrimi- natively, with application to face verification","venue":null,"work_id":"7784c732-7553-40b7-a931-9f51ce77acc9","year":2005},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:17.193287Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:6adc9886ab459d52df2a363c977e56aeddcca22c422a69dce5ac6a5fbd59549f","observation_id":"0a716c15-8ebd-4fd0-88bb-34b2ee5bbf71","resolution":{"observed_at":"2026-08-05T14:03:33.487670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:33.179784Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"4ba9d353-9e2b-430c-8e98-1eb9d84c21cb","year":2009},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:17.318838Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:2fc0bc75ca420eb038394a278bd9380765ddcb2ad899447d27bbd812b012b5ef","observation_id":"e14f1e04-fc7c-4f20-a678-de813f45fdb2","resolution":{"observed_at":"2026-08-05T14:03:33.265198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:33.056288Z","title":"Condi- tional generation of audio from video via foley analogies","venue":null,"work_id":"c85ed274-cdcf-439b-9b46-45a9a6ef63fb","year":2023},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:17.370379Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:ffef8106859e23a271aaa3c88ab159a004e536f7260b2030329f6d940c2a24f2","observation_id":"d975b22f-4ca3-4589-a2e4-72ee818513cb","resolution":{"observed_at":"2026-08-05T14:03:33.105208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01774","last_updated":"2025-01-15T13:04:43Z","snapshot_observed_at":"2026-08-04T23:59:19.987065Z","submitted_at":"2024-07-01T20:06:57Z","title":"Audio-Visual Approach For Multimodal Concurrent Speaker Detection","version":2},"cited_work":{"arxiv_id":"2407.01774","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.01774","snapshot_observed_at":"2026-08-05T14:03:23.533527Z","title":"Audio-Visual Approach For Multimodal Concurrent Speaker Detection","venue":"eess.AS","work_id":"484f7897-9b84-488a-ad4e-f86b513bcd51","year":2024},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:17.449504Z"},"links":{"cited_paper":"/paper/2407.01774","citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:7ee506a4aaacbf0cc2e17cb9b4116f8c202bf4146180060f881a17cd738e6b24","observation_id":"289e305d-b66e-4ba4-bce0-e02e77410ff9","resolution":{"observed_at":"2026-08-05T14:03:23.586547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:32.880973Z","title":"Effect of acoustic scene complexity and visual scene representation on auditory perception in virtual audio-visual environments","venue":null,"work_id":"5035cac2-63c3-4257-bee4-2dcd5320b3f8","year":2021},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:17.494864Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:0877bf156274f2dc5fa4d9b85610f8565092fee8138c42fb678b99be294f5c33","observation_id":"4ab82633-9016-4ffb-81d5-3db50d0ec276","resolution":{"observed_at":"2026-08-05T14:03:32.961414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:32.674566Z","title":"Learning joint sta- tistical models for audio-visual fusion and segregation","venue":null,"work_id":"0baec302-4216-4bc5-a848-d0a323150628","year":2000},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:17.608532Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:3e47d54606fc3450ec37c033c0120a5a5cd8a3c9abb8548f7ce2a08a88bbaff5","observation_id":"7035228b-f75d-47ad-8bb6-095d71fefd7f","resolution":{"observed_at":"2026-08-05T14:03:32.769252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:32.499191Z","title":"Visualvoice: Audio-visual speech separation with cross-modal consistency","venue":null,"work_id":"4080f8f4-dc7b-4a18-a975-5ce78876e120","year":2021},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:17.717130Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:c846bbc35435a2b99d95c58d9752705f8d9677d1f063088e2173cadd7e34cafb","observation_id":"21b16037-084b-48f8-9727-8994e6d63e22","resolution":{"observed_at":"2026-08-05T14:03:32.569106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:32.251520Z","title":"Cyclip: Cyclic contrastive language-image pretraining","venue":null,"work_id":"b142c3c0-89a7-41ef-9757-14c88c2131e6","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:17.817540Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:6db710d10769d82eb70d8268b43be0da230d6b78a55f3c97666bcdbcd88bc374","observation_id":"7a8dccc9-a42b-4a45-9b98-5a25c45fe29f","resolution":{"observed_at":"2026-08-05T14:03:32.373662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:17.872247Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:17.872247Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:0f3af2e8e9642a589a847effa6d63dc6f9ae17d0a77d25e74e9d88b14217a1f6","observation_id":"555accc2-bd1e-4443-be62-406557953cf7","resolution":{"observed_at":"2026-08-05T14:03:17.872247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:32.076017Z","title":"chirp\" from the","venue":null,"work_id":"d9c8b27e-7d41-47fa-98f1-2d5e124da60e","year":2024},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:17.970801Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:3e9832102bd3f78bf52bac4cc864658c9458870934f3c1bd37effc45ef984528","observation_id":"9117824f-d757-446f-a13a-c5ca6b004c8a","resolution":{"observed_at":"2026-08-05T14:03:32.139912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:31.865893Z","title":"Canonical correlation analysis: An overview with application to learning methods","venue":null,"work_id":"dd518fc3-5218-4535-9b97-cabae0f3a266","year":2004},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:18.046880Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:5bf353feb823ec4166a757870724ab16c23fd2f35503e559212a4b4a0ae5744d","observation_id":"c1f857d6-a920-4f0c-8c65-9a2f577b3ec1","resolution":{"observed_at":"2026-08-05T14:03:31.989916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:31.663281Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"1c947c28-5c8f-4fe1-8578-0a1dd3aa77ce","year":2016},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:18.151815Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:3f2271541907a2835e6782741e26b6af53cef1d5e06a7827148a39ca2897f4f1","observation_id":"f9ac9d16-c864-4f9a-874c-84270023d2d5","resolution":{"observed_at":"2026-08-05T14:03:31.716044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:31.516313Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":"2b8fcbca-cfb3-4613-aa86-11dd93a9789f","year":2020},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:18.223211Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:30be1a898cabe0ce968431c419ee47adfd93620c44bae1f6053299c0ffd253b8","observation_id":"bdcaa123-6481-48ef-8d32-f6d0a08e3848","resolution":{"observed_at":"2026-08-05T14:03:31.579954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:31.255057Z","title":"Audio vision: Using audio-visual synchrony to locate sounds","venue":null,"work_id":"e3dc48cc-0fb3-4790-8419-257cd632f798","year":1999},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:18.309446Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:1c5ebade9a3dd18c5ddee2a5d53ff5bbe596860af31323bb836fdeb7b272ab43","observation_id":"1531a6c8-67b1-4cd1-b540-fb97086735e4","resolution":{"observed_at":"2026-08-05T14:03:31.401708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:31.062189Z","title":"Discriminative sounding objects localization via self-supervised audiovisual matching","venue":null,"work_id":"f0a21758-6649-45af-be3b-6c875a942f17","year":2020},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:18.380386Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:95969b252cd4965f96ed261d7f7e0fe1199c46a9c72bea0336085667f36fe799","observation_id":"2f85e6e0-8b9c-4b19-b9d8-e3c329afbaa8","resolution":{"observed_at":"2026-08-05T14:03:31.135238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:30.793236Z","title":"Mix and localize: Localizing sound sources in mixtures","venue":null,"work_id":"d92594b5-1568-47ff-ac3f-c2461211e5eb","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:18.493766Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:8fa42fb8bc53dcbe2eab166a207dd5cddd25daf6a0b2fb9c9a18e10fa572f9a5","observation_id":"d41ebcae-edae-4131-a152-077352edea82","resolution":{"observed_at":"2026-08-05T14:03:30.939933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:30.589035Z","title":"You said that?: Synthesising talking faces from audio","venue":null,"work_id":"cc02d670-c3f0-499b-a8cd-7ac94eac815c","year":2019},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:18.591004Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:13079fcae3c9fe4a3987de7da2ea1121b8be3930b3389fc035e05116ba89d01b","observation_id":"f24628e5-4deb-4bd6-a161-2ec939372d7b","resolution":{"observed_at":"2026-08-05T14:03:30.689850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:30.394328Z","title":"A critical assessment of visual sound source localization models including negative audio","venue":null,"work_id":"8439a8bf-8baf-4506-865f-4f7ed57b6536","year":2025},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:18.664703Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:af5d1f0e2d1386120d794d560f6092a79b3d89f2d9c9528ba13efc7767796d46","observation_id":"fe8c4062-3b87-4099-b58b-ab27916b5b14","resolution":{"observed_at":"2026-08-05T14:03:30.496216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:30.203182Z","title":"Pixels that sound","venue":null,"work_id":"9cf301c8-eeeb-40a4-bb57-cc896fb39c0d","year":2005},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:18.762759Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:5f65dcb86f5ea8e523b815c9e5b863958674253bb2489479266480528e17a5c3","observation_id":"3c20823b-4950-455a-9f2d-e625d405f647","resolution":{"observed_at":"2026-08-05T14:03:30.279438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:30.012945Z","title":"Learning to visually localize sound sources from mixtures without prior source knowledge","venue":null,"work_id":"6df45389-6ef0-4a89-a4e6-0d01520391d8","year":2024},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:18.830545Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:55c302534f4dbc7c9ea2b4b7c083f1150fe03a6b3334544856cf6f4a0130ad65","observation_id":"86a4e8a1-aca1-4a30-a092-b47e19d647af","resolution":{"observed_at":"2026-08-05T14:03:30.115536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T14:03:18.902349Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:18.902349Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:9a96786b73cd8e3caff07180cf6095200b3a9cce13f08cc664c9006d569294aa","observation_id":"f74c8c59-b5b1-4b15-9869-a16ad8230e4a","resolution":{"observed_at":"2026-08-05T14:03:18.902349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:29.862469Z","title":"Cooperative learning of audio and video models from self-supervised synchronization","venue":null,"work_id":"d33758f8-90f8-434c-8249-a5dc77004794","year":2018},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.044555Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:de6c6b2a22c0e07759764dde10a28c9a6eaf0aa43a4ff79378865d6cd15fe532","observation_id":"26e5a637-3c5a-4d02-83c3-de343d8cab76","resolution":{"observed_at":"2026-08-05T14:03:29.932477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15676","last_updated":"2026-06-01T14:59:35Z","snapshot_observed_at":"2026-07-06T16:37:42.806807Z","submitted_at":"2023-10-24T09:39:05Z","title":"Recent Advances in Multi-modal 3D Intelligence: A Comprehensive Survey and Evaluation","version":2},"cited_work":{"arxiv_id":"2310.15676","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.15676","snapshot_observed_at":"2026-08-05T14:03:23.280228Z","title":"Recent Advances in Multi-modal 3D Intelligence: A Comprehensive Survey and Evaluation","venue":"cs.CV","work_id":"014d37c5-aab4-4d2b-8428-130997206d69","year":2023},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.177165Z"},"links":{"cited_paper":"/paper/2310.15676","citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:0b8f7dfe6b867b7da3105adb5e959de2b6c65281bf00401ea472d4bfb66eb532","observation_id":"c3270f41-9b6a-4e61-a63d-3ae7c5b4fc9e","resolution":{"observed_at":"2026-08-05T14:03:23.396154Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00358","last_updated":"2025-02-20T22:37:12Z","snapshot_observed_at":"2026-07-06T20:29:26.524162Z","submitted_at":"2025-02-01T07:40:29Z","title":"Do Audio-Visual Segmentation Models Truly Segment Sounding Objects?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00358","snapshot_observed_at":"2026-08-05T14:03:19.216337Z","title":"Do audio-visual segmentation models truly segment sounding objects? arXiv preprint arXiv:2502.00358, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.216337Z"},"links":{"cited_paper":"/paper/2502.00358","citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:89a5f4be0159cb32d486a82351427b43cc2ddb9d315c9bdc0c008f470ae28e6c","observation_id":"5ac2cb49-56c7-419a-97c4-702c5577b400","resolution":{"observed_at":"2026-08-05T14:03:19.216337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:29.620903Z","title":"Av-nerf: Learning neural fields for real-world audio-visual scene synthesis","venue":null,"work_id":"25c19cd7-f111-40e0-8e67-c0b5e5e8a9b7","year":2023},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.287441Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:fb5fb27b2d0386e1dfa0a2d17f316cfcc5802c336eff5def119e70d6f093007e","observation_id":"5726eb08-efbe-48d2-8b9a-57ff590efcdd","resolution":{"observed_at":"2026-08-05T14:03:29.749676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:29.364947Z","title":"Exploiting transformation invariance and equivariance for self-supervised sound localisation","venue":null,"work_id":"6f7587b6-af2d-438a-8e4b-7b8fa5bfbcce","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.364018Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:d8819c650002f34493c67891864eafe222052f13e050d5508f920e5682ea520d","observation_id":"545b8489-112a-4a7c-acb4-3bf5445ac3b9","resolution":{"observed_at":"2026-08-05T14:03:29.444007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:29.196159Z","title":"Visual sound localization in the wild by cross-modal interference erasing","venue":null,"work_id":"70bcbaeb-0258-4c34-af9a-bc037644f686","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.430163Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:e51e76f46cac3edc75b46e3ec434bd1126227cd0bc305665ba900035d2180230","observation_id":"d6efb336-eb53-4d2b-8eb8-ead267617474","resolution":{"observed_at":"2026-08-05T14:03:29.268918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:28.902239Z","title":"Image segmentation using text and image prompts","venue":null,"work_id":"60241513-feb3-4ac8-9f92-cb85bbc07189","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.524109Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:746e877251afa85ff8290ec348670cd1f600ca0a24b6c8539ebb3e9106852c45","observation_id":"dfadd034-3502-4d21-8367-823a8361e709","resolution":{"observed_at":"2026-08-05T14:03:29.062912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:28.575451Z","title":"T-vsl: Text-guided visual sound source localization in mixtures","venue":null,"work_id":"828686e8-fe24-48b7-ae0e-fe9edbe964aa","year":2024},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.613935Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:95dd16dbb265b0edd78547ff2e44dc25eeda7e552d7f11403978511e440f3ed6","observation_id":"f3b6196e-4d12-4e59-9b43-ef4eb58d925e","resolution":{"observed_at":"2026-08-05T14:03:28.730076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:28.366911Z","title":"Localizing visual sounds the easy way","venue":null,"work_id":"4dba03c9-4e37-4844-9642-0f7715dec485","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.694552Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:0c97f8cadda8fe18ddb506642d51126f3b7234082ab1a59d08f68c4c145ec754","observation_id":"1b55d64d-b16d-409d-bd20-36164e3dab4a","resolution":{"observed_at":"2026-08-05T14:03:28.457229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:28.140235Z","title":"A closer look at weakly-supervised audio-visual source localization","venue":null,"work_id":"ea0a12cb-7b69-4f36-8133-1010c59d94c0","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.728379Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:f9b765b89541e984e1cbb1264a963108697b22c41e1239f3a65f60a89242d89c","observation_id":"5198aa3c-400b-4ebf-a71e-8d6cee7cc734","resolution":{"observed_at":"2026-08-05T14:03:28.241052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:27.925477Z","title":"Audio-visual grouping network for sound localization from mixtures","venue":null,"work_id":"cdfdf67b-9a71-4d30-9d94-5e3be2e6427c","year":2023},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.819750Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:9f9204283e0b929d95545599492f4e43366b86d951f328059d86b4ad7f28d59c","observation_id":"29abf2f1-28ad-4e4d-9c21-79903fa57789","resolution":{"observed_at":"2026-08-05T14:03:28.027267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:27.754383Z","title":"V ovit: Low latency graph-based audio-visual voice separation transformer","venue":null,"work_id":"ded959de-01dd-4eb4-8922-525735a51134","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.877524Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:36cabc1b3f93143b289e470857bbce4bd39cdaaf7f4f88acfc02e32097202a68","observation_id":"f6d1524a-ddb1-46a0-8027-bc1a17cdaaee","resolution":{"observed_at":"2026-08-05T14:03:27.867430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:27.539792Z","title":"Speech inpainting: Context-based speech synthesis guided by video","venue":null,"work_id":"b4970bfa-e3c0-49ea-8233-efbb8a98af40","year":2023},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:19.963920Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:7230ff1b7be07cd92dde6671d225f85a9e82f2600c2a874ed8be695d59fa0bf2","observation_id":"4212176c-8216-4b62-9e64-87aa0313ae39","resolution":{"observed_at":"2026-08-05T14:03:27.640497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T14:03:20.022923Z","title":"Representation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.022923Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:045b25eb97bfb3689470f367d2b7d5539bd6d065a197a0418df297e1445d57db","observation_id":"35c1b0bd-8031-4bfc-87ec-decfcf16a85b","resolution":{"observed_at":"2026-08-05T14:03:20.022923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:27.337938Z","title":"Audio-visual scene analysis with self-supervised multisensory features","venue":null,"work_id":"ad2659fe-42a3-461c-b757-1b54165aa241","year":2018},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.134878Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:e01a80b830a649fe666955b207f95680cffc20f5c83efc8bfc1b1c6ede8e84f2","observation_id":"ccb7fd8a-a7cb-4ea2-8729-807d1485a669","resolution":{"observed_at":"2026-08-05T14:03:27.447874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:27.123250Z","title":"Do we need sound for sound source localization? In Asian Conference on Computer Vision, 2020","venue":null,"work_id":"a3f21693-6db5-47f6-8f04-aaa85b3bf1ec","year":2020},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.231901Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:e9b30b4a009b109e72cf436b9dcc411d04ed4cb6c04d2deff6b1897451d9990d","observation_id":"8bff9481-9821-4878-a193-e6c244a8ef4b","resolution":{"observed_at":"2026-08-05T14:03:27.224197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:26.849710Z","title":"Marginnce: Robust sound localization with a negative margin","venue":null,"work_id":"a819b334-7c27-4ee6-a1be-5f3bf1f36e8b","year":2023},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.299684Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:53cec735c07658f237da5ab266b0284ccb6d0ebc6928516b6530b946bed98903","observation_id":"40558691-05dd-42d0-b7bb-56127c08ea6e","resolution":{"observed_at":"2026-08-05T14:03:27.021849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:26.525409Z","title":"Can clip help sound source localization? In IEEE/CVF Winter Conference on Applications of Computer Vision, pages 5711–5720, 2024","venue":null,"work_id":"1269763e-3e52-496f-8129-59bbaddd3b9d","year":2024},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.368803Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:2468f3e59a1f7a665936f67221a13922f7972a87a0749be2dfe2713f72f5eeb9","observation_id":"b267725d-7f77-42e1-88e6-f3f085c22a92","resolution":{"observed_at":"2026-08-05T14:03:26.681627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:26.111037Z","title":"Multiple sound sources localization from coarse to fine","venue":null,"work_id":"d8dd33e2-bd0d-4c86-84fa-4b426cb1a82a","year":2020},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.433210Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:4fa716b23654d14bd69cb63b6afc3f0963a915f9bffcd67b9fede3c8f37a1c59","observation_id":"41058908-543f-4c88-a706-d013f88c9a81","resolution":{"observed_at":"2026-08-05T14:03:26.217672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:26.058728Z","title":"See the sound, hear the pixels","venue":null,"work_id":"98f8eb4d-d3a2-47d5-809b-36259067c014","year":2020},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.496314Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:4c6208edf97cee60de672b4a11e7f646294a140d8240fd2cbccdcc6094f07725","observation_id":"b70c6e83-750c-47ff-bb69-fae5b234ca61","resolution":{"observed_at":"2026-08-05T14:03:26.068140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:25.893528Z","title":"Sound source localization","venue":null,"work_id":"e65f4249-68d0-42bf-9849-ab189a2e8e57","year":2018},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.563495Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:ddbe2c22dbdb14e91cfb3bff107ea38b4548c8640df274b58016d590329f1be2","observation_id":"c89f614e-64eb-4afe-9485-56ad4c7a6dc3","resolution":{"observed_at":"2026-08-05T14:03:25.968208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:25.710614Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"1d0afb48-5f49-481c-99a2-e9f83592dcfc","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.665585Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:c351da275939bcbbe33007b368945d88e827486863657c1d9cd8c34c3da0fb36","observation_id":"d1015605-cbf7-49cd-b70f-aeb0766ec065","resolution":{"observed_at":"2026-08-05T14:03:25.822302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:25.570420Z","title":"Multimodal emotion recognition based on a fusion of audiovi- sual information with temporal dynamics","venue":null,"work_id":"f1a16a4b-dbfb-4085-9e9b-e6ce983a5dd7","year":2024},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.753635Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:3fa9d108ed824fb80f303fd81ce72e264042a9e95bfe748a41bf324b4b9a13c7","observation_id":"7bdcae6c-96c0-4e71-94d6-f754b9f90e0f","resolution":{"observed_at":"2026-08-05T14:03:25.641943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:25.414329Z","title":"Learn- ing to localize sound source in visual scenes","venue":null,"work_id":"2686a451-9c8c-49ab-b5b7-a1c6eeb74999","year":2018},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.867559Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:46b5c2a3e7ce6f20d14ae7923dcbaa59a4c4154f7c3d42d4c0b96e5e051f175d","observation_id":"76cf4767-5cb6-4e57-95b5-ec764ceea4c5","resolution":{"observed_at":"2026-08-05T14:03:25.491772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:25.272483Z","title":"Learn- ing to localize sound sources in visual scenes: Analysis and applications","venue":null,"work_id":"9d8cbd1b-680b-46f1-8bad-c9cbf49d447a","year":2019},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:20.939327Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:47dfc81c596c899d617384dda0cd32ed569799e061bd62660c815157d80f0a8f","observation_id":"fa0e209e-fb30-4268-a906-a1141e833c0f","resolution":{"observed_at":"2026-08-05T14:03:25.322500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:25.117705Z","title":"Learning sound localization better from semantically similar samples","venue":null,"work_id":"322520cf-ba99-4230-839d-0d4e893d65c4","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:21.045335Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:ce66137d152eb138b100de8b47253aae0e719b312a75d74f7e99bf148bad07eb","observation_id":"c0ed37e3-6dda-4b6b-845c-8fd6163ece78","resolution":{"observed_at":"2026-08-05T14:03:25.181472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:25.001819Z","title":"Less can be more: Sound source localization with a classification model","venue":null,"work_id":"81dc31cd-75e4-49c5-9826-a0f6f14a18b4","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:21.119429Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:af73b2d8e55e03effa84465bf96fa621ae4b5d8d8afc265470d00ebb0ffcd10f","observation_id":"c3ee7642-6288-4b1d-a719-e0eea20dadac","resolution":{"observed_at":"2026-08-05T14:03:25.058136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13676","last_updated":"2024-07-18T16:51:15Z","snapshot_observed_at":"2026-07-06T18:48:37.723242Z","submitted_at":"2024-07-18T16:51:15Z","title":"Aligning Sight and Sound: Advanced Sound Source Localization Through Audio-Visual Alignment","version":1},"cited_work":{"arxiv_id":"2407.13676","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.13676","snapshot_observed_at":"2026-08-05T14:03:23.115871Z","title":"Aligning Sight and Sound: Advanced Sound Source Localization Through Audio-Visual Alignment","venue":"cs.MM","work_id":"141b1b7b-ec5e-4772-a118-abbdefb64ed1","year":2024},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:21.201865Z"},"links":{"cited_paper":"/paper/2407.13676","citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:3c6365e80db2c7cab35cf07e7ea772458a9a58c15133d8cf6679406c2538c24e","observation_id":"a86842d6-bc6f-4693-9f2b-08d3fc350837","resolution":{"observed_at":"2026-08-05T14:03:23.177348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.00443","last_updated":"2021-08-01T12:35:16Z","snapshot_observed_at":"2026-07-06T11:34:31.916599Z","submitted_at":"2021-08-01T12:35:16Z","title":"A Survey on Audio Synthesis and Audio-Visual Multimodal Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.00443","snapshot_observed_at":"2026-08-05T14:03:21.327224Z","title":"A survey on audio synthesis and audio-visual multimodal processing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:21.327224Z"},"links":{"cited_paper":"/paper/2108.00443","citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:07863fc1a24fa66f7fbe3ebd80b390ef19789136d675e8f9d5a3e334e0ee8e85","observation_id":"3c7d422b-5187-4053-8ea8-18ee6b274945","resolution":{"observed_at":"2026-08-05T14:03:21.327224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:24.856676Z","title":"En- hancing sound source localization via false negative elimination","venue":null,"work_id":"b2612aac-5a4a-4c6b-a263-08c2ba2cf82e","year":2024},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:21.398564Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:ae04bb8cfd26818467b1894c31abf64cf964f378d2d2421abdf68f3eca1db0dc","observation_id":"c6f32e40-f962-4dbf-a376-12ab955ba608","resolution":{"observed_at":"2026-08-05T14:03:24.933449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:24.710472Z","title":"Learning audio-visual source localization via false negative aware contrastive learning","venue":null,"work_id":"65b60b22-ffba-46ba-9c57-f5fda567268d","year":2023},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:21.503132Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:3c69997f4a7c5b3b72183886ff881c73bcd9f39b80b02e3870d0d2a2d5518481","observation_id":"b90020e4-a3a1-4aaf-a769-4fc824b1fef4","resolution":{"observed_at":"2026-08-05T14:03:24.767706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:24.549685Z","title":"Sound to visual scene generation by audio-to-visual latent alignment","venue":null,"work_id":"2677f8f9-40b9-4d6e-979f-d696cf0e2e14","year":2023},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:21.569517Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:cd03b1292179e51526f59aa35cf02785fe38b25aa807d1738a2d6a82b2aa010b","observation_id":"582a0c3a-1945-42fb-b321-9d4ed159de83","resolution":{"observed_at":"2026-08-05T14:03:24.635351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06209","last_updated":"2024-12-09T05:04:50Z","snapshot_observed_at":"2026-08-03T03:28:55.901215Z","submitted_at":"2024-12-09T05:04:50Z","title":"Sound2Vision: Generating Diverse Visuals from Audio through Cross-Modal Latent Alignment","version":1},"cited_work":{"arxiv_id":"2412.06209","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.06209","snapshot_observed_at":"2026-08-05T14:03:22.989858Z","title":"Sound2Vision: Generating Diverse Visuals from Audio through Cross-Modal Latent Alignment","venue":"cs.CV","work_id":"5274d8eb-932a-4e9c-b11b-45b44d751fde","year":2024},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:21.674724Z"},"links":{"cited_paper":"/paper/2412.06209","citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:6e3d665ada4ce9e32761b5ce9c13a5180e4ce859d541a8d76a36d3207a9676d1","observation_id":"fd6bf942-0d75-4daa-8780-f3e02d52b7b9","resolution":{"observed_at":"2026-08-05T14:03:23.027866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:24.347192Z","title":"Audio-visual event localization in unconstrained videos","venue":null,"work_id":"7b686cec-71b1-4051-b7c0-9075337b987a","year":2018},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:21.770318Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:5f0311ec7863ed4551707b7b7ce557acd4ccf740cece56509795d86c3ffceabf","observation_id":"d030f199-b42e-4bd6-a4d8-bf6c0aef12c9","resolution":{"observed_at":"2026-08-05T14:03:24.453977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:24.171489Z","title":"Phrasecut: Language-based image segmentation in the wild","venue":null,"work_id":"6108931c-bdd0-42cb-8744-96bc789fd54f","year":2020},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:21.859711Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:279e575adad41d64f7f410252ccc27c9d941b5b48063fad7e75c2fee33289a91","observation_id":"ff4b3a39-ebe0-402b-b3e6-63d44945da3b","resolution":{"observed_at":"2026-08-05T14:03:24.279956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:23.998012Z","title":"How to listen? rethinking visual sound localization","venue":null,"work_id":"215adec0-f2f4-47d8-b365-69f12b1b27e0","year":2022},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:21.931296Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:5c5020b871dcd6477aa282a5131ecc2938603a49df9f14f84c989d442d29c21b","observation_id":"913503cf-93d5-4e6b-a859-7063cfbc141a","resolution":{"observed_at":"2026-08-05T14:03:24.077187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:23.835152Z","title":"Acoustic and visual knowledge distillation for contrastive audio-visual localization","venue":null,"work_id":"8fea7cb6-8bea-446d-be4f-2fded21f5ad9","year":2023},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:22.024661Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:2565bd6cc72fee2881ec7e1f92dbd219f5a27575908f8f67f68b7fa8019b8946","observation_id":"36113071-3274-493b-80ff-fc83234719e8","resolution":{"observed_at":"2026-08-05T14:03:23.900431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04269","last_updated":"2023-02-08T18:59:42Z","snapshot_observed_at":"2026-07-06T14:49:48.724079Z","submitted_at":"2023-02-08T18:59:42Z","title":"Diagnosing and Rectifying Vision Models using Language","version":1},"cited_work":{"arxiv_id":"2302.04269","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.04269","snapshot_observed_at":"2026-08-05T14:03:22.738072Z","title":"Diagnosing and Rectifying Vision Models using Language","venue":"cs.LG","work_id":"96cf9a9c-5789-4fc5-b413-225764ea7607","year":2023},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:22.115862Z"},"links":{"cited_paper":"/paper/2302.04269","citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:54cc1528a5a0455cabb4098266485de8285add409d8f7cdd56a9f503063f7ea3","observation_id":"5472dad6-6e1f-401b-a811-31d910bf3686","resolution":{"observed_at":"2026-08-05T14:03:22.863662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2514.8713","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:03:22.523151Z","title":"chicken clucking","venue":null,"work_id":"7587282f-6d58-44fb-aab6-d48935d53f25","year":2024},"citing_paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:22.242986Z"},"links":{"citing_paper":"/paper/2508.21761"},"observation_digest":"sha256:9bc75302d493273806ddb00cba3a0db4912f471d2ef8ddc1f6d8a5d8880044df","observation_id":"0e808f95-19fd-484e-813b-c4a6e281eee7","resolution":{"observed_at":"2026-08-05T14:03:22.624081Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.21761","last_updated":"2025-08-29T16:36:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T20:49:22.250981Z","submitted_at":"2025-08-29T16:36:16Z","title":"Learning from Silence and Noise for Visual Sound Source Localization"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":6,"verified_fuzzy":56},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2508.21761."}