{"as_of":"2026-08-09T13:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d2714f48eb0f9afdd73929f2f3e8bba2074a7d0c97fac9d41c0bde5259b60dc7","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:04:01.886110Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05816/citation-record","integrity":"/paper/2608.05816/integrity","json":"/paper/2608.05816/citation-record.json","paper":"/paper/2608.05816"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.598791Z","title":"In: Proceedings of the IEEE international conference on computer vision","venue":null,"work_id":"8d6f66a8-e214-4ab8-854a-292a1f984c8b","year":2017},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.554204Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:3444edcb7082d983fc54828a5c5a3504aa1acf8a026d177896409efbd5d28364","observation_id":"6c274851-dcd5-4301-ac50-615b7b1006bc","resolution":{"observed_at":"2026-08-07T23:04:02.603025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.584279Z","title":"In: Proceedings of the Euro- pean conference on computer vision (ECCV)","venue":null,"work_id":"b92e0794-fb71-430c-9a66-054294246ef0","year":2018},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.559635Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:12e125dbdd66bb317169fa9e4e2f1e2b29938a48ac1eb62189c78dee1c0ed3f2","observation_id":"1860f9dc-9b7b-4999-8dcb-9d2fc6394f17","resolution":{"observed_at":"2026-08-07T23:04:02.588893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.568188Z","title":"Advances in neural information processing systems29(2016)","venue":null,"work_id":"fb7e188a-35f4-4a1a-b3be-7bae45d55673","year":2016},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.564650Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:df3d9b30d5131002fa00e872776104c992e5257d49f02afce0bab52fe808cdc9","observation_id":"37445cdf-c368-4921-907f-b9a63da27640","resolution":{"observed_at":"2026-08-07T23:04:02.572902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.553808Z","title":"Frontiers in Neuroscience11, 159 (2017)","venue":null,"work_id":"e31f385a-c6f2-45c8-bd57-c92707ab8234","year":2017},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.569568Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:f9fcd2a09701f17dbe3d2cfe16e04ba3cf71d1aef4e1aa431c2d1c327608dd0a","observation_id":"fe0cb4b8-2b9c-4535-bc18-b60886a618c4","resolution":{"observed_at":"2026-08-07T23:04:02.558217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.538390Z","title":"Attention, Perception, & Psychophysics77(5), 1465– 1487 (2015)","venue":null,"work_id":"123a0d4d-1e0b-48c8-bf7c-0abb4942c386","year":2015},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.575305Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:a3768fb70bdf608bb7baa6f657e1de6fdcc9933b8ce0c13f44b493461ebb45f1","observation_id":"2226b01b-410e-4810-8a64-7fb3295ee0d7","resolution":{"observed_at":"2026-08-07T23:04:02.543677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.522198Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":"371b4476-2e55-4d60-be71-e57010920f52","year":2021},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.580317Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:001c122a94b30dd6be2c98ccc835d314c61bb98dd9345922a6430cc31319dc01","observation_id":"70bbde47-6c15-44e2-accc-24068ee7d583","resolution":{"observed_at":"2026-08-07T23:04:02.527389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.505107Z","title":"In: ICASSP 2020-2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":"da701944-5cbb-4ce1-8347-cbd9b5a35a4a","year":2020},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.586258Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:d6e70634a33eb47003fa6434e2df81e0b0521632b1c49c467ee3caddabb231c1","observation_id":"04861d27-f7da-46b9-9d0c-60e141688c93","resolution":{"observed_at":"2026-08-07T23:04:02.510649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.487497Z","title":"In: Conference on Computer Vision and Pattern Recognition (CVPR) (2020)","venue":null,"work_id":"47b193b6-118e-41b8-9b17-f5d28c2d3f5e","year":2020},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.591367Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:0533cb44b17ed1ec4e340a33e7565cc84a9d5311462e138a935399a55b8c339c","observation_id":"aa60035c-c75c-4be2-815f-8443961b437e","resolution":{"observed_at":"2026-08-07T23:04:02.492991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.471448Z","title":"In: Proceedings of the IEEE/CVF International Confer- ence on Computer Vision (ICCV) (2025)","venue":null,"work_id":"e016470d-705e-40f0-8618-b3a07fa5f00e","year":2025},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.596497Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:e820bd65aed4844d2974c08049b8b51b752bdaf482612dcac29424b6cc0acccd","observation_id":"24df23de-f6f3-4649-96cf-a1d483f84a1b","resolution":{"observed_at":"2026-08-07T23:04:02.476703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.455698Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence (AAAI)","venue":null,"work_id":"914a1a85-a50a-470a-8af3-bfaff50cfec9","year":2024},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.601464Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:e5adbe8c8754c342de2c1351f39d211860eeae77b4adeb6919f9c5c518652af2","observation_id":"b39f2f56-35e7-4d00-a4a4-535a8ff02df8","resolution":{"observed_at":"2026-08-07T23:04:02.460940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.439760Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2025)","venue":null,"work_id":"4431f029-bf69-488e-9b99-b00a91f89385","year":2025},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.613119Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:7e4f7ef7437eef2489379750e789b8a83c683ad10e02666bfab612f0a5451c18","observation_id":"3a424f31-5dac-467d-b69f-93376678c2f1","resolution":{"observed_at":"2026-08-07T23:04:02.444767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.424640Z","title":"In: Advances in Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":"2b52785a-3c41-4852-936a-756322775f07","year":2023},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.628526Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:6f41243777d023fd1ced35b3748b72c8851937c5433d256d593289a1fbdedb74","observation_id":"8ea478e6-0ac9-4039-9617-0d09ef77e084","resolution":{"observed_at":"2026-08-07T23:04:02.429207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:01.645386Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.645386Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:c8e4ca619c32123bf68730f5e807ef741417679637c3959f407b8234162044a8","observation_id":"210ccabd-7b88-4e58-a277-8c47d2959df1","resolution":{"observed_at":"2026-08-07T23:04:01.645386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.396930Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":"ea525fad-8018-428a-b1d5-b38a7f3693e6","year":2019},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.656480Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:02ac29e69358a3e77c89e4ad660ad53b47557cbbbb275311b577f5461996c2a6","observation_id":"d322b711-de24-4baa-b2a8-46f8d5ca0d46","resolution":{"observed_at":"2026-08-07T23:04:02.401361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.381028Z","title":"Advances in Neural Information Processing Systems33, 10077–10087 (2020)","venue":null,"work_id":"48abed69-3745-4186-b9ac-b41bdc46f65e","year":2020},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.667931Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:01f8345474e5f35b2a5117f75a2eedaa88ca2fd9e393dd8a69e871a51d68abb6","observation_id":"a441b1f1-0c6e-4e0c-9643-8db7ab5d6bcf","resolution":{"observed_at":"2026-08-07T23:04:02.386110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.364748Z","title":"In: British Machine Vision Conference (BMVC) (2025)","venue":null,"work_id":"6356469d-ba5e-4a50-9db6-7265eb70f63c","year":2025},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.679994Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:a6ee8d23ecb74ef9d969b7afb46a5943305c3660abab10831238a3c0f28a86fb","observation_id":"fa0c01c6-d212-4035-81ba-28fb7fbe33e1","resolution":{"observed_at":"2026-08-07T23:04:02.369268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.348917Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pat- tern Recognition (2022) Whence the Voice? 33","venue":null,"work_id":"152f1c97-95b6-45a8-abfb-0eb6c21db65d","year":2022},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.692047Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:a388782d9a8868f9b14fc87938f0f6ca6506f014aa1ac25dc818caa458b04fd9","observation_id":"cc5e74c0-e9c9-454e-9394-3862c0ec41f4","resolution":{"observed_at":"2026-08-07T23:04:02.354037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.331948Z","title":"In: British Machine Vision Conference (BMVC) (2025)","venue":null,"work_id":"11c5e17d-0dc9-44ad-9548-cc838d3dea18","year":2025},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.704370Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:2d65465d7bdd67375cf37e5f4346a8de902cccd8c163574e7928a24dc31d67b4","observation_id":"a00b0d01-9f57-469b-939c-66eb56d2f339","resolution":{"observed_at":"2026-08-07T23:04:02.337579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.314635Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"6fbf2cf1-5086-4f40-bf5a-3ddae62b9218","year":2024},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.717929Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:e5b75aa0a573704434308aa52d2402b734f65c692406adab2a98c5a52db2b931","observation_id":"01159ed1-3a04-4182-abd5-d43280ebe315","resolution":{"observed_at":"2026-08-07T23:04:02.320224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.297473Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":"6f3d1b6a-8c20-412d-aacd-f288b3f29f22","year":2025},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.731400Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:51a4904a78bcbd4a8dabeab8117f72d88cccb1cb42d6ec27c6af3d5201283398","observation_id":"0a9cdadb-e65e-470b-9873-9f088ea81ed5","resolution":{"observed_at":"2026-08-07T23:04:02.303101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T23:04:01.744967Z","title":"arXiv preprint arXiv:1412.6980 (2014)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.744967Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:16136dd788b5ea7f92d7a2cc63257dca1706c9d3f41ec8370240a84dd9218173","observation_id":"c799eb3e-e1a8-4529-98df-28647321f6d7","resolution":{"observed_at":"2026-08-07T23:04:01.744967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:01.759221Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.759221Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:ec45fe328450c63bffc8a96da9c303a1db0a859021af84be994072b4ea8e2b49","observation_id":"5eb0effc-344b-4a37-bbe8-7d646a28c510","resolution":{"observed_at":"2026-08-07T23:04:01.759221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.270877Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence","venue":null,"work_id":"744c5af4-0f54-4ee3-a252-401a06bd18b9","year":2022},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.771411Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:79d3a51997c3a6be94f79e3aec876d2664695080ea634151e85215ca55b7c5a0","observation_id":"9a3a2b95-8243-4ef0-b3e9-89a7ae82b892","resolution":{"observed_at":"2026-08-07T23:04:02.275731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.255552Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":"858cc111-186c-4d39-bd67-536cc47f5ee4","year":2024},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.776984Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:809e843d44f68c039f50caaf1b865b1b7788c320023b4b1c4f05fb177d5e79aa","observation_id":"afe5a8c0-2469-42dc-86ac-082e3f35f50f","resolution":{"observed_at":"2026-08-07T23:04:02.260518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.238296Z","title":"In: European Confer- ence on Computer Vision","venue":null,"work_id":"bdb364b1-d0fe-4aaf-9656-63c8e8dad6e1","year":2022},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.781720Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:a5f3b2b01f17717b9125aba121b00195e3c76cac1977ce180f76b05639da5cbb","observation_id":"6289fb5c-0299-4add-99be-b18439494471","resolution":{"observed_at":"2026-08-07T23:04:02.243499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.223211Z","title":null,"venue":null,"work_id":"6e51e12f-fd82-4875-a843-50628699718f","year":2023},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.786501Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:2d09de5aed786f014f497d48f5b654a391c2319cf5ebf4eb891052b545492486","observation_id":"058b684d-7c8c-48f1-acb4-3e8b47e2325f","resolution":{"observed_at":"2026-08-07T23:04:02.227849Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00486","last_updated":"2024-08-31T15:43:22Z","snapshot_observed_at":"2026-07-06T19:08:44.269514Z","submitted_at":"2024-08-31T15:43:22Z","title":"Multi-scale Multi-instance Visual Sound Localization and Segmentation","version":1},"cited_work":{"arxiv_id":"2409.00486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00486","snapshot_observed_at":"2026-08-07T23:04:01.974209Z","title":"Multi-scale Multi-instance Visual Sound Localization and Segmentation","venue":"cs.CV","work_id":"9aab51dd-5305-41f8-b3ff-0c3301c006a5","year":2024},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.791902Z"},"links":{"cited_paper":"/paper/2409.00486","citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:4c8693c0a77193abf8e941330d85a095fddb08ddf497aec2a4ee1327fadff116","observation_id":"7d9570fc-408d-4b6a-b6aa-a5a106d818b8","resolution":{"observed_at":"2026-08-07T23:04:01.982686Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T23:04:01.797039Z","title":"arXiv preprint arXiv:1807.03748 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.797039Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:3d0db24c0f82aeacf2345e7f229317a145c25ccd097f83871004c52cfa04d4fe","observation_id":"0b86ad80-4dc9-45c6-b617-66949b7bdde8","resolution":{"observed_at":"2026-08-07T23:04:01.797039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.208995Z","title":"In: Proceedings of the European conference on computer vision (ECCV)","venue":null,"work_id":"0ce74a7e-44d8-4c78-8fe0-00f5c1e131c2","year":2018},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.803709Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:2a80ab9ff946ccf59fec0812dc0e352f4d00d99d26364c780ef262c33ae42c7d","observation_id":"f8669019-ec0f-4286-b572-2f2f0744da26","resolution":{"observed_at":"2026-08-07T23:04:02.213675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.194485Z","title":"In: European conference on computer vi- sion","venue":null,"work_id":"95a7de26-fe4c-4bac-beaa-e034bc4b6bf3","year":2016},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.810853Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:f3642bd345333a84a2aef22771bd5ffc584ebd9e241308bfba076bc0b9dcd1dd","observation_id":"872970d9-7b66-42c4-8e95-ee3866be1439","resolution":{"observed_at":"2026-08-07T23:04:02.198824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.179913Z","title":null,"venue":null,"work_id":"50f33df2-83fe-4f84-bf5e-09be48085eec","year":2024},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.815816Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:0a28f7d0c2f3ff4d0f40a46e86252fd3f25c4c37e898f54fc5dbe5b9e1e89393","observation_id":"ab100932-b508-46dd-be9d-d176605f76d5","resolution":{"observed_at":"2026-08-07T23:04:02.184569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.164824Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":"2f9e13c7-9b96-4874-b1d4-d04ecb45b0c9","year":2020},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.823082Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:b2b0d5eb6d3a9c0e1d25b1066c85f8ca3a5c8a595ef9648e512878c7b7b51c27","observation_id":"2965b4f1-3b10-43fa-87b4-e4afc5d408c5","resolution":{"observed_at":"2026-08-07T23:04:02.169557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.149468Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":"7cc22404-b8f1-46d4-bd2a-12b15af81c9a","year":2018},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.828317Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:140537556abbecf03355bd5a1be067ddefd0d227f22f658b1454881fe70d6f42","observation_id":"d95d7cd5-6837-4960-9822-0fff0adb090a","resolution":{"observed_at":"2026-08-07T23:04:02.154225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.132799Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence42(8), 1984–1997 (2020)","venue":null,"work_id":"d8aaaf13-0200-4379-9a69-e1e9e86860f2","year":2020},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.834636Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:94000b14dbf72bccf5fd2da806b968bf3b6ee5c5f2f8dd5480db42e7b033e9f0","observation_id":"56b0f1df-d741-4d6d-bcb7-4044eb785e8f","resolution":{"observed_at":"2026-08-07T23:04:02.137544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.116000Z","title":"Hu et al","venue":null,"work_id":"d07cfc1a-48d4-418a-afd3-300f0fe56afe","year":2023},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.847282Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:2979ce393ef265c47c608ab550ddfc89ef8a50d086f600afd02ce8d9ee0d05d2","observation_id":"035a9a13-d765-4d3f-976b-538cc424f664","resolution":{"observed_at":"2026-08-07T23:04:02.120779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.097554Z","title":"Journal of Speech, Language, and Hearing Research60(10), 2989–3000 (2017)","venue":null,"work_id":"ef8430f9-63c6-4922-b282-83bb125695c2","year":2017},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.854989Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:6b14ecc965081fb6c62cdd7d6242e5e65949b6ebca26164d95bc52a6aff7b767","observation_id":"9e0ca096-c3ef-4693-9934-eccc92b981c8","resolution":{"observed_at":"2026-08-07T23:04:02.102936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.081289Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":"a74abd5e-dfd1-42d5-9072-0fb5de16585c","year":2025},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.860761Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:1be08fa61192ad76e606628da5068f7cea370ba714e0cb633db13ee2b242fd2d","observation_id":"4395275b-730b-4d7f-90e9-fa21db9ffef9","resolution":{"observed_at":"2026-08-07T23:04:02.086380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.063463Z","title":"In: International Conference on Machine Learning (2023)","venue":null,"work_id":"8d4ad78d-c487-46b7-9408-f92560da0348","year":2023},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.866450Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:e0835d7f660422ed3457982487b6878e4e2c0aa21988d989fa64425f69f1d33b","observation_id":"0e8bbfe5-f322-4844-9222-d57d9560d1b3","resolution":{"observed_at":"2026-08-07T23:04:02.068961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.039243Z","title":null,"venue":null,"work_id":"d763efd6-d7bd-47ff-be4c-d921860a4a53","year":2018},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.873644Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:666702c657798ef30d0dbd5ad1510b565ed498531bb186543f969a3c8735cf86","observation_id":"1af77587-3acd-4773-83bf-f867cd91f2cc","resolution":{"observed_at":"2026-08-07T23:04:02.050943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13190","last_updated":"2023-01-30T18:53:32Z","snapshot_observed_at":"2026-08-05T20:42:38.247638Z","submitted_at":"2023-01-30T18:53:32Z","title":"Audio-Visual Segmentation with Semantics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13190","snapshot_observed_at":"2026-08-07T23:04:01.879461Z","title":"arXiv preprint arXiv:2301.13190 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.879461Z"},"links":{"cited_paper":"/paper/2301.13190","citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:fb0e29dbc3dbafca7e4f12796cee069487ae4a9468e469df1610e7c5d67a7713","observation_id":"027d935b-c4ad-4bfa-976f-f0b81b9b0548","resolution":{"observed_at":"2026-08-07T23:04:01.879461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:04:02.020065Z","title":"In: Proceedings of the European Conference on Computer Vision (ECCV) (2022)","venue":null,"work_id":"b7321f34-c47f-4086-9ccd-47cd7947928e","year":2022},"citing_paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T23:04:01.886110Z"},"links":{"citing_paper":"/paper/2608.05816"},"observation_digest":"sha256:4a9a2980bc734eaa5cbc71ff2374a4fa60d905ae2c2c079f6da84de2d96b8fa9","observation_id":"70c20b9a-212b-49ef-89d3-3efa484953b0","resolution":{"observed_at":"2026-08-07T23:04:02.027050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.05816","last_updated":"2026-08-06T09:47:34Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-09T13:10:48.345070Z","submitted_at":"2026-08-06T09:47:34Z","title":"Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2608.05816."}