{"as_of":"2026-08-07T10:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b8cab7749215debe66e932fb05c3a5d5c225fb7685c81e4954ad04d658699a5d","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:47:28.634151Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.04667/citation-record","integrity":"/paper/2507.04667/integrity","json":"/paper/2507.04667/citation-record.json","paper":"/paper/2507.04667"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:29.040623Z","title":"Self-supervised learning of audio-visual objects from video","venue":null,"work_id":"7b50e125-b179-4602-9cd8-20547ec2e14e","year":2020},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.120371Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:a87bd1c9406febee7a132f39c484d451639533908a84240f06070afe57419296","observation_id":"5d25d9bc-8170-472e-af95-cf5808dfbd8f","resolution":{"observed_at":"2026-08-06T19:47:29.045291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.262239Z","title":"Vivit: A video vision transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.262239Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:e8b242bbe1538cc2cbcb7346e0e2a9697fbc856560f81432e0da9a0ec4f6e74f","observation_id":"1aa1ec69-56e9-4da3-90c5-fc901871e907","resolution":{"observed_at":"2026-08-06T19:47:28.262239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:29.022121Z","title":"Soundnet: Learning sound representations from unlabeled video","venue":null,"work_id":"bb350985-0d40-4316-808a-429f977e5dea","year":2016},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.379125Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:9a4cdcc45c1287131dc619b1e2a4c6eaf7763d64b0e597418be0bf82291a7cf3","observation_id":"3320ce3b-6bf2-4ec7-b40e-b04bbcb804e0","resolution":{"observed_at":"2026-08-06T19:47:29.025881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:29.009940Z","title":"Is space-time attention all you need for video understanding? In ICML, page 4, 2021","venue":null,"work_id":"1c982a88-a4ec-4fc4-97d9-050fb2559730","year":2021},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.442925Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:e79674cd72603ebd1739b6b15f223723102784b27b2f36ecdf4298f5ec1aae52","observation_id":"6077323f-fcd4-43c7-ae78-702acd364b30","resolution":{"observed_at":"2026-08-06T19:47:29.013865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.996508Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"75016df2-9196-430f-a75b-993515ec6b12","year":2020},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.516909Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:cf38ddecb8f261c4e2b632198a285d2d41eb418a1ccef69dfd66766f7be2c940","observation_id":"4b2c3113-78f9-4010-b99d-9ab5c5d32334","resolution":{"observed_at":"2026-08-06T19:47:29.001333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.985606Z","title":"Localizing visual sounds the hard way","venue":null,"work_id":"3a4a3049-510f-4267-bc29-f898684cda1c","year":2021},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.520441Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:18e22040800aa5058ec84025c107b00f9f7b9a935b6ebd893b0118652a4e1390","observation_id":"6db0cbf5-aea7-41de-a057-ff38cf9d5ef5","resolution":{"observed_at":"2026-08-06T19:47:28.989452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.974948Z","title":null,"venue":null,"work_id":"734c61f5-2f83-44c6-acc2-0796de0f1342","year":2021},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.523621Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:7f0bdfecc1b1010a47d7c7d95fa090e8f2eb76f63de543f4f4362d9484a9d2d7","observation_id":"dbff7220-d553-448d-a284-ba15e0d503bc","resolution":{"observed_at":"2026-08-06T19:47:28.978673Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.963422Z","title":"Gemmeke, Daniel P","venue":null,"work_id":"0ba1a491-e553-479e-9bea-e4325ebc0e1c","year":2017},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.526956Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:5ef1d93a3ff3b746a3f212858653ae134a041507bcffd555c44c0ebdae1c766a","observation_id":"4bc77b1f-e344-41a9-a1ee-cecfed6faeef","resolution":{"observed_at":"2026-08-06T19:47:28.966826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.952188Z","title":"Liu, David Harwath, Leonid Karlinsky, Hilde Kuehne, and James R","venue":null,"work_id":"1da791a8-44a7-41fe-9e2b-22299171839f","year":2023},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.530439Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:27eb5f96e18cd9e6f23168525803a803353e6cd4a087af72e202a90eeb0cd984","observation_id":"3cf20378-63ed-4945-8d0a-db61d337984e","resolution":{"observed_at":"2026-08-06T19:47:28.955716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.941619Z","title":"Dual mean-teacher: An unbiased semi-supervised framework for audio-visual source localization","venue":null,"work_id":"cbf088c9-afe9-4df3-9eb7-fed8c0549557","year":2023},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.533809Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:e3178f529b8231c4acc1d5f56059823a913bb134931c158624141374be0de25b","observation_id":"2d615601-776e-4ec3-9ab3-5d54eb5462bb","resolution":{"observed_at":"2026-08-06T19:47:28.945502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.536881Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.536881Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:d22b22cb5559bc2c67fffb44b710c41db7650caefec635c5641aebb87efc1a90","observation_id":"ace7c10c-b03b-4f78-b764-a66dcc45fe87","resolution":{"observed_at":"2026-08-06T19:47:28.536881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.924876Z","title":"Deep multimodal clus- tering for unsupervised audiovisual learning","venue":null,"work_id":"7b37c7a7-3741-428c-952d-31ff2956b60c","year":2019},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.540100Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:3fed4c7536cf36138dffe1fc44e5a3d8bbeebab63cc64d13797e8d7b04e47896","observation_id":"ccd609c0-720a-4ce9-b980-5a02641883a7","resolution":{"observed_at":"2026-08-06T19:47:28.928999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.543459Z","title":"Mix and local- ize: Localizing sound sources in mixtures","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.543459Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:d57cb39d284df08f9dafeebcae124eb597972ade4ce1776558496ec49bc68357","observation_id":"729f0c5a-698e-4cbc-9517-57dffab53d7d","resolution":{"observed_at":"2026-08-06T19:47:28.543459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.906685Z","title":"Egocentric audio-visual object localization","venue":null,"work_id":"b54a762c-f8bd-413e-abd7-44388701f5d8","year":2023},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.546983Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:685e627668c38aa5d0a91f0b453459c41aa946e7e427c96e429e4e41b78cdf6f","observation_id":"6523c2d7-6bed-4c0b-9da2-d0bda742bb2b","resolution":{"observed_at":"2026-08-06T19:47:28.910711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.895727Z","title":"Learning to visually localize sound sources from mix- tures without prior source knowledge","venue":null,"work_id":"ad06f967-86d7-4525-8391-a8cf1e5251d7","year":2024},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.550853Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:0af1577b3d953aff360e60cf36ddefce957377269d4e96811d04dd3c97c3b5ba","observation_id":"b556ca4e-d0e4-4e44-8542-91f5fe1c0163","resolution":{"observed_at":"2026-08-06T19:47:28.899326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.555315Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.555315Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:316490da6b1d7fb95d3cf9bc2fa9a944a5f2012f1806ac7bc5fa76a22e86ca4a","observation_id":"7a83fb99-9282-440f-aa18-6bb13256a02c","resolution":{"observed_at":"2026-08-06T19:47:28.555315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.878586Z","title":"Openimages: A public dataset for large-scale multi-label and multi-class image classification","venue":null,"work_id":"f4524305-133c-4220-b393-7e868f0fff70","year":null},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.558796Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:9300020acddc59a8ed7b3012b519b34ad71fe2960dddb02c4809ba3dc0cb7ba0","observation_id":"dd8d6a7a-de6a-4da8-aa46-360b7106627c","resolution":{"observed_at":"2026-08-06T19:47:28.882386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.868323Z","title":"Ex- ploiting transformation invariance and equivariance for self- supervised sound localisation","venue":null,"work_id":"3e9a80d7-5dc1-4393-98ec-5cd4d96a92d5","year":2022},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.562746Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:c71a3d87dbf472746dbe6871aa4748de323b0870703e99ebc3351eb0ac10c4fc","observation_id":"756d42fb-3d7f-48ff-805f-e39fab60c70a","resolution":{"observed_at":"2026-08-06T19:47:28.872036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.858198Z","title":"A framework for multiple-instance learning","venue":null,"work_id":"513364dd-4330-4491-9fbf-0fbee38e6f05","year":1997},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.566583Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:846089fa2075de2674928517d84138ac00d45a5dfafaa19625d3a69b1023b527","observation_id":"64222c37-fb0c-4454-8815-d7f71efe56a5","resolution":{"observed_at":"2026-08-06T19:47:28.861737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.846929Z","title":"A closer look at weakly- supervised audio-visual source localization","venue":null,"work_id":"c90b5e5e-d89e-4e8f-8058-41abc70f56b4","year":2022},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.570189Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:a73f410c06298fadd342a581ef98ebf7d21e328d6c32c1a329640049cad0aae3","observation_id":"4b09be43-d2d4-4ca5-9ca1-702280eeaded","resolution":{"observed_at":"2026-08-06T19:47:28.850639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.834764Z","title":"Localizing visual sounds the easy way","venue":null,"work_id":"e1607e6d-ece0-4e20-b551-a68145aba367","year":2022},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.574111Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:9192ec4325cb8a445eadc7217912edbb5387d4edfe06095c70376a1131a3b0c9","observation_id":"1f88f78c-6ba2-4fe3-8716-cefef78857d1","resolution":{"observed_at":"2026-08-06T19:47:28.839103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.823382Z","title":"Audio-visual grouping net- work for sound localization from mixtures","venue":null,"work_id":"9d304ef4-b94a-4560-ad5f-4235b6ec6341","year":2023},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.577704Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:119b085b9f7ec20020327632d55af9b26649ed452098a3a09ea09274e4964199","observation_id":"4f6053e6-4114-40b8-a6a6-35d4f6652d1e","resolution":{"observed_at":"2026-08-06T19:47:28.827331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.812577Z","title":"Learn- ing representations from audio-visual spatial alignment","venue":null,"work_id":"027a0a2f-867a-4fbe-9200-dc2f2153fa27","year":2020},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.581769Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:285ee420fc69abf10c36ded5bdddbc5c32fb20670171c314838b464b8d837d2d","observation_id":"bae5192a-2750-4212-9aaf-42fa629ceb0d","resolution":{"observed_at":"2026-08-06T19:47:28.816423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.801374Z","title":"Can clip help sound source localization? In Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision, pages 5711–5720, 2024","venue":null,"work_id":"4b841ed6-fc7d-4f84-9817-7f0f06390263","year":2024},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.585329Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:dff2d88dbfe5ea02f142122fbefc2faec941c92a72b60344ca166e48c48c9431","observation_id":"834fcbfb-1546-4393-b36b-9a6975cd24c2","resolution":{"observed_at":"2026-08-06T19:47:28.805247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.791287Z","title":"Audio-visual object localization and separation using low- rank and sparsity","venue":null,"work_id":"8026d534-c881-43fa-aff7-14721286227a","year":2017},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.588633Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:9a0b31ddc1861f0ffc173c3b651c88e79fc28b49c4a723305ad5309d19ac0357","observation_id":"b500f5a6-4eff-41d1-bf5b-fb9e77c5dedd","resolution":{"observed_at":"2026-08-06T19:47:28.794982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.780688Z","title":"Multiple sound sources localization from coarse to fine","venue":null,"work_id":"151b2c26-ad42-4d2e-9e70-2403c5af0aac","year":2020},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.592354Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:e071030d75947e88e9f7bf226935b652ffdcf4e7f848ba96ba2b050ecc8f5e00","observation_id":"99621e61-5379-41c4-8f43-73d3fa554fcc","resolution":{"observed_at":"2026-08-06T19:47:28.784403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.595754Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.595754Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:e50f7857ab05a105d3a6cf6d739b480e317fe66c3833fe068423b767bc870b74","observation_id":"73338dac-fbe3-46c6-bbfb-0bdb26c5117e","resolution":{"observed_at":"2026-08-06T19:47:28.595754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09972","last_updated":"2024-05-22T05:05:38Z","snapshot_observed_at":"2026-08-05T12:46:40.822750Z","submitted_at":"2023-05-17T06:11:10Z","title":"Real-Time Flying Object Detection with YOLOv8","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09972","snapshot_observed_at":"2026-08-06T19:47:28.600083Z","title":"Real-time flying object detection with yolov8.arXiv preprint arXiv:2305.09972, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.600083Z"},"links":{"cited_paper":"/paper/2305.09972","citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:0b9b1d5eba8262645c48ed10423cb954b492753a17a064a8dfa9d595a6f99459","observation_id":"1bed4dee-3972-4944-a7e4-65461141bebf","resolution":{"observed_at":"2026-08-06T19:47:28.600083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.763096Z","title":"Learning to localize sound source in visual scenes","venue":null,"work_id":"8172fe9f-8ee2-426a-81cd-89bb19ad8c44","year":2018},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.604552Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:bf682dc0e87156051d96b783e11f4b8f756166866c7ff6e43067ebb785e4f12f","observation_id":"0bc6ec16-b7bf-4a6e-bba4-366b0b56ffc8","resolution":{"observed_at":"2026-08-06T19:47:28.767085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.751864Z","title":"Sound source local- ization is all about cross-modal alignment","venue":null,"work_id":"4647f0e3-2d30-43e6-ac2c-1e165741dd30","year":2023},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.608218Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:9e84e9e4e0b1c3d8273d8fd17d68e2b69efcd667f86994bd647e30ededbe226d","observation_id":"46019f8d-bf6f-498f-bbea-5173633a346d","resolution":{"observed_at":"2026-08-06T19:47:28.756066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13676","last_updated":"2024-07-18T16:51:15Z","snapshot_observed_at":"2026-07-06T18:48:37.723242Z","submitted_at":"2024-07-18T16:51:15Z","title":"Aligning Sight and Sound: Advanced Sound Source Localization Through Audio-Visual Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13676","snapshot_observed_at":"2026-08-06T19:47:28.611835Z","title":"Aligning sight and sound: Advanced sound source localization through audio- visual alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.611835Z"},"links":{"cited_paper":"/paper/2407.13676","citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:174959b4062e97ccd1c36447a3a9904e27ac3e7330ae65c9cb22b25660788307","observation_id":"1a1ba15e-929a-455c-a454-bce4a1f66423","resolution":{"observed_at":"2026-08-06T19:47:28.611835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.739670Z","title":"Learning audio-visual source localization via false negative aware contrastive learning","venue":null,"work_id":"9839de71-9a25-4233-8b5d-a7b2c63b830f","year":2023},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.615704Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:2430ea1608d2efc1f31e7edb920110ba86c18110dac836708a78935531b3e95b","observation_id":"1108011b-256e-48b9-bb8f-624531372e34","resolution":{"observed_at":"2026-08-06T19:47:28.743921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.729018Z","title":"Audio-visual event localization in unconstrained videos","venue":null,"work_id":"153aa413-d191-4239-b185-21502f4e553c","year":2018},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.619505Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:f0f5dd1045eee309493ff2aab50bd1902b37764bfe9b6b74102ca3f46f1d778d","observation_id":"8da0e691-4b13-4b6b-b5b5-c3adc29ce8f7","resolution":{"observed_at":"2026-08-06T19:47:28.732696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.716972Z","title":"Scaling autoregressive video models","venue":null,"work_id":"99faf20d-ca49-43ab-9bed-c08c505e6903","year":2020},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.622770Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:915ec07d0016d845e61e266eeb1b19e1dabf67cc8e266fd1d17a2f6def6eb840","observation_id":"d421adb9-2239-4eb8-b456-106d4c5313dc","resolution":{"observed_at":"2026-08-06T19:47:28.722139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.706594Z","title":"The sound of pixels","venue":null,"work_id":"0ca8e20d-a19e-4d8e-a3a9-787a4621a93a","year":2018},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.626178Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:59618e3c5e97dfb8304dd45e2736ea8385f666a5ff1425b1c78c59b69c3179ea","observation_id":"ebbd4606-7474-40bd-ada4-3083f496b229","resolution":{"observed_at":"2026-08-06T19:47:28.710135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:28.692908Z","title":"Audio-visual segmentation","venue":null,"work_id":"3d457d72-0d4e-4bec-9f2b-6d8ac26a8774","year":2022},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.630375Z"},"links":{"citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:91d3e7a58e57ddfea56f7ddbb59ec64657413f4fa61a53da659fdd39e6853443","observation_id":"b9dcf0b8-4232-4fb7-b00c-f6ec9afee9f1","resolution":{"observed_at":"2026-08-06T19:47:28.698811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13190","last_updated":"2023-01-30T18:53:32Z","snapshot_observed_at":"2026-08-05T20:42:38.247638Z","submitted_at":"2023-01-30T18:53:32Z","title":"Audio-Visual Segmentation with Semantics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13190","snapshot_observed_at":"2026-08-06T19:47:28.634151Z","title":"Audio- visual segmentation with semantics","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:28.634151Z"},"links":{"cited_paper":"/paper/2301.13190","citing_paper":"/paper/2507.04667"},"observation_digest":"sha256:5a9d3fd1d5e00d768a80a36be0a67a8d4527530f5f87a337e6757a28f00a8e63","observation_id":"4f421f1c-d8a9-4b1f-b122-40798004a8a2","resolution":{"observed_at":"2026-08-06T19:47:28.634151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04667","last_updated":"2025-07-08T14:46:46Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T19:40:18.670219Z","submitted_at":"2025-07-07T05:12:34Z","title":"What's Making That Sound Right Now? Video-centric Audio-Visual Localization"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2507.04667."}