{"as_of":"2026-08-10T18:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:79fada0b36ad8b2b8ddfc10ee4904e2dd16926909235f32d050f06609665ca89","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:20:49.374967Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.18557/citation-record","integrity":"/paper/2506.18557/integrity","json":"/paper/2506.18557/citation-record.json","paper":"/paper/2506.18557"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:44.623191Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:44.623191Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:a1f899f80ec7c98aafe10e967ca71b2e254414ddaad4a1e23a22a96c8d49fd14","observation_id":"cc21691c-a3a3-4237-830a-168b45d996dc","resolution":{"observed_at":"2026-08-06T23:20:44.623191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:58.944239Z","title":"Objects that sound","venue":null,"work_id":"5e9b3703-b952-4306-90ab-1f50704edac5","year":2018},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:44.739030Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:1519f6c3a604969e42a1c4f5c1f69a02fd0c19ffbf96bb440c4e9dcb19c83b57","observation_id":"e009438d-2da3-44a7-937e-2cab930c2b7a","resolution":{"observed_at":"2026-08-06T23:20:59.016524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:58.726611Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"44a5cdc5-ff6f-469f-9944-cfe998156ab0","year":2020},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:44.827505Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:cd6a66970ca6aedf6331c0e8bc2a881bd2ee8fcf73fbe65fee6979cbe409084b","observation_id":"dcfd5eab-c51b-4ab0-9a80-ba0fed71de2a","resolution":{"observed_at":"2026-08-06T23:20:58.812481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:58.547062Z","title":"Localizing visual sounds the hard way","venue":null,"work_id":"e781a361-cc9b-4b47-97a4-f288ab27a33d","year":2021},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:44.963367Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:bc00096390787063a06a4ba0f04c6544e2501867f6c8efda9a7bf273946b8f08","observation_id":"f152976f-0ba2-4acb-954e-ec303d1b96a0","resolution":{"observed_at":"2026-08-06T23:20:58.588619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:45.067294Z","title":"Exploring simple siamese representation learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:45.067294Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:45fba23b97cc310cdc8310562813c80f9eb4910c76c07d4f38e156233c4af4cb","observation_id":"dd4af06e-17c5-4d08-8ab4-0589e05ecb75","resolution":{"observed_at":"2026-08-06T23:20:45.067294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:58.354337Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"494d2150-6336-4633-9653-f8c5a1846413","year":2024},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:45.124745Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:e01eae1ee9bfec23e0b7c295f530e048d1a6dcd3c86742cf17cbeedeaeb8fb5a","observation_id":"9d7937df-f7d3-4751-b852-a6663328b554","resolution":{"observed_at":"2026-08-06T23:20:58.416200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:45.241334Z","title":"Sinkhorn distances: Lightspeed computation of optimal transport","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:45.241334Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:dcb09762ba8dae92721fd24e3a7e750a9e6ff0669ff7330fee77a8b110d8eaeb","observation_id":"71495029-6d41-4882-920a-4fd2ee8da924","resolution":{"observed_at":"2026-08-06T23:20:45.241334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:45.352669Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:45.352669Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:2b5d88f317cfe90317fc2f7d24e15046adcf1cd6f539cd6c9112197f5067a84f","observation_id":"cb5fff76-df51-49c0-8092-58bc5216a9f1","resolution":{"observed_at":"2026-08-06T23:20:45.352669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:58.219244Z","title":"Cross-modal prompts: Adapting large pre-trained models for audio-visual downstream tasks","venue":null,"work_id":"a96ae628-cdbc-41f2-be65-545d941d20f6","year":2024},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:45.494963Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:e84b48e3aee8fc1fb0e62b51e65df0edab74842880c166c70eb981eeb7b8b2ac","observation_id":"100fedaa-026b-4114-907f-c8f5cbcad8dd","resolution":{"observed_at":"2026-08-06T23:20:58.265975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:57.997605Z","title":"With a little help from my friends: Nearest-neighbor contrastive learning of visual representations","venue":null,"work_id":"72f96009-e620-45a6-a130-c8fe44071bdc","year":2021},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:45.594337Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:86adf8560731e18ca681901d77e6a98bfdd73b940f3080c3cabfb1639dbaa3ae","observation_id":"12d58a27-c3a6-42b7-879b-6a065254e04c","resolution":{"observed_at":"2026-08-06T23:20:58.116336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:57.743240Z","title":"Hear the flow: Optical flow-based self-supervised visual sound source localization","venue":null,"work_id":"79384900-c99b-4342-a187-7e21dc983b27","year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:45.678394Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:6ab75dfe5f94197134ed15220011a6e714806c7a56d9fd8e808e9a433e6a74b1","observation_id":"ffcba95a-21df-47a5-8d80-a8e8ed04626e","resolution":{"observed_at":"2026-08-06T23:20:57.831456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:57.546131Z","title":"Audioclip: Extending clip to image, text and audio","venue":null,"work_id":"db5f57fc-f96a-485b-8aa3-2705eb5183cb","year":2022},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:45.810588Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:99bc27f7f5f4092e7b3cbda018f498d3687510e97f364a013ff585824ae6b7ce","observation_id":"686ef128-6d45-4c11-a4da-ae432dc4a78a","resolution":{"observed_at":"2026-08-06T23:20:57.654611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:45.882461Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:45.882461Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:ca84487ad4f4457c88e14a1c0f90f7688b35e3dd0681ee4e4c541d514f4cda3d","observation_id":"314c11cc-f68e-4daa-97a6-0aad424811eb","resolution":{"observed_at":"2026-08-06T23:20:45.882461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:57.274018Z","title":"Deep multimodal clustering for unsupervised audiovisual learning","venue":null,"work_id":"e749aec7-f13b-4396-b0ed-9d4fdc0c1b46","year":2019},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:45.999412Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:ae0e62fd714f80fe6aa7c69fc37a4809eed3434aad21cd5f14701c38d02280d7","observation_id":"45025512-b2a6-4da2-b930-10160292978c","resolution":{"observed_at":"2026-08-06T23:20:57.394754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:57.064902Z","title":"Discriminative sounding objects localization via self-supervised audiovisual matching","venue":null,"work_id":"6308cede-b391-4720-aed0-0da7c151fcd5","year":2020},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:46.075610Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:4a832e9a09a63d5d7780658d94fb624b2cab6bf094b5ce048bf6c8f6f249071b","observation_id":"64deb004-f7ae-4e9b-abbe-a48c365b3762","resolution":{"observed_at":"2026-08-06T23:20:57.153525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:56.816839Z","title":"Mix and localize: Localizing sound sources in mixtures","venue":null,"work_id":"da2cbd38-ff31-4d03-af6c-d213e665f285","year":2022},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:46.152099Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:bb767bc4d1ecdf66c1df659417fbbdf9ddaa032ea32d5525dd4a5b853ad86733","observation_id":"cc069196-7209-4cd1-bb72-3dc76df8ebdf","resolution":{"observed_at":"2026-08-06T23:20:56.914740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:56.534255Z","title":"Boosting contrastive self-supervised learning with false negative cancellation","venue":null,"work_id":"fcd7ee19-86ba-4637-a93c-517f8da196e8","year":2022},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:46.260804Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:0c542e604f9d7f53f3a941bcce1528242c7fcddd481e452303525459cb5f013d","observation_id":"9faa0021-b426-4b9a-85af-cd5d45bafa24","resolution":{"observed_at":"2026-08-06T23:20:56.674748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:56.283472Z","title":"A review of recent advances on deep learning methods for audio-visual speech recognition","venue":null,"work_id":"4f550bba-041c-4671-b26b-adc22825c718","year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:46.326449Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:dd353b62266ac467f0e12e1724fdf788a49fb96423cddcc146a3fe6d1e71f869","observation_id":"f11684f8-189a-4455-bcfd-dfee9d4c5ca1","resolution":{"observed_at":"2026-08-06T23:20:56.385786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:56.006927Z","title":"Learning to visually localize sound sources from mixtures without prior source knowledge","venue":null,"work_id":"40be126f-7eba-4676-991f-4fef485c11dd","year":2024},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:46.404760Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:d9a8ed512ebcc23f1425340cb03a8528ef134b6e31dd9dfb7a9ced1ea8a11d83","observation_id":"ac83f528-b373-4ce5-94d9-41338915fbbb","resolution":{"observed_at":"2026-08-06T23:20:56.134749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T23:20:46.466395Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:46.466395Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:0de9a6bfab9b9b7e1eaef91907af99e328428d253962c820b0809f822d34af2e","observation_id":"085df064-f62c-4d87-8d26-60ae9757c918","resolution":{"observed_at":"2026-08-06T23:20:46.466395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:55.872877Z","title":"Unsupervised sound localization via iterative contrastive learning","venue":null,"work_id":"9204479e-ef2a-4bf8-8854-d7642c364b15","year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:46.543786Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:25554d93df5d19942080a44072c6a2e4fde6c8515eb6d716221ebe99b598bef0","observation_id":"572067d7-d2fc-498e-968e-d1122aeb18d6","resolution":{"observed_at":"2026-08-06T23:20:55.942335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:55.586453Z","title":"Exploiting transformation invariance and equivariance for self-supervised sound localisation","venue":null,"work_id":"eb7ec45d-bb7c-475c-baa6-c0678e8e80b5","year":2022},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:46.716945Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:edee63ebcfc56f6e502894238a5be9c2dcfbaa07e9f16a51aa2ce056dba5b9e5","observation_id":"e9005eba-beb0-4a48-98b5-bd5048d15ffb","resolution":{"observed_at":"2026-08-06T23:20:55.749982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:55.348938Z","title":"Generalized video anomaly event detection: Systematic taxonomy and comparison of deep models","venue":null,"work_id":"0c277c97-944f-4ff3-acff-f6a2356453d4","year":2024},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:46.825427Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:9ba3d42a78aaac80a1f0c7b71cd135f18a4291710b57eda3400a47dc05a60816","observation_id":"5ee4ac45-00ea-492c-aee1-293e2cc937d9","resolution":{"observed_at":"2026-08-06T23:20:55.434742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:55.116198Z","title":"T-vsl: Text-guided visual sound source localization in mixtures","venue":null,"work_id":"c46e139d-26b6-4a37-b7f2-ebd8ba4464c0","year":2024},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.179413Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:d7dd691ab6e86c61d03d432615e9718c3ea5f08a01d649a88599ac13082d01e8","observation_id":"dab2a57e-d48f-462e-ae71-3874f91a96fa","resolution":{"observed_at":"2026-08-06T23:20:55.207310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:54.904736Z","title":"Localizing visual sounds the easy way","venue":null,"work_id":"d7ac67f5-de08-4f15-b27b-858c1e5d23ff","year":2022},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.319708Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:f6137a6565fd803ad8bac8faeac0a2780b1a3c5c741e5a194c80bd87c53ef144","observation_id":"d6076cb8-c9fa-45a4-a79f-0e9f64d5713c","resolution":{"observed_at":"2026-08-06T23:20:54.989857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:54.700947Z","title":"A closer look at weakly-supervised audio-visual source localization","venue":null,"work_id":"48dc1776-8db8-4ceb-94f6-580071926ebd","year":2022},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.399677Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:60cd7e48224232bc0a35d67effb5e8100f77fc4cb1c2e43bfa215f950b6a8d2b","observation_id":"510a2c9a-c178-450c-9083-5d6387ce1c88","resolution":{"observed_at":"2026-08-06T23:20:54.793986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:54.476888Z","title":"Audio-visual grouping network for sound localization from mixtures","venue":null,"work_id":"bbce7a4e-4b1f-4904-930d-a5e2180b081d","year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.445298Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:a3b515f3e075a464b11df0b93908482a738f373be626712dbc9e0f87b6d4c506","observation_id":"7ead8897-a468-4d84-9723-bbdd899358ea","resolution":{"observed_at":"2026-08-06T23:20:54.602287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:54.290215Z","title":"Audio-visual scene analysis with self-supervised multisensory features","venue":null,"work_id":"126e0f1b-2e75-4c4e-afe5-57304bb097ce","year":2018},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.474313Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:130881c23926d90b883f4f25fb08899f2fd73e785b8174d95209ec3f9f7fa9d5","observation_id":"a7f2f281-70a1-44d5-a856-c0cdf82229f3","resolution":{"observed_at":"2026-08-06T23:20:54.380654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:54.060452Z","title":"Multiple sound sources localization from coarse to fine","venue":null,"work_id":"9ec23431-a7b9-4c89-ad32-089a802eec57","year":2020},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.545828Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:886fb3faa3bd7d8c2a1cb7aedf64c85cd31318e48a95fc540204b85c7637e661","observation_id":"78868aa1-7c8c-4746-98c3-374d3e091bc9","resolution":{"observed_at":"2026-08-06T23:20:54.184834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.07646","last_updated":"2022-07-15T17:59:11Z","snapshot_observed_at":"2026-08-06T19:04:25.950223Z","submitted_at":"2022-07-15T17:59:11Z","title":"Multimodal Open-Vocabulary Video Classification via Pre-Trained Vision and Language Models","version":1},"cited_work":{"arxiv_id":"2207.07646","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.07646","snapshot_observed_at":"2026-08-06T23:20:49.500854Z","title":"Multimodal Open-Vocabulary Video Classification via Pre-Trained Vision and Language Models","venue":"cs.CV","work_id":"f07e851d-bbed-46b3-a06c-f3fa662b6363","year":2022},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.607798Z"},"links":{"cited_paper":"/paper/2207.07646","citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:a129a38717b23dd8646610e50197551986ddac284c69a4ad0f2d9df6bb19807f","observation_id":"a8698035-bfd8-4a4e-993b-51396e7e26a4","resolution":{"observed_at":"2026-08-06T23:20:49.591703Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:53.862611Z","title":"Mm-diffusion: Learning multi-modal diffusion models for joint audio and video generation","venue":null,"work_id":"25f7bef2-69d7-41f9-a5b1-c16bbed2e4de","year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.662872Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:b85de496b0f27dd23736342f4c86e5b09dca94757364b9837e2fa6355d7e6957","observation_id":"9b0ae4b5-47ac-48ad-9615-77b480b67d4a","resolution":{"observed_at":"2026-08-06T23:20:53.964747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:53.704863Z","title":"Learning to localize sound source in visual scenes","venue":null,"work_id":"3c5c1c1c-6a03-495a-9a20-c90ec493c3e6","year":2018},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.742209Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:ed8aeddb2f938140810b44af441ed0507ad8987dc1547ac29a50ed37c3a148bc","observation_id":"d51aa6db-5f85-46d9-ad3c-9af470c889bc","resolution":{"observed_at":"2026-08-06T23:20:53.797386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:53.252042Z","title":"Learning sound localization better from semantically similar samples","venue":null,"work_id":"c7455f8b-cb02-4f4a-82cf-8d9ddf778639","year":2022},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.780015Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:99867542066052145efe6df5b305c83b915058b8045bd8c86e25316ebd52fbbe","observation_id":"fc4440a1-9511-4a3e-a515-fb31081f8a81","resolution":{"observed_at":"2026-08-06T23:20:53.536440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:53.013919Z","title":"Sound source localization is all about cross-modal alignment","venue":null,"work_id":"1646a925-5d03-4b6e-9708-06bea609c1c0","year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.952858Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:471d6de5ab4926bf20c2931d373dd125e34d0486c355936e7c9aedfbf296185d","observation_id":"c3c94bfc-8ce8-4f7c-99ff-cfaa9bf03581","resolution":{"observed_at":"2026-08-06T23:20:53.104744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:52.787787Z","title":"Unsupervised sounding object localization with bottom-up and top-down attention","venue":null,"work_id":"9f469910-2b83-4e94-ba3b-8a30aeb2e0b9","year":2022},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:47.985284Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:3a60e5ac68fe417eab708cf4d0054d7b6ea28f65483e0bb03a97a7e1a6d4e3d6","observation_id":"edc0cf83-fb89-4bc0-8973-1cce97dd04a5","resolution":{"observed_at":"2026-08-06T23:20:52.876261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:52.363674Z","title":"Flowgrad: Using motion for visual sound source localization","venue":null,"work_id":"ce825217-d505-43ef-bd44-9a14d0e247d8","year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:48.061595Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:dbf89906ae6a0baa80d510ccae830fcb49cf14ae355d9da7a0355b683aa28d96","observation_id":"e821573b-01b8-42d4-b2ee-4af3b572fda0","resolution":{"observed_at":"2026-08-06T23:20:52.534945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:52.142637Z","title":"Self-supervised predictive learning: A negative-free method for sound source localization in visual scenes","venue":null,"work_id":"bc04851d-6f91-4850-a856-5f44ecc8c23e","year":2022},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:48.196924Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:0bca4bbaaa12c721b4e24d04ce6e201f0d3967678e1f90f69a115c7b9c9b650d","observation_id":"9b7a432f-dd00-4e2e-880b-98c6df771e1f","resolution":{"observed_at":"2026-08-06T23:20:52.215295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:51.890495Z","title":"Learning audio-visual source localization via false negative aware contrastive learning","venue":null,"work_id":"e0461996-7de1-4d48-be68-7d8ba8fd91e8","year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:48.316561Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:beda3a46cc4eadf451fa69e6f3ff24df659ed7e6e8ee3cb2f6b6f45ab6ae64ed","observation_id":"0099b1eb-197c-4982-bbdd-470db32f7dbe","resolution":{"observed_at":"2026-08-06T23:20:51.998121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:51.681873Z","title":"Audio-visual spatial integration and recursive attention for robust sound source localization","venue":null,"work_id":"1f7f30f9-1076-42f4-a16b-8b7407e629c8","year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:48.413073Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:1194a6b26fac6903cdef8ed1660c6189023fb9eb9767a1ebb734add368bf1d2d","observation_id":"04793bae-3c14-47f6-b257-7b79e6ed984b","resolution":{"observed_at":"2026-08-06T23:20:51.739907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:51.422300Z","title":"Watch video, catch keyword: Context-aware keyword attention for moment retrieval and highlight detection","venue":null,"work_id":"d0f4c0c0-443f-4939-a4fd-4a9a35ddc0be","year":2025},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:48.481956Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:04ad9683e2c4ae4508c6b1ad41703a545f417fd93a396e78cd3498d65e3a38a9","observation_id":"a4793b17-fe85-4b43-8de0-53d48099bcae","resolution":{"observed_at":"2026-08-06T23:20:51.514758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:51.156930Z","title":"V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foundation models","venue":null,"work_id":"f6d64217-c024-4a77-8dcb-7234c632e9f9","year":2024},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:48.538040Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:005c8cd26b4d73c2793cd5a60fe0943225e4c73dc06ed35be08f8620043b5606","observation_id":"de45388e-df01-4cc3-aafa-63a089495525","resolution":{"observed_at":"2026-08-06T23:20:51.283695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:50.930047Z","title":"Multimodal large language models: A survey","venue":null,"work_id":"dadce087-f9c6-4ec0-a64b-fc18d3fd3443","year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:48.669587Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:9acfc50d6f0b59b85a90b85f76978c826f400709608e3a73ff9a78d0eeee396f","observation_id":"02f9acb8-8e93-4110-856a-999f7b07683d","resolution":{"observed_at":"2026-08-06T23:20:51.046232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:50.683789Z","title":"Sonicvisionlm: Playing sound with vision language models","venue":null,"work_id":"149aa04a-5448-4f57-821a-a14fa6e85d66","year":2024},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:48.722137Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:103f4a88bc937ffe957a7c1ecc0f3f393ef1b10b1e25373af1cdc69a4e67ba34","observation_id":"caf9bdfc-63e5-467e-a050-368ba2d6297b","resolution":{"observed_at":"2026-08-06T23:20:50.814775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:50.497745Z","title":"A proposal-based paradigm for self-supervised sound source localization in videos","venue":null,"work_id":"6a0937d4-256c-4231-916c-467a5106776b","year":2022},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:48.915324Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:9751d803901d97f930d4ec1c6a61a0e9fe7b6211b6bb7711f1b77fdc55a0f423","observation_id":"e09ecbac-9ff0-495b-9354-2b1ed2b00458","resolution":{"observed_at":"2026-08-06T23:20:50.588081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-06T23:20:48.985249Z","title":"A survey on multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:48.985249Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:2002a5aaff38ac594a53142d4162aecc707cebdb4f745beb7c81e712fd36a190","observation_id":"0ae44f15-eda2-4597-b370-81865df6e06d","resolution":{"observed_at":"2026-08-06T23:20:48.985249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T23:20:49.075435Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:49.075435Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:fce0eb1d55683fe14612e7efba8927ab3b718bbd8b6783a1b99706a8ec4e5771","observation_id":"52a526d2-17b8-4015-8ead-64026d200fcc","resolution":{"observed_at":"2026-08-06T23:20:49.075435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:50.146911Z","title":"The sound of pixels","venue":null,"work_id":"0a987918-0c76-4692-8c20-e6fefe2ea17f","year":2018},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:49.160956Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:a4f4b6f55b808d4f87019bcc0cd539fefa26c1fcd25c6112b252e10344412ad1","observation_id":"7d765c18-5d41-445c-a565-addc16c9924e","resolution":{"observed_at":"2026-08-06T23:20:50.348537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:49.942418Z","title":"Weakly supervised contrastive learning","venue":null,"work_id":"ffc88a2f-e2aa-4ea8-9767-2c80a7c220df","year":2021},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:49.253720Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:0fafce8862e98731e0559e0be1239e71a5e2b54b515a024e58440d59cb802e51","observation_id":"37e29985-6257-4e8f-af2e-e41c0dfa0027","resolution":{"observed_at":"2026-08-06T23:20:50.052232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:49.729512Z","title":"Exploiting visual context semantics for sound source localization","venue":null,"work_id":"1fadf405-8d4b-44f0-815a-2c394693d6cb","year":2023},"citing_paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:49.374967Z"},"links":{"citing_paper":"/paper/2506.18557"},"observation_digest":"sha256:2c84b45d7b4921369553ec6a63aff2a83046af49af31dd022fd038c0721313fa","observation_id":"69480215-0ca9-4260-b091-d46be833e310","resolution":{"observed_at":"2026-08-06T23:20:49.795672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.18557","last_updated":"2025-06-24T02:05:51Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T23:13:29.775397Z","submitted_at":"2025-06-23T12:08:07Z","title":"Object-aware Sound Source Localization via Audio-Visual Scene Understanding"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":1,"verified_fuzzy":40},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2506.18557."}