{"as_of":"2026-08-07T23:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:580408d6de8168859c665dcfccd3f994442611112cd3e8b31be68c0450cbb85a","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:58:02.357429Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:58:02.208194Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T05:58:02.433864Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"cited_work":{"arxiv_id":"2506.06537","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.06537","snapshot_observed_at":"2026-08-07T05:58:02.433864Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","venue":"cs.CV","work_id":"e9b5cd7d-b60b-4104-ad05-74b3a5642fa5","year":2025},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.208194Z"},"links":{"cited_paper":"/paper/2506.06537","citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:a3308b1cb67b3b1100bd38428c409c5b5474d66bd36b65b6013aaade071a326f","observation_id":"5b467b46-f159-4823-b8ab-669a8d04bc28","resolution":{"observed_at":"2026-08-07T05:58:02.440658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06537/citation-record","integrity":"/paper/2506.06537/integrity","json":"/paper/2506.06537/citation-record.json","paper":"/paper/2506.06537"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:03.133298Z","title":"This capability is essential for applica- tions in video understanding, surveillance, human-computer in- teraction, and autonomous systems","venue":null,"work_id":"a0699deb-0eea-4913-8613-69d5cceb9196","year":null},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.197732Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:c8ad40d9d7d5e8717d1c55b5b3630ad5c3975270bbfc926ad04f2e97c392588d","observation_id":"9c324de4-f448-45d4-9973-c134069f57ec","resolution":{"observed_at":"2026-08-07T05:58:03.137883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:03.119575Z","title":"Many approaches leverage cross-modal attention [1, 2, 3] combined with contrastive learning [4, 5] to align audio and visual features","venue":null,"work_id":"3bc6f366-cd45-4ee1-b502-128a876ff834","year":null},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.203606Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:ad2cd760b46832ae48856b434437041444e947fa51782ccee25c9436c2eafd90","observation_id":"ba2b96cc-0daf-4343-abb5-a88b9eeb2afc","resolution":{"observed_at":"2026-08-07T05:58:03.124094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"cited_work":{"arxiv_id":"2506.06537","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.06537","snapshot_observed_at":"2026-08-07T05:58:02.433864Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","venue":"cs.CV","work_id":"e9b5cd7d-b60b-4104-ad05-74b3a5642fa5","year":2025},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.208194Z"},"links":{"cited_paper":"/paper/2506.06537","citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:a3308b1cb67b3b1100bd38428c409c5b5474d66bd36b65b6013aaade071a326f","observation_id":"5b467b46-f159-4823-b8ab-669a8d04bc28","resolution":{"observed_at":"2026-08-07T05:58:02.440658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:03.105935Z","title":"Models Below, we elaborate on the final models built for each approach","venue":null,"work_id":"35f005e8-aa82-41bc-bc07-e85cc6c97c17","year":null},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.213087Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:6f6509ada5d0e84a9bd4829efd504502be7a0667515feef2796365bc6256609e","observation_id":"05360814-6668-4846-b41d-7cdc1d1a6efe","resolution":{"observed_at":"2026-08-07T05:58:03.110256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:03.092115Z","title":"By systematically integrating audio, vision, and text representations, we bridge modality gaps and achieve fine-grained segmentation without requiring A VS-specific annotations","venue":null,"work_id":"1d7fdb9b-154c-4360-8662-6f825ca4d60e","year":null},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.218012Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:18eda2d209a8d1f438c810593e5dafce1d0d0384445b2549be0c55be1aea9efa","observation_id":"7266a948-ce5a-4a2f-97ae-f12a5361c794","resolution":{"observed_at":"2026-08-07T05:58:03.096865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:03.078961Z","title":null,"venue":null,"work_id":"39c47dac-1765-46a3-8b43-79ad233ee0cf","year":2025},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.222340Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:180a418b7dfe3fb1ad9ff23e70669e67a2b718840d5b602747bf08e132e66db5","observation_id":"45b681cf-81c4-47a9-8c43-0945a0339f6f","resolution":{"observed_at":"2026-08-07T05:58:03.083300Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:03.065839Z","title":"Learning to localize sound sources in visual scenes: Analysis and applications,","venue":null,"work_id":"b7602887-9f58-412c-923b-f05f1cc615cf","year":2019},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.227428Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:9775fcc07f01c8d85d568c47c02b0cb8b84425cdc73207035f2055ec109ba68d","observation_id":"51b6b9a9-a56e-40c4-a262-d9929e24d7fe","resolution":{"observed_at":"2026-08-07T05:58:03.069950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13676","last_updated":"2024-07-18T16:51:15Z","snapshot_observed_at":"2026-07-06T18:48:37.723242Z","submitted_at":"2024-07-18T16:51:15Z","title":"Aligning Sight and Sound: Advanced Sound Source Localization Through Audio-Visual Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13676","snapshot_observed_at":"2026-08-07T05:58:02.231835Z","title":"Aligning sight and sound: Advanced sound source localization through audio-visual alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.231835Z"},"links":{"cited_paper":"/paper/2407.13676","citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:640b096b3de41d203ddfc6f3527b61f0608cafd1fc2b994cbdd7be938840bf4f","observation_id":"dbc8d8e5-6e64-4c80-844f-d0602e249a49","resolution":{"observed_at":"2026-08-07T05:58:02.231835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:03.053363Z","title":"Exploiting transformation in- variance and equivariance for self-supervised sound localisation,","venue":null,"work_id":"1e7620a5-cce1-48f4-bd97-32337c7b3a37","year":2022},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.236552Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:2d36e2abd286e03750ba974373d5e4b778642ac9220da3ba2d06ed1fc586134a","observation_id":"ea2187a2-3ab3-4113-9ef0-27d3b535398a","resolution":{"observed_at":"2026-08-07T05:58:03.057441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:03.040730Z","title":"Localizing visual sounds the easy way,","venue":null,"work_id":"859717be-7640-40a0-b360-21b3038ba6aa","year":2022},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.241086Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:9c0e0940e35dfa87ab130df5ac460838dee57099ceea60aadf3fd223bfabf5c0","observation_id":"61908570-0221-42fd-89a2-e50426373aeb","resolution":{"observed_at":"2026-08-07T05:58:03.044572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:03.028351Z","title":"Localizing visual sounds the hard way,","venue":null,"work_id":"54250634-f2e9-47d1-b9d3-ce3c766f1982","year":2021},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.246202Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:d1a010ca1523a863f058f70944272c2e0f11edbfd7aec8a813ef8f60111d8001","observation_id":"187b50d7-1b94-47c1-a2b1-a173a5565f20","resolution":{"observed_at":"2026-08-07T05:58:03.032265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:03.015753Z","title":"Learning audio-visual source local- ization via false negative aware contrastive learning,","venue":null,"work_id":"82f9ebf1-d083-4204-a1e1-6ad24d3f62d8","year":2023},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.250492Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:70bec79fbdc5a37a2c0f5fe4c50bd571daba69d9fe2d67425d120f4226b720c9","observation_id":"8330852f-ff89-4c02-b9ba-acd7124ae7d0","resolution":{"observed_at":"2026-08-07T05:58:03.019857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:03.002914Z","title":"Marginnce: Robust sound localization with a negative margin,","venue":null,"work_id":"d0064e18-2729-4837-8dbc-fb8c49cffcaf","year":2023},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.255202Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:4dc5a980cc3679e2705c264f10185a75b22703e7f6444b902833899661563930","observation_id":"fe06a59f-5fdb-47ab-a449-d45ab740654f","resolution":{"observed_at":"2026-08-07T05:58:03.006909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.990517Z","title":"Audio–visual segmen- tation,","venue":null,"work_id":"3f057844-97e0-49bc-a7af-8fff1b2d6274","year":2022},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.259409Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:d2f61e28fb0d499887e411d777e34886a4b326855c7b26a7e3d3b4e53a613809","observation_id":"c2d24cae-a9bd-49af-86f2-29dc969e99db","resolution":{"observed_at":"2026-08-07T05:58:02.994261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.977388Z","title":"Improving audio-visual segmentation with bidirectional generation,","venue":null,"work_id":"f3806f8a-e9e0-471d-8431-4ee14d88edc5","year":2024},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.263449Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:9f6b829536fd8b944132d5ee91650c15d61ce5667975af79eb3cfff630da0c05","observation_id":"a97a0451-fba9-402e-b8a0-3e358bed884f","resolution":{"observed_at":"2026-08-07T05:58:02.981778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.820392Z","title":"Selm: Selective mechanism based audio-visual segmentation,","venue":null,"work_id":"bfbf767f-d204-4816-8e3f-fa409e62c3b9","year":2024},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.267534Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:3d63b4f992fd673ecd09c4c14e3ab26c84c6a60bd41e4a4df749c7c2d3f6e248","observation_id":"ea52bc2d-7569-4054-80fd-e8d55ad2b4fb","resolution":{"observed_at":"2026-08-07T05:58:02.910728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.782628Z","title":"Bavs: Bootstrapping audio-visual segmentation by integrating foundation knowledge,","venue":null,"work_id":"33bd88bc-a246-4e4b-ac8b-4407838f0446","year":2024},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.271953Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:8745cb32b25dd1be3bffda093af340f45977cef2d1be9699fe4c6e91fe574836","observation_id":"110a07f7-5a14-41a5-a5a0-4d25e7cd41e2","resolution":{"observed_at":"2026-08-07T05:58:02.801448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.733258Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"6e23c0fb-bf30-48c3-aa5f-240a955e0587","year":2021},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.276213Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:1dbad1de1490c4bc32e395f302937e4d88817f044f565dba387a32bf262299e1","observation_id":"b0f3a086-d99a-4b58-add1-057deb845d7d","resolution":{"observed_at":"2026-08-07T05:58:02.755960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-07-06T16:17:07.927369Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-07T05:58:02.280500Z","title":"Natural language supervision for general-purpose audio representations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.280500Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:ec55eaa8621c54a15d63ba56c4a969d242ffcc3091a936ab6e30632a6224105a","observation_id":"b97ce92b-dd08-458a-a942-8ba4a2e442af","resolution":{"observed_at":"2026-08-07T05:58:02.280500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.703496Z","title":"WavCaps: A ChatGPT-assisted weakly-labelled audio captioning dataset for audio-language mul- timodal research,","venue":null,"work_id":"30ce2d57-ddc6-45c2-a9d9-8248bbf7f3f3","year":2024},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.285239Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:e34c03b40fa18302da76e6ce855a968835f6768467971d0faed9308d48895afe","observation_id":"b957c4a4-d464-45c3-8a17-463ab759847e","resolution":{"observed_at":"2026-08-07T05:58:02.714559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.670231Z","title":"AudioCaps: Generating Captions for Audios in The Wild,","venue":null,"work_id":"8bfacbf1-29e2-476e-b998-56b51ed4617c","year":2019},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.289939Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:b2e7e60fa5e6128b347101d815bb42b38675ca182154edf9b8ecb531807c3cd4","observation_id":"b8a97d62-a16f-4e8d-9b2a-5cfb5cca0335","resolution":{"observed_at":"2026-08-07T05:58:02.682158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.636741Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":"9245cedd-fac1-4aad-a4a0-a2d0d517632a","year":2014},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.294346Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:699afe87f51595ca5c167b61ac21847056ff079c2227e0c6c3f45335e5c438d1","observation_id":"5d9c8752-8a7a-40f4-a793-eda42895a494","resolution":{"observed_at":"2026-08-07T05:58:02.646312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.622128Z","title":"Blip: Bootstrapping language- image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":"0c623444-1665-4c89-a448-2e611e257d16","year":2022},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.298465Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:7dae7d92decfd00dbddf41b3eb737a51a61a853603fe2b5c6130c3f0414f790d","observation_id":"c4704ecb-6a7c-4a03-bfd6-782595e87095","resolution":{"observed_at":"2026-08-07T05:58:02.626754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-07T05:58:02.302544Z","title":"An image is worth one word: Personalizing text-to-image generation using textual inversion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.302544Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:92a6a2c698795d1512a1754e5f3b45fc41078332b825aed07449ac343c858873","observation_id":"3cead3a2-851f-41a0-9133-c6a0c9ce0374","resolution":{"observed_at":"2026-08-07T05:58:02.302544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.608397Z","title":"Learning to visually localize sound sources from mixtures without prior source knowl- edge,","venue":null,"work_id":"b046012e-1d87-4ea5-b024-c0e5c84fc861","year":2024},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.307043Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:fba0154ebf89a900a317e83aadda20d5b7b3f844acc460974f3d5ce157995393","observation_id":"cdcf4a11-9322-438d-b2be-c3d27ffbf35f","resolution":{"observed_at":"2026-08-07T05:58:02.613063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.594989Z","title":"Adaptive selection based referring im- age segmentation,","venue":null,"work_id":"ee76b1f6-6b8e-48e8-9cb7-d997af106950","year":2024},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.310995Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:8522fe84ec36612b197f58c4630cfa5e76c498691ed17e7ae40578a2fecd0661","observation_id":"ef3a48c4-44d5-4ca7-923b-66227211d06f","resolution":{"observed_at":"2026-08-07T05:58:02.599272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.581724Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":"09604cd7-2faf-4af9-877b-680ec7c071b6","year":2022},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.315084Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:515abef165b7754b06944fa63f22c42e8d2553b161dcc58a5ebf6df20ebf8f0b","observation_id":"a1d42340-6c74-4b35-a8e2-918242b51871","resolution":{"observed_at":"2026-08-07T05:58:02.585955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.319071Z","title":"Audio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.319071Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:a6ce38b9f9a51daa186ae6abfee5865876438c8041a1928aa2ea49dadbc9be6d","observation_id":"3955a45d-4ea2-4ede-af26-ed42f347f5f7","resolution":{"observed_at":"2026-08-07T05:58:02.319071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.559112Z","title":"Clotho: An audio cap- tioning dataset,","venue":null,"work_id":"51144c61-56f8-4fbe-8e68-274303ced1e3","year":2020},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.323482Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:0e853623e5c6093cdd86d14c65f9d43e38f383682f400b0bf6ffb4bee6fe4a06","observation_id":"7e948701-6ee2-4222-99c9-14d9ced8b76b","resolution":{"observed_at":"2026-08-07T05:58:02.563661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.545750Z","title":"spaCy 2: Natural language under- standing with Bloom embeddings, convolutional neural networks and incremental parsing,","venue":null,"work_id":"2caa220b-8572-407b-8776-ee63d86b9c6a","year":2017},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.327698Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:5869ae76f769ac31fe56d9bf87277ad95ea359c6ac9a739221eb14af734e64bc","observation_id":"809d8bfc-ead5-43fe-8513-94e268eb35f4","resolution":{"observed_at":"2026-08-07T05:58:02.550108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.331753Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.331753Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:e6419a26792787bc2a47e0ad261db9055354a8a0616fdbacd4a9839e7090d8bf","observation_id":"99888b15-3398-4842-943c-7ca0b879f59c","resolution":{"observed_at":"2026-08-07T05:58:02.331753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.522602Z","title":"Vggsound: A large-scale audio-visual dataset,","venue":null,"work_id":"b03b36dd-a732-44be-ae28-f4139dd7320f","year":2020},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.335799Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:e046391a9d5a19d32178f6bbde9dc986ce078070e35bbe5189f4679c6fff9784","observation_id":"406847a3-bac8-415e-b23d-bce3dce0f5e7","resolution":{"observed_at":"2026-08-07T05:58:02.526857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.507422Z","title":"Segment anything,","venue":null,"work_id":"a0dec9c9-c571-49aa-ad63-6115d06033a3","year":2023},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.340053Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:88fd619422fa304bd1f5dc38faf8b39918dea56692e2752134dd7dff9e637af2","observation_id":"96a2c20c-d4bb-4263-b611-9c364e4e3414","resolution":{"observed_at":"2026-08-07T05:58:02.512415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.493288Z","title":"Unraveling instance associations: A closer look for audio-visual segmentation,","venue":null,"work_id":"64fdcb00-3850-481e-8efa-7f74b29e9d39","year":2024},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.344260Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:cfe81a29d795b04825c5192f6a0bf91af0ca5ac7b271adf7f118709a94847629","observation_id":"3dec38ed-1032-4ad8-8887-aca36f518f87","resolution":{"observed_at":"2026-08-07T05:58:02.497818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.479438Z","title":"A closer look at weakly-supervised audio-visual source localization,","venue":null,"work_id":"6832ce68-91ba-434b-a618-d17e45a68e96","year":2022},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.348596Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:30ed7cdfefaf657486c239a27caa18043a027824fae6c800b0e9d7427f433e93","observation_id":"005345c1-4e4b-48e5-b82e-acfb4c9df8b5","resolution":{"observed_at":"2026-08-07T05:58:02.483950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.464485Z","title":"Bridg- ing vision and language encoders: Parameter-efficient tuning for referring image segmentation,","venue":null,"work_id":"96c29558-c04b-41f3-930e-e3da628ff2e1","year":2023},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.352781Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:2a57515a5d18d66e2bc7cba7136ffe3862129237f3727e91a397ac2935732078","observation_id":"9f67a6e9-214e-4beb-8c99-694d45256cc4","resolution":{"observed_at":"2026-08-07T05:58:02.469077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.450664Z","title":"Cris: Clip-driven referring image segmentation,","venue":null,"work_id":"e9d8fffc-631f-4163-a2a9-e5fabdcb6197","year":2022},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.357429Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:4f7be70bb94cf5073186d47e4c9f4b562c21369633dc927c25ff6964d9000839","observation_id":"f16500da-de98-4eac-9740-46fc5134d510","resolution":{"observed_at":"2026-08-07T05:58:02.455112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:52:16.002269Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":30},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 1 inbound Pith citation observation for arXiv:2506.06537."}