{"as_of":"2026-08-07T09:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:325421042b7a920870175daf81f7bdb343b97d3bc5f0d25a42eb04f27acd1bf6","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:24:31.180804Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.20740/citation-record","integrity":"/paper/2507.20740/integrity","json":"/paper/2507.20740/citation-record.json","paper":"/paper/2507.20740"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:20.667712Z","title":"Remembering the past and imagining the future: Common and distinct neural substrates during event construction and elaboration","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:20.667712Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:94447719f35a41fd0b1e14dc03099dcf0e01d96ba8acab53c31594ff2c559ec2","observation_id":"92232e28-b925-4df0-98d6-3cd58f3e6a75","resolution":{"observed_at":"2026-08-06T13:24:20.667712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14203","last_updated":"2024-03-21T07:56:09Z","snapshot_observed_at":"2026-07-06T17:48:08.016138Z","submitted_at":"2024-03-21T07:56:09Z","title":"Unsupervised Audio-Visual Segmentation with Modality Alignment","version":1},"cited_work":{"arxiv_id":"2403.14203","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.14203","snapshot_observed_at":"2026-08-06T13:24:32.241520Z","title":"Unsupervised Audio-Visual Segmentation with Modality Alignment","venue":"cs.CV","work_id":"72971c73-44d9-4f92-b171-6ac05ac75389","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:20.791836Z"},"links":{"cited_paper":"/paper/2403.14203","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:a874b518f6a9d9a0d03fd42bcfd72cc6eb816db017b41f9c5ee9d0f773b5a447","observation_id":"9eb1ad31-b9f1-4f74-96f2-1c505fd5a6b4","resolution":{"observed_at":"2026-08-06T13:24:32.277437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:20.951174Z","title":"Numerics of gram-schmidt orthogonalization","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:20.951174Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:462143099f12c2e33ffe93fa6ecba9afcf331cd03206a2fbfa9a752d00a0fc78","observation_id":"a94ba4dc-11e1-4712-acd0-31967afc369f","resolution":{"observed_at":"2026-08-06T13:24:20.951174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:21.092219Z","title":"Self-projection and the brain","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:21.092219Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:1de93d0f5327b4ff4f92bca7f11790ebc666f444ba2120dbf3a9b97cd052f303","observation_id":"a04bf18d-2e62-4197-8c4a-71e71f82acf2","resolution":{"observed_at":"2026-08-06T13:24:21.092219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02327","last_updated":"2024-02-06T11:35:05Z","snapshot_observed_at":"2026-07-06T17:24:57.402088Z","submitted_at":"2024-02-04T03:02:35Z","title":"Bootstrapping Audio-Visual Segmentation by Strengthening Audio Cues","version":2},"cited_work":{"arxiv_id":"2402.02327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.02327","snapshot_observed_at":"2026-08-06T13:24:32.082012Z","title":"Bootstrapping Audio-Visual Segmentation by Strengthening Audio Cues","venue":"cs.CV","work_id":"93e64cb2-65f9-43be-b99e-12e85769eecb","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:21.302100Z"},"links":{"cited_paper":"/paper/2402.02327","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:8bf7ce99b2358070e0536610783c9cf91a6a48b049bb3074a1dcdec9ca10f02e","observation_id":"d1420b7c-6981-4053-8105-cf2018875008","resolution":{"observed_at":"2026-08-06T13:24:32.180551Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:21.405095Z","title":"Unraveling in- stance associations: A closer look for audio-visual segmenta- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:21.405095Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:5a9f742a8a7d6a8eb1693cdebf01915d0c391f8a8452a825752b19314ee683e4","observation_id":"f0f5345d-472c-470c-9d4f-604e5b30339e","resolution":{"observed_at":"2026-08-06T13:24:21.405095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:21.553958Z","title":"Cpm: Class-conditional prompting ma- chine for audio-visual segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:21.553958Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:7303b4809869fe3904ad655af0f445e6ad915b73cfc8df35c8a19e7bf1f31ca9","observation_id":"030edca1-1e34-4e8e-beaa-9300ac0f420a","resolution":{"observed_at":"2026-08-06T13:24:21.553958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:21.724840Z","title":"Cpm: Class-conditional prompting ma- chine for audio-visual segmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:21.724840Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:ee0d9192f6273afbfd53c791629a30a602a629a3710c880fe1a7b9339ededbfc","observation_id":"a6ea029d-b907-43e9-9046-4109dee5f372","resolution":{"observed_at":"2026-08-06T13:24:21.724840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.505453Z","title":"C-cam: Causal cam for weakly supervised seman- tic segmentation on medical image","venue":null,"work_id":"0231cc62-3964-4f77-bc1f-e383c9fc6692","year":2022},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:21.852776Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:6df33272a631d845dbde694e87542bd02916acf322a2ac2d45d2ec15e96d30a2","observation_id":"1ce8f95b-8eaa-45d5-aea5-7067c2022032","resolution":{"observed_at":"2026-08-06T13:24:38.508793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.494870Z","title":"Asi- seg: Audio-driven surgical instrument segmentation with surgeon intention understanding","venue":null,"work_id":"5817c23e-2055-42f0-8996-bcad22f3f81a","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:21.943556Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:7dd02b1d460d84b8aa33edc14568fa1e16e0aa39af6c2ae94e51df3935db6d17","observation_id":"c6142001-4757-44a9-bc47-8aa03bb6c9c2","resolution":{"observed_at":"2026-08-06T13:24:38.498445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.483919Z","title":"Regret and its avoidance: a neuroimaging study of choice behavior","venue":null,"work_id":"56dc09b3-853f-4f33-8ac2-7241e6e2dda8","year":2005},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:22.148549Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:beb72cd1264b691fac5172144d51e092a9ff61ef26031d01dda238d1f0685235","observation_id":"fb8e7385-9045-4591-820f-a702f4b0b486","resolution":{"observed_at":"2026-08-06T13:24:38.487167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-06T13:24:22.313670Z","title":"An image is worth one word: Personalizing text-to- image generation using textual inversion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:22.313670Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:0d19dc81bb326b81328e517626dc1e865eaad21a3bdb3ad942080a78a062f87c","observation_id":"fbd22937-7218-4a6c-b92f-ef4c741c36b6","resolution":{"observed_at":"2026-08-06T13:24:22.313670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.473782Z","title":"Avsegformer: Audio-visual segmentation with trans- former","venue":null,"work_id":"b126b325-390e-418c-a17c-7b8aba959d92","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:22.499286Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:cac42367697d80e55f74bca887e7687e64b027a0aeb8ac0a997a77fa5c8083ce","observation_id":"a1df29dc-3460-4ad4-b47e-84b0ecfdb377","resolution":{"observed_at":"2026-08-06T13:24:38.477009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.464663Z","title":"Open- vocabulary audio-visual semantic segmentation","venue":null,"work_id":"47ba567a-4a5a-4e35-ad66-629fbc386168","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:22.665424Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:306060b3af141c837754fa8d1698001c985eafdb72c07284a3c2d0a4aebd0432","observation_id":"55ba5b81-6af3-40a3-896e-5c9ab45c8ab2","resolution":{"observed_at":"2026-08-06T13:24:38.467530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.455371Z","title":"Embodied intelligence via learning and evolution","venue":null,"work_id":"776276dc-d82b-4a6e-ae9f-be5672190c95","year":2021},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:22.804976Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:3068751ab0a4550e4cf2d664fc082100cfd689089a9af8e0cf8a2aceb312bff2","observation_id":"a40a676a-cf8a-4e3e-af99-e85fb9a9efcf","resolution":{"observed_at":"2026-08-06T13:24:38.458399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.445706Z","title":"Improving audio-visual segmenta- tion with bidirectional generation","venue":null,"work_id":"e43b4882-48f6-447a-8f7b-3f420f4db068","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:22.948652Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:aa04a363a76c079854f984e5755dd9f3004feb3e34f1cebd42819cb038161705","observation_id":"7d8ebeb7-ef7a-4eca-9289-3da185fc510d","resolution":{"observed_at":"2026-08-06T13:24:38.449069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:23.073062Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:23.073062Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:eb2c061f3efbf3b9e5236cbf21156a4fd0cdd4e9882e74ff54823b73e7712dcb","observation_id":"7db11bdb-d39e-4059-89d5-b0291245b940","resolution":{"observed_at":"2026-08-06T13:24:23.073062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.430113Z","title":"Momentum contrast for unsupervised visual rep- resentation learning","venue":null,"work_id":"fe8fe6a6-81d6-4899-89e2-7cf19fda0908","year":2020},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:23.261042Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:3f33b13d48322e6abef2c7e81557b0a5643d23daa38c2870da0d3e630316ee01","observation_id":"7db395b5-bece-416d-a433-19a801035327","resolution":{"observed_at":"2026-08-06T13:24:38.433031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.421067Z","title":"Decoupling static and hier- archical motion perception for referring video segmentation","venue":null,"work_id":"c11fca44-de6a-478d-90a9-9e31c941be71","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:23.491221Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:cf0276c570224586070fb7bcd90b9f47b85644f4dde4ce3004b17f0d31bb1fbc","observation_id":"11788e0e-e091-4466-80f6-be4069bbd29f","resolution":{"observed_at":"2026-08-06T13:24:38.424334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.412640Z","title":"A general mechanism for perceptual decision-making in the human brain","venue":null,"work_id":"b6f80ca5-d38d-49d9-84cb-d47a2be580f4","year":2004},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:24.452927Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:4873e640b9fae4210cf087a833dac4789a008897bb71b902018d9e6474cc4a0a","observation_id":"a084624f-8829-4e51-9103-40308de46c4f","resolution":{"observed_at":"2026-08-06T13:24:38.415636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.403300Z","title":"Cnn archi- tectures for large-scale audio classification","venue":null,"work_id":"98ac33a7-f732-42ae-9b8f-f620507e47c0","year":2017},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:24.614224Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:f807ef1a3c7e98b2c134cbdc47e7e25e473c2690fc047543cf0eec5d094f0fe3","observation_id":"25d03ac9-fee1-4fbe-b4e1-10adddf4bc64","resolution":{"observed_at":"2026-08-06T13:24:38.406901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.394779Z","title":"Aleatory and epistemic uncertainty in prob- ability elicitation with an example from hazardous waste management","venue":null,"work_id":"ebf5cf4e-c8ca-46f0-bcfb-c873b1e2242f","year":1996},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:24.755532Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:125c5acf8d5527abc6ecf00596c9816fb3f5cd5c8d2b82e7523a203692cb7771","observation_id":"0439d45d-3416-427a-a8f1-2f5fcc1fe83e","resolution":{"observed_at":"2026-08-06T13:24:38.397744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.386518Z","title":"Mix and local- ize: Localizing sound sources in mixtures","venue":null,"work_id":"eebd53e1-f68a-43ef-ad74-bc275b51f41d","year":2022},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:24.860562Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:a42088ecd3155a030a249534f0086a0656308bafe46be84d476f8cde1e43371c","observation_id":"ad0cc980-5875-4b85-8a50-691e04dbeb66","resolution":{"observed_at":"2026-08-06T13:24:38.389427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.377033Z","title":"Make-an-audio: Text-to-audio gen- eration with prompt-enhanced diffusion models","venue":null,"work_id":"6a983656-b60e-49f9-9e29-42cb495ae97b","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:25.010580Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:62affa9d27b7ee0bb2b5880622345bd85ba9ab6693bc0bad3a1c6fb95e4574b9","observation_id":"4bd25916-ba48-4257-b022-57a94eebb045","resolution":{"observed_at":"2026-08-06T13:24:38.380217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09501","last_updated":"2023-09-18T05:58:06Z","snapshot_observed_at":"2026-07-06T16:19:45.746334Z","submitted_at":"2023-09-18T05:58:06Z","title":"Discovering Sounding Objects by Audio Queries for Audio Visual Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09501","snapshot_observed_at":"2026-08-06T13:24:25.169098Z","title":"Discovering sound- ing objects by audio queries for audio visual segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:25.169098Z"},"links":{"cited_paper":"/paper/2309.09501","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:e50fcf55e51f4ef0776ed68b5ec0cdce89e44179c8c4c8ec88cda8f847442517","observation_id":"22163450-fa2b-4b2c-b5fa-5ccb7264a524","resolution":{"observed_at":"2026-08-06T13:24:25.169098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.368022Z","title":"Adaptive mixtures of local experts.Neu- ral computation, 3(1):79–87, 1991","venue":null,"work_id":"803b046c-c5b0-477c-b8bb-c476d98fa23b","year":1991},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:25.330912Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:0ed2bed4d83e7081cba1f0722c5e59bed944c0c62592c014311ca5e70a6e2abe","observation_id":"68326339-9d84-4988-b9c3-9c53df2ff659","resolution":{"observed_at":"2026-08-06T13:24:38.371190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.359473Z","title":"Counterfactually augmented event matching for de-biased temporal sentence grounding","venue":null,"work_id":"134883f8-6236-4606-a5b8-887fe72041c3","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:25.559673Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:042cf2baae4a5c00eba6ac7bc41dccdd97cf7a887e2676fee1eb735500123d1c","observation_id":"6c4c9f0d-b966-4443-b3cb-2633c9986a55","resolution":{"observed_at":"2026-08-06T13:24:38.362368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.350557Z","title":"Learning to visually localize sound sources from mix- tures without prior source knowledge","venue":null,"work_id":"234d00d6-0717-495d-a58c-dc6f7d5e9804","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:25.728411Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:1e2c23662929dc7f79c0c1e32f656a1f664cf07005a61a1219fb1d5c2d083857","observation_id":"993faee2-f328-4068-9126-e24260f76fb1","resolution":{"observed_at":"2026-08-06T13:24:38.353458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-07-06T15:12:37.953383Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-06T13:24:25.802594Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:25.802594Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:b45b0323df34c7ddb7e6d7aba7b18f80138c1a5be4544836b6de6b17b0a45994","observation_id":"dd417650-4dd9-4d51-b7d5-2064dcdfbd7e","resolution":{"observed_at":"2026-08-06T13:24:25.802594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.341810Z","title":"The singular value decompo- sition: Its computation and some applications","venue":null,"work_id":"2cd114c9-fad2-483b-a589-702338f62a24","year":1980},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:25.806450Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:728f9a36aa5aa46810133c8e0028ef323f7eb345c7f8ebccfb2ba6ad5fab820a","observation_id":"e63916f1-06da-44b1-9a0a-9fb875251c68","resolution":{"observed_at":"2026-08-06T13:24:38.344825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.332344Z","title":"Improving vision and language concepts understanding with multimodal counterfactual samples","venue":null,"work_id":"e7f693bc-4ddc-42f0-a0f3-e6797a5bbb01","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:25.892511Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:f8019682f672bd974e71bde5e31daaf50b68eeeb1c8c1dfb860a8697536b0479","observation_id":"474a0f74-f627-4521-b5f7-23d07f5141c8","resolution":{"observed_at":"2026-08-06T13:24:38.335417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.321696Z","title":"Selm: Selective mechanism based audio-visual segmentation","venue":null,"work_id":"c2b865dc-ba5e-43df-8795-906d71a7c2b1","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:26.058249Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:292831a5c49b470a92206b74adb902866d19674daa24d09ccfd57025428145e2","observation_id":"408135f8-3618-45b7-bf4c-cdddf4533d7d","resolution":{"observed_at":"2026-08-06T13:24:38.325244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.312208Z","title":"Catr: Combinatorial-dependence audio-queried transformer for audio-visual video segmentation","venue":null,"work_id":"c24759aa-1e58-4164-b2d2-73e883e9168d","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:26.185331Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:f480f2fc39269451011ad655bc8fd7e96767abf1a6628aea64f05d09868ee994","observation_id":"cb089aa7-6c78-41ad-8705-7df5c63882fe","resolution":{"observed_at":"2026-08-06T13:24:38.315333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02855","last_updated":"2026-07-29T07:55:45Z","snapshot_observed_at":"2026-08-01T23:09:00.410365Z","submitted_at":"2019-11-07T11:14:05Z","title":"Dice Loss for Data-imbalanced NLP Tasks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02855","snapshot_observed_at":"2026-08-06T13:24:26.309876Z","title":"Dice loss for data-imbalanced nlp tasks","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:26.309876Z"},"links":{"cited_paper":"/paper/1911.02855","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:ad88c9c3176e2290e056c62d4bf1aed1a061332ed207063ef01a4df95a277881","observation_id":"4bda86bf-c11d-4172-9739-69e6e3a052d8","resolution":{"observed_at":"2026-08-06T13:24:26.309876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.231445Z","title":"Qdformer: Towards ro- bust audiovisual segmentation in complex environments with quantization-based semantic decomposition","venue":null,"work_id":"7b7a5fb6-8c0e-423c-b104-a1804d701519","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:26.423838Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:218acc094f499a7bf78fdf3301a09b17de40ed6e15967ce812ca4466d7c619fb","observation_id":"dc6ce626-8fa9-44c3-8a01-d4ab5140b521","resolution":{"observed_at":"2026-08-06T13:24:38.305293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:37.978814Z","title":"Bavs: bootstrapping audio- visual segmentation by integrating foundation knowledge","venue":null,"work_id":"04cceaaa-53e1-4bee-a716-f5676ce142c2","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:26.526751Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:5d36a952a2f7f9df929fe7970dce702dfdcb31f819fab7ffb718fba2f49faa5a","observation_id":"07b5e024-bb4d-4dfc-8e01-9cb7c3ac55b4","resolution":{"observed_at":"2026-08-06T13:24:38.084022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:37.790571Z","title":"Benchmarking au- dio visual segmentation for long-untrimmed videos","venue":null,"work_id":"e356492a-6caf-48fd-94c1-9b44a6f33b5e","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:26.586204Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:409d1e4a4c1ec4f64b15aa3eec8b25fed7714dd0dcc93aeaf6b83ddf84162d72","observation_id":"cf977619-d618-4910-b7d3-7d9da6e76caf","resolution":{"observed_at":"2026-08-06T13:24:37.893219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:37.612786Z","title":"Pay attention to mlps","venue":null,"work_id":"a3a43941-ab90-46e4-b8f1-b07c92a8786c","year":2021},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:26.693841Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:4914348015d3b76df34179cd38bae991290eac7d7c488f123aa27d52efa54af1","observation_id":"b31a92b5-bc64-4781-84c0-0900693af95b","resolution":{"observed_at":"2026-08-06T13:24:37.688252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13236","last_updated":"2023-07-25T03:59:04Z","snapshot_observed_at":"2026-07-06T15:58:08.777051Z","submitted_at":"2023-07-25T03:59:04Z","title":"Audio-aware Query-enhanced Transformer for Audio-Visual Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13236","snapshot_observed_at":"2026-08-06T13:24:26.828928Z","title":"Audio-aware query-enhanced trans- former for audio-visual segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:26.828928Z"},"links":{"cited_paper":"/paper/2307.13236","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:9ff463133968f5f3df1403e805c977468e10b2d1df5940244d7c6349da78b0d0","observation_id":"83406f5f-7bb9-4ab9-8444-f8fed48f887d","resolution":{"observed_at":"2026-08-06T13:24:26.828928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11019","last_updated":"2023-10-07T07:57:15Z","snapshot_observed_at":"2026-08-02T11:10:26.756993Z","submitted_at":"2023-05-18T14:52:45Z","title":"Annotation-free Audio-Visual Segmentation","version":4},"cited_work":{"arxiv_id":"2305.11019","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.11019","snapshot_observed_at":"2026-08-06T13:24:31.854076Z","title":"Annotation-free Audio-Visual Segmentation","venue":"cs.CV","work_id":"4868945c-be34-42b5-a3f6-8c9a9bd1a2e9","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:26.936793Z"},"links":{"cited_paper":"/paper/2305.11019","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:255c1ce35537f3737822b0f807b42457194dc1daf1be8d424524bf6c1b1143fa","observation_id":"2c8f30a5-6a29-4d72-bdfd-1edacc700458","resolution":{"observed_at":"2026-08-06T13:24:31.926622Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:37.425882Z","title":"Audio-visual segmentation via unlabeled frame exploitation","venue":null,"work_id":"a16772d6-2d25-4f98-aba7-11faa1a12400","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:27.047524Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:ade304191db5edfd2cc286e547125f27a21ae8300a56150ddb64445c455ab31b","observation_id":"625ce05b-28ab-495a-b273-91ed366358e5","resolution":{"observed_at":"2026-08-06T13:24:37.518602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:37.169935Z","title":"Cross-modal causal relational reasoning for event-level visual question answer- ing","venue":null,"work_id":"cdff6539-a71b-4d7d-8b64-a1f28d0b970d","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:27.109504Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:e8fd2180cf03abaf5ff4f077ee91a97a457e238e7c9c2ca47303dad48c787def","observation_id":"c7579be3-fa9c-49a3-be3a-10f786024ce9","resolution":{"observed_at":"2026-08-06T13:24:37.282649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:27.197551Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:27.197551Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:fc40790c3f6e6dc4604dbf3b4ed0a20a1d8ade0a2890562eae28b3d4ef4811b8","observation_id":"a06da19b-3e21-4ffb-b1d3-ac841e088740","resolution":{"observed_at":"2026-08-06T13:24:27.197551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:37.058775Z","title":"Step- ping stones: a progressive training strategy for audio-visual semantic segmentation","venue":null,"work_id":"32ed0636-3ec3-49e7-9c0c-3432205f01a6","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:27.320757Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:8d52607ddc5466577b5e2e0d2f3ce40a56a8f9fe367b1a370586cba5eb96ad08","observation_id":"13a86cc8-f036-4e73-9a36-d75679152aaa","resolution":{"observed_at":"2026-08-06T13:24:37.131875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:36.910051Z","title":"T-vsl: Text-guided visual sound source localization in mixtures","venue":null,"work_id":"0527fc37-e6c6-4e2c-b50b-b7b5093f93ee","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:27.386920Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:f1726bbad4ad738942c91a804fe069da4dec4a568c52ff4aea9940606f331ea0","observation_id":"b64d31e0-fc4b-46aa-a4d2-719d938986bf","resolution":{"observed_at":"2026-08-06T13:24:36.993803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16579","last_updated":"2025-07-01T05:44:57Z","snapshot_observed_at":"2026-08-01T16:34:42.779898Z","submitted_at":"2023-07-31T11:29:50Z","title":"Contrastive Conditional Latent Diffusion for Audio-visual Segmentation","version":2},"cited_work":{"arxiv_id":"2307.16579","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16579","snapshot_observed_at":"2026-08-06T13:24:31.703852Z","title":"Contrastive Conditional Latent Diffusion for Audio-visual Segmentation","venue":"cs.CV","work_id":"e2fb4410-4e8b-44fc-8fa7-e08f40beab92","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:27.507201Z"},"links":{"cited_paper":"/paper/2307.16579","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:efe548236bc0315056c8e1dee0ad7f53d2b27a76809d516117e8c88664bd5f78","observation_id":"076f56ba-c832-4b60-b184-fb3d02046c3e","resolution":{"observed_at":"2026-08-06T13:24:31.766124Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:36.779918Z","title":"Multimodal variational auto-encoder based audio-visual segmentation","venue":null,"work_id":"d9310847-b8e8-4b3e-a39c-8544ab16ea05","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:27.623102Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:b0abb38cbc13ded78586aa4bc449901628158830b6cfee5b57dcbc7628061826","observation_id":"055e248f-983a-45a3-8192-908b2a38d400","resolution":{"observed_at":"2026-08-06T13:24:36.818435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:27.707306Z","title":"Weakly-supervised audio- visual segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:27.707306Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:8e67fa6057ebff551d02876929d7a4b82c515794a7dfea4a31bdda000007a348","observation_id":"6bd68199-fb71-4bcd-95f9-262304aef98b","resolution":{"observed_at":"2026-08-06T13:24:27.707306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:36.600377Z","title":"Audio-visual grouping net- work for sound localization from mixtures","venue":null,"work_id":"71aa0401-2696-4d84-89d3-f36bbc0deabc","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:27.831618Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:4f8d9f587012371141855022bbbaa59aecf7a5840304e8187208dbc6e179ca24","observation_id":"679f4081-6369-4b62-8236-66eb37155659","resolution":{"observed_at":"2026-08-06T13:24:36.647904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:36.469318Z","title":"The book of why: the new science of cause and effect","venue":null,"work_id":"124cd9e9-d5a1-4297-bed3-799e1ce1a3cc","year":2018},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:27.932310Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:fad1cdea5fbd71b1bde072b90643c32549766a8c52a424941d98af050fc93227","observation_id":"b1a01a9e-85cd-4fce-8f44-da6ae9d201d1","resolution":{"observed_at":"2026-08-06T13:24:36.501190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:28.047650Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:28.047650Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:c6af273ecfa21c21421cd68686ea692af30b976bffced07bfbb2e22f30ecf9a4","observation_id":"bcabcb0c-4af6-402f-ac10-adf0ba432cfd","resolution":{"observed_at":"2026-08-06T13:24:28.047650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:28.155249Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:28.155249Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:be712709c4b38f81ea7d3fb3927fae85e96582bb56029a3db6da2cd87e56b197","observation_id":"550e563d-bb74-48bb-8da8-98f2af648330","resolution":{"observed_at":"2026-08-06T13:24:28.155249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:36.331046Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"f24f48f4-d7c9-4acb-991c-f2393610e3f3","year":2022},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:28.258287Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:3ca2d85f669807e6d95cf48c85373ae6c1d71222024100082b90d097b3ac49cd","observation_id":"a0617c11-9af7-4ca2-aed7-99a53b509b4b","resolution":{"observed_at":"2026-08-06T13:24:36.393079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:28.331897Z","title":"Focal loss for dense ob- ject detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:28.331897Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:255b24de1e854b515559cce49db362b2e2e01e570eadc7bd32e69a6b2edd00d9","observation_id":"5e9251e1-5e22-4c0c-87d5-841fd30864bb","resolution":{"observed_at":"2026-08-06T13:24:28.331897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:36.163804Z","title":"The wasserstein distance and approxi- mation theorems","venue":null,"work_id":"981972b7-81d4-4854-83f8-b164ddcae17e","year":1985},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:28.439113Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:bab61c2d21f76e2b03b0ccfe7e896a9f41e75eeb036c7986888b2b19d06642e1","observation_id":"af45f266-bf12-4f4b-8d4c-88b9a904e7be","resolution":{"observed_at":"2026-08-06T13:24:36.249885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:35.988464Z","title":"Better aggregation in test-time augmentation","venue":null,"work_id":"5b5f672c-d91f-4513-ae56-63744653bac1","year":2021},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:28.519677Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:955fe4b2938a356b93e952096ac3422df8d01fad694a1c6db805d4372d7c077a","observation_id":"f7ab43a7-705a-400e-92ea-0d19b46e369c","resolution":{"observed_at":"2026-08-06T13:24:36.097862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:35.872730Z","title":"A mathematical theory of commu- nication","venue":null,"work_id":"034617b8-540a-42a2-afe7-87cec52f23a0","year":null},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:28.634597Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:de14e57c6e7422be18dfb506f40782dd3c6d00be440376853f1b1fcc43216750","observation_id":"ffb19ff6-108c-4007-954d-feb8189ad7d3","resolution":{"observed_at":"2026-08-06T13:24:35.925906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:35.757020Z","title":"Looking similar sounding different: Leveraging counterfactual cross-modal pairs for audiovisual representa- tion learning","venue":null,"work_id":"f9753d7e-2207-40eb-866a-cfc2b88ca31d","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:28.704904Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:b0c7141889d60ac003d7a7ba34e436346b8fdd72b3c1638a5db03cb486d23b4a","observation_id":"99535a89-fd96-4c7c-bd56-9077b0df0bef","resolution":{"observed_at":"2026-08-06T13:24:35.804483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.02236","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:31.513729Z","title":"3d audio-visual segmentation","venue":null,"work_id":"d94fd790-daf1-4e22-a5a1-65e096564bb4","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:28.777772Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:c96e2a6b0957deb1cc176e020e8c171c9d607774b6d9454640ec330d6a001bb8","observation_id":"23110967-391c-4226-986c-db595b6da29e","resolution":{"observed_at":"2026-08-06T13:24:31.614704Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:35.640444Z","title":"Unveiling and mitigating bias in audio visual segmentation","venue":null,"work_id":"036ae61b-53f3-4a56-b1de-1dd3c902b6bc","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:28.858392Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:a49c9d072a8c4c9e73b95a31fd82e1b77d3a594f883ab8dab6ffb51eb4b3544a","observation_id":"e2a02759-95dd-43e7-ac93-50bfdd89d177","resolution":{"observed_at":"2026-08-06T13:24:35.702149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:35.517750Z","title":"Learning audio-visual source localization via false negative aware contrastive learning","venue":null,"work_id":"08bc6d48-cf1f-451c-8a9c-e76383aafd28","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:28.979464Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:a9c0b2371002d38c7e0acf00176b4356b0b00bbb0d28092128de0e4758a5cbf0","observation_id":"15377690-589c-47c1-8b04-87f7639ab53a","resolution":{"observed_at":"2026-08-06T13:24:35.572731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:35.319351Z","title":"Language-guided audio-visual source separation via trimodal consistency","venue":null,"work_id":"c9a61440-5c4b-4905-a695-e604d2c7b02a","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:29.061286Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:3a577b619a4df496bb7375b7017ee1ba4876d450c2a66abb20f181fe362bec10","observation_id":"2515ccf1-998f-4f4d-ac57-f3a328a0e817","resolution":{"observed_at":"2026-08-06T13:24:35.417838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T13:24:29.167740Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:29.167740Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:20e97e0c87a1631680f94134fdecdfbad778c4f6f4b835413ce09642649640a5","observation_id":"0c2e86cd-6ec9-4654-a9a2-c8867e76ca0a","resolution":{"observed_at":"2026-08-06T13:24:29.167740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:35.139668Z","title":"Neural discrete representation learning","venue":null,"work_id":"5e0ee349-a031-460c-8294-e5bcbb6e7d8a","year":2017},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:29.269444Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:11151eeaf71d1000d2a8f562f9572fb15a2967761f40971f9624e168a5519d99","observation_id":"8a2ca42f-3d2f-4d93-a5d3-fb2d02c7faac","resolution":{"observed_at":"2026-08-06T13:24:35.232776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:34.904825Z","title":"Counterfactual cycle-consistent learn- ing for instruction following and generation in vision- language navigation","venue":null,"work_id":"a601ea1e-97d8-4f7b-8537-633905e5b8e3","year":2022},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:29.340354Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:61222f4051f3a4f547301fd4a26fdc612ba08d5c474bd08d21a52573dc0177a8","observation_id":"f2efaf7a-148a-4976-ac2b-eb2b10eaeb84","resolution":{"observed_at":"2026-08-06T13:24:34.985658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:34.707738Z","title":"Vision-and-language naviga- tion via causal learning","venue":null,"work_id":"914d7e42-40b9-4e62-b391-85109cdbb872","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:29.450485Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:5b0606f13675deae194bb6f34da8bf351394f65611ea11b25e958d5e68b84aab","observation_id":"dfe75355-433d-4e55-8086-5c7bb61ea5b4","resolution":{"observed_at":"2026-08-06T13:24:34.817968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T13:24:29.575827Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:29.575827Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:4672d3b96155bc9cb5ba770b4a353873a3968626b54d20d952f90dae670a3148","observation_id":"6b0363dd-d240-4a07-b11c-99257ee012d2","resolution":{"observed_at":"2026-08-06T13:24:29.575827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:34.522551Z","title":"Pvt v2: Improved baselines with pyramid vision transformer","venue":null,"work_id":"d0f08dc3-ee13-492a-817c-f86f6d14cb57","year":2022},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:29.651671Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:8bdfd6f5fe721f89d79d2473e22e8dca5b85dcf8a204d472395b6b79ab2bb07d","observation_id":"57326a31-7fed-419a-9e03-f04f782c88ca","resolution":{"observed_at":"2026-08-06T13:24:34.591109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:29.738949Z","title":"Drivedreamer: Towards real-world- drive world models for autonomous driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:29.738949Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:5578f7a2a2b1919024b04eff48767004ed99a68c34515d33d5feab2dd59d94f3","observation_id":"2d8e8a11-5f77-4b10-8d4c-a21c080864b3","resolution":{"observed_at":"2026-08-06T13:24:29.738949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07929","last_updated":"2024-02-02T08:02:35Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-13T05:43:35Z","title":"Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer","version":3},"cited_work":{"arxiv_id":"2309.07929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.07929","snapshot_observed_at":"2026-08-06T13:24:31.297834Z","title":"Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer","venue":"cs.CV","work_id":"4edfe677-ba82-47dd-ba87-f3a17568e05c","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:29.839727Z"},"links":{"cited_paper":"/paper/2309.07929","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:d90f70ba0516a00aa874143941386129170b254cd472e28f601dd2acb86739dd","observation_id":"b00d8a91-7e04-44c4-be8e-414d4a62e7f1","resolution":{"observed_at":"2026-08-06T13:24:31.372411Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:34.310519Z","title":"Prompting segmentation with sound is gen- eralizable audio-visual source localizer","venue":null,"work_id":"d328d581-26e9-4c51-bbbb-f7de94bb314b","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:29.911767Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:b232d432a50bcaec61cb8604c9bd9ab2dffdeb2dda1ec6bb88f6694d7047b4cf","observation_id":"d84413af-577e-40c0-bc13-1a6e731270b3","resolution":{"observed_at":"2026-08-06T13:24:34.366851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:34.138277Z","title":"Can textual semantics mitigate sounding object segmentation preference? In European Conference on Com- puter Vision, pages 340–356","venue":null,"work_id":"f0c86d9a-095f-441f-9717-074eefff9a54","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.002229Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:0ba5740e81f550a51a46d8284d0aecde4bb26b4be58e90af0098594b912fbeb3","observation_id":"2e1162cf-9d17-4e68-b0cc-8e8d71258c23","resolution":{"observed_at":"2026-08-06T13:24:34.206530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:33.987290Z","title":"Large-scale con- trastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":"55a45035-e8da-4133-9598-7375fbf3d41b","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.078314Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:1a868441680c06948b86526953d6468d6854af53c6ee702a4e2f309ef0f4aa25","observation_id":"145afdec-8d79-44d4-a233-1db959720e1c","resolution":{"observed_at":"2026-08-06T13:24:34.033283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-04T06:58:39.755482Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-08-06T13:24:30.193705Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.193705Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:70da2cf0f87433fce341599466e0438e4ef29f7bb3a2013d8f701ecfbfc314b1","observation_id":"2f93e96f-c19c-41b4-8489-c070a09d9865","resolution":{"observed_at":"2026-08-06T13:24:30.193705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:33.828351Z","title":"Referred by multi-modality: A unified tem- poral transformer for video object segmentation","venue":null,"work_id":"838cdae0-a6f1-40e5-b950-3b6d10eff825","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.264676Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:4eccdec02f6419abc714f58f08f1e40100d7a7b6442b106a6e283e878412b03a","observation_id":"25e4326e-a60c-4e3f-b7ee-99d4bb643f4a","resolution":{"observed_at":"2026-08-06T13:24:33.919685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:33.696242Z","title":"Cooperation does matter: Exploring multi-order bilateral relations for audio- visual segmentation","venue":null,"work_id":"3279e9a4-dfc0-416f-91e8-30978ae5f494","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.395792Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:876f9ba260e2bfba296fb2a71cccc6fa7c3e257c9509864a6418abf817094459","observation_id":"5434c471-de08-4491-804c-0091f009c7c1","resolution":{"observed_at":"2026-08-06T13:24:33.757091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:33.550467Z","title":"Revisiting counterfactual prob- lems in referring expression comprehension","venue":null,"work_id":"1924f7bb-73f9-4220-8e75-9d356361ac57","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.482824Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:bfbd6232595623c717a01a675ce869177b5745d1baf184a247ef8f70015f298f","observation_id":"c1f36da8-5497-4e1f-9186-b2268aa953a2","resolution":{"observed_at":"2026-08-06T13:24:33.617230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:33.379006Z","title":"Losh: Long-short text joint prediction network for referring video object segmentation","venue":null,"work_id":"8b540de2-919a-4437-9bda-298cc0581ddc","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.591093Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:09ea38d2508fa702c7d274cc98f9bf4683508361a8248d15b4b11121c09b1eb3","observation_id":"fc20ea18-d27a-4797-a966-e1b8bd72dcee","resolution":{"observed_at":"2026-08-06T13:24:33.459830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:33.224228Z","title":"Discovering the real association: Multimodal causal rea- soning in video question answering","venue":null,"work_id":"67f409ce-b2f4-4334-adcd-2d936bcb1f51","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.648645Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:0dd5416c1141b5a2078e10221afe26ebce0bda04c4b8a1d049f4b89bde879536","observation_id":"9c325e08-f56f-4645-b594-f7a34b8e575a","resolution":{"observed_at":"2026-08-06T13:24:33.321674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:33.100721Z","title":"Weakly- supervised mirror detection via scribble annotations","venue":null,"work_id":"53567de1-77c5-4404-a4fd-1df7befff3c6","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.711366Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:afb6ebc9599b79f5469168793cffbc0c1cc5c4fd42b46077ace5c8e321e7a59e","observation_id":"de25b491-8657-4d1f-8b76-893d79779aad","resolution":{"observed_at":"2026-08-06T13:24:33.147692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:32.939210Z","title":"Heterogeneous experts and hierarchical perception for un- derwater salient object detection","venue":null,"work_id":"96e3f5a2-a2c8-4178-b36e-4a0bf6e82f7a","year":2025},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.787086Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:455f9cdf234a5b98e1e7057daa82483924dcfb631361bf3a0cb191e86f73d146","observation_id":"7410b16a-d8ab-4b01-b633-cbee76be50da","resolution":{"observed_at":"2026-08-06T13:24:32.969158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:32.818909Z","title":"Causal intervention for weakly- supervised semantic segmentation","venue":null,"work_id":"0de9321d-e143-4a67-bee6-555362d2bb6b","year":2020},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.860023Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:6db4606dc4265bd68ee8d4cb9e69b943bdcb39da234d6f6dd33270bcb70e24b1","observation_id":"5310ff46-d21b-4fc5-836b-00592f7203dc","resolution":{"observed_at":"2026-08-06T13:24:32.874213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:30.918766Z","title":"Audio–visual segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.918766Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:ec7c6606dd2658f17b35e62b881f33bb56eb01633faab281e87c963a7ea6b099","observation_id":"919094cc-387d-44d6-9e58-d36771852dd4","resolution":{"observed_at":"2026-08-06T13:24:30.918766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:32.516276Z","title":"Audio-visual segmentation with semantics","venue":null,"work_id":"be7ddabd-5da9-47bc-bf43-874df17c413c","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:31.109915Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:6f5571c51c81c8a30eb6dc8b8d82aa60f5099489f9a31fe7ef50a0afbf2502e5","observation_id":"ed7a1761-fd70-4dab-bcb5-a3e28308dedc","resolution":{"observed_at":"2026-08-06T13:24:32.591154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:32.366379Z","title":"Exploring pre-trained text- to-video diffusion models for referring video object segmen- tation","venue":null,"work_id":"74059f7c-b478-487b-abe8-7970fa0d3e1b","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:31.180804Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:bee6148d47092e2b145a90d33a7ba345650eb56f2f99f24fd5416dbf975c343e","observation_id":"cc711852-876c-4aff-83cc-ffd8923a2ae3","resolution":{"observed_at":"2026-08-06T13:24:32.424693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:32.647345Z","title":"2, 5, 6, 8","venue":null,"work_id":"cca018d8-7d87-4d09-8e60-c58ea0884051","year":2022},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":403,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:31.029697Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:57be4c5f1b8f324e64856750830183318ef0ec9a9160e0f76eb39855b80570f6","observation_id":"9abe49c0-d912-40e2-9f47-04af5b5e656a","resolution":{"observed_at":"2026-08-06T13:24:32.709159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T13:24:19.529284Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":6,"verified_fuzzy":58},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 0 inbound Pith citation observations for arXiv:2507.20740."}