{"as_of":"2026-08-09T17:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:966c2ae6e196fb89b73fe32c3b718a779fff3511e25f21d80edd04298792c601","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:41:36.060867Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.23623/citation-record","integrity":"/paper/2506.23623/integrity","json":"/paper/2506.23623/citation-record.json","paper":"/paper/2506.23623"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1609.08675","last_updated":"2016-09-27T21:21:49Z","snapshot_observed_at":"2026-08-06T22:24:48.588621Z","submitted_at":"2016-09-27T21:21:49Z","title":"YouTube-8M: A Large-Scale Video Classification Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08675","snapshot_observed_at":"2026-08-06T21:41:31.482657Z","title":"Youtube-8m: A large- scale video classification benchmark","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:31.482657Z"},"links":{"cited_paper":"/paper/1609.08675","citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:d9dd5f30e6b4304c5887aecc1f3a5ce4a0ff0d38f54850af5398c0b7d35ce90f","observation_id":"aa8f3d36-a08a-421c-8fdf-47fd3b0c4810","resolution":{"observed_at":"2026-08-06T21:41:31.482657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:41.957220Z","title":"Look, listen and learn","venue":null,"work_id":"e5683467-2320-4400-8c93-643eb026ee9b","year":2017},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:31.586701Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:59a267629db6d384090372246e70c33e2f5959c1c2f2c33bfcfbc93e85625fb5","observation_id":"23cd1ae3-f838-4f6e-bfd7-6a2f85723205","resolution":{"observed_at":"2026-08-06T21:41:42.024585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:41.698806Z","title":"Objects that sound","venue":null,"work_id":"5d600a71-e83b-4b58-b581-a2f5e456fa70","year":2018},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:31.716244Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:eb4a075fc1d1979551c22da1e46e0a8f1801b11bf848ef752aab7d6c8670207b","observation_id":"b1e50aeb-48e1-43bd-bf45-e4008fa20df0","resolution":{"observed_at":"2026-08-06T21:41:41.837097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:41.457059Z","title":"End-to- end object detection with transformers","venue":null,"work_id":"14708584-c09d-41f5-aefc-b0a80e10f9bf","year":2020},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:31.826333Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:f7a9be6cf940e6745abe3bdca0e2a9657991d17ed114c0ab6d1cc09939ace5d1","observation_id":"09f6cf4b-f046-4e8f-82c2-bc55882d4daa","resolution":{"observed_at":"2026-08-06T21:41:41.586720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:41.258109Z","title":"Unraveling in- stance associations: A closer look for audio-visual segmen- tation","venue":null,"work_id":"65748296-a08f-4d82-8762-4e65a3a89403","year":2024},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:31.913803Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:f43dbaed0968b40692b995995514c8857125ac9f801d3faf6300298c1d59033e","observation_id":"e5201e53-e6e6-48ff-ad7b-cea907d754ce","resolution":{"observed_at":"2026-08-06T21:41:41.337696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:41.122288Z","title":"Cpm: Class-conditional prompting ma- chine for audio-visual segmentation","venue":null,"work_id":"5d6b2e57-e1e7-4ef3-92f9-c1bf71122884","year":2024},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.030508Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:a6cbd9c6f27fcfd9bec0b8efad34ff87df279d01f2a2066b969bbee3f0a9e741","observation_id":"dc189158-aeb2-4d76-a8cc-187179750181","resolution":{"observed_at":"2026-08-06T21:41:41.167594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:32.108899Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.108899Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:6cc95056688b7bd73da69ee09c4fa54fc74adfafcd644b5f18d80c1d73de57f5","observation_id":"efcd098a-21a3-40c1-975d-f9d168260952","resolution":{"observed_at":"2026-08-06T21:41:32.108899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:40.992046Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"0af1e9e7-1041-4387-98c5-64d5978f5c1f","year":2009},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.261318Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:8a2dc2aa9cf30aa79910d753ccb19181c19b9f4498831b31a4fd1f07411d85e2","observation_id":"29abd25d-36ff-4733-a9bb-ffe5ea9ffba4","resolution":{"observed_at":"2026-08-06T21:41:41.074072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:40.835346Z","title":"Avsegformer: Audio-visual segmentation with trans- former","venue":null,"work_id":"651884d7-cac9-438b-b04d-97dff6525ab1","year":2024},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.343379Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:8fe8cfc23aebcb819fa06e1f3fd3c0bdea5869a6b114f81d9dcd6afbabfe4c22","observation_id":"7b0c203d-9e91-49f0-b601-91f4e7141e6a","resolution":{"observed_at":"2026-08-06T21:41:40.912430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:40.679611Z","title":"Improving audio-visual segmentation with bidirectional generation","venue":null,"work_id":"c3e7d49b-71d3-463e-a7f9-73b49cb9f475","year":2024},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.443820Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:82a4c16b5f5d80c96d34cc2b91beb04a9f4d8222687d81ef6e907fc4219c8449","observation_id":"e420913e-a1d9-40cc-af95-7490e3fdee29","resolution":{"observed_at":"2026-08-06T21:41:40.748513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:32.506980Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.506980Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:a9ae168439c29621a4218a340246ee1afd874c18d2c69305d97f93b18b9661ec","observation_id":"7361d6a7-0cd5-4279-9834-3c7393f42224","resolution":{"observed_at":"2026-08-06T21:41:32.506980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:40.539461Z","title":"Cnn ar- chitectures for large-scale audio classification","venue":null,"work_id":"65e2f35d-8985-432e-8adf-f53fa91bcf4f","year":null},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.603576Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:775722894378c734279c4e98bbacd44db531c2e19b4e502c0cbaf0267504fed6","observation_id":"ac069957-c7ae-472b-89a3-ad52f747f997","resolution":{"observed_at":"2026-08-06T21:41:40.594891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:40.403737Z","title":"Discriminative sounding objects localization via self-supervised audiovisual match- ing","venue":null,"work_id":"137b6051-0875-4ce8-ac78-09fe71925f83","year":2020},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.718372Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:4cd5e4947ad6df2bac921972a89e6e7e334a92bcd9bc4f86877f15e5aa08f5b0","observation_id":"8c3f7eca-2434-46e9-aab8-232ffd9aca7b","resolution":{"observed_at":"2026-08-06T21:41:40.463805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:40.266461Z","title":"Mix and local- ize: Localizing sound sources in mixtures","venue":null,"work_id":"3af87dfb-a17d-41f8-9090-5edb354e2fa8","year":2022},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.869256Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:3891246ed6af51486ad62d0b1754adc587a57b9876973c7fc810262016b999e9","observation_id":"c82fe159-1178-473d-aedb-5bb85bc7d67f","resolution":{"observed_at":"2026-08-06T21:41:40.333852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:40.103579Z","title":"Discovering sound- ing objects by audio queries for audio visual segmentation","venue":null,"work_id":"1b0b4659-d73d-45de-97e0-17cf97a5eb34","year":2023},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.959886Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:107dc393bd5429126a3d5a20e2a1a698e834e864089fefda4f2482d2f505fd91","observation_id":"40b57b97-ca7c-4cee-a191-ed46c83c5091","resolution":{"observed_at":"2026-08-06T21:41:40.186153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:39.954498Z","title":"Unleashing the temporal-spatial reasoning capacity of gpt for training-free audio and language referenced video object segmentation","venue":null,"work_id":"e66afb33-7d6d-4d62-b5a9-19d1093e5393","year":2025},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.072492Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:20abe6abcdf3621792059b62520d94fcdc754a15acb3a8062d04c085538dfe79","observation_id":"d25fb5fe-93bb-4656-9b93-1d1cff10c754","resolution":{"observed_at":"2026-08-06T21:41:40.040705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01144","last_updated":"2017-08-05T22:45:19Z","snapshot_observed_at":"2026-08-01T18:34:23.156273Z","submitted_at":"2016-11-03T19:48:08Z","title":"Categorical Reparameterization with Gumbel-Softmax","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01144","snapshot_observed_at":"2026-08-06T21:41:33.179277Z","title":"Categorical reparameterization with gumbel-softmax","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.179277Z"},"links":{"cited_paper":"/paper/1611.01144","citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:b3442f50f73d7b61a523635f217c3552d7a54934d3794a12f294d9edef7d0868","observation_id":"ee624052-5cc3-4b98-9a52-18deccb58ea6","resolution":{"observed_at":"2026-08-06T21:41:33.179277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:39.817606Z","title":"Learning to visually localize sound sources from mixtures without prior source knowledge","venue":null,"work_id":"c013be09-549f-4fb3-bdba-4a431539dcb4","year":2024},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.309142Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:b577eb02baa6cf89aa9e162ea6a0003bd6a86dc3fa9c34ba475edc8b4d14f34f","observation_id":"41ad0a72-2ffe-45a9-aa0f-8e4e1e4ddf6f","resolution":{"observed_at":"2026-08-06T21:41:39.885616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:39.570650Z","title":"Segment and recognize anything at any granularity","venue":null,"work_id":"031bbe7e-56dc-45aa-9944-388e24236ab9","year":2024},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.391819Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:547398e4d59ef6d52e6366593cfb7eddb46e9361b8b6c11d3e694b271fa274a7","observation_id":"e0850671-1124-4d09-9b43-ad461b3e9f85","resolution":{"observed_at":"2026-08-06T21:41:39.711224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:39.273047Z","title":"Selm: Selective mechanism based audio-visual segmentation","venue":null,"work_id":"881eb9aa-cd12-43d6-b012-547f3b15ea00","year":2024},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.454380Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:3ff7330d3641e5c1ce7efcbccec93fefd2be151c72a2496f81d8689e8ab25b1c","observation_id":"557eaabc-3bc0-4ac5-b9b6-64bc4c705ff8","resolution":{"observed_at":"2026-08-06T21:41:39.412029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:38.978442Z","title":"Catr: Combinatorial-dependence audio-queried transformer for audio-visual video segmentation","venue":null,"work_id":"a5e4dd46-a12f-486d-b9e9-3893bfd06f7f","year":2023},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.511966Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:47802c92b47bd8d730118a62c1708e0f00327c48af64c0d19cc351a453f7bca6","observation_id":"594137aa-e7b9-45a3-b15e-c931e8c2cb97","resolution":{"observed_at":"2026-08-06T21:41:39.107211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:38.812125Z","title":"Qdformer: Towards robust audiovisual segmentation in complex environments with quantization-based semantic decomposition","venue":null,"work_id":"be148db5-8014-4620-90e0-89fcec64a521","year":2024},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.616815Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:0c70fa9942008caf8bfebd649733590225acca9107f9afb51d6cc028b3ff436c","observation_id":"bc2fa17b-80a6-4743-8d1d-ba532f346af0","resolution":{"observed_at":"2026-08-06T21:41:38.879380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:38.604792Z","title":"Audio-visual seg- mentation by exploring cross-modal mutual semantics","venue":null,"work_id":"e58ab521-861c-4794-844f-202d488b9395","year":2023},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.689305Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:2426919be6179c531d7a970ab709de4336b24f5aed507a1446ff411f0784d6fd","observation_id":"99edfce9-9f0a-4e00-8f3a-90cd10fa66f3","resolution":{"observed_at":"2026-08-06T21:41:38.688281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:38.494132Z","title":"Bavs: bootstrapping audio- visual segmentation by integrating foundation knowledge","venue":null,"work_id":"edc2dfa8-cfe3-4f8d-a9ee-b3bf135bef15","year":2024},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.782512Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:8bf55f26a2ec3f83da876cb6ee760b599c0fe5b8b9865aba32a4ee4edde2ae21","observation_id":"5fd01971-599b-4e35-8b0d-6118fd06e6f5","resolution":{"observed_at":"2026-08-06T21:41:38.542899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:38.386383Z","title":"Audio-visual segmentation via unlabeled frame exploitation","venue":null,"work_id":"51cc7865-5f3a-4a0c-914f-1fbc34d3185f","year":2024},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.936683Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:72e2d56372832970978ac239bfcde3da8dfd7b47ff2c527540cb469114c15721","observation_id":"5594549c-6997-45d0-be52-b6ec97324966","resolution":{"observed_at":"2026-08-06T21:41:38.423120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:38.172228Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"6e58192e-a5b6-4ec4-9910-720d9b8892f3","year":2021},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:34.086780Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:0d1caf09d4bc086da6698114626a6df4ae907ea57e20f69e2eef0f8b90391abd","observation_id":"64d8d45c-f16c-46e5-adc9-45f0bd51b49b","resolution":{"observed_at":"2026-08-06T21:41:38.281255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.997229Z","title":"Step- ping stones: A progressive training strategy for audio-visual semantic segmentation","venue":null,"work_id":"ea6485a2-ffb2-4004-8a3d-84077b404d63","year":2024},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:34.199767Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:cff9221cedfb6943fd061c16d7a3513139600784fd7e1c90465e7e0360e6a00c","observation_id":"f4a473fa-928b-4c7b-9581-f898b61efaf2","resolution":{"observed_at":"2026-08-06T21:41:38.056471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.00712","last_updated":"2017-03-05T16:59:44Z","snapshot_observed_at":"2026-08-05T03:48:52.905768Z","submitted_at":"2016-11-02T18:25:40Z","title":"The Concrete Distribution: A Continuous Relaxation of Discrete Random Variables","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.00712","snapshot_observed_at":"2026-08-06T21:41:34.318918Z","title":"The concrete distribution: A continuous relaxation of discrete random variables","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:34.318918Z"},"links":{"cited_paper":"/paper/1611.00712","citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:02a4ace52f439a34623daff9896362401701ae1872afb0a131f309c14ed0b8d1","observation_id":"93a05f2a-da34-4a01-a35e-c31f1cd5d779","resolution":{"observed_at":"2026-08-06T21:41:34.318918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.860949Z","title":"Multimodal variational auto-encoder based audio-visual segmentation","venue":null,"work_id":"089a13bb-a16c-4d10-8f63-fd1baa0bf980","year":2023},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:34.439115Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:0cd37cb4454547df18d7918139676f3a366ff8fb071c0657eb79494df84a4a4a","observation_id":"4a683ffc-aa9d-49a0-b4b7-9f8a1414b584","resolution":{"observed_at":"2026-08-06T21:41:37.924346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:34.565020Z","title":"V-net: Fully convolutional neural networks for volumetric medical image segmentation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:34.565020Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:70f5e26a504e2763d2fad89af1413adf31d2db63573efa264512fbc5dcd3d9e0","observation_id":"c896ac0a-91cd-4d05-8e86-02e4e2a07110","resolution":{"observed_at":"2026-08-06T21:41:34.565020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.696701Z","title":"Localizing visual sounds the easy way","venue":null,"work_id":"d2fde8e1-9980-4504-aabb-40abb52bb262","year":2022},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:34.644918Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:990120a16c63a384031f707f17a93c04ed8fbeef2b863e80dd1fa8fb4814a25f","observation_id":"12acaf33-1cc4-4f26-bc45-2b3916bb233d","resolution":{"observed_at":"2026-08-06T21:41:37.770885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10972","last_updated":"2021-08-05T15:04:28Z","snapshot_observed_at":"2026-08-06T21:17:51.553405Z","submitted_at":"2021-04-22T10:10:14Z","title":"ImageNet-21K Pretraining for the Masses","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10972","snapshot_observed_at":"2026-08-06T21:41:34.691781Z","title":"Imagenet-21k pretraining for the masses","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:34.691781Z"},"links":{"cited_paper":"/paper/2104.10972","citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:97a6867c6e2f5cb67af0bac67ab69b2b6679a5c8505eedbf7da5d6aa36a44b4a","observation_id":"61e08455-777a-485e-922f-b50865cd6976","resolution":{"observed_at":"2026-08-06T21:41:34.691781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.505193Z","title":"Learning to localize sound source in visual scenes","venue":null,"work_id":"72db210c-f4c0-4097-8e58-a17a84ab594a","year":2018},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:34.805399Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:5d2ee25b652dca88c2635b897d4f2a07e7ae96c2d6a56a8618a7f966f5160702","observation_id":"6e212d0b-4b98-4770-9859-b7f7d524c2a8","resolution":{"observed_at":"2026-08-06T21:41:37.584961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.388387Z","title":"Unveiling and mitigating bias in audio visual segmentation","venue":null,"work_id":"a32ffbcf-9798-449d-94dc-9b297bedf162","year":null},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:34.928705Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:718144e139aea26abfcef92be863627260f7930e05eb9fab005f682cd9ff04b3","observation_id":"8558b1c3-c7cd-4b42-a45b-986f175d4a75","resolution":{"observed_at":"2026-08-06T21:41:37.449932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.229051Z","title":"Attention is all you need","venue":null,"work_id":"6133c476-65f9-4ee2-b50a-f5af27fa8bc2","year":2017},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:35.049495Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:d71ba42651c33112ea97ce802e114cbee4993f9759f0b64cca19c3b1ce667bfb","observation_id":"4b9407e4-f987-47c8-bfa1-3e9993290f55","resolution":{"observed_at":"2026-08-06T21:41:37.325303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.088335Z","title":"Pvt v2: Improved baselines with pyramid vision transformer","venue":null,"work_id":"d441ed1d-6432-4d1a-b8e8-6a3284b64321","year":2022},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:35.197478Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:b12c975af5a0d181e1aeac94f6d47ec821cf76486467d46653e1a0f2a2aa48bb","observation_id":"4e5570ef-adf9-4359-b489-04f566873b41","resolution":{"observed_at":"2026-08-06T21:41:37.140744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.002334Z","title":"Prompting segmentation with sound is gen- eralizable audio-visual source localizer","venue":null,"work_id":"4d8f2b2d-20d9-4be8-9205-e0216b49f84d","year":2024},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:35.345607Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:ab3d3d86bbd742676b7d94493f43d9b548262a4138e24eab3983ddda289ccb04","observation_id":"68b63946-3b18-4703-a312-e51b8b6b3182","resolution":{"observed_at":"2026-08-06T21:41:37.040398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.898463Z","title":"Can textual semantics mitigate sounding object segmentation preference? In ECCV, 2024","venue":null,"work_id":"e79d02d7-b79a-477a-a82f-48269bd035c0","year":2024},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:35.461145Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:ce2d35542cadecebf9bb74b811eeb725c2de1154d642e76a3a3024b94050622f","observation_id":"654e324a-4466-4d0d-ba48-662b261e815e","resolution":{"observed_at":"2026-08-06T21:41:36.949566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.795237Z","title":"Language as queries for referring video object segmen- tation","venue":null,"work_id":"fb21b502-aaa5-4579-bac3-63aac978ebff","year":2022},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:35.561559Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:7703b2e07a9942c5f83afe20d5a280666eea4017f16223619ba93b1a5939aa42","observation_id":"1a3152aa-e2d3-4363-a01a-37eeae646bef","resolution":{"observed_at":"2026-08-06T21:41:36.839445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.685219Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":"5948886d-6925-4052-a406-2a4a427ab078","year":2022},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:35.688895Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:509bdb2206b2c634b716a870c2e1db3677d0769813c7a0423f351829b1637d03","observation_id":"694d6013-9516-4e6b-aefd-7e19eb6e14d7","resolution":{"observed_at":"2026-08-06T21:41:36.722606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.562756Z","title":"Cooperation does matter: Exploring multi-order bilateral relations for audio- visual segmentation","venue":null,"work_id":"895a6394-4ae1-4d30-bbca-eb58c0414e02","year":2024},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:35.826823Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:33b56aeef11e9f9662e1a7c6803f79e92b490aad3735eb2cc665030ba43a4461","observation_id":"7b97016a-c9d5-4421-b092-c2d49bdb3fca","resolution":{"observed_at":"2026-08-06T21:41:36.625618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03605","last_updated":"2022-07-11T10:30:29Z","snapshot_observed_at":"2026-08-07T03:38:32.486362Z","submitted_at":"2022-03-07T18:55:26Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03605","snapshot_observed_at":"2026-08-06T21:41:35.888288Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:35.888288Z"},"links":{"cited_paper":"/paper/2203.03605","citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:f9643f67e72c766a557b928279a96f7cbc317689bed3934be9e1a6a21d5019d3","observation_id":"8f542558-3947-4313-aae6-06267c83d111","resolution":{"observed_at":"2026-08-06T21:41:35.888288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.373639Z","title":"Audio–visual segmentation","venue":null,"work_id":"aa79080a-0419-47b1-af1c-528830d49112","year":2022},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:35.944156Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:ac41b270caf07990663714bdcbffa48b39624e8f9e17ba1957886d878adfea27","observation_id":"ae275b49-d7fd-433b-bef5-0c9faecb429b","resolution":{"observed_at":"2026-08-06T21:41:36.468244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.229992Z","title":"Audio-visual segmentation with semantics","venue":null,"work_id":"75f756e2-d020-4838-b76a-36d061247e6b","year":2024},"citing_paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:36.060867Z"},"links":{"citing_paper":"/paper/2506.23623"},"observation_digest":"sha256:9971a89b6cafaf6515f83b79fba7eb6ac731d78bcb8f1b8d5b2fcf79aaa96d5b","observation_id":"0970f7ae-fe0a-4f3b-9879-55ca2b4724c6","resolution":{"observed_at":"2026-08-06T21:41:36.314198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23623","last_updated":"2025-06-30T08:40:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T12:15:49.915840Z","submitted_at":"2025-06-30T08:40:36Z","title":"Revisiting Audio-Visual Segmentation with Vision-Centric Transformer"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":36},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2506.23623."}