{"as_of":"2026-08-07T15:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:551cb049b8db3390b6e05ef6ecce443239e2af3629e6925d440ae800ba33b36d","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:36:50.080336Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T02:20:34.568987Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T02:21:16.444115Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"cited_work":{"arxiv_id":"2506.21233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21233","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reme: A data-centric framework for training-free open-vocabulary segmentation","venue":null,"work_id":"6b71c9c7-bde1-4ca6-bd74-de0493a29342","year":2025},"citing_paper":{"arxiv_id":"2605.09090","last_updated":"2026-05-09T17:54:31Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T17:54:31Z","title":"Investigating Anisotropy in Visual Grounding under Controlled Counterfactual Perturbations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T02:20:34.568987Z"},"links":{"cited_paper":"/paper/2506.21233","citing_paper":"/paper/2605.09090"},"observation_digest":"sha256:d51590dc97fcf5d34955f5da602674bfaee9d672af3d95bebf61b2304183ee59","observation_id":"3514aca8-2c36-42e1-b4ba-e32671ab8a27","resolution":{"observed_at":"2026-05-12T02:21:16.446524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.21233/citation-record","integrity":"/paper/2506.21233/integrity","json":"/paper/2506.21233/citation-record.json","paper":"/paper/2506.21233"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T22:36:41.066792Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:41.066792Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:ff844ccde46132a487bb45139362a886906894eca4678a65423109613b76b7d2","observation_id":"cf7ffdbe-619a-4043-8f38-01740027583d","resolution":{"observed_at":"2026-08-06T22:36:41.066792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:41.205604Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:41.205604Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:d8bc2d2292a5f8468075ce44029114c2bd9d7787b67a85da71bedbf639520c8a","observation_id":"cd914686-f234-451d-9949-7d09c783182c","resolution":{"observed_at":"2026-08-06T22:36:41.205604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-06T22:36:41.378991Z","title":"Openflamingo: An open- source framework for training large autoregressive vision- language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:41.378991Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:59315569fc8cd0f24fe8a902a354bd9aba34b9d0b23233dc6b401e1fbb628949","observation_id":"74c5eecd-f12d-4c99-98b5-ff0aba3e3442","resolution":{"observed_at":"2026-08-06T22:36:41.378991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T22:36:41.542927Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:41.542927Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:e60428d7138a14ca0b60bd1be4362385371aa27675a4d147c91a00a20bbbd096","observation_id":"0baa2d50-c5a6-41f9-952a-5795148417ec","resolution":{"observed_at":"2026-08-06T22:36:41.542927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:41.772590Z","title":"Fossil: Free open-vocabulary semantic seg- mentation through synthetic references retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:41.772590Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:21a77afbb2c4320b7c1c8c5b640e8d34eb34da88d4ed1ba6d1416d03254b7e50","observation_id":"46710b7c-4fe9-49d9-82b9-dba06738be3b","resolution":{"observed_at":"2026-08-06T22:36:41.772590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:41.884696Z","title":"Training-free open- vocabulary segmentation with offline diffusion-augmented prototype generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:41.884696Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:b95cde3a49df227e318e822cd76a93dbec3eb747deadafec40e11905b1fcb450","observation_id":"333a0029-aa3a-4a3a-88b9-80e6799c5484","resolution":{"observed_at":"2026-08-06T22:36:41.884696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:42.039022Z","title":"Grounding everything: Emerging localiza- tion properties in vision-language transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:42.039022Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:250cfaf5b2a0397d38dc8ab45cbb1aeee5b0bff97ec28198c7be10346bdff0fa","observation_id":"d76d690d-d53b-4205-a2e2-7e76aedd0ed8","resolution":{"observed_at":"2026-08-06T22:36:42.039022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:42.213969Z","title":"Coco- stuff: Thing and stuff classes in context","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:42.213969Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:de3fd1c26fcb1dadabe3da5dc274eb54e7b37d6b47df3ef981d07596dc9059fe","observation_id":"9a8c96ff-c8a7-4241-b597-68eba597dd03","resolution":{"observed_at":"2026-08-06T22:36:42.213969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05095","last_updated":"2023-05-08T23:47:07Z","snapshot_observed_at":"2026-07-06T15:24:49.798924Z","submitted_at":"2023-05-08T23:47:07Z","title":"Less is More: Removing Text-regions Improves CLIP Training Efficiency and Robustness","version":1},"cited_work":{"arxiv_id":"2305.05095","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.05095","snapshot_observed_at":"2026-08-06T22:36:50.760616Z","title":"Less is More: Removing Text-regions Improves CLIP Training Efficiency and Robustness","venue":"cs.CV","work_id":"24b55893-7a0d-4deb-b0c5-29d814aee752","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:42.353046Z"},"links":{"cited_paper":"/paper/2305.05095","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:00c33ca6746970c6641da2d93e668e4e237ee6655548fff5f0b0fbf80e879037","observation_id":"94387481-f722-4ff7-b6d5-4a4d5bacff81","resolution":{"observed_at":"2026-08-06T22:36:50.840513Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:42.467394Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:42.467394Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:1bf91624925caedbfad0fbc99cbb0133940e1b723bf86364cfc4454fdb089336","observation_id":"ca4bd275-f430-4cc3-976a-6f1df19623e8","resolution":{"observed_at":"2026-08-06T22:36:42.467394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:42.530193Z","title":"Learn- ing to generate text-grounded mask for open-world semantic segmentation from only image-text pairs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:42.530193Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:2fec38362dfe1f2893283e452ece136b5a86f3298651a2881fab06e1e1e280c5","observation_id":"11b8a85c-faab-4680-9636-0f94aa33aa3f","resolution":{"observed_at":"2026-08-06T22:36:42.530193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:42.592388Z","title":"Exploring open-vocabulary semantic segmentation from clip vision encoder distillation only","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:42.592388Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:967f522be440c92f4e575f5b17af96f02fcc87078b93e852172bfed95b65fc9e","observation_id":"67565dd0-a3ce-4640-8fa7-5b9562b3ecc1","resolution":{"observed_at":"2026-08-06T22:36:42.592388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:37:01.137571Z","title":"Cat- seg: Cost aggregation for open-vocabulary semantic seg- mentation","venue":null,"work_id":"a77b9ed6-b523-437e-a354-17c2f4cd9444","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:42.654833Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:3bc06fecaebae7c1060bf777d0f43281d030b9564099642d9db45289b9765bbe","observation_id":"adb1df3d-4eeb-44cc-af5b-64b414e4d944","resolution":{"observed_at":"2026-08-06T22:37:01.189272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:42.720357Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:42.720357Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:0b2382e23670e2bf5127f277828e1f972c57cf65da13c98b45f44e01f6444884","observation_id":"f7b5927d-492a-4cb0-93ea-2e1a17daf067","resolution":{"observed_at":"2026-08-06T22:36:42.720357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03234","last_updated":"2025-06-23T17:41:29Z","snapshot_observed_at":"2026-07-06T18:10:12.621492Z","submitted_at":"2024-05-06T07:44:07Z","title":"A Reliable Framework for Human-in-the-Loop Anomaly Detection in Time Series","version":4},"cited_work":{"arxiv_id":"2405.03234","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.03234","snapshot_observed_at":"2026-08-06T22:36:50.544438Z","title":"A Reliable Framework for Human-in-the-Loop Anomaly Detection in Time Series","venue":"cs.HC","work_id":"b0819419-1452-48e0-ba0a-cf657445c788","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:42.807218Z"},"links":{"cited_paper":"/paper/2405.03234","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:a1ad34c92770dd0076994963928f0688058b3bb6fd57aec3987c1cb5d9ecac4a","observation_id":"36ef914b-a060-49d1-a8ec-59918348b329","resolution":{"observed_at":"2026-08-06T22:36:50.628452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:37:00.993049Z","title":"De- coupling zero-shot semantic segmentation","venue":null,"work_id":"0876c6a6-578f-4ebb-82e0-0079a5fd31c5","year":2022},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:42.894928Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:ebef06b120457d57428253e5f38ff4f532f0d32b212051466a213d0a033d2bdf","observation_id":"2cd16033-0233-4c96-a8bf-3ba19040934a","resolution":{"observed_at":"2026-08-06T22:37:01.060369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:42.984185Z","title":"The pascal visual object classes (voc) challenge","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:42.984185Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:315d20a505f5597b625abfbf5f508d9441176388b52f5f8c47278fcc82b59837","observation_id":"6c908253-b44e-4cbb-ab13-92d2447b06f6","resolution":{"observed_at":"2026-08-06T22:36:42.984185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:37:00.877110Z","title":"Scaling laws of synthetic images for model training","venue":null,"work_id":"c6bcb99b-9455-4f67-9eeb-b7b31f3f6c7f","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:43.072377Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:19fe0a6b9f6d6385435eaeeeb70aea75aff930a51cd5d85d2e12d3d15912629b","observation_id":"3892d368-a669-48c5-8cf8-0a505b637656","resolution":{"observed_at":"2026-08-06T22:37:00.928416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:43.164983Z","title":"Data filtering networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:43.164983Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:8f4b4b5ff603c8e8ded9659ef87a9d9daaf17548e4f032ca52c26b6359467e92","observation_id":"311b996a-43aa-43ef-a8a4-b2df7c035b97","resolution":{"observed_at":"2026-08-06T22:36:43.164983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:37:00.747932Z","title":"Efficient graph-based image segmentation","venue":null,"work_id":"1f39288d-8c88-4774-918f-5a277052d41b","year":2004},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:43.252714Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:1b823584370cd139029ab6a7b8e03689f5ed85d1ae365244e3403b2f40340a14","observation_id":"954082e9-66ad-49e9-b105-1853337e8dfb","resolution":{"observed_at":"2026-08-06T22:37:00.809896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:37:00.594593Z","title":"Dat- acomp: In search of the next generation of multimodal datasets","venue":null,"work_id":"8572247f-61bc-4929-942a-1a7b21adceec","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:43.328155Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:e9f4fa6d0fe3ab9ff577c76b8b44a072df4091ac26adb5707a617e8b7036f942","observation_id":"d803ab9f-f081-4f38-9ce5-14389720d6f7","resolution":{"observed_at":"2026-08-06T22:37:00.656979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:37:00.445376Z","title":"Scal- ing open-vocabulary image segmentation with image-level labels","venue":null,"work_id":"06f6e806-2573-4985-bbd8-e46b38cbafbf","year":2022},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:43.405581Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:8972f3c78191ac6bf7e95ff271436887e4818c1f7f2640178c687bb533ea41a8","observation_id":"4ed156c9-1ccd-4c66-85a5-d6259b2ed1a4","resolution":{"observed_at":"2026-08-06T22:37:00.515245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:37:00.310506Z","title":"kNN-CLIP: Retrieval enables training-free segmentation on continually expanding large vocabularies","venue":null,"work_id":"3cd49384-1755-48f5-b5a7-9ff521690d47","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:43.488587Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:802628325673f9bad6084c1ff931ae507c44b03769420a9ec7a896316be7f980","observation_id":"b4d3db01-e840-4138-8b42-31e5b166fbfd","resolution":{"observed_at":"2026-08-06T22:37:00.375826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:37:00.178729Z","title":"Robustifying token attention for vision transformers","venue":null,"work_id":"eb3be745-f5d8-4b6d-b17c-74f51df6a7f7","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:43.577378Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:224e19550c3c4d5d567c506660b0ddb9f5bfc2eab5350ab2f7efbfeba2a32383","observation_id":"52935343-e4da-4be0-84d9-3be0fb9dea9c","resolution":{"observed_at":"2026-08-06T22:37:00.241465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08181","last_updated":"2024-09-16T20:11:48Z","snapshot_observed_at":"2026-08-06T11:06:50.565282Z","submitted_at":"2024-04-12T01:08:04Z","title":"Pay Attention to Your Neighbours: Training-Free Open-Vocabulary Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08181","snapshot_observed_at":"2026-08-06T22:36:43.675722Z","title":"Pay attention to your neighbours: Training-free open-vocabulary semantic segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:43.675722Z"},"links":{"cited_paper":"/paper/2404.08181","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:36340aef8e7f24f68a6f61841533079738926a9b82def543848cc2f6f988ac94","observation_id":"eb7229ce-55a5-423c-acd2-5a7a34c4a8ca","resolution":{"observed_at":"2026-08-06T22:36:43.675722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:43.732948Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:43.732948Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:a53c3991b892176e2e9b16efbf0b4dcc6746b4869cb36f37557649f68f0182a8","observation_id":"9a0960c0-ee4f-45ec-9e1f-9e051843e8e3","resolution":{"observed_at":"2026-08-06T22:36:43.732948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:59.997065Z","title":"Diffusion models for open-vocabulary segmen- tation","venue":null,"work_id":"4a687074-0255-4705-802c-8044b33b0867","year":2025},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:43.846052Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:b4fdbd7dc0d0467f3ab400272bc62c2e7d42285aee7809b77fc5a11e06262011","observation_id":"8a30cfe1-fe1a-4f29-a0aa-658120423536","resolution":{"observed_at":"2026-08-06T22:37:00.075626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:59.847284Z","title":"Segment any- thing","venue":null,"work_id":"428d23ab-6c1e-4bb7-935f-4c95a22e75f1","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:43.914741Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:4a01e16445dabf5691e6588fd95158e50879471b10bf110c2192c3b41ba9003e","observation_id":"f8a112ce-fa41-4054-8fa9-ca0fdae66fbe","resolution":{"observed_at":"2026-08-06T22:36:59.927219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:59.723092Z","title":"Efficient inference in fully connected crfs with gaussian edge potentials","venue":null,"work_id":"cb5df445-6b7e-4a9e-90d3-30424d629ee9","year":2011},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:44.018955Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:1e49676b083c7377a829e62345d82343d099641c934525129a73820c1d75f61d","observation_id":"3b4bf006-a2cb-4476-9dc6-33e3c00841fa","resolution":{"observed_at":"2026-08-06T22:36:59.783055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:59.571036Z","title":"LISA: Reasoning segmentation via large language model","venue":null,"work_id":"028851ee-75d9-4b7c-a956-bb27591d8bb3","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:44.138088Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:807099ce7b6077d41fc4207be7ac5a3d793e1d8ca88640378142ebbdab5ad47e","observation_id":"81b4d717-c583-40c0-92f1-222e9f679150","resolution":{"observed_at":"2026-08-06T22:36:59.634942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:59.402675Z","title":"Veclip: Improving clip training via visual-enriched captions","venue":null,"work_id":"30ff4ba6-1f88-43c4-a2a1-53d0eee1dcc2","year":2025},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:44.250058Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:816120d3db36218d1f52a0950d65c8f0386eb6210cc706087187cacd46c643fa","observation_id":"dfe96d18-2965-425a-adf8-a6fc94efafe6","resolution":{"observed_at":"2026-08-06T22:36:59.488442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:59.222856Z","title":"Proxyclip: Proxy at- tention improves clip for open-vocabulary segmentation","venue":null,"work_id":"b01747ba-f5b0-4c9a-aee0-a063892d77cc","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:44.346562Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:3b54d9e291a6fee50402cc9626962eb31eb568185c0fe46ede69d6823e78a483","observation_id":"4c8af45d-efa0-401f-93b7-9205e54e89c1","resolution":{"observed_at":"2026-08-06T22:36:59.303421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07547","last_updated":"2024-09-03T03:20:54Z","snapshot_observed_at":"2026-08-01T05:15:36.171789Z","submitted_at":"2023-04-15T12:52:23Z","title":"TagCLIP: Improving Discrimination Ability of Open-Vocabulary Semantic Segmentation","version":2},"cited_work":{"arxiv_id":"2304.07547","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.07547","snapshot_observed_at":"2026-08-06T22:36:50.324873Z","title":"TagCLIP: Improving Discrimination Ability of Open-Vocabulary Semantic Segmentation","venue":"cs.CV","work_id":"f281c577-263f-4d20-898c-4e7a2a3c344b","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:44.403622Z"},"links":{"cited_paper":"/paper/2304.07547","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:6c74be54fcef3e263ac25d608c09e171d29ba2ac87b74204b63719cd2dc6423f","observation_id":"331b762f-f057-49cd-a03f-10158e0fe608","resolution":{"observed_at":"2026-08-06T22:36:50.395037Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:59.049679Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"460272b2-c05b-48e8-922d-b4d3b488a2f4","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:44.480509Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:9552cd8d79d5857554ce758915b6dcbd933ed10c6510566ce2df4cf51a7bc77a","observation_id":"180ecf60-04bc-4158-8db5-28f171710624","resolution":{"observed_at":"2026-08-06T22:36:59.128591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05653","last_updated":"2024-09-16T09:10:00Z","snapshot_observed_at":"2026-07-06T15:14:44.015806Z","submitted_at":"2023-04-12T07:16:55Z","title":"A Closer Look at the Explainability of Contrastive Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05653","snapshot_observed_at":"2026-08-06T22:36:44.502984Z","title":"Clip surgery for better explainability with enhancement in open- vocabulary tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:44.502984Z"},"links":{"cited_paper":"/paper/2304.05653","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:e8da8b7c2b63e3e653db84491033fab591223d91827d4af6de98908424cf6412","observation_id":"8beec294-3051-4213-8b55-992b160f942d","resolution":{"observed_at":"2026-08-06T22:36:44.502984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:58.896504Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip","venue":null,"work_id":"90f29e24-40aa-4e22-bc97-676eecd2d228","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:44.507435Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:43d210e1238d5878836a7ba9a43e80e113f910be478e18e9e35157cfa2d5fe26","observation_id":"16dbde27-7b52-4aa6-9434-a11135ffa506","resolution":{"observed_at":"2026-08-06T22:36:58.953216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:58.725751Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"3054b17c-ba56-46e2-960d-02f71eb5d8fc","year":2014},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:44.585617Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:43d7e3dcdc625c6f0ff09f6b36b6c5b6bfb8e71b265f2f64fc4f695b86d61bce","observation_id":"3a351e8b-0260-4233-8d10-03e5542bf1ab","resolution":{"observed_at":"2026-08-06T22:36:58.792576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:58.590340Z","title":"Visual instruction tuning","venue":null,"work_id":"a564689d-02fe-4081-af4b-b9065d8b176c","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:44.721539Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:91e3a0165cc79b2741b21c7b69749459db9f74f5247a1420c7e7283dffa7a9e1","observation_id":"fba273c8-4571-4c9f-ba49-e2c19b85bc7f","resolution":{"observed_at":"2026-08-06T22:36:58.656534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:58.453649Z","title":"Segclip: Patch aggregation with learnable centers for open-vocabulary semantic segmentation","venue":null,"work_id":"ec085799-4fbb-42fd-bf2b-f0f2d574ebe5","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:44.901957Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:77a994a205ce2acf616fb4f1fef66c7663e0ab22f9a96bf7376bc0b0cecfb7f0","observation_id":"5125b102-0d7b-419c-8686-4989c1d9110f","resolution":{"observed_at":"2026-08-06T22:36:58.521702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:58.275847Z","title":"Emergent open-vocabulary semantic segmenta- tion from off-the-shelf vision-language models","venue":null,"work_id":"0bef801b-c961-4c46-9f70-dff6e04e5756","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:45.083381Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:4ecfd69cd902a88f7ecad49802a202a4248c2525abcc9422b0bee5f8f441b4d3","observation_id":"3b06323d-273a-437f-9e1a-03618052a566","resolution":{"observed_at":"2026-08-06T22:36:58.342445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:45.286587Z","title":"Sieve: Multimodal dataset pruning using image captioning models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:45.286587Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:043f6f6aec156bdfbaa9a7c3dc14122b02da1a32820d9d453948b7b28f3bddfe","observation_id":"6002662a-966c-4168-9b96-2978718d2b6e","resolution":{"observed_at":"2026-08-06T22:36:45.286587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:58.055450Z","title":"Towards interactive 3d surgical scene reconstruction: An incremental training and monitoring framework","venue":null,"work_id":"1e2f3ff7-ca82-4e9c-aee8-ec40d5c36441","year":2025},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:45.463478Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:2fcba1e4b1a3b182b3eed9891ec4c1a48c48817cd6b94b6160c9379395066c56","observation_id":"c9af95e9-08f0-48e3-9e2e-054a974cf749","resolution":{"observed_at":"2026-08-06T22:36:58.156005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:57.855457Z","title":"The role of context for object detection and semantic segmentation in the wild","venue":null,"work_id":"8304d5f0-27df-47c8-b2dd-954391c2e270","year":2014},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:45.669187Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:e568bb4afd08729594a8d18ac9c5a9aabd8ff6c25358505a3f50c97247b3f7c4","observation_id":"8a6d29d4-e7ac-489b-9ecb-07effd638e79","resolution":{"observed_at":"2026-08-06T22:36:57.944191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:45.814609Z","title":"Open vocabulary semantic segmentation with patch aligned con- trastive learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:45.814609Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:77dc5c331600df071887b610a1a7ecb31fce0436ca0762609148d09ecf83eb31","observation_id":"7bd015a8-43b4-4111-8c61-7c5e69ec2db0","resolution":{"observed_at":"2026-08-06T22:36:45.814609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:57.636758Z","title":"Dataset diffusion: Diffusion-based synthetic data generation for pixel-level semantic segmentation","venue":null,"work_id":"b937c48d-77aa-4e4c-b845-2b4214870b03","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:45.894499Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:be7dc025ad131cfa744d374e19b7fb01cc899d6306f5213d308d109efe1192b7","observation_id":"1244d5a0-8689-405c-8415-f8912b86acd7","resolution":{"observed_at":"2026-08-06T22:36:57.735661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:57.436390Z","title":"Improving multimodal datasets with image captioning","venue":null,"work_id":"dd8d6383-eb69-406b-a645-f73ffa52bc5e","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:45.934377Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:87ef170a89ee1b11413ee26ca4729ab728882731e6e3095311a603f1b91f1cc3","observation_id":"66d335a9-8cfd-46e8-94e4-e5ba3e893868","resolution":{"observed_at":"2026-08-06T22:36:57.525846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:45.975908Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:45.975908Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:349f1bd8fb62e5bb39831b4dd70aa4ab7c44ea3d473688d10c1d119a654bdd59","observation_id":"9e61ecd3-404d-4af5-83fe-7fb003037fd8","resolution":{"observed_at":"2026-08-06T22:36:45.975908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-06T22:36:46.053309Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:46.053309Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:44d63d4495c704357b1f2aa361038c9b9f47eee27895632c0fd2ab434d65fa04","observation_id":"93041323-ebb8-40c9-bbec-e1bfeb8885e8","resolution":{"observed_at":"2026-08-06T22:36:46.053309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:57.181438Z","title":"and et al","venue":null,"work_id":"59153a29-31c7-42e7-b18a-6340c82a30fa","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:46.167118Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:a4bbb5f81e65fa9dca51f843db9279a9958fa1bcc083682fe768d4e4f6d94e27","observation_id":"abd72d5f-9ef4-41b9-a29a-cad84a9053a0","resolution":{"observed_at":"2026-08-06T22:36:57.281898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:56.980873Z","title":"Filtering, distil- lation, and hard negatives for vision-language pre-training","venue":null,"work_id":"e9022aa5-02ca-48cf-86b9-55b7b9f4cf15","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:46.264276Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:f69a201343f0fb413d062cdf5f722e2a12f975caffb3c00fda6a515d8b11ae89","observation_id":"603d34ca-b464-4b79-affb-fcec8c418b06","resolution":{"observed_at":"2026-08-06T22:36:57.070655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:46.359825Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:46.359825Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:c9444e7b14fa473945ab578b3ea0a8f960c40effcaaf4f5e424648cd7bd0612b","observation_id":"c5de6fb1-fd74-4917-a404-c71029f69adb","resolution":{"observed_at":"2026-08-06T22:36:46.359825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-06T22:36:46.497678Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:46.497678Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:334e6a8251faa3c96155118dc51677107ce1c53130c6b55c39e7c7282a66489f","observation_id":"54d4afd6-97ee-4556-b348-9bb92f1b3abe","resolution":{"observed_at":"2026-08-06T22:36:46.497678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:56.800746Z","title":"Zero- guidance segmentation using zero segment labels","venue":null,"work_id":"2528773a-0908-4bb4-a49e-435e21fd39fb","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:46.587155Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:98f3646801af65803bb0e73031f361b680653a86310c8f1b6ead7c7da4746dfa","observation_id":"bcdc1e21-0cc8-4230-8e0d-5325b9b5e63a","resolution":{"observed_at":"2026-08-06T22:36:56.869198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:46.686677Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:46.686677Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:dab796ee65f2effe99e1b082e3d0a6cdff3a3ab1d3129adc85670b5f4096b44e","observation_id":"37ebec69-623b-43d2-8dd3-50d2be1383ee","resolution":{"observed_at":"2026-08-06T22:36:46.686677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-06T22:36:46.806895Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:46.806895Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:3de40553ccda53e562efe6fb169b9ffff734299c3fdc9dd5a0f1ff609a534cc0","observation_id":"e32bfd97-c36c-496f-ad7a-5c05f34c0968","resolution":{"observed_at":"2026-08-06T22:36:46.806895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:56.577667Z","title":"LAION-5b: An open large-scale dataset for train- ing next generation image-text models","venue":null,"work_id":"b51c1245-8e04-462f-933b-4955485a6656","year":2022},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:46.923658Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:2161e5e74a5c9c437802a35ef2f9a5db3b57bce63602d1a111b045c3d8af1c26","observation_id":"700574c9-37fb-49ba-8225-ed76d2ca434e","resolution":{"observed_at":"2026-08-06T22:36:56.707483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08268","last_updated":"2024-07-11T08:12:16Z","snapshot_observed_at":"2026-08-03T11:41:23.844997Z","submitted_at":"2024-07-11T08:12:16Z","title":"Explore the Potential of CLIP for Training-Free Open Vocabulary Semantic Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08268","snapshot_observed_at":"2026-08-06T22:36:47.017637Z","title":"Ex- plore the potential of clip for training-free open vocabulary semantic segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:47.017637Z"},"links":{"cited_paper":"/paper/2407.08268","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:cfe69fe10dcc9f0836ea25d021c2c45c8c9f5b8152589bb1f81bb04e27ee9312","observation_id":"1d84a963-fb5e-4ca1-9e78-8e53df002a54","resolution":{"observed_at":"2026-08-06T22:36:47.017637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:56.389093Z","title":"Reco: Re- trieve and co-segment for zero-shot transfer","venue":null,"work_id":"8c55b9cf-a6cc-4f57-bb8a-6ff56a722b6c","year":null},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:47.128137Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:ef8a21f25bfb63b5c6050201df1cbc3b67237c4672693455e0fd3569f1c690aa","observation_id":"c4f2a0fe-8c59-4474-ba13-cc2f43d14b0d","resolution":{"observed_at":"2026-08-06T22:36:56.491432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:56.200666Z","title":"Is synthetic data all we need? benchmarking the robustness of models trained with synthetic images","venue":null,"work_id":"60c0d94f-f1a6-41c1-994d-b24e57a85736","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:47.268929Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:a82e1327b1f3cadbbd1b5c2789d2f040da8ed8467daf381ac2ff598482467654","observation_id":"e0a010d1-d229-44bd-8efa-cee0425f0b95","resolution":{"observed_at":"2026-08-06T22:36:56.304317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:55.931540Z","title":"Clip as rnn: Segment countless visual concepts without training endeavor","venue":null,"work_id":"ad4d661d-2c78-48ab-992c-38533ade1633","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:47.348154Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:c4ca8c9bfd031598c2acbe00623a382e0a1ed3f4c95d1fe48fafa50d20b8f344","observation_id":"83d77fd3-a0b2-479b-8ae2-36eb0da908ac","resolution":{"observed_at":"2026-08-06T22:36:56.055550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:47.455196Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:47.455196Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:00f7b82edfeed6dce010fed73f71bae53ecce8edceb386087b713a099bb4856f","observation_id":"02be3e0b-e9bd-4d43-8b88-6728f84301b6","resolution":{"observed_at":"2026-08-06T22:36:47.455196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:55.664094Z","title":"Sclip: Rethink- ing self-attention for dense vision-language inference","venue":null,"work_id":"e2a62460-21aa-425d-88fe-ffa48ec4ac18","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:47.584694Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:007f209c4c2d970218c0185ac235239f8700079c35ca01589e9865b07ca110fe","observation_id":"5f87a123-372f-44e3-9c41-ef8a0c82ad77","resolution":{"observed_at":"2026-08-06T22:36:55.766792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:55.450790Z","title":"Sam-clip: Merging vision foundation models to- wards semantic and spatial understanding","venue":null,"work_id":"250c9651-541e-4af1-a84c-284534d6c877","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:47.680065Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:cbc2a37d8213d2c505da8607ea58c3065a6cee27e3bffdb8deeee3599129be92","observation_id":"41427905-8526-4e77-8d91-442d53537a6f","resolution":{"observed_at":"2026-08-06T22:36:55.549572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02773","last_updated":"2024-01-22T07:18:55Z","snapshot_observed_at":"2026-07-06T16:15:04.496291Z","submitted_at":"2023-09-06T06:31:08Z","title":"Diffusion Model is Secretly a Training-free Open Vocabulary Semantic Segmenter","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02773","snapshot_observed_at":"2026-08-06T22:36:47.810899Z","title":"Diffusion model is secretly a training-free open vocabulary semantic segmenter","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:47.810899Z"},"links":{"cited_paper":"/paper/2309.02773","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:0b1f81bc235754130ab0e62ee3074c50e83de8b6b93ea769c556f825dba5c2b4","observation_id":"309c8087-76f6-409b-b9a7-1eeabbd38cb1","resolution":{"observed_at":"2026-08-06T22:36:47.810899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:55.238032Z","title":"Use: Universal segment embeddings for open-vocabulary image segmentation","venue":null,"work_id":"eb7a84f2-626b-489b-8fc7-65db9705bade","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:47.971184Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:130e5472831d5e0e775438080f3b8f10c631efc67c2c92009fc6edb4b45e4e3b","observation_id":"f5ff4a74-34cd-4f60-822d-7ff79976c443","resolution":{"observed_at":"2026-08-06T22:36:55.340583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:55.040096Z","title":"Image-to-image matching via foundation models: A new perspective for open-vocabulary semantic segmentation","venue":null,"work_id":"367645e0-e05b-4be5-b405-5c6839992e65","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:48.097496Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:03466a518f5726f854dc95d1dd8969e7b87e29745125710c7c98e5e60b112fc3","observation_id":"a4876ccb-0095-4a07-9b26-ce67a5934714","resolution":{"observed_at":"2026-08-06T22:36:55.129780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:54.879247Z","title":"Probabilistic pixel-adaptive refinement networks","venue":null,"work_id":"41c91342-fb05-4805-80c0-dddf12e24b1e","year":2020},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:48.256102Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:ca39b39d2931986d270d335a1f5520d55446c6ba912bf65dcc7c12700954f067","observation_id":"7c51c9f8-092b-4b3f-8468-bb066e5cb98f","resolution":{"observed_at":"2026-08-06T22:36:54.927224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:54.775528Z","title":"Image-text co- decomposition for text-supervised semantic segmentation","venue":null,"work_id":"0547094e-1a88-4a3c-a789-9c0d3ec763b8","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:48.365938Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:5ad1e1ca1f8d0786462cd5203cc89cfd32126b2228e3be4e58e5910df4b43a88","observation_id":"8eed80cd-4bf3-467a-b25c-edc5a6ed56c9","resolution":{"observed_at":"2026-08-06T22:36:54.827136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:54.573633Z","title":"Clip-diy: Clip dense infer- ence yields open-vocabulary semantic segmentation for-free","venue":null,"work_id":"871f13cc-8ace-4296-b526-0aea9a0d2a16","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:48.434137Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:4a8e04b9c056dc2545981fa428e127438286444e4145e2fb02c44a39c442ae16","observation_id":"a08aac2d-72b3-4835-91a3-5794fd848797","resolution":{"observed_at":"2026-08-06T22:36:54.664824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:54.298652Z","title":"Florence-2: Advancing a unified representation for a variety of vision tasks","venue":null,"work_id":"588a7e60-5a5d-4bd6-a989-7a7488a15286","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:48.528678Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:f6439e6c9c7e110240821b9218c665bff9da70392e692bcebb6a389aaf2cf515","observation_id":"b55d44bf-32a9-4afd-8a9c-0882d73331d5","resolution":{"observed_at":"2026-08-06T22:36:54.458882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:54.034669Z","title":"Rewrite caption semantics: Bridging seman- tic gaps for language-supervised semantic segmentation.Ad- vances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"93f6b965-b518-4354-ad13-d8f6250b8f09","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:48.616081Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:a78acd0ad848420965dae88b15c257d7b649a6e3f3bf808a3b2864e29bf58c7f","observation_id":"ab6c9639-e480-4eba-acce-1449f601e5fc","resolution":{"observed_at":"2026-08-06T22:36:54.145551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:53.843978Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":"e7f12fbf-cfde-40e6-8701-6b0b71e11cc9","year":2022},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:48.705840Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:1a30413578f6d3e513c3081e1af8afdd7a20b741be4adc0ca116ec23730ddada","observation_id":"4c496ad9-1609-4cde-9375-aa13bb9887fc","resolution":{"observed_at":"2026-08-06T22:36:53.906607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:53.674156Z","title":"Learning open-vocabulary semantic segmentation models from natural language supervision","venue":null,"work_id":"a48b0a0a-e1f3-4d48-a36a-d2ddf94fa7c5","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:48.798359Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:33664fe778952e2975a151f82358fbfaa2c9cba243dda1aef212fa8d2d872794","observation_id":"66b577f4-10ea-46e7-b8aa-7ebf025f3ec4","resolution":{"observed_at":"2026-08-06T22:36:53.753127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:53.499217Z","title":"A simple baseline for open- vocabulary semantic segmentation with pre-trained vision- language model","venue":null,"work_id":"dd4863ea-b8db-412a-aa2a-cc8f72f3b881","year":2022},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:48.888577Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:33bd05a622e10632644992353157f1ce0607a5866767e97914e0953412db3978","observation_id":"fc8ff5d2-783f-4225-87bb-08d2cd59cd79","resolution":{"observed_at":"2026-08-06T22:36:53.573724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:53.302954Z","title":"Side adapter network for open-vocabulary semantic segmentation","venue":null,"work_id":"edf7b696-0241-41c5-96be-940c14ebb484","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:48.982197Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:ee3ffe61423b625cf689259d064d7698df45c5798ec37de982571583bc7ee95d","observation_id":"be625883-898b-4e83-af6d-619f375df21b","resolution":{"observed_at":"2026-08-06T22:36:53.373398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:53.116060Z","title":"V AC-CNN: A visual analytics system for compar- ative studies of deep convolutional neural networks","venue":null,"work_id":"9e9da378-38ad-4b2a-8ecc-d421ccd8160e","year":2022},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.041654Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:6824f3c33eb50761cfdd5bf7ce3012cc5ef40dc518c331e3170bcf92e200ea98","observation_id":"ea1d4c6b-1f80-4025-be9e-86883b3755c0","resolution":{"observed_at":"2026-08-06T22:36:53.213445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:52.923211Z","title":"Suny: A visual interpretation framework for convolutional neural networks from a necessary and suf- ficient perspective","venue":null,"work_id":"33fc0467-0a89-41fb-b3a5-37bd48e748dd","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.112634Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:859bf9c5fd7a3f5b5fa63836761df723952e11647aa2e816831315c04aa33da2","observation_id":"1ec1d09f-238b-4f3f-a1b0-cbdf222634b8","resolution":{"observed_at":"2026-08-06T22:36:53.030841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:52.713792Z","title":"SLIM: Spuriousness mitigation with minimal human annotations","venue":null,"work_id":"da4544ff-9f61-4047-bf68-72b8f876d97d","year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.188623Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:89c817e6e7c394e27261832049a053f46ea42f865d4b75cd306ebb2d412c4bba","observation_id":"181d2d2a-36bf-4b86-81b6-42412eec4de8","resolution":{"observed_at":"2026-08-06T22:36:52.810813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:52.492539Z","title":"AttributionScanner: A visual analytics system for model validation with metadata-free slice finding","venue":null,"work_id":"a2c1d079-2c56-4825-bdef-a241213e0725","year":2025},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.284813Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:fdb3476e98b7aff2f4ed036cbf5b632d3351362509212cc877b55a57cd1f9cee","observation_id":"83e490e4-ce6c-4795-8c24-9696f3cb06e4","resolution":{"observed_at":"2026-08-06T22:36:52.601357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:52.214035Z","title":"VISTA: A visual analytics framework to enhance foundation model-generated data labels","venue":null,"work_id":"3d344a4a-acab-4d61-b104-504fdb15783a","year":2025},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.373969Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:ab528946974d366e699218ba24524989bfa723d1feed64b3cf3d2c718000c5a3","observation_id":"9e3cefe5-8395-4cb9-ae90-f0df2e3b1b36","resolution":{"observed_at":"2026-08-06T22:36:52.339810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:52.041159Z","title":"Vislix: An xai framework for val- idating vision models with slice discovery and analysis","venue":null,"work_id":"3014e12b-c866-4fcc-8c39-ed89bedf087e","year":2025},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.475679Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:025ebfe8f6cf15ee8ab2497267157fcfa98ad8073f7b748159e4198d7c456d0d","observation_id":"3c3e2c41-bf7c-44ba-beb5-881c22edc89f","resolution":{"observed_at":"2026-08-06T22:36:52.130422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:51.822840Z","title":"A simple framework for text- supervised semantic segmentation","venue":null,"work_id":"adb16458-3936-4290-9415-c2af90c26433","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.564221Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:c7dac64f1e2e95c0f455cdc59241ea93c416040b319bcfcf80a56fd874e8082b","observation_id":"d5d65c32-dd3d-42a1-86a3-778889d3e525","resolution":{"observed_at":"2026-08-06T22:36:51.956664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10086","last_updated":"2025-08-01T08:25:34Z","snapshot_observed_at":"2026-07-06T19:50:52.652955Z","submitted_at":"2024-11-15T10:14:55Z","title":"CorrCLIP: Reconstructing Patch Correlations in CLIP for Open-Vocabulary Semantic Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10086","snapshot_observed_at":"2026-08-06T22:36:49.685565Z","title":"Corrclip: Recon- structing correlations in clip with off-the-shelf foundation models for open-vocabulary semantic segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.685565Z"},"links":{"cited_paper":"/paper/2411.10086","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:274564aa4a37215bbb72fb14e20527937a321074829ec4a50be4c533fed7ce9f","observation_id":"5cba2281-be1c-4c55-9237-96172f817b4a","resolution":{"observed_at":"2026-08-06T22:36:49.685565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:51.648089Z","title":"Tip- adapter: Training-free adaption of clip for few-shot classi- fication","venue":null,"work_id":"b122c40f-ec3b-4bab-9fcb-99fd00bd0167","year":null},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.753856Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:3f7d0c2e3c0b86a95ff14d5dc8e5c10e8db41fbf145b44ac71198a7716565fcf","observation_id":"4fab9d7d-1604-42b9-98f8-480652ec23e8","resolution":{"observed_at":"2026-08-06T22:36:51.720728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:51.404221Z","title":"Labelvizier: Interactive validation and relabeling for technical text annotations","venue":null,"work_id":"431e9d68-7d97-45d1-b176-a1a8748d5b2d","year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.837476Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:644e8ed9731a8091a9438083b373be71eaf65d3cd8877956eb003b895bff6dbe","observation_id":"6500ca74-6770-42a8-b284-04cce307a393","resolution":{"observed_at":"2026-08-06T22:36:51.537913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:51.170118Z","title":"Semantic under- standing of scenes through the ade20k dataset","venue":null,"work_id":"37d81345-352c-41bf-828f-965ebf0de453","year":2019},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.933174Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:d60e3d371260af8c3eda8cbec940aaae93bec41d022ff1bc65592c4e47617733","observation_id":"cb7908d7-b580-4ca3-8f1a-43ecba8a208a","resolution":{"observed_at":"2026-08-06T22:36:51.293736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:50.999735Z","title":"Extract free dense labels from clip","venue":null,"work_id":"7eb603ea-4863-488b-9f8f-8da3924b34cf","year":2022},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:49.990789Z"},"links":{"citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:b7e3d00e62c5824befa0e9e474e385992d6d5f80fc5d2067bdeecc465a740ea0","observation_id":"3d7417e8-12e5-42aa-8179-965fb5ba9ca4","resolution":{"observed_at":"2026-08-06T22:36:51.084290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06594","last_updated":"2023-03-12T07:22:08Z","snapshot_observed_at":"2026-07-06T15:01:49.803305Z","submitted_at":"2023-03-12T07:22:08Z","title":"ChatGPT Asks, BLIP-2 Answers: Automatic Questioning Towards Enriched Visual Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06594","snapshot_observed_at":"2026-08-06T22:36:50.080336Z","title":"The room has a cozy atmosphere","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:50.080336Z"},"links":{"cited_paper":"/paper/2303.06594","citing_paper":"/paper/2506.21233"},"observation_digest":"sha256:f8e1600bda57b35f0ae194e95d43afddfdcb4197959e5b9eb46c0a29362269e4","observation_id":"5afc66ba-1db5-4322-8cac-109c8ec26260","resolution":{"observed_at":"2026-08-06T22:36:50.080336Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21233","last_updated":"2025-06-27T12:06:27Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T22:27:18.219692Z","submitted_at":"2025-06-26T13:22:03Z","title":"ReME: A Data-Centric Framework for Training-Free Open-Vocabulary Segmentation"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":3,"verified_fuzzy":55},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 1 inbound Pith citation observation for arXiv:2506.21233."}