{"as_of":"2026-08-08T21:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:00d54047090bba6a2af1bdef15e2111d6b359fb7634d8ff51bfe0b1d61e2ff20","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:15:40.971046Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.22209/citation-record","integrity":"/paper/2505.22209/integrity","json":"/paper/2505.22209/citation-record.json","paper":"/paper/2505.22209"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.08104","last_updated":"2020-05-16T21:10:10Z","snapshot_observed_at":"2026-08-07T11:06:20.411055Z","submitted_at":"2020-05-16T21:10:10Z","title":"Single-Stage Semantic Segmentation from Image Labels","version":1},"cited_work":{"arxiv_id":"2005.08104","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.08104","snapshot_observed_at":"2026-08-07T13:15:54.446144Z","title":"Single-Stage Semantic Segmentation from Image Labels","venue":"cs.CV","work_id":"10b1288b-54ac-46fe-9617-92fcc0f1b1c5","year":2020},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:32.862929Z"},"links":{"cited_paper":"/paper/2005.08104","citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:6a6f886e8dfa291a51b807d5b996e0322c597139d47f5048fa5a9aa04f2178ee","observation_id":"162dfefc-54f6-43fc-8a0d-4e56258b2c13","resolution":{"observed_at":"2026-08-07T13:15:54.539865Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:03.504105Z","title":"Arda Aydın, Efe Mert C ¸ ırpar, Elvin Abdinli, Gozde Unal, and Yusuf H","venue":null,"work_id":"e735d775-6136-4ef3-af0b-285d2c7f63d1","year":2024},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:32.967192Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:7bbcef85573e8dd769acbd9b381ed66b750c73f0bcf5e8da0b8f1971799cd408","observation_id":"56e44d03-b119-45f3-9695-c108ea391baf","resolution":{"observed_at":"2026-08-07T13:16:03.609493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:03.236019Z","title":"Self-calibrated clip for training-free open-vocabulary segmentation, 2024","venue":null,"work_id":"83e4f0d1-7896-4d3f-8816-3145bee4a883","year":2024},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:33.063163Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:a3c5fd3cae5b1678c570eb57407353c54dd4de827c743620b21c74eac3c7ebb7","observation_id":"c6f47ce1-6590-4f33-96c3-3061ff2095ae","resolution":{"observed_at":"2026-08-07T13:16:03.345295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:02.952987Z","title":"Fossil: Free open-vocabulary semantic seg- mentation through synthetic references retrieval","venue":null,"work_id":"bfc99266-2c8f-4391-bcf2-e2b049cb6940","year":2024},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:33.122588Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:a3f2331bc9aa396e562a18eeaf8d39bdb1e533078abf579817c5844df5240490","observation_id":"bd8c3490-b7da-4347-9eb8-8cf648806759","resolution":{"observed_at":"2026-08-07T13:16:03.097676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:02.650637Z","title":"Training-free open- vocabulary segmentation with offline diffusion-augmented prototype generation, 2024","venue":null,"work_id":"37d35ec7-38da-44b0-b780-2a1c5cfbdbd8","year":2024},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:33.198418Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:d8daf06f99b3a5a1e409a67fc6555727ea0a75aef4f4e3fd5e2b7fdfc3d96008","observation_id":"001d9414-24b2-4a23-8fcb-53244acb41f8","resolution":{"observed_at":"2026-08-07T13:16:02.762251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:02.468412Z","title":"Grounding everything: Emerging localiza- tion properties in vision-language transformers, 2023","venue":null,"work_id":"c187cc51-3150-45e0-87ee-643e046fe65a","year":2023},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:33.301555Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:30b5a0955cb854c88abe035619edc6d27e7272127b435a76fd6299b69fdf290c","observation_id":"c07b875d-8df2-400a-be3e-3265566429c0","resolution":{"observed_at":"2026-08-07T13:16:02.567722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:02.205984Z","title":"Breunig, Hans-Peter Kriegel, Raymond T","venue":null,"work_id":"04f15034-ed03-406b-b18c-f0e97c2d72f7","year":2000},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:33.405392Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:e3a20111a9814b458b010893f1ad51c858c74dcf98b8181e9733a32a49736bf9","observation_id":"dfcefeb0-5b38-4b87-a2a6-0e8025aaca35","resolution":{"observed_at":"2026-08-07T13:16:02.296513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00817","last_updated":"2019-11-18T11:10:40Z","snapshot_observed_at":"2026-08-08T06:49:23.954205Z","submitted_at":"2019-06-03T13:53:00Z","title":"Zero-Shot Semantic Segmentation","version":2},"cited_work":{"arxiv_id":"1906.00817","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.00817","snapshot_observed_at":"2026-08-07T13:15:54.288641Z","title":"Zero-Shot Semantic Segmentation","venue":"cs.CV","work_id":"e2f32b34-539f-478b-96b3-40b0e45ffe87","year":2019},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:33.484843Z"},"links":{"cited_paper":"/paper/1906.00817","citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:760f820ff46ae1cf458d3549cba6195b1f06e50c4afdbbdfd7dff7a5f37f50af","observation_id":"e60bd182-2469-493e-ad49-20d1d8179109","resolution":{"observed_at":"2026-08-07T13:15:54.353434Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03716","last_updated":"2018-03-28T10:15:59Z","snapshot_observed_at":"2026-08-07T21:43:33.904740Z","submitted_at":"2016-12-12T14:46:23Z","title":"COCO-Stuff: Thing and Stuff Classes in Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03716","snapshot_observed_at":"2026-08-07T13:15:33.605660Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:33.605660Z"},"links":{"cited_paper":"/paper/1612.03716","citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:6e0b9fa365ab952eb32f99a00649cf4d705cc8b62ccdc05108de82d7dc541e68","observation_id":"c664261f-004f-46bd-851b-a85e53265907","resolution":{"observed_at":"2026-08-07T13:15:33.605660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.11027","last_updated":"2020-05-05T09:13:24Z","snapshot_observed_at":"2026-08-08T05:33:42.283828Z","submitted_at":"2019-03-26T17:19:56Z","title":"nuScenes: A multimodal dataset for autonomous driving","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.11027","snapshot_observed_at":"2026-08-07T13:15:33.741356Z","title":"Lang, Sourabh V ora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yu Pan, Giancarlo Baldan, and Oscar Beijbom","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:33.741356Z"},"links":{"cited_paper":"/paper/1903.11027","citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:99798c9aca5ecdfd9339efd6f2508c3efdde3724d18a32fe996fc2d20e904faf","observation_id":"aa804497-019f-440b-a7d0-2db400f2380a","resolution":{"observed_at":"2026-08-07T13:15:33.741356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:33.850466Z","title":"A computational approach to edge detection","venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:33.850466Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:fee3efa3c1dd1a13e961e1c651dbd9c370d7dd70fc19b6b104ff25f7953718bd","observation_id":"7a30a213-aeb4-49e2-bee1-47d1fa908bdc","resolution":{"observed_at":"2026-08-07T13:15:33.850466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14294","last_updated":"2021-05-24T17:49:18Z","snapshot_observed_at":"2026-08-04T11:32:10.695202Z","submitted_at":"2021-04-29T12:28:51Z","title":"Emerging Properties in Self-Supervised Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.14294","snapshot_observed_at":"2026-08-07T13:15:33.926711Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:33.926711Z"},"links":{"cited_paper":"/paper/2104.14294","citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:3a4f8131f129d6a44a8a24950f9ee03e89f6d360cbafcbfc39dd2fc764a96ed9","observation_id":"dad5186e-d81e-460c-be35-9589892ec465","resolution":{"observed_at":"2026-08-07T13:15:33.926711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:01.887213Z","title":null,"venue":null,"work_id":"57857a1b-c209-4a87-8bbc-fd6bfe1f0599","year":null},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:34.068322Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:f5bb9c24aaa772870ae8a9a72e4c9b3811c007f007a5fe1bf83cf5305afedb42","observation_id":"54e043b5-a9d9-490b-9ff6-2acec7ac60b3","resolution":{"observed_at":"2026-08-07T13:16:02.019327Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.01527","last_updated":"2022-06-15T20:58:09Z","snapshot_observed_at":"2026-08-06T03:07:55.969083Z","submitted_at":"2021-12-02T18:59:58Z","title":"Masked-attention Mask Transformer for Universal Image Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.01527","snapshot_observed_at":"2026-08-07T13:15:34.171223Z","title":"Schwing, Alexan- der Kirillov, and Rohit Girdhar","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:34.171223Z"},"links":{"cited_paper":"/paper/2112.01527","citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:699c5c9b6fbd0acd9ee9a9b43f7f6c8aba9005941b6c1e97dcd70baaa0ccef2f","observation_id":"2d86ad36-7574-4981-9afd-3ff5e7d12756","resolution":{"observed_at":"2026-08-07T13:15:34.171223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06278","last_updated":"2021-10-31T17:41:44Z","snapshot_observed_at":"2026-07-06T11:28:47.290831Z","submitted_at":"2021-07-13T17:59:50Z","title":"Per-Pixel Classification is Not All You Need for Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06278","snapshot_observed_at":"2026-08-07T13:15:34.275567Z","title":"Schwing, and Alexander Kir- illov","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:34.275567Z"},"links":{"cited_paper":"/paper/2107.06278","citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:f2e487f0c708376ee99b3e0e6637062bf36074a6cbf6125e96f7d45a79fc1205","observation_id":"3a0e4d14-680c-42b5-bb33-d7e04e1ca2f9","resolution":{"observed_at":"2026-08-07T13:15:34.275567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.01685","last_updated":"2016-04-07T15:39:22Z","snapshot_observed_at":"2026-07-06T04:51:58.161972Z","submitted_at":"2016-04-06T16:34:33Z","title":"The Cityscapes Dataset for Semantic Urban Scene Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.01685","snapshot_observed_at":"2026-08-07T13:15:34.409766Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:34.409766Z"},"links":{"cited_paper":"/paper/1604.01685","citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:6d3f2aaef28d1af229bf9580da2aecaf36669fc4a9f4b1e14de5527f2479572f","observation_id":"78ff3d40-e45a-4e06-b770-8bb2ba47b8a8","resolution":{"observed_at":"2026-08-07T13:15:34.409766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:01.718436Z","title":"Freeseg-diff: Training-free open-vocabulary segmentation with diffusion models, 2024","venue":null,"work_id":"87cef883-ba8e-40cd-80d2-c1845626f280","year":2024},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:34.557062Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:12e661d60d53b821b80b804175729afd6c3e41c022c669c636a39d83fb3c6519","observation_id":"650e906e-2843-4439-87a0-235e157e8d54","resolution":{"observed_at":"2026-08-07T13:16:01.804892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T13:15:34.695855Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:34.695855Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:59eb5685a81e1a6b059373fb67b91a2cefe4a68dcd9badc909c39244a80573b6","observation_id":"3f82ee31-c044-449f-980c-1b08b57f684c","resolution":{"observed_at":"2026-08-07T13:15:34.695855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:01.549456Z","title":"A density-based algorithm for discovering clusters in large spatial databases with noise","venue":null,"work_id":"3d6a2d22-af7a-491a-8d59-8bad45c173fe","year":1996},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:34.789763Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:30ca0d3ca39078fe29843779358138a7b93b2b995ba52fa6c524ea32a8bb3cd8","observation_id":"d03ab2dc-7099-456d-bf18-4cc3d5ae3c59","resolution":{"observed_at":"2026-08-07T13:16:01.625165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:01.215570Z","title":"The pascal visual object classes (voc) challenge","venue":null,"work_id":"76b24586-d61e-4b5b-b9e8-60c0b36c7247","year":2010},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:34.920104Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:50ad5502c274c216eb1a5e60422e1948bd2d77e3e8e42e2b6e302ecd0e2221be","observation_id":"a7814347-ac8a-40a3-b581-e958746f2371","resolution":{"observed_at":"2026-08-07T13:16:01.367555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:01.025897Z","title":"Pay attention to your neighbours: Training-free open-vocabulary semantic segmentation, 2024","venue":null,"work_id":"6bdf6c05-a4c8-4302-8a86-f39d4b99d791","year":2024},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:35.050963Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:48ad77b51d18f2eae390f61e2ba01b986b20c81206f63576282e2130e79a3d83","observation_id":"12d1b802-29bc-48a9-9adf-8e7140a4efb3","resolution":{"observed_at":"2026-08-07T13:16:01.099681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.06870","last_updated":"2018-01-24T07:54:08Z","snapshot_observed_at":"2026-08-08T19:08:12.187509Z","submitted_at":"2017-03-20T17:53:38Z","title":"Mask R-CNN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.06870","snapshot_observed_at":"2026-08-07T13:15:35.193975Z","title":"Girshick","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:35.193975Z"},"links":{"cited_paper":"/paper/1703.06870","citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:6fcdee26133814a17e15beb80f0df5dc8d54003b32bd3bb908e56d2d6a902497","observation_id":"63e5088f-8fc3-43e2-97db-846836d22cb6","resolution":{"observed_at":"2026-08-07T13:15:35.193975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.06377","last_updated":"2021-12-19T19:23:25Z","snapshot_observed_at":"2026-07-31T02:35:46.853381Z","submitted_at":"2021-11-11T18:46:40Z","title":"Masked Autoencoders Are Scalable Vision Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.06377","snapshot_observed_at":"2026-08-07T13:15:35.270568Z","title":"Girshick","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:35.270568Z"},"links":{"cited_paper":"/paper/2111.06377","citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:3e5ed12d4f79e4f0641a1b14a1e97fac8e2c7c3f4569ef67ae7316650c1463d1","observation_id":"93389212-7283-453d-aa6b-8e6304f0c8a4","resolution":{"observed_at":"2026-08-07T13:15:35.270568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:00.810289Z","title":"Zemel, and M.A","venue":null,"work_id":"198138b3-9c7a-4c39-81c4-3f415ea70e03","year":2004},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:35.431760Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:cb4daaf8870eb81e36a2414913f22559fa47f1cee4732993f1b4dda28c6db457","observation_id":"ac223569-daa6-444c-99c4-a6fc003f2132","resolution":{"observed_at":"2026-08-07T13:16:00.909958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12698","last_updated":"2022-04-19T14:59:56Z","snapshot_observed_at":"2026-08-06T12:10:33.161811Z","submitted_at":"2021-11-24T18:50:47Z","title":"Open-Vocabulary Instance Segmentation via Robust Cross-Modal Pseudo-Labeling","version":2},"cited_work":{"arxiv_id":"2111.12698","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.12698","snapshot_observed_at":"2026-08-07T13:15:41.284785Z","title":"Open-Vocabulary Instance Segmentation via Robust Cross-Modal Pseudo-Labeling","venue":"cs.CV","work_id":"b385fd89-3f8b-4d16-803a-c23fca3c0cfd","year":2021},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:35.515524Z"},"links":{"cited_paper":"/paper/2111.12698","citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:c0bcd5a04ce918c0c01b86712eaf3a82f22c5484c3df4e96634386d386271ce1","observation_id":"6fe08cd4-814e-4ed4-a22a-c6c13b88c374","resolution":{"observed_at":"2026-08-07T13:15:53.880449Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-07-06T10:40:28.145954Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-07T13:15:35.615457Z","title":"Le, Yun-Hsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:35.615457Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:b88817d443ff4ad026442b4670e34e00d85f31719fd12480b907ed748a8b9018","observation_id":"1ffc0213-69d9-479c-9df5-8ce397816749","resolution":{"observed_at":"2026-08-07T13:15:35.615457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:00.638947Z","title":"In defense of lazy vi- sual grounding for open-vocabulary semantic segmentation,","venue":null,"work_id":"d45a65b0-50e1-484b-9a95-414ba9080fb6","year":null},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:35.714144Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:01dccfb1c1104e295bd9fe20dc0ac079508ba08c052907e01af9608c9b39a125","observation_id":"9b5fd46d-9ee2-4d40-b3e3-180275e3eb72","resolution":{"observed_at":"2026-08-07T13:16:00.712602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:00.422395Z","title":"Diffusion models for open-vocabulary segmen- tation, 2024","venue":null,"work_id":"96dd731f-d4c9-43f9-812e-85fc233b6f4a","year":2024},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:35.829873Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:6e60efebf815bed6d2a975bfebd0c2002a4123a737dd2773f8761a42667464b2","observation_id":"f44b9b9c-e28f-49a5-94af-2a154a31bc43","resolution":{"observed_at":"2026-08-07T13:16:00.531213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:00.256612Z","title":"Maskdiffusion: Exploiting pre-trained diffusion models for semantic seg- mentation, 2024","venue":null,"work_id":"f8066bfb-f602-4ce4-be65-ec7633ec99cb","year":2024},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:35.952913Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:929a4364a6225b97c76cfa74a8798cabe9e0a2e39807505afb75d0147ff6ef65","observation_id":"f93b4432-224e-4518-8b20-58c2b9d63e42","resolution":{"observed_at":"2026-08-07T13:16:00.327311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:00.028394Z","title":"Tag: Guidance-free open-vocabulary semantic segmentation, 2024","venue":null,"work_id":"1c65348f-701d-4b8f-9883-378b6ae161a7","year":2024},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:36.007619Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:0b05b0f5eb2cf7c59c18fd1160bd4fa8be62a0e3b1742ac00bf7bb0e371206cc","observation_id":"8b7e5900-6390-4e1e-a052-1c03d8fc3962","resolution":{"observed_at":"2026-08-07T13:16:00.147416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:59.850749Z","title":"Distilling spectral graph for object-context aware open-vocabulary semantic segmenta- tion, 2024","venue":null,"work_id":"8141f8c4-186e-440f-b56e-d579b7f35225","year":2024},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:36.071916Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:fc5b588e295b51f2b911dd9f6da746e72322b71da64d931a9ffa4cce2c280365","observation_id":"42d92d55-3dd9-4b15-8811-5ed81029aa92","resolution":{"observed_at":"2026-08-07T13:15:59.938836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:59.581359Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":"5bd6c841-339a-4c9f-8762-40c68fab9e9c","year":2023},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:36.154955Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:bbb1df5ede247a3eb054c79aba66940bcc52397bc4c53b6f00e49bd1c50b5e94","observation_id":"f1a8fc71-5754-4df4-92bb-8409cb236056","resolution":{"observed_at":"2026-08-07T13:15:59.738163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:59.386401Z","title":"Clearclip: Decom- posing clip representations for dense vision-language infer- ence, 2024","venue":null,"work_id":"4d0f42b2-1f9d-4829-a452-1a83087af1fe","year":2024},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:36.306558Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:13b9398c69b190b3bfbdd9d599a67c4a4ed0e40afea9ac4256f574c40aa2acc3","observation_id":"1e0eda89-f649-42e2-9c30-eecaa18598b2","resolution":{"observed_at":"2026-08-07T13:15:59.456872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:59.170053Z","title":"Proxyclip: Proxy attention improves clip for open-vocabulary segmentation,","venue":null,"work_id":"a3ff4e5c-4ca8-4d7d-bebd-bbfaa35c7003","year":null},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:36.468390Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:7f0e95a0ce5077b987c3431b92ca53232a9325dcd943a56cb289aba44fb29985","observation_id":"f9f466f5-566b-46d4-9deb-b8edc88a5cc0","resolution":{"observed_at":"2026-08-07T13:15:59.265572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:58.968086Z","title":"A closer look at the explainability of contrastive language-image pre-training, 2024","venue":null,"work_id":"6d3c2d49-e1fb-4489-a6b6-489def0befe1","year":2024},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:36.584073Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:a5056099e7904dc45303c1be4734a7a91647e7cce1cb225810d5ce7120d31013","observation_id":"b5fdea1e-151d-40de-bda0-436303ab7507","resolution":{"observed_at":"2026-08-07T13:15:59.055505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.03545","last_updated":"2022-03-02T15:08:16Z","snapshot_observed_at":"2026-07-06T12:26:09.094759Z","submitted_at":"2022-01-10T18:59:10Z","title":"A ConvNet for the 2020s","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.03545","snapshot_observed_at":"2026-08-07T13:15:36.761669Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:36.761669Z"},"links":{"cited_paper":"/paper/2201.03545","citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:5ce3640099b45e4b418ea21e4d4981aaaf07d94b3ac29244e6af7b2010dbd223","observation_id":"510b10e2-07fe-4037-b339-f970f122ad57","resolution":{"observed_at":"2026-08-07T13:15:36.761669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1411.4038","last_updated":"2015-03-08T22:16:40Z","snapshot_observed_at":"2026-07-06T04:00:38.324755Z","submitted_at":"2014-11-14T20:46:03Z","title":"Fully Convolutional Networks for Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.4038","snapshot_observed_at":"2026-08-07T13:15:36.874489Z","title":"Fully convolutional networks for semantic segmentation","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:36.874489Z"},"links":{"cited_paper":"/paper/1411.4038","citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:33cd6115c7eeff77fd46e19cfff2e63f732025f0d452823a973bdca52af7ca8d","observation_id":"4eec1d8f-4bf4-47e6-98a0-f75e9a5e41a3","resolution":{"observed_at":"2026-08-07T13:15:36.874489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:58.810221Z","title":"Segment anything in medical images","venue":null,"work_id":"0ded193f-3c65-411c-b0ce-e250ff19944f","year":2024},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:37.050621Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:35870f9c72014cf5ef1e30c9a1dac9eeb7c0439072d3ace967c44c12875da26e","observation_id":"fca9c634-0b52-4f6b-b8fa-480fbc6cc09a","resolution":{"observed_at":"2026-08-07T13:15:58.873466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:58.629916Z","title":"Meyer and S","venue":null,"work_id":"83888f65-6463-461b-8e91-5a28c66d4535","year":1990},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:37.187929Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:2c14fa444dd9420c54390a8e8cd95439c36b2c96f0ac4fd9f72406678e451451","observation_id":"37c7a82c-43d1-4be6-b5e7-09b26a6ebd90","resolution":{"observed_at":"2026-08-07T13:15:58.680347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:58.506016Z","title":"The role of context for object detection and se- mantic segmentation in the wild","venue":null,"work_id":"c959deb8-84ad-4976-b7e5-bda5c755bf58","year":2014},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:37.363516Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:1cf8d482f54f2033f4e8a5dc96d30ea66c2bb7c2a7603dc5ecb20bae2eb899e4","observation_id":"b6aaa17f-2195-46d6-98f7-9b8d07f08f6e","resolution":{"observed_at":"2026-08-07T13:15:58.557904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:58.374657Z","title":"Emerdiff: Emerging pixel-level semantic knowledge in diffusion models, 2024","venue":null,"work_id":"a604f55f-54d5-45b5-8e21-e60fb948741c","year":2024},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:37.523104Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:61b2e7c866fbc0ed1992e136b2785a1ab0ea4aa7e2bbf78ddb9d97d4e460b8c1","observation_id":"2da6d4b9-974d-4e43-8842-2ae29fce07d8","resolution":{"observed_at":"2026-08-07T13:15:58.447124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:58.242882Z","title":"Dinov2: Learning robust visual features with- out supervision, 2024","venue":null,"work_id":"c2b4b65a-59b4-4085-9802-ff17c098898a","year":2024},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:37.666238Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:397264576a1d49f90083f531688e9acc71e1a8ca77d6ffd5f46ce9a2b83f128d","observation_id":"aa66cf53-b618-4eee-9906-30125ce4f52b","resolution":{"observed_at":"2026-08-07T13:15:58.298751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:58.119257Z","title":"A threshold selection method from gray- level histograms","venue":null,"work_id":"d301f4da-2060-4437-9419-705fb8793759","year":1979},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:37.763278Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:91e5581d36c306b088d7f22e6376a82868d102ad7f68676eb3af81b61a44ebe5","observation_id":"273a4529-29ee-4d56-bcd7-6b39a4a71808","resolution":{"observed_at":"2026-08-07T13:15:58.169091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:58.007819Z","title":"Cattle segmentation and contour extraction based on mask r-cnn for precision livestock farming","venue":null,"work_id":"63db1ce2-79db-43a2-bab9-759a3ce7917c","year":2019},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:37.883823Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:71396397379edc732aa49eac40cc537ac82a903d748d3c46840919de3f615625","observation_id":"cf151e72-8693-4a6f-9b6e-b6efe336bed7","resolution":{"observed_at":"2026-08-07T13:15:58.051572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-07T13:15:38.031972Z","title":"Learning transferable vi- sual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:38.031972Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:7b32a61b5802e8a2ea9c1c4e1bc74069d91db07f9bc31bb4036e5b9867b37eca","observation_id":"9bbb184b-0b76-46ee-b46d-7b42e3bde8c4","resolution":{"observed_at":"2026-08-07T13:15:38.031972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-07T13:15:38.319381Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:38.319381Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:bb0aec1079e05ec106675620e3e43ef7f5a3cf358516dec27bd5657b84cc473d","observation_id":"cbf79215-ed95-4539-8f31-465bf593c57a","resolution":{"observed_at":"2026-08-07T13:15:38.319381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04597","last_updated":"2015-05-18T11:28:37Z","snapshot_observed_at":"2026-08-06T11:05:16.105361Z","submitted_at":"2015-05-18T11:28:37Z","title":"U-Net: Convolutional Networks for Biomedical Image Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04597","snapshot_observed_at":"2026-08-07T13:15:38.442426Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:38.442426Z"},"links":{"cited_paper":"/paper/1505.04597","citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:91d1d4e3d5ffc677b6ad02dbb8e49bc2c319273a228f0848559505a0b18d2f8c","observation_id":"e214adb3-75dc-4c3c-b003-9daf81fa5411","resolution":{"observed_at":"2026-08-07T13:15:38.442426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:57.891708Z","title":"Deep learning based real-time industrial framework for rotten and fresh fruit detection using semantic segmentation","venue":null,"work_id":"a84cac11-b8a0-46c6-975d-3d7cc2940761","year":2021},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:38.574832Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:ed8cc545de3a8710d98f1ff38c9d64397d0cd1a7559b635d376ecae825a1c1b4","observation_id":"ed19a431-bf15-4dd7-a5e0-b0eff50a3591","resolution":{"observed_at":"2026-08-07T13:15:57.942026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1610.02391","last_updated":"2019-12-03T02:13:03Z","snapshot_observed_at":"2026-07-06T05:13:49.420787Z","submitted_at":"2016-10-07T19:54:24Z","title":"Grad-CAM: Visual Explanations from Deep Networks via Gradient-based Localization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.02391","snapshot_observed_at":"2026-08-07T13:15:38.680970Z","title":"Selvaraju, Abhishek Das, Ramakrishna Vedantam, Michael Cogswell, Devi Parikh, and Dhruv Ba- tra","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:38.680970Z"},"links":{"cited_paper":"/paper/1610.02391","citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:d84bd4aee0bb20603b47ac5491c2ef956cc8ce8fc8bcfd6df8ffe28e0127a97c","observation_id":"ffb49e98-6bf8-4660-8338-645d3247122e","resolution":{"observed_at":"2026-08-07T13:15:38.680970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:57.760036Z","title":"Ex- plore the potential of clip for training-free open vocabulary semantic segmentation, 2024","venue":null,"work_id":"6bab0e05-91e1-4f74-933b-9217ebc2eff6","year":2024},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:38.812535Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:5babd60de30ac50dce061a95195ff1ba2e2f6dd4887bb54d1c6599f6192e6767","observation_id":"9975889e-a410-443d-bb4e-0c7eba94feda","resolution":{"observed_at":"2026-08-07T13:15:57.810811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:57.597900Z","title":null,"venue":null,"work_id":"5bdac31a-22ec-405c-b985-c2ed4a42dc6f","year":2000},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:38.928512Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:634ccb9e0c10b0366ed69fe646831e3eb72bd308285e7b3850473a6a983fa4eb","observation_id":"73e56832-5e65-4569-b2d4-c573d23b2a12","resolution":{"observed_at":"2026-08-07T13:15:57.659856Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:57.480842Z","title":"Harnessing vi- sion foundation models for high-performance, training-free open vocabulary segmentation, 2024","venue":null,"work_id":"28bdb042-925e-4d54-ace3-fc3bc3771076","year":2024},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:39.058357Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:4705bd7e63ff0b79ece868322b629dfd814f63cf04bbbd5b2f543f6fba495103","observation_id":"2074cfe0-15bc-4b82-ab62-1b7ac6d1ecad","resolution":{"observed_at":"2026-08-07T13:15:57.532414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:57.362597Z","title":"Reco: Re- trieve and co-segment for zero-shot transfer, 2022","venue":null,"work_id":"3e313c35-6f78-4220-ba2e-bea6312d31de","year":2022},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:39.182263Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:b7a253219ce80b48e74271b3fa39fc8f05f3825af180aa90ada55eaa5a5dcda0","observation_id":"2057d027-833b-49d5-847c-1b60a440becd","resolution":{"observed_at":"2026-08-07T13:15:57.411128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:57.161394Z","title":"Unsupervised object local- ization: Observing the background to discover objects, 2023","venue":null,"work_id":"d3c2e874-1986-46fb-a298-044ff8704704","year":2023},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:39.292183Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:7d2f331f9fd9eb7b21eea094014d6252706230c09c0af6d2ea81c51ceb5d20fe","observation_id":"8cb0ee3d-0d18-494f-b827-de322854a926","resolution":{"observed_at":"2026-08-07T13:15:57.294462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:56.866841Z","title":"Cliper: Hierarchically improving spatial represen- tation of clip for open-vocabulary semantic segmentation,","venue":null,"work_id":"8f8eb27b-f59f-47bf-abc4-3d3fb5786e30","year":null},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:39.408409Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:cff531f1efc7e667955dcac0f78f053731916581d5368b3b89ffaa4a08768871","observation_id":"063e6642-c992-40a8-a57f-67a367538ce5","resolution":{"observed_at":"2026-08-07T13:15:56.983603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:56.609038Z","title":"Clip as rnn: Segment countless visual concepts without training endeavor, 2024","venue":null,"work_id":"63941c26-aba6-4ffe-b08c-f7157319c2cc","year":2024},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:39.516381Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:29aec7e141388be87dc7e8da75317c6d46f45af1c6bfdfba52a4e6fb73f24175","observation_id":"69bb5b1a-5d44-474e-9bbd-0ceb656b0c38","resolution":{"observed_at":"2026-08-07T13:15:56.723736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:56.431903Z","title":"Lema, Oscar D","venue":null,"work_id":"8eb79aa5-349a-48ad-93f2-003a59fc83c3","year":2022},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:39.690018Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:105fe6d3a180a21ca54cd8d6d73fd3cbdb33e2e3d229d138078e28535cc40eb9","observation_id":"ceaf2ac0-f685-4bb4-9ac4-b5f7cd30a8f5","resolution":{"observed_at":"2026-08-07T13:15:56.506492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-07T13:15:39.754942Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:39.754942Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:6c158b6e2c6001b8cac3cb3088404b45e8e4353ad22581f4e2094e30fbc34bc4","observation_id":"7863f2b6-01dd-4d8d-87c8-093f43aab2d1","resolution":{"observed_at":"2026-08-07T13:15:39.754942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:56.297603Z","title":"Sclip: Rethinking self-attention for dense vision-language inference, 2024","venue":null,"work_id":"d923af41-2279-4c21-8c58-66bb375c6ecd","year":2024},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:39.839955Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:ec10d26f1e4e7d08eff5b568edbe2986364b3f7765293b7b7524c11bf78b62d2","observation_id":"3b92efe3-9ef9-4a19-9c75-96127572cb86","resolution":{"observed_at":"2026-08-07T13:15:56.364925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:56.168444Z","title":"Diffusion model is secretly a training-free open vocabulary semantic segmenter,","venue":null,"work_id":"38689e54-4ef6-453f-b03f-d4d6ec8d579d","year":null},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:39.922449Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:ffe1ae53d67c23bfb9dc040009595ec55bbfa2ab91099e807f2e1035c70962eb","observation_id":"d0b4491c-d40b-48f5-8b84-88791906f9a2","resolution":{"observed_at":"2026-08-07T13:15:56.219556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:56.041963Z","title":"Tokencut: Segmenting objects in images and videos with self-supervised transformer and normalized cut, 2023","venue":null,"work_id":"7025b864-21b6-4cb2-b15c-567d3b6df185","year":2023},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:39.996194Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:e0b064a29b49cf9c9e490979f194dc0c578390736ae68dc8f417156d970393ca","observation_id":"93d8a46d-c2bf-4f70-8316-db4018842321","resolution":{"observed_at":"2026-08-07T13:15:56.106036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:55.886214Z","title":"Image-to-image matching via foundation models: A new perspective for open-vocabulary semantic segmentation,","venue":null,"work_id":"e4ebc237-4c75-41f2-a9ce-ce4d8799a493","year":null},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:40.061135Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:a25831a579890e8b7787bfffc9dff8a7fd4130f4c359098134ac92b5023e7803","observation_id":"054952a6-48a5-434d-a209-66b44c81c958","resolution":{"observed_at":"2026-08-07T13:15:55.961957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:55.715202Z","title":"Clip-diy: Clip dense infer- ence yields open-vocabulary semantic segmentation for-free,","venue":null,"work_id":"48b9ada9-54b4-4a63-8873-1e312e11cbfd","year":null},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:40.140183Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:6048f19f170245ed6f716a31f8f08a3ed9d8cedc11e992835a1a752f64e2b93d","observation_id":"69eeb3a7-b54f-4833-a642-7fae32d68c7b","resolution":{"observed_at":"2026-08-07T13:15:55.792238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:55.579801Z","title":"Groupvit: Semantic segmentation emerges from text supervision, 2022","venue":null,"work_id":"ddba8e78-0ff4-46e5-ba30-ba91aa930a48","year":2022},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:40.256709Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:19fdbd693d499c6d6ea023132121b9ce4c9c3cfe756d99965d98405ac4b1a2d3","observation_id":"f66bdd74-fe76-4c02-af23-bd92753f26cb","resolution":{"observed_at":"2026-08-07T13:15:55.630832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:55.423608Z","title":"Tuning-free universally- supervised semantic segmentation, 2024","venue":null,"work_id":"fd0f0b58-f62a-431a-9f28-8d4c19d6e583","year":2024},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:40.317545Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:eae3fbcc170eb2abc070e349ed2aae0bad898262d4cd9b89edfee7269c829522","observation_id":"c9b21baa-48c3-46bb-ab4c-f3c22877fd8d","resolution":{"observed_at":"2026-08-07T13:15:55.510378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:55.279232Z","title":"Tuning-free universally- supervised semantic segmentation, 2024","venue":null,"work_id":"22bb0ae5-568f-4556-9fae-6fa5c8e4a004","year":2024},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:40.383712Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:e6d5e9d9fb3cbddf847dcaa177dcc8e38e7c838238de25c4e5f06850d153d0b7","observation_id":"46facfd2-8310-45d7-9a68-8128d3425310","resolution":{"observed_at":"2026-08-07T13:15:55.331364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:55.095579Z","title":"Resclip: Residual attention for training-free dense vision- language inference, 2024","venue":null,"work_id":"57f3e5c4-0c1a-4fc6-9e05-91bafd5b70df","year":2024},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:40.445055Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:d41cad14c6d46661c231cbc14e297c80d344e351b6e1ea0636acf9517d4c451e","observation_id":"335789c7-b1b0-4861-9761-720d9d8f3e87","resolution":{"observed_at":"2026-08-07T13:15:55.215557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:54.982455Z","title":"Advanced agricultural disease image recognition technologies: A re- view","venue":null,"work_id":"b3597094-c514-4820-984d-02846608837f","year":2021},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:40.548160Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:9de7feb2edd4d0e8a8489f90c74c1268659eae2d20084f127d5f0a61cc659466","observation_id":"fed52601-e2c2-46c0-b7c1-c4e6bc624e65","resolution":{"observed_at":"2026-08-07T13:15:55.018589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:40.664764Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:40.664764Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:5adecb14a5088a7692ca541221f8d3e80c267593f79032cfcd3e9cad2b877a75","observation_id":"d9763a44-a80d-40cd-bafc-a4e5895e60d4","resolution":{"observed_at":"2026-08-07T13:15:40.664764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:54.857539Z","title":"Corrclip: Recon- structing correlations in clip with off-the-shelf foundation models for open-vocabulary semantic segmentation, 2024","venue":null,"work_id":"8806668f-df14-4f92-be8b-a2a45355b08f","year":2024},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:40.744209Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:68381101aa5518deba253abf9fde4b7c03a42a137f70403701d744fa78eb6f96","observation_id":"101100c7-b134-47c4-a6cb-4889f9d2aab2","resolution":{"observed_at":"2026-08-07T13:15:54.906021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15840","last_updated":"2021-07-25T10:44:52Z","snapshot_observed_at":"2026-07-06T10:29:11.807491Z","submitted_at":"2020-12-31T18:55:57Z","title":"Rethinking Semantic Segmentation from a Sequence-to-Sequence Perspective with Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15840","snapshot_observed_at":"2026-08-07T13:15:40.806172Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:40.806172Z"},"links":{"cited_paper":"/paper/2012.15840","citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:a8c40bc36d0169681cf3a47a08d0fb840b35adcfa832d6de686c1e5e6374280e","observation_id":"e0bcf50c-1c35-4713-a608-c94c167d1241","resolution":{"observed_at":"2026-08-07T13:15:40.806172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.05442","last_updated":"2018-10-16T04:41:24Z","snapshot_observed_at":"2026-07-06T05:07:29.254936Z","submitted_at":"2016-08-18T22:23:13Z","title":"Semantic Understanding of Scenes through the ADE20K Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.05442","snapshot_observed_at":"2026-08-07T13:15:40.886189Z","title":"Semantic understand- ing of scenes through the ADE20K dataset","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:40.886189Z"},"links":{"cited_paper":"/paper/1608.05442","citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:a9b935c715dca97efa7bae7ba6d75a01dc88d917052207beb733c07a5eda6ddc","observation_id":"a811e6a5-08a8-40b9-a646-6dfbaf661822","resolution":{"observed_at":"2026-08-07T13:15:40.886189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:15:54.611370Z","title":"Extract free dense labels from clip, 2022","venue":null,"work_id":"3b6d585f-04c3-4bba-a83e-277c01b584db","year":2022},"citing_paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T13:15:40.971046Z"},"links":{"citing_paper":"/paper/2505.22209"},"observation_digest":"sha256:4703eb6e95d15dc0dcb2b3a4cc3feb8e0d94b5b51f442ee895e7714aae687ef8","observation_id":"52d97c00-de2e-478c-9625-3448408ba26f","resolution":{"observed_at":"2026-08-07T13:15:54.714808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22209","last_updated":"2025-05-28T10:37:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T13:23:12.861833Z","submitted_at":"2025-05-28T10:37:52Z","title":"A Survey on Training-free Open-Vocabulary Semantic Segmentation"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":3,"verified_fuzzy":47},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 0 inbound Pith citation observations for arXiv:2505.22209."}