{"as_of":"2026-08-21T07:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a70bad1bea0ef16fae590d42dbfa6db55c87ad79f7ccb04a888b64670da1a4fd","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:55:24.690477Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.11676/citation-record","integrity":"/paper/2505.11676/integrity","json":"/paper/2505.11676/citation-record.json","paper":"/paper/2505.11676"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.377920Z","title":"Cdul: Clip-driven unsupervised learning for multi-label image classification","venue":null,"work_id":"0d62f651-b625-42c8-a07d-b2f833c73fa3","year":2023},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.369136Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:f9e05bb8526bf524f165823c8134872037821fdc4081711fd554efa12ceb8020","observation_id":"11fd8b37-3cbd-4edd-9121-adbf8f86c0d1","resolution":{"observed_at":"2026-08-15T20:55:25.381467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.368246Z","title":"Zero-shot semantic segmentation.Advances in Neural Information Processing Systems, 32, 2019","venue":null,"work_id":"99cc74c6-5439-4316-b855-1c573dbd9c8b","year":2019},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.373163Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:77fd43e3b8523a4093348380ce4ffda443f78b2f2b71827bd6caa2977060bc0d","observation_id":"99b3e847-9a84-47e5-a1df-d3d00b6c3ebf","resolution":{"observed_at":"2026-08-15T20:55:25.371417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.357874Z","title":"Coco- stuff: Thing and stuff classes in context","venue":null,"work_id":"c57c6d59-e19f-4bc9-ad9e-6708c6723057","year":2018},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.376509Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:5b562ea348adcc3790c0714a73f28c5d130508854aa85e998082928068971860","observation_id":"f2a76d69-bd3f-4793-925d-96e8f2e12cea","resolution":{"observed_at":"2026-08-15T20:55:25.361398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.346655Z","title":"Attention to scale: Scale-aware semantic im- age segmentation","venue":null,"work_id":"44f8489c-769e-4b94-b910-d574eda8b8eb","year":2016},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.379863Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:318a0625997b0ba42a97ba4ba1ff35124ea1afa6d96c0e9715718879492fbd20","observation_id":"cc40b112-8cc1-47b4-b5b1-983869591786","resolution":{"observed_at":"2026-08-15T20:55:25.350595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.383196Z","title":"Deeplab: Semantic image segmentation with deep convolutional nets, atrous convolu- tion, and fully connected crfs","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.383196Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:e0ce46fff38a338616b9080f07981242f7b2d404a142fe1f0a367803feae51f6","observation_id":"b92c5ded-4f7d-4d02-9217-72b1a20bc41e","resolution":{"observed_at":"2026-08-15T20:55:24.383196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.329931Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":"6fcbcd85-0e88-431c-acf2-845ce070bbaa","year":2020},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.386484Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:aba2675e3b95828ab756db9db14425e942d628409a40f6a831eec14c47cc3a86","observation_id":"48ca0a36-7930-4406-8222-d1a50487e9c4","resolution":{"observed_at":"2026-08-15T20:55:25.333347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.389752Z","title":"Cat- seg: Cost aggregation for open-vocabulary semantic seg- mentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.389752Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:78fc66751f38f8dfb196bad2ef9d10556a19e39b3f6f1c6ee42c1759edb26d7e","observation_id":"e8e63b8c-6075-4085-8854-0fee0659e3fb","resolution":{"observed_at":"2026-08-15T20:55:24.389752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.312556Z","title":"De- coupling zero-shot semantic segmentation","venue":null,"work_id":"f3dc971f-a2b2-4f86-9046-62608a10b5e3","year":2022},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.392793Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:73c7c3d9c4889a3c265df500c662f087e7b24217b24786674e5cc84b3c419289","observation_id":"c9b9e4cb-cf3c-41c6-aa8b-d278e9d72c79","resolution":{"observed_at":"2026-08-15T20:55:25.315743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08984","last_updated":"2023-06-08T06:35:33Z","snapshot_observed_at":"2026-08-18T03:12:30.624760Z","submitted_at":"2022-08-18T17:55:37Z","title":"Open-Vocabulary Universal Image Segmentation with MaskCLIP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08984","snapshot_observed_at":"2026-08-15T20:55:24.395730Z","title":"Open- vocabulary universal image segmentation with maskclip","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.395730Z"},"links":{"cited_paper":"/paper/2208.08984","citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:df732c7b28ff5b862b072a4a9cf2b28bca9e8297f019138a8e60229ace761b37","observation_id":"2a74307a-4178-49d1-a084-47de8faf3be8","resolution":{"observed_at":"2026-08-15T20:55:24.395730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.302817Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"8d0aff48-5a28-4996-96ab-6549dbf9bc07","year":2024},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.399095Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:e0345e98c6cfbaa897370982800e2302e8bcf6eba200f5b4179c911903c1d818","observation_id":"5130628c-fc77-4f94-b2b0-76d8aea58356","resolution":{"observed_at":"2026-08-15T20:55:25.306137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.292214Z","title":"The pascal visual object classes challenge 2011 (voc2011) development kit","venue":null,"work_id":"5b031836-558b-46eb-b80a-f13e2336e13b","year":2011},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.401915Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:23adf25e9bc4d7df651c2a27a90d05811ac43e84c9218c51c0b8bc24c2c330d6","observation_id":"48abede5-8046-4708-a839-e91180906165","resolution":{"observed_at":"2026-08-15T20:55:25.295794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.281756Z","title":"Scal- ing open-vocabulary image segmentation with image-level labels","venue":null,"work_id":"3ad62f46-7ed8-4fbc-8a3f-b88160e52ad0","year":2022},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.405474Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:659d174c894d5d7851b39d017c2e2040fb3634c259162061758f6024b2736ce8","observation_id":"e5780371-87f8-4c6a-b4cc-3cf7cec51e9a","resolution":{"observed_at":"2026-08-15T20:55:25.284985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13921","last_updated":"2022-05-12T01:27:40Z","snapshot_observed_at":"2026-08-16T03:57:01.951598Z","submitted_at":"2021-04-28T17:58:57Z","title":"Open-vocabulary Object Detection via Vision and Language Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13921","snapshot_observed_at":"2026-08-15T20:55:24.408366Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.408366Z"},"links":{"cited_paper":"/paper/2104.13921","citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:bd2035a6df91889ca1225b9775577b40ae3626f76611f827001236afd6ea4102","observation_id":"7f121f68-2855-419b-b9f0-67e6c3891e0b","resolution":{"observed_at":"2026-08-15T20:55:24.408366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.271091Z","title":"Global knowledge calibration for fast open-vocabulary segmentation","venue":null,"work_id":"e0647444-2ff8-4ca6-9086-ec06a2bc36fe","year":2023},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.411535Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:8593fa6d4dcbae733f72f7ad0c001070d46cfe4c9eb49befafdb4d5645595210","observation_id":"d13d5415-7940-4483-9254-8a4174f8469a","resolution":{"observed_at":"2026-08-15T20:55:25.274559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.260597Z","title":"Clip-s4: Language-guided self-supervised semantic segmen- tation","venue":null,"work_id":"75013d47-7143-4622-a1ba-04d377f127d4","year":2023},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.414463Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:1d19a4235e2ef0e884595bed24e740256d76504491dfa5d2334bb8ad3ba46c71","observation_id":"5980ef97-1e62-4f5a-a644-c33755fe8870","resolution":{"observed_at":"2026-08-15T20:55:25.263921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.250007Z","title":"Visual prompting for generalized few- shot segmentation: A multi-scale approach","venue":null,"work_id":"46c09ee5-ddc2-404c-aef8-687dd7518e59","year":2024},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.417455Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:9b1d69a1ac0d2e62ac6339f58db7b0f87e24d08e3b39a6e166410a2811ba03e8","observation_id":"6b646f2d-947d-4714-a18a-507e74d415ef","resolution":{"observed_at":"2026-08-15T20:55:25.253648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.239523Z","title":"Open-vocabulary instance segmentation via ro- bust cross-modal pseudo-labeling","venue":null,"work_id":"67253d3f-0b15-40fc-bacb-e55116874c80","year":2022},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.420415Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:a281920a98ebf1440fdc73598c07db7094617e119e8469fdf835a8dfa96ab551","observation_id":"8dc793a8-14db-4abd-87c3-8e52e3584cc7","resolution":{"observed_at":"2026-08-15T20:55:25.242882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.423297Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.423297Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:653152187f65ba25739ef26ab52641f421819d17eb75d267c06821377e866403","observation_id":"6558287b-c5a3-43a2-8e60-88609cde01b8","resolution":{"observed_at":"2026-08-15T20:55:24.423297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.221720Z","title":"Understanding and constructing latent modality structures in multi-modal representation learning","venue":null,"work_id":"2b82d4f3-0fc7-400d-a168-d48d8ad03c22","year":2023},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.426417Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:2cb280ce4107c2478bdac750f34697c22bd57cd343b6aa0935c2e5b8b23364c9","observation_id":"75e69ed0-24e7-46ac-bb5b-3355cfbf70a1","resolution":{"observed_at":"2026-08-15T20:55:25.225616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.212236Z","title":"Panoptic segmentation","venue":null,"work_id":"ad606e16-dab3-4fc5-b94d-72575d6fc4d9","year":2019},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.544792Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:3e7a3aceb50550b447b1b747cf85392b8372bd333d64db9167e15858c811dfd9","observation_id":"3cce9264-88ac-4c9e-8934-f320f95bab80","resolution":{"observed_at":"2026-08-15T20:55:25.215283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.548109Z","title":"Imagenet classification with deep convolutional neural net- works","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.548109Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:0c4bfe38e5495635ef9fcb4c94b10d9970f51f5d7fa84600b2c7677df0989f50","observation_id":"4c1971c7-d82a-4d33-8b40-a8351ef3105a","resolution":{"observed_at":"2026-08-15T20:55:24.548109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.195752Z","title":"Attribute-based classification for zero-shot visual object categorization","venue":null,"work_id":"e17f1548-d8f9-45b4-abd0-f8d7f94cdc50","year":2013},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.551310Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:d7b6264619f04b1159e851e38400728df3e280dccded4a7ccf834734094aa740","observation_id":"7336f6de-3acb-4a0c-9589-bffc9fa48d92","resolution":{"observed_at":"2026-08-15T20:55:25.199027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.554105Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.554105Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:29309b9435b47ef24ef551e676b51e8f9c651655140d7186de3da50bc92880f6","observation_id":"5e0e9b83-97be-49ff-a9ec-32d47a5d19e0","resolution":{"observed_at":"2026-08-15T20:55:24.554105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.178544Z","title":"Mind the gap: Understanding the modality gap in multi-modal contrastive representation learning","venue":null,"work_id":"e5e1cce5-45ac-4d14-ad2b-85d673ec36f0","year":2022},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.557009Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:0ecbe608dae0fbceacbaf5381edf9d029dff2f96e37554096fac331c8ec48ac3","observation_id":"6220566f-735b-44f7-b0fa-d0f6be4ce429","resolution":{"observed_at":"2026-08-15T20:55:25.181906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.168840Z","title":"Feature pyra- mid networks for object detection","venue":null,"work_id":"62e9894c-ae94-403a-b23f-b7b09b0fb23b","year":2017},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.559689Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:de1272131b2696a657580507379cbe2bfb48f62e23b0222127e0e90e4bd15a04","observation_id":"56b37ca5-1a64-4389-b2a2-3cad3242ef31","resolution":{"observed_at":"2026-08-15T20:55:25.171996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04089","last_updated":"2024-11-26T13:45:09Z","snapshot_observed_at":"2026-08-18T03:20:16.912255Z","submitted_at":"2023-12-07T07:00:09Z","title":"Open-Vocabulary Segmentation with Semantic-Assisted Calibration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04089","snapshot_observed_at":"2026-08-15T20:55:24.562348Z","title":"Open-vocabulary segmentation with semantic-assisted calibration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.562348Z"},"links":{"cited_paper":"/paper/2312.04089","citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:72a0b971647248b41ff5b8f3b06a112f9ff6559e65fae22ab1ab21cf4d93b4d0","observation_id":"46069cb2-cbc8-4351-b0d9-0b28dcb42add","resolution":{"observed_at":"2026-08-15T20:55:24.562348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.158203Z","title":"Open-vocabulary segmentation with semantic-assisted calibration","venue":null,"work_id":"ced7b3fa-6969-457c-940b-c6c5804119ea","year":2024},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.565601Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:b326b10e6d1902181e5ce7a7abb94c7a1e37cbb2eebc24f1a785a2bf1215ee12","observation_id":"f3ca5a54-a064-49cf-836f-18277f748698","resolution":{"observed_at":"2026-08-15T20:55:25.161828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.568646Z","title":"Fully convolutional networks for semantic segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.568646Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:aaefde35ca26d549786c0afcd50e5958e1f4b0103da286ef682d955649930a6a","observation_id":"164496c5-ba19-485d-a486-95b015911c00","resolution":{"observed_at":"2026-08-15T20:55:24.568646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.571444Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.571444Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:3b35aa794e8f1254d8a5dd1c9a54add1e741b041df2ab1e197865feb612bcfea","observation_id":"73199f18-c763-47a6-aa5c-6eb678b9e0b5","resolution":{"observed_at":"2026-08-15T20:55:24.571444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-08-16T17:40:54.088104Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-15T20:55:24.574678Z","title":"Clip- cap: Clip prefix for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.574678Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:3478dd9a1336b83ca02767c1823f35ceb82df9228afb38299519ba8ab8281d91","observation_id":"16920ff4-ddf5-45aa-9246-89f859ec5f6b","resolution":{"observed_at":"2026-08-15T20:55:24.574678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.134235Z","title":"The role of context for object detection and semantic segmentation in the wild","venue":null,"work_id":"362781e9-335a-45ad-a493-64c7d0793522","year":2014},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.577699Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:f1d47aa6f784d3d69eb6115771942f3827c875425d7210d975ad22e0dab5516d","observation_id":"be53c4be-4f99-4e9a-966b-7e89d04e7b7c","resolution":{"observed_at":"2026-08-15T20:55:25.137580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.122633Z","title":"Slip: Self-supervision meets language-image pre- training","venue":null,"work_id":"460f02ed-3049-463c-8818-ee275bad14d6","year":2022},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.580589Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:f29cce19c9be1cf76ce5a692ad0028b8671f3cc42b3561c1c84cdaaff47d4bce","observation_id":"8b60b762-bc48-40db-b7f1-a206764ee906","resolution":{"observed_at":"2026-08-15T20:55:25.126502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.112016Z","title":"Open vocabulary semantic segmentation with patch aligned con- trastive learning","venue":null,"work_id":"8780c55b-9fc0-420d-92fd-67fbf8195536","year":2023},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.583273Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:0582173e19406c2d51ae09bae27fd17b45a70f74f1a2538aa6e871ad31bbbc3b","observation_id":"32ec490e-7b2b-4d83-80fa-b07526ff0284","resolution":{"observed_at":"2026-08-15T20:55:25.115528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.586120Z","title":"Pytorch: An im- perative style, high-performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.586120Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:517a4bb34f34be5bc8fae26d3dedfdfe67f723e22e5fba6c975fc6aeb240b8b8","observation_id":"5596e6c5-c686-4b99-9503-5cfad323016f","resolution":{"observed_at":"2026-08-15T20:55:24.586120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.095214Z","title":"Hierarchical dense cor- relation distillation for few-shot segmentation","venue":null,"work_id":"d768cfe0-7454-4b74-aa6b-91deb0697366","year":2023},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.588901Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:065708dc380106c874c2a86be2a378c240722b97d0f9f1e21439070895d5fd65","observation_id":"b5f673d2-54e6-44c2-89bb-1b14d17a9eac","resolution":{"observed_at":"2026-08-15T20:55:25.098698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.085024Z","title":"Connecting vision and lan- guage with localized narratives","venue":null,"work_id":"e53a8bb7-6e1d-421a-867d-b558afab57f8","year":2020},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.591787Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:bbe8b7d84b1c89300c3aa5ba3a43ef6e748f87fcffdbc4f91d1ffe1384a677ab","observation_id":"ffdb333e-f3c8-4196-8985-697ddbd97be5","resolution":{"observed_at":"2026-08-15T20:55:25.088420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.594559Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.594559Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:dae936e3b21eee1d909a8688e30b3ede6657be932098f711143cd3208d5dc23e","observation_id":"45ecd938-1370-4fb5-9b18-e74ff69719ee","resolution":{"observed_at":"2026-08-15T20:55:24.594559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.597500Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.597500Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:5ca57058532a8677851888a113c6900c692628d91fd3be0d0802501ce3514cfb","observation_id":"02b94598-4bad-4fd0-b035-7c1ebb2fb61a","resolution":{"observed_at":"2026-08-15T20:55:24.597500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.600613Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.600613Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:fb028e16a7806721dc5ca122d9f74c033b717ef439add6c6e3827408889ee5e7","observation_id":"24ef4581-b0e2-414c-9343-3f5024736e86","resolution":{"observed_at":"2026-08-15T20:55:24.600613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.054409Z","title":"Open-vocabulary semantic segmentation with image embedding balancing","venue":null,"work_id":"c165fd2a-bce8-4279-b5c5-44e92030a86b","year":2024},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.603475Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:27d836645b9ce9670737595f1ef7a1cf30b673b07f9b7b102091d0c79466770e","observation_id":"6144e1e2-5296-4489-a38c-48e9c0965cd3","resolution":{"observed_at":"2026-08-15T20:55:25.057822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.043679Z","title":"Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning","venue":null,"work_id":"1d1ee0ed-2204-4f2a-91f5-5dbc4b0eb349","year":2018},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.606591Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:851773f37e12071e5b28aa1bff706876cbde1eb4e2f3a318047a4200a003d313","observation_id":"0893e040-fc3a-4672-b131-e06c1e3274fd","resolution":{"observed_at":"2026-08-15T20:55:25.047253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-17T19:17:06.411141Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-15T20:55:24.609571Z","title":"Very deep convo- lutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.609571Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:c8187123454b3b9be654803c3cdabdc69054c66b4b7870bba95e771fd24f5f8b","observation_id":"ad856778-a71e-4216-bb62-9f7ba9387c90","resolution":{"observed_at":"2026-08-15T20:55:24.609571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07490","last_updated":"2019-12-03T19:30:19Z","snapshot_observed_at":"2026-08-17T10:15:40.814612Z","submitted_at":"2019-08-20T17:05:18Z","title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.07490","snapshot_observed_at":"2026-08-15T20:55:24.612842Z","title":"Lxmert: Learning cross- modality encoder representations from transformers","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.612842Z"},"links":{"cited_paper":"/paper/1908.07490","citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:36205f31137bc8aa95e4b6d333bfaceb574df36fb7d9cbe138f131e750120250","observation_id":"0326d4fc-d6c2-4344-985d-d69fc786fa2b","resolution":{"observed_at":"2026-08-15T20:55:24.612842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.616210Z","title":"Efficientnet: Rethinking model scaling for convolutional neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.616210Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:823d5b47397f8a9750e0c38e0d2d24730197602fa6c85ae35aa0f72a44dc23bc","observation_id":"5cdbc4e4-d859-4e6f-bc05-8c08b3f7a538","resolution":{"observed_at":"2026-08-15T20:55:24.616210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.025779Z","title":"Yfcc100m: The new data in multimedia research","venue":null,"work_id":"bee24d72-a6b5-4e21-8772-6f270dbd6d62","year":2016},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.619155Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:ecd3de1a303cce1964f09e7d5e999bef038d5266475820c77cf324cca39d5a8b","observation_id":"cd452eaf-a075-49b0-bda7-bb334a2c54b6","resolution":{"observed_at":"2026-08-15T20:55:25.029024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.015368Z","title":"Panet: Few-shot image semantic seg- mentation with prototype alignment","venue":null,"work_id":"218d0f59-2746-4c99-84d4-aec33e5c0a79","year":2019},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.622296Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:33f680a4d2dc3a9f1c272e767c0892ca8d8271a1256f75a2f805fd769c168e5f","observation_id":"371bc0a2-b48a-413c-966a-0cd6ec995c66","resolution":{"observed_at":"2026-08-15T20:55:25.019029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:25.004482Z","title":"USE: Univer- sal Segment Embeddings for Open-V ocabulary Image Seg- mentation","venue":null,"work_id":"14115210-931e-4665-876a-b404210a6464","year":2024},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.625632Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:1fbb993efb44a1246aeb2b63aec2aab1ef5642d297d4b93bee868ebd41a651e1","observation_id":"ab0f6a31-3ef8-4cfb-a38c-eb5eb73a5a57","resolution":{"observed_at":"2026-08-15T20:55:25.008192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.993665Z","title":"Use: Universal segment embeddings for open-vocabulary image segmentation","venue":null,"work_id":"2e32b803-b4f5-460e-bc86-4a7ed1388f6e","year":2024},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.628933Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:cf851b832d1e74240eda393d7d3078216569c2b353ad93e1fb3165f577c609b0","observation_id":"9b06a7bb-3e64-47dd-b0e1-b93d1b9fe84c","resolution":{"observed_at":"2026-08-15T20:55:24.997088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.983130Z","title":"Hierar- chical open-vocabulary universal image segmentation","venue":null,"work_id":"0d161194-f5f1-4e2f-8837-4579714022e9","year":2024},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.631815Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:5160407a6275ec7b723f548f743e2606d9d0cc9861a31d4d419275db401afe90","observation_id":"b2bedd52-b422-4ecf-97ba-bf5dd3e47173","resolution":{"observed_at":"2026-08-15T20:55:24.986663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.634589Z","title":"Detectron2","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.634589Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:ca2cbc6844e56a8157c122b2cd0cca34128bcc5229d2ca46c81c8913b5a02774","observation_id":"56767e4b-7b7b-4820-8a48-b8b48319e6a3","resolution":{"observed_at":"2026-08-15T20:55:24.634589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.965382Z","title":"Semantic projection network for zero-and few-label semantic segmentation","venue":null,"work_id":"0ff7f6d1-02b1-42ec-b18f-86226a86edc9","year":2019},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.637610Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:ccc335febfd8ae85b059caf9e1b39bb0ff1e831d0cd7395b7c8122a7bd1283b7","observation_id":"f93ebe23-a419-4b6f-8f52-bcd107829ca2","resolution":{"observed_at":"2026-08-15T20:55:24.968789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.954759Z","title":"Sed: A simple encoder-decoder for open- vocabulary semantic segmentation","venue":null,"work_id":"ad8d302a-5d8f-4d34-a3dc-0fd934d2b449","year":2024},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.640878Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:e78db7f34550977bd4a78a9c93c476acf7ff5a5fb4dd2e822a275ad1316a6b0b","observation_id":"7ef9f71b-9c01-42c6-a94a-34495ed5f05a","resolution":{"observed_at":"2026-08-15T20:55:24.958331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.643561Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.643561Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:f2c168d4c08a1bd288a2832944fbe132e87f62c13dd4a37cb637c171f14c7177","observation_id":"9b4ff238-fdc2-4367-b122-4106788a1a40","resolution":{"observed_at":"2026-08-15T20:55:24.643561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.937864Z","title":"Open-vocabulary panop- tic segmentation with text-to-image diffusion models","venue":null,"work_id":"e62ac4f6-60f3-45c0-a726-ec71d6d0d3ce","year":2023},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.646499Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:3f9c481091ba58f01a3d54bd16649c8c03484ac256433339f0b65b664f7a2161","observation_id":"38e10f38-f6ae-4aed-ad8e-65cf78c2ecf1","resolution":{"observed_at":"2026-08-15T20:55:24.941286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.926989Z","title":"A simple baseline for open- vocabulary semantic segmentation with pre-trained vision- language model","venue":null,"work_id":"73390625-6c49-4b8c-89ec-3a78cea089ca","year":2022},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.649170Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:a5cfe067367bee363074cb4202149b94dbc8e82a6ee799c6558c9193b642ccb6","observation_id":"1e970be4-69d1-4ca2-8644-71fc8e1db1b3","resolution":{"observed_at":"2026-08-15T20:55:24.930840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.651950Z","title":"Side adapter network for open-vocabulary semantic segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.651950Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:5c5f752fba6717781f96f02efe24134f3dbc381b224ceffe0d353f6bac01aba8","observation_id":"6a6eb9ef-e367-4413-a9b0-1e2fdf1d1746","resolution":{"observed_at":"2026-08-15T20:55:24.651950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.909549Z","title":"Attentive mask clip","venue":null,"work_id":"2ca36dae-0469-4567-a7c6-5d610d76a217","year":2023},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.654848Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:6ff0bf0108d8018b0ebbf897badc3249bc77ecf5af93ab0e0180e798e5bebb29","observation_id":"ab46658b-dc95-41dd-a8d9-2fb5023a1893","resolution":{"observed_at":"2026-08-15T20:55:24.912915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-08-18T13:50:47.418070Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-15T20:55:24.657625Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.657625Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:73903cf153a3ae3e07c8af5ba5d7027ec1af17f2c0f3deb3e2e930965b215226","observation_id":"7ccb72d7-813b-4bde-aaa2-3c35c2daaa72","resolution":{"observed_at":"2026-08-15T20:55:24.657625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.898038Z","title":"Convolutions die hard: Open-vocabulary seg- mentation with single frozen convolutional clip","venue":null,"work_id":"a3164fde-9b55-40f4-9025-c9ba272f3a7f","year":2023},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.660804Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:ba175d65d62b591ed3d6b9ad59f507da02dbeeb32fe957d550162aeaf8d56fcf","observation_id":"ff4d50ed-23a8-4af2-9102-be763169d441","resolution":{"observed_at":"2026-08-15T20:55:24.901740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.887424Z","title":"Sair: Learning semantic-aware implicit representation","venue":null,"work_id":"97c1bcc4-7ee9-42f0-9ab4-7f20b5a7b086","year":2024},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.663729Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:7d871fe32f97667c2e4555eeb31acac25eb2fbaa14f648f6935bb333ee506f14","observation_id":"0a8cbcbc-d3ef-463c-af3e-4844ada62597","resolution":{"observed_at":"2026-08-15T20:55:24.890979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.876611Z","title":"Few-shot segmentation via cycle-consistent trans- former","venue":null,"work_id":"821b2e48-85f1-4c6a-a1d3-e3078e00885f","year":2021},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.666294Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:9d4b7109e449fbf9aa4b27f88bb8920f43ec1c2b3372bf55fb0bdda3d74650da","observation_id":"bc650c4b-8c55-499f-bdfd-984521cf9930","resolution":{"observed_at":"2026-08-15T20:55:24.880074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.865985Z","title":"Transparent image layer diffusion using latent transparency, 2024","venue":null,"work_id":"eea251e3-2583-46e9-89d7-439076c1cd51","year":2024},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.669267Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:25ffc7f4246a609e089705b0df195d9147f6bebf625340e5a4d0aa1d495d30a6","observation_id":"7a94300a-e5d6-49c2-a401-79d9925b9cca","resolution":{"observed_at":"2026-08-15T20:55:24.869189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.855203Z","title":"Zero-shot learning via joint latent similarity embedding","venue":null,"work_id":"041f5156-b969-4d7b-9152-65d1d3a4e98b","year":2016},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.672221Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:a8ce06868e01df19979f9771fd8279321c541fb40e55a62756ffd0299d4e429d","observation_id":"ba3b0d7d-7085-4f09-9f4d-9e2e8c80a201","resolution":{"observed_at":"2026-08-15T20:55:24.858800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.844578Z","title":"Crossmodal few-shot 3d point cloud semantic seg- mentation","venue":null,"work_id":"6d53f766-3de6-42e2-b643-9d4198cae1a5","year":2022},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.675161Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:38a2635e67996e8b45aa60a284c91519d94d4fa3b62eeca867e59e2125c20bff","observation_id":"2836347a-646c-4b6f-b999-2e0fb9cff56e","resolution":{"observed_at":"2026-08-15T20:55:24.848046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.833781Z","title":"Crossmodal few-shot 3d point cloud semantic segmentation via view synthesis","venue":null,"work_id":"0330e043-47ac-4c7c-9faa-76c027c90107","year":2024},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.678082Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:43943554a6c2bfbafcab4773235f820b8b74d531caf2ee9f9ec2b82a2fbb2f49","observation_id":"0f975c01-3106-4e4e-a5fc-d8151221c1bc","resolution":{"observed_at":"2026-08-15T20:55:24.837271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.681043Z","title":"Regionclip: Region- based language-image pretraining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.681043Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:b465083e98fde2ba4302a479fe21d97e921da93d8c926c82a9bec346f50a9e70","observation_id":"e761476b-3f71-4dd4-b829-26d81573463a","resolution":{"observed_at":"2026-08-15T20:55:24.681043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.816646Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":"9c3b9e93-62e4-4228-8ab1-5f4c83ff588f","year":2017},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.684039Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:8d3bf3a715b02b41d31b49a85eefcf8a5cedc5cc0f94eefaebc31aa4b8f7becf","observation_id":"bc033a80-caf8-49df-9613-58b829dde3bf","resolution":{"observed_at":"2026-08-15T20:55:24.819968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.806193Z","title":"Extract free dense labels from clip","venue":null,"work_id":"7d3d6531-2b3c-4d99-8f01-f48b84dd51e7","year":2022},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.687449Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:dbb793d784d690ce457f2d26c73ad7f77b7cb8ae8c0a149389ff336079ae7aa5","observation_id":"ea620f21-c28f-47e5-bd16-6229013c322e","resolution":{"observed_at":"2026-08-15T20:55:24.809486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:55:24.793325Z","title":"Generalized decoding for pixel, image, and lan- guage","venue":null,"work_id":"3636b5b9-29f6-4ffd-99ff-74435ee2bfd5","year":2023},"citing_paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T20:55:24.690477Z"},"links":{"citing_paper":"/paper/2505.11676"},"observation_digest":"sha256:6e29d35893bd483db715541db6a09121a7c301eb37e59b61124f970597b485a5","observation_id":"b5ad274f-84b7-4bc4-9b5d-72e9c45c8bce","resolution":{"observed_at":"2026-08-15T20:55:24.798678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.11676","last_updated":"2025-05-16T20:25:42Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T03:12:30.075055Z","submitted_at":"2025-05-16T20:25:42Z","title":"DPSeg: Dual-Prompt Cost Volume Learning for Open-Vocabulary Semantic Segmentation"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":46},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2505.11676."}