{"as_of":"2026-08-17T02:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:77faa586f439f072f21473154bbfb098021c666fb006fc2f5c46ef39e8d7bfd7","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:52:34.595212Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.04211/citation-record","integrity":"/paper/2508.04211/integrity","json":"/paper/2508.04211/citation-record.json","paper":"/paper/2508.04211"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:45.132387Z","title":"Learn- ing to generate text-grounded mask for open-world semantic segmentation from only image-text pairs","venue":null,"work_id":"36039214-8636-4d1d-a3e3-5bee3048fc7e","year":2023},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:29.063864Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:d587d194143ff154bd31d9268739e8fc1e1b375909c4c393f9816af8ceacecea","observation_id":"08bccb0c-6ff9-4ea0-b57a-86b2bb22ab30","resolution":{"observed_at":"2026-08-06T00:52:45.262064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:44.906425Z","title":"Deeplab: Semantic image segmentation with deep convolutional nets, atrous convolu- tion, and fully connected crfs","venue":null,"work_id":"a06dc1dc-68f9-45a0-b1d0-e9e1ffa5a2ce","year":2017},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:29.196234Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:23a6c257eb5282a5e4dc5c16a5639e796fcab52c607d92f397a6114e4fe6c320","observation_id":"836284c2-f191-4e0e-a75b-72a72fa9aa63","resolution":{"observed_at":"2026-08-06T00:52:45.027960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:29.372193Z","title":"Encoder-decoder with atrous separable convolution for semantic image segmentation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:29.372193Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:a28154842fe650f75c90dd9e3665b839f1ba35a8138a00bec8aa4c3ea539cb55","observation_id":"9490c158-dae6-4c24-be8a-979aa108f2ec","resolution":{"observed_at":"2026-08-06T00:52:29.372193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-16T15:49:09.216982Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-08-06T00:52:29.522196Z","title":"Pali: A jointly- scaled multilingual language-image model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:29.522196Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:715671b5349e049feaca606cb8c83a89afce5d42fc3e05bcc352f9f2a7ebbfc5","observation_id":"806af3ec-7367-49d1-b12a-6b8585006ea6","resolution":{"observed_at":"2026-08-06T00:52:29.522196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:44.650203Z","title":"Per- pixel classification is not all you need for semantic segmen- tation","venue":null,"work_id":"9b1351c3-5334-4722-b47e-5c17ad8d1e5d","year":2021},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:29.645567Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:81d209e93c1b3145f34f062d890b8868505711d031bd2a4509998f52a58b2d22","observation_id":"38cc5346-8fc7-4c0c-9949-1213fcfecf2c","resolution":{"observed_at":"2026-08-06T00:52:44.798621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:44.408734Z","title":"Schwing, Alexan- der Kirillov, and Rohit Girdhar","venue":null,"work_id":"e0ab85c3-6cdd-401e-8805-b412d6ba5ce7","year":2022},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:29.769588Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:aa5e22940ed22724de3565ee065419abcda27857acb8f4a585ee2f1abe6366ff","observation_id":"191b2a45-989c-4ac5-a9d7-ecd897f398b1","resolution":{"observed_at":"2026-08-06T00:52:44.496946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:44.132239Z","title":"Reproducible scal- ing laws for contrastive language-image learning","venue":null,"work_id":"1f8b69c9-4c33-44cc-8be3-ffc72e49bfca","year":2023},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:29.857281Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:0b29ff7118271529fbd3128d12b3de5d26a905bd44395b3d1ecba584007f214c","observation_id":"b86c4654-8a19-4e16-8be3-ba7c5dda47d2","resolution":{"observed_at":"2026-08-06T00:52:44.259586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:43.864150Z","title":"Cat- seg: Cost aggregation for open-vocabulary semantic seg- mentation","venue":null,"work_id":"0f15d4f6-7c82-457b-945a-5a8a4256463b","year":2024},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:29.943467Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:edb18231799c0ab9c8f1d22a40169049ce2b4b1f0501b075f9988d109cd760f3","observation_id":"0e8ead4f-bce7-4f73-9fad-538cb6374bad","resolution":{"observed_at":"2026-08-06T00:52:43.982668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:43.721095Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":"323ccbf3-08e7-4804-8c22-48c1b8dbac5d","year":2016},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:30.038805Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:f39e5874471d5cff95bc88725f1eb9cd8516b368d39526fb87f6cea3070cf10b","observation_id":"ba68cbba-3e4f-4171-8486-81cfbd7e7c2b","resolution":{"observed_at":"2026-08-06T00:52:43.786629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:43.559180Z","title":"Deepglobe 2018: A challenge to parse the earth through satellite images","venue":null,"work_id":"c19adac3-90c5-45e6-a898-a2dd6fa2bcb1","year":2018},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:30.141309Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:1f27a6a5a5891d64bd380ae0fdd0d4a1e6f08ecf7d79be7d0d28f3ef759d02d1","observation_id":"3428a1a7-d1b6-4b94-980a-ac9be6c4f41e","resolution":{"observed_at":"2026-08-06T00:52:43.649919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:43.320126Z","title":"De- coupling zero-shot semantic segmentation","venue":null,"work_id":"20c999a2-c900-4ab9-ae3c-0170a087debb","year":2022},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:30.240344Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:01879ad9e26d5e767a6b8735fdd7aa4c9abea99b66e2aa8a487b9b2d3c28d94b","observation_id":"d23e21c5-cdd9-4ef5-bc62-9d80e5a84c3f","resolution":{"observed_at":"2026-08-06T00:52:43.434392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T00:52:30.331238Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:30.331238Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:c4a2ccc022f0ad4365de52d4417bcad567947bf342fd399b41b3b03d00ad7a5c","observation_id":"b6a04b08-0d49-4c0f-bdee-f522c436d2c6","resolution":{"observed_at":"2026-08-06T00:52:30.331238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:43.070335Z","title":"The pascal visual object classes (voc) challenge","venue":null,"work_id":"64fe051d-320c-43d0-adaa-c3c3928e6e9f","year":2010},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:30.451894Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:9c2cafdb3c3de14e6a2c2a637c4c88ca406fb1b31b79b873ccd0565196cc1758","observation_id":"b671e2d3-bbda-4482-b01f-b35146de6900","resolution":{"observed_at":"2026-08-06T00:52:43.192557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:42.838413Z","title":"Data filtering networks","venue":null,"work_id":"2f64744a-cbda-45a9-a7ee-9cdb2e225287","year":2024},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:30.565010Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:b28f4162aa6b53dae49b45c1df0b3e40b053c0dd54319a7bdccd0dfec312f71b","observation_id":"803d38f5-55ea-470f-97a1-6d2f039e898a","resolution":{"observed_at":"2026-08-06T00:52:42.949925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:42.702674Z","title":"Scal- ing open-vocabulary image segmentation with image-level labels","venue":null,"work_id":"b50116c9-67cb-407b-8479-49419c0a2f63","year":2022},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:30.657678Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:48fb88029f6ad500449df727b804d6168d98270fc6565ace5022871b4d7000fb","observation_id":"b169b8a2-47d1-4296-b7cb-2e6e936684e2","resolution":{"observed_at":"2026-08-06T00:52:42.773828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:30.726218Z","title":"Fast r-cnn","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:30.726218Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:0b16fbfc8db2853a814bc39861132fac06dcdbaaf742765830de5f4b6dee0600","observation_id":"ed2a5457-1b21-40d3-98ef-d176f69ad4a8","resolution":{"observed_at":"2026-08-06T00:52:30.726218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:30.798509Z","title":"Rich feature hierarchies for accurate object detection and semantic segmentation","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:30.798509Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:041491a888ff74adb9f54a9c4fba879a5beadab4b6a393094d67af72c0dc82fb","observation_id":"28f0228b-916a-437b-8bcb-46114c6a224e","resolution":{"observed_at":"2026-08-06T00:52:30.798509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:42.497048Z","title":"Open-vocabulary semantic segmentation with decou- pled one-pass network","venue":null,"work_id":"ba965c8f-82b6-4743-bf68-372f4b63ed4d","year":2023},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:30.889096Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:3e7ec9b463cd3a001dd0b798a711629b4ba335b1a6c5c39d5807fac362795b17","observation_id":"1e996761-a417-4339-b74e-a6c084f6b76f","resolution":{"observed_at":"2026-08-06T00:52:42.602852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:42.358614Z","title":"Simultaneous detection and segmentation","venue":null,"work_id":"093c8eff-657e-4cd9-af49-28d668e948cd","year":2014},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:30.953642Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:72a97fd7e7ee10c631ba08e9d50c5969f3518ccb5e431bc97b90f141eeeffae2","observation_id":"8928180e-a749-424b-94c3-48294938e91a","resolution":{"observed_at":"2026-08-06T00:52:42.424121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:31.050425Z","title":"Mask r-cnn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:31.050425Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:c31de5b5782e9ca2abe36c194a7ed67384d5552bba4f531bd4641976d5911dc1","observation_id":"7b531e68-4a63-4063-91ee-4e5b4de7c130","resolution":{"observed_at":"2026-08-06T00:52:31.050425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:42.191176Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":"40c0d0d3-fefb-42bc-9a5b-71d937d23d26","year":null},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:31.139595Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:48d4d39873420ee493565020e934faebd74049dd302e6deb67290b913dac149d","observation_id":"eb57fcd8-7492-4ae9-a712-4f9bb45c9809","resolution":{"observed_at":"2026-08-06T00:52:42.257739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:42.013623Z","title":"Collaborative vision-text rep- resentation optimizing for open-vocabulary segmentation","venue":null,"work_id":"088d3def-4e82-48d4-9b8b-85fc06478ea5","year":2024},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:31.230619Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:f47753a959c8c03afb271044cbbaae9be20c860916a62620c2c90537f88d96e6","observation_id":"bbfe1c44-789c-4386-9490-e9c8499326e8","resolution":{"observed_at":"2026-08-06T00:52:42.097447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:41.877517Z","title":"Diffusion models for open-vocabulary segmen- tation","venue":null,"work_id":"288bd0c0-8378-4490-a10e-7138d2764607","year":2024},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:31.333947Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:82ba58c2de4da1f323fb3587548170a50b0e85614f8389c0f45721a8b9c918ac","observation_id":"582cd08c-efe5-4ffb-a139-d357dc1c09ad","resolution":{"observed_at":"2026-08-06T00:52:41.938234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:41.682526Z","title":"Panoptic segmentation","venue":null,"work_id":"6a3c33fe-dfd0-4a29-9ec8-65da4e04db7f","year":2019},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:31.400137Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:6ffa158f6ee2ee9d28d03e98e01c6587413045f2383f68d3499d6cfd869b771d","observation_id":"b0e45d05-49fb-4239-967d-437a7bdff061","resolution":{"observed_at":"2026-08-06T00:52:41.770170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:41.515119Z","title":"TIPS: Text-image pretraining with spatial awareness","venue":null,"work_id":"0801caa7-a9e9-4cb6-b386-80732986acb7","year":2025},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:31.476294Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:308c11d77d94dd643d32120ba2ed73df34a4bbec0075d4141a47a9b43c66afdb","observation_id":"f9097f64-90bd-45d4-a0c6-1c5b4c294a00","resolution":{"observed_at":"2026-08-06T00:52:41.605623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:41.385794Z","title":"Ladder-style densenets for semantic segmentation of large natural im- ages","venue":null,"work_id":"d0252e28-af22-44e0-b3a5-6bcd8f4474d1","year":2017},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:31.576470Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:1972f7c1e9e853078f6dccc10fe3f03c1148aadb57d52dc2363a4b90e7371850","observation_id":"477dca5c-e68f-415e-9416-57a2f288c93c","resolution":{"observed_at":"2026-08-06T00:52:41.435465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:41.266327Z","title":"Clearclip: Decom- posing clip representations for dense vision-language infer- ence","venue":null,"work_id":"5fec74a0-4d2d-483a-80ed-53f2517efc5c","year":2024},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:31.644242Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:ba60c87bb5811342e8647ba833d9409080d280ef8f17d77b5cb3b404feabc9e4","observation_id":"4491d09f-d931-4c9a-8077-51e366e8a527","resolution":{"observed_at":"2026-08-06T00:52:41.352324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:41.085441Z","title":"Proxyclip: Proxy attention improves clip for open-vocabulary segmentation","venue":null,"work_id":"d31a0b42-d560-41a1-a81d-d191f99f9c8e","year":2024},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:31.721672Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:d9270734e57579801d10b894cf463d07e8d9e3ad5578858871074145b5f9d0e8","observation_id":"0e0f052c-91ce-45d1-86ae-46aed6951a9b","resolution":{"observed_at":"2026-08-06T00:52:41.177292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:40.946847Z","title":"Mask dino: Towards a unified transformer-based framework for object detection and segmentation","venue":null,"work_id":"65a7bf84-4200-4bdf-b887-13a0b69364ec","year":2023},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:31.813349Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:ac3a4516a05fb3e75e527e8329a8d90023787702d1bd27ee3141ff77fab92d7f","observation_id":"7febfaa7-c6ec-411e-ac58-35f10061e988","resolution":{"observed_at":"2026-08-06T00:52:40.999444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:40.788053Z","title":"An inverse scal- ing law for clip training","venue":null,"work_id":"a397b17d-2af9-4252-a8dd-f3eaccaf89a8","year":2023},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:31.962056Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:e58b85e4dd7df1b1c7deb04ec1ef40b8f982b7939a354e1910fb35dea1cc7805","observation_id":"b63f0c58-d510-47d8-8436-0afb64394c38","resolution":{"observed_at":"2026-08-06T00:52:40.854883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:40.652238Z","title":"Scaling language-image pre-training via masking","venue":null,"work_id":"67036a1c-9bac-4491-8da0-12c99995b5b3","year":2023},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:32.057501Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:2af702685d354f66b5a7b762cc8f1590cd0853cd2d2d7198697ee8195e362483","observation_id":"8e31c34b-255f-46d7-829e-7ef98889aa10","resolution":{"observed_at":"2026-08-06T00:52:40.701891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:40.517168Z","title":"Clip surgery for better explainability with enhancement in open- vocabulary tasks","venue":null,"work_id":"fbad2716-772d-4933-891b-4af3fb1055a5","year":2023},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:32.190338Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:e48a75e6b9f63941bbbe2db2afa3de6932ec180dafd3d1bc45c08a16a2070a9c","observation_id":"a6293139-0be3-4d4b-8f0f-b2935d7c2a7f","resolution":{"observed_at":"2026-08-06T00:52:40.572494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:40.362751Z","title":"Mask-adapter: The devil is in the masks for open-vocabulary segmentation","venue":null,"work_id":"4e9ca19b-c1fd-4d69-a825-126db7f3215f","year":2025},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:32.236708Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:a81a283aee6e9fd2ddf82fa99c845743f81eb18de4448f7bf06e4f40c4e32518","observation_id":"528ef065-1a13-44b8-aa2c-30253bcbda81","resolution":{"observed_at":"2026-08-06T00:52:40.447287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:40.206027Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip","venue":null,"work_id":"737b1e7c-40a8-4a79-b39b-87a1e1f0d959","year":2023},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:32.294092Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:9ac946469ccd6501273a5da1a07c68c81ed6efda9072f562205f1c58ab8cabae","observation_id":"bdbb79db-9480-45c4-b2e8-d5de898b0779","resolution":{"observed_at":"2026-08-06T00:52:40.274097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:40.043436Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip","venue":null,"work_id":"8afb5470-4092-4371-a58e-f713af30fa5b","year":2023},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:32.381810Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:e13a6be8275c48010c31f42378dc6f39c37d7ba1d6fbd5815bfe4f4f4f8b16c2","observation_id":"a475f8be-bc5c-48a6-8619-975b54c639b7","resolution":{"observed_at":"2026-08-06T00:52:40.125545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:39.882632Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"e74b16c5-38aa-4f8f-a53f-b6bbbc636408","year":null},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:32.473145Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:4e669b9636a13e8a0d4fb7b9102e2fe199d0f91f99120002514af2cc755082c6","observation_id":"39e0a733-9c49-49b9-b587-4c69162f4bc3","resolution":{"observed_at":"2026-08-06T00:52:39.964322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:32.581521Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:32.581521Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:37c141ae3d30c9c76fe06911f960fd811fdd40ce70f6f0006315ee2e5d8c5626","observation_id":"c6eb9401-e27e-4d16-bac8-804b39a030fb","resolution":{"observed_at":"2026-08-06T00:52:32.581521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:39.459841Z","title":"Fully convolutional networks for semantic segmentation","venue":null,"work_id":"b3e56379-66e0-4d26-9d75-e4dddbbfde7e","year":2015},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:32.652442Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:0711ce28d6020c22ebc0674923f4ce2e32ac0baf8ca027b242a0b224e2eb128f","observation_id":"a4d70e7d-22b5-410f-9134-7ac259c53b70","resolution":{"observed_at":"2026-08-06T00:52:39.547599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10118","last_updated":"2025-07-14T10:01:02Z","snapshot_observed_at":"2026-08-16T05:37:34.037848Z","submitted_at":"2025-07-14T10:01:02Z","title":"DEARLi: Decoupled Enhancement of Recognition and Localization for Semi-supervised Panoptic Segmentation","version":1},"cited_work":{"arxiv_id":"2507.10118","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.10118","snapshot_observed_at":"2026-08-06T00:52:34.730780Z","title":"DEARLi: Decoupled Enhancement of Recognition and Localization for Semi-supervised Panoptic Segmentation","venue":"cs.CV","work_id":"81d2abd8-8e52-481e-be01-8fdbf41d0c6b","year":2025},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:32.734021Z"},"links":{"cited_paper":"/paper/2507.10118","citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:359e0e3995cdd2b932c225009e2c143cd9dc7a4cf4538f40f069a2bda9b6be4d","observation_id":"a3a73361-f290-4831-869e-faf0fe434571","resolution":{"observed_at":"2026-08-06T00:52:34.783235Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:39.211504Z","title":"Open vocabulary semantic segmentation with patch aligned con- trastive learning","venue":null,"work_id":"e97578fa-6aa7-4cdf-b95d-2855f50f4a7a","year":2023},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:32.831892Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:433635ff31d4b28969ef59315bcfe7ba52157e71e93cf44c203f809592c1c588","observation_id":"9e9685cb-ec8b-4ecc-a3f0-fac3c5f2ba6e","resolution":{"observed_at":"2026-08-06T00:52:39.375088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:38.909461Z","title":"Silc: Improving vision language pretraining with self-distillation","venue":null,"work_id":"a47d6cc1-03d1-42d0-aef9-25a3f05a014f","year":2024},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:32.878193Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:4f727b51b322b415f4b71ac737331548910f342564a69c872b7b6d4064ea1e30","observation_id":"5d0c50ea-f768-48e0-a300-6db953751d91","resolution":{"observed_at":"2026-08-06T00:52:39.067966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:38.718071Z","title":"The mapillary vistas dataset for semantic understanding of street scenes","venue":null,"work_id":"d5954c4b-77fc-4fe7-b436-9e807e7607f4","year":2017},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:32.937921Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:e3b58db8aac233dcb750fa07a812776994b807c713af72dc23be424ee463586f","observation_id":"3aa5fea6-f1d4-4906-960b-c919d4f88d33","resolution":{"observed_at":"2026-08-06T00:52:38.809930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:38.583062Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"a3355f38-86c6-42e7-983a-26b021195732","year":2021},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:33.074332Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:4978733facf9e222a844a392052d837b009a1dcf507c53390f4fc9a6bd876daf","observation_id":"2018411c-89ea-4c54-8328-24697be00b76","resolution":{"observed_at":"2026-08-06T00:52:38.630423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:38.343327Z","title":"Faster r-cnn: Towards real-time object detection with region 10 proposal networks","venue":null,"work_id":"c8830339-469d-4e45-8a26-f313f8c03b73","year":2015},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:33.169790Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:d612eba89d31cab932f08c3fe4845c65b1311d35c03ad68f55969d2b5923338d","observation_id":"11137e0e-28dc-4b4a-b836-327fee72a551","resolution":{"observed_at":"2026-08-06T00:52:38.451570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:38.099078Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":"8a280df0-5ffb-462d-b24b-6c02907f7a42","year":2015},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:33.237726Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:e6b081c65b28bfca37ad0f3b95aa8de774e92d90973e06a8502d9779b9950047","observation_id":"c5604ea4-ce5d-458b-b4c1-ef69dec4152f","resolution":{"observed_at":"2026-08-06T00:52:38.221021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:37.890313Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"2dd8e803-fe97-49b6-b2cb-b97816398e2d","year":2022},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:33.297753Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:59893947c3e42897141af420a8f422feb2025d17e760d56d484102672deb39ec","observation_id":"a8068a9a-a40b-40db-b9a6-cc7bc9746531","resolution":{"observed_at":"2026-08-06T00:52:37.974048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-08-16T07:24:08.156932Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T00:52:33.344662Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:33.344662Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:0c7017745801e2d2dfa32ebc8322f08dd77960217447367a780487f6db6abb42","observation_id":"45d2c4fc-cb69-406c-95b0-d4f156f6fb3d","resolution":{"observed_at":"2026-08-06T00:52:33.344662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-06T00:52:33.410715Z","title":"Siglip 2: Multilingual vision-language en- coders with improved semantic understanding, localization, and dense features","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:33.410715Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:a352d32605148dbc3a2260d4288fc06b83b2134ce2742e4e36b80a143ff5af7e","observation_id":"70e6db1c-7dcc-490a-a551-7aa169efb490","resolution":{"observed_at":"2026-08-06T00:52:33.410715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:37.644346Z","title":"Sclip: Rethink- ing self-attention for dense vision-language inference","venue":null,"work_id":"d466b503-fa22-48ca-9232-e9f32cb5d2a8","year":2024},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:33.492924Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:392e7bfa2b6e6448fc784a847b36d32c994d7f7bc3375364d3fb6aba35e8a730","observation_id":"c88a9c5d-c065-4fe1-b737-8ad4fde952dd","resolution":{"observed_at":"2026-08-06T00:52:37.752484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:37.433777Z","title":"Max-deeplab: End-to-end panoptic segmentation with mask transformers","venue":null,"work_id":"06a6320f-1215-43ac-865a-c732aa0e6940","year":2021},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:33.552118Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:1918011f09b6bdcff23559c01fe13a7afa12e05b4f5fda66891c98db45e10b03","observation_id":"c2bd8ac5-750f-44d1-bd2f-0c67b30f4a03","resolution":{"observed_at":"2026-08-06T00:52:37.540092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:37.197594Z","title":"Internimage: Exploring large-scale vi- sion foundation models with deformable convolutions","venue":null,"work_id":"60ea219d-fe12-4fc7-ad41-4fb3c878a7a9","year":2023},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:33.615800Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:7c1b4482d3e2feb0782c36aa815c7de4f8ea487bb3311461ca210c9d2e73f2cb","observation_id":"c76e95e2-6bc2-474d-b1d4-d9f15dea236b","resolution":{"observed_at":"2026-08-06T00:52:37.290839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01403","last_updated":"2024-01-24T18:11:53Z","snapshot_observed_at":"2026-08-16T21:35:43.033380Z","submitted_at":"2023-10-02T17:58:52Z","title":"CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01403","snapshot_observed_at":"2026-08-06T00:52:33.694344Z","title":"Clipself: Vision trans- former distills itself for open-vocabulary dense prediction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:33.694344Z"},"links":{"cited_paper":"/paper/2310.01403","citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:1c91fccd433fc268642dab94c89e9d08ab41f3151b54e779ecb47c61391ce45b","observation_id":"05ab4961-86c0-4bb0-962d-9764b056adc4","resolution":{"observed_at":"2026-08-06T00:52:33.694344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:36.981697Z","title":"Sed: A simple encoder-decoder for open- vocabulary semantic segmentation","venue":null,"work_id":"760c089f-43b4-4428-b191-1b6bd7ac338b","year":2024},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:33.778792Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:356e7e5dfddb633434def0f18c4f29d3c40a5f8e00f8db2e643eaabdabacca54","observation_id":"77c76741-f118-462a-a791-8a604c287ea7","resolution":{"observed_at":"2026-08-06T00:52:37.081625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-02T18:24:11.208164Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16671","snapshot_observed_at":"2026-08-06T00:52:33.858924Z","title":"Demystify- ing clip data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:33.858924Z"},"links":{"cited_paper":"/paper/2309.16671","citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:e39d8f8f63a3fcda7b2dc2abe017059b8fd81fa387adbb73162c5ee67c96e990","observation_id":"20bc680c-a86b-4c4c-95a3-433049a44c8f","resolution":{"observed_at":"2026-08-06T00:52:33.858924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:33.926973Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:33.926973Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:f9fa7469249a8df7e89d36ae1d864cc1b6d0f67e73bb2a348c17c1771fe79ccc","observation_id":"93334985-0d14-4e54-b9ef-d32c1ac5be10","resolution":{"observed_at":"2026-08-06T00:52:33.926973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:36.787388Z","title":"Learning open-vocabulary seman- tic segmentation models from natural language supervision","venue":null,"work_id":"55ca9985-f465-4a26-8a11-b249465f78ed","year":null},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:34.013450Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:101d027c61e198a88491902d4a014cbcd09674377c1c4d7d2449b5bf4a0aa0d1","observation_id":"ff5eb810-0a4c-40a1-bfb7-9b5b3008d332","resolution":{"observed_at":"2026-08-06T00:52:36.887396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:36.564856Z","title":"Open-vocabulary panop- tic segmentation with text-to-image diffusion models","venue":null,"work_id":"abefd0e3-732d-4cd7-9cec-7d5bccd21d0f","year":2023},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:34.090426Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:7ac512085f05f337728fd7f6bfa57787110c1675a2f8aeb92991fb3b392473a7","observation_id":"d83e1658-cb16-4259-839f-99cdcec37ce1","resolution":{"observed_at":"2026-08-06T00:52:36.682637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:36.320047Z","title":"Side adapter network for open-vocabulary semantic segmentation","venue":null,"work_id":"82fd3d6f-f2d1-4c72-9176-a9e17508140f","year":2023},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:34.162129Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:111446f489c2a3a6e0d3de4d11ddc8050b12908db1b98448fb3b5ecfd7b490e6","observation_id":"4171ffa6-65a6-44fd-b784-e765653b5266","resolution":{"observed_at":"2026-08-06T00:52:36.445159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:36.130421Z","title":"k-means mask transformer","venue":null,"work_id":"6843c558-a491-4c3f-80b9-3ec1823ffd66","year":2022},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:34.249365Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:54e7302f4b9ff978293e2892855f2f067bbf7439881e18e6124f4fae3533e33b","observation_id":"61698048-ca34-41ef-b0c6-5d71330e0cee","resolution":{"observed_at":"2026-08-06T00:52:36.230408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:35.827724Z","title":"Convolutions die hard: Open-vocabulary seg- mentation with single frozen convolutional clip","venue":null,"work_id":"b9a41138-1471-4166-b8ad-ac31a628dba6","year":null},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:34.303491Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:cf8b7733a80e974ea923755f705903aa24fc3d2d0996eaf6127e589815ed6182","observation_id":"81525f0d-9bc9-46d3-95d8-9e82f4efd066","resolution":{"observed_at":"2026-08-06T00:52:35.965193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:35.599457Z","title":"Lit: Zero-shot transfer with locked-image text tuning","venue":null,"work_id":"788c52fa-e04f-4417-8674-a38736dde96e","year":2022},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:34.356877Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:38b39f80a54776633e90ebc8c0f9d650a893a5c37524347b4c8b24857819aa01","observation_id":"3e68a02c-c5da-417c-bb19-73f39cd6b51f","resolution":{"observed_at":"2026-08-06T00:52:35.717899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:35.355704Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"384ddc14-ea54-4c2e-87e6-5406edd439bc","year":2023},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:34.413901Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:d689098c2f3fe29a0d428391efe817c522c0587f567c2d438a87290eb4e9a959","observation_id":"4bdd62b8-597d-4771-a03c-e0ee645b8ff3","resolution":{"observed_at":"2026-08-06T00:52:35.475649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:34.493510Z","title":"Pyramid scene parsing network","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:34.493510Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:ee917b5bbf02edd85fda8f4bda456950d7cae8e964fe21dcde7fd7a16f537d4f","observation_id":"16226b19-de43-419b-be29-22bd2c83b221","resolution":{"observed_at":"2026-08-06T00:52:34.493510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:35.054339Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":"f4d5c6df-2e3a-42cb-a6ae-7a108eef6738","year":2017},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:34.528413Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:17da5aeb1592338025ec56f7055e96495fee17c9c7f8db95b2417334fe1ee40e","observation_id":"65388892-487d-40ee-b5a5-11a02ad08bbf","resolution":{"observed_at":"2026-08-06T00:52:35.190577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:34.873198Z","title":"Extract free dense labels from clip","venue":null,"work_id":"6a5767ef-f010-4ee2-8bc5-0379830c00d9","year":2022},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:34.595212Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:45864e25d851bcd85fd58312c317a24d6e6933f0f0d3083401abd11e88cea4a9","observation_id":"0afb6c39-3ebe-45bb-804c-ce44ccc79abd","resolution":{"observed_at":"2026-08-06T00:52:34.939613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:52:39.684925Z","title":null,"venue":null,"work_id":"0df9600d-ad69-499c-b6c7-c6e74143536f","year":2014},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":755,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:32.516086Z"},"links":{"citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:fdcbde1e7a544424a20588934739ce4b183b30d852d3bdfc8cfa8f0748621b87","observation_id":"650fa148-71b0-4ef2-a8f0-2b8fddfef6f2","resolution":{"observed_at":"2026-08-06T00:52:39.793598Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":13,"verified_exact":1,"verified_fuzzy":51},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2508.04211."}