{"as_of":"2026-08-22T03:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3d6c01c9c584ae9f1706f0edc578b87eb10a9260051ab7b33c24d7ab0c5d0baf","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T16:13:22.031007Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.10292/citation-record","integrity":"/paper/2412.10292/integrity","json":"/paper/2412.10292/citation-record.json","paper":"/paper/2412.10292"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.375890Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.375890Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:db095841cfa9b7e01ae57288528e7bf7eded6134fa790d84d428c7d51de50e60","observation_id":"2165829c-d998-4ffd-8a8a-85767d819233","resolution":{"observed_at":"2026-08-11T16:13:21.375890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:25.603887Z","title":"Yolact: Real-time instance segmentation","venue":null,"work_id":"fd5298af-2fb2-455f-8bf7-62aab99c5fb5","year":2019},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.382432Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:8437d64c24904f39bf50269b50692fe0d2747d109ee5bf30438a73f1df045b10","observation_id":"9da6e0c7-d4d4-4573-aab5-d66a620e0fbd","resolution":{"observed_at":"2026-08-11T16:13:25.755956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.388591Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.388591Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:c32c14f7debbb31222ab664bb2a01410d27443a3c62bc2a0e57bba80f9c77356","observation_id":"1dc29a32-c36f-43cd-9613-5a850c26bad8","resolution":{"observed_at":"2026-08-11T16:13:21.388591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:25.343564Z","title":"Coco- stuff: Thing and stuff classes in context","venue":null,"work_id":"bdf690a3-7c3c-4a9a-b20a-dee18f7f95c9","year":2018},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.395367Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:8d5c7d4abb60ef811739c24c4b2e64e24557b2ec218b8c18a17d93a8bfa034a9","observation_id":"e7fd6820-8147-4a1b-ae21-645ea9228469","resolution":{"observed_at":"2026-08-11T16:13:25.483073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.401147Z","title":"Cascade r-cnn: Delv- ing into high quality object detection","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.401147Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:3e99ff71db9778c7f05ed0c99c6dcdd4d45d550af408918a6d0c52da286f046d","observation_id":"e1f5977a-246a-4a0f-b9b6-c7fb799ced9e","resolution":{"observed_at":"2026-08-11T16:13:21.401147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:25.300310Z","title":"End-to- end object detection with transformers","venue":null,"work_id":"997460e5-f5c5-428d-83d2-30d460724480","year":2020},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.406730Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:4ecc6007003c062452dfe57b8b6a6f92415310e67424ad1c98e9fbfa4845c298","observation_id":"234daceb-41a8-453a-bc27-e6e23aacc44f","resolution":{"observed_at":"2026-08-11T16:13:25.328126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.411982Z","title":"Hybrid task cascade for instance seg- mentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.411982Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:86bae94c7ba6c31d276729e92b88a65dd359205d58b250776b7d46c44ccb127e","observation_id":"99e41fc5-af82-4dcc-ab4e-9446c9c0874b","resolution":{"observed_at":"2026-08-11T16:13:21.411982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.7062","last_updated":"2016-06-07T04:00:08Z","snapshot_observed_at":"2026-08-14T23:06:27.726818Z","submitted_at":"2014-12-22T17:18:33Z","title":"Semantic Image Segmentation with Deep Convolutional Nets and Fully Connected CRFs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.7062","snapshot_observed_at":"2026-08-11T16:13:21.418230Z","title":"Semantic image segmen- tation with deep convolutional nets and fully connected crfs","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.418230Z"},"links":{"cited_paper":"/paper/1412.7062","citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:0e593f3eb50681761f44973cc70339ee468772d076b98c8d338586d5c41413f0","observation_id":"d66f6102-df1f-40f0-977d-e87c70b01b1a","resolution":{"observed_at":"2026-08-11T16:13:21.418230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.423864Z","title":"Deeplab: Semantic image segmentation with deep convolutional nets, atrous convolu- tion, and fully connected crfs","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.423864Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:38bca16b19a3a693a9f780314404f201e8ec485138b6da65e4ad5e3474ffe7f4","observation_id":"de363a9c-96dc-471d-99d9-a29914830bca","resolution":{"observed_at":"2026-08-11T16:13:21.423864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05587","last_updated":"2017-12-05T18:06:21Z","snapshot_observed_at":"2026-08-16T09:04:18.586776Z","submitted_at":"2017-06-17T22:48:57Z","title":"Rethinking Atrous Convolution for Semantic Image Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05587","snapshot_observed_at":"2026-08-11T16:13:21.429902Z","title":"Rethinking atrous convolution for seman- tic image segmentation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.429902Z"},"links":{"cited_paper":"/paper/1706.05587","citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:de8adf13f6b65c3ddf64546ccb8a75697d4e8378aa768dac352d86948f504027","observation_id":"e17ee739-1306-48d8-95ce-c5a4a67ead0c","resolution":{"observed_at":"2026-08-11T16:13:21.429902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:25.125067Z","title":"Encoder-decoder with atrous separable convolution for semantic image segmentation","venue":null,"work_id":"370f36ab-4216-4644-9cf4-c9750f86b378","year":2018},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.436211Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:2bca1f938da358395b8feaed7fb4ae9e3f50f0bc8a55e5a0dd0e26a2e39d3bcf","observation_id":"b08237e9-efe2-4efe-a916-b3266748e198","resolution":{"observed_at":"2026-08-11T16:13:25.151587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.11675","last_updated":"2021-02-08T04:07:27Z","snapshot_observed_at":"2026-08-16T19:03:51.166071Z","submitted_at":"2020-11-23T19:14:11Z","title":"Scaling Wide Residual Networks for Panoptic Segmentation","version":2},"cited_work":{"arxiv_id":"2011.11675","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.11675","snapshot_observed_at":"2026-08-11T16:13:22.170739Z","title":"Scaling Wide Residual Networks for Panoptic Segmentation","venue":"cs.CV","work_id":"f22a0a17-99c6-4610-ac26-aa39fcf6071b","year":2020},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.441168Z"},"links":{"cited_paper":"/paper/2011.11675","citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:5844ce83a8e6a2061f9f7b82d6eff3dc9570e954b983c9002235fa69410d0d4d","observation_id":"87305927-b1d6-4780-96dd-a86a87e1917f","resolution":{"observed_at":"2026-08-11T16:13:22.223603Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.446770Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.446770Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:f494bb1e89f724a815ad6dfbb8a904719901558827d2863257076bb219b59aa2","observation_id":"7c1f5756-20fe-4506-ad05-1f66da3ea466","resolution":{"observed_at":"2026-08-11T16:13:21.446770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:24.978391Z","title":"Panoptic-deeplab: A simple, strong, and fast baseline for bottom-up panoptic segmentation","venue":null,"work_id":"6908bc61-4bca-4a6b-b00a-ff5c92df18f1","year":2020},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.451080Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:67d53001caf4bc20a1a05fe26720ec3645c0e46a958f1e1559f4e9b23bb2ae18","observation_id":"b64e0bf5-b913-433f-a822-e1748ce36c6c","resolution":{"observed_at":"2026-08-11T16:13:24.982954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:24.962628Z","title":"Per- pixel classification is not all you need for semantic segmen- tation","venue":null,"work_id":"a858748b-c483-4fd8-b962-7fab931759fc","year":2021},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.455582Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:8cdaa1d24bed9f132b52baafb57258c020db0538b8b2f0226fb95ed445a74b4c","observation_id":"e55bde3c-278c-4834-8028-3bef5c78a77d","resolution":{"observed_at":"2026-08-11T16:13:24.968243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:24.838028Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":"d72311cd-e62c-4b0f-977f-3ccfa6e4c6a2","year":2022},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.459895Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:112e5420ff83042e3c3ff0d5e59daa6365b6cc2d43858e322b026b5bf3063192","observation_id":"29a6deb3-65a9-4dc0-aaf8-7b46ad5e60dd","resolution":{"observed_at":"2026-08-11T16:13:24.951629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:24.709434Z","title":"Cat- seg: Cost aggregation for open-vocabulary semantic seg- mentation","venue":null,"work_id":"c38f7e3d-2480-49a3-88dc-c5b2b7d09f46","year":2024},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.464246Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:f48d4ff31c082b16d1feaac674f91558f6f2019a2050f2e7e1a61660619536e0","observation_id":"bae75d33-06d8-4738-850a-131e1e7cab14","resolution":{"observed_at":"2026-08-11T16:13:24.713965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-11T16:13:21.468248Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.468248Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:f57d2e091a309aa99a7e313faad08912617f6845bc54414dc7f97ab958066a42","observation_id":"3ad12b4c-fedb-4092-9b6c-ac97ab336997","resolution":{"observed_at":"2026-08-11T16:13:21.468248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:24.695419Z","title":"De- coupling zero-shot semantic segmentation","venue":null,"work_id":"5be29bdb-0c01-4f87-9589-c097a61b89af","year":2022},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.472470Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:7fc06553014d9e48fcf0d2371bc86e89bdef6707188c28241f67bd5e82de9eb8","observation_id":"d969e514-a726-48c4-86c5-eefa0c7b6699","resolution":{"observed_at":"2026-08-11T16:13:24.699960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:24.489752Z","title":"Open- vocabulary universal image segmentation with maskclip","venue":null,"work_id":"a1ffbd2a-5e8e-48ea-93ab-0d3a07d25690","year":null},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.492415Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:3d9f33a5745f082703e1f8e78684e9dd86f3c6854a2472e3c7a9b75c7461c653","observation_id":"21243f6c-26b9-4bca-8d8c-803728e83eeb","resolution":{"observed_at":"2026-08-11T16:13:24.550986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.528327Z","title":"The pascal visual object classes challenge: A retrospective","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.528327Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:a5ad193bebdd679eb7c73741fd64ab3d565e7cd2931bc56d6347132b1b5e677c","observation_id":"8b9c1c51-15c2-4810-9b33-1efbf780ab13","resolution":{"observed_at":"2026-08-11T16:13:21.528327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.567103Z","title":"Dual attention network for scene seg- mentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.567103Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:f4fe9ed2bac1f3e7014d7caa2c2be1f896e451e256afdd352d0c4bd00ffe9729","observation_id":"a88faa8b-a639-48b2-aca2-6125d38d419e","resolution":{"observed_at":"2026-08-11T16:13:21.567103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:24.461112Z","title":"Scal- ing open-vocabulary image segmentation with image-level labels","venue":null,"work_id":"19f73434-3cb1-4786-96c8-0c81f067c66c","year":2022},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.605909Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:409f2772b44e3255251ce6d35b2f4377ea02c294140f56d2d96b0afc7ee50225","observation_id":"b79c1770-b6e2-47a6-9521-32155e03f1eb","resolution":{"observed_at":"2026-08-11T16:13:24.465178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:24.232190Z","title":"Multi-scale high-resolution vision transformer for se- mantic segmentation","venue":null,"work_id":"e3c56ccb-5a35-49fe-8d6c-5c2501e0f2b2","year":2022},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.647381Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:1c206c205bbf3252cd10fb197319756b4b83ee3e03f4d539ea4af47b2e3f5a2b","observation_id":"f965b801-b33d-4269-959e-d466c7116519","resolution":{"observed_at":"2026-08-11T16:13:24.334936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.666915Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.666915Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:8f43ce6d5f641b6c3f93280300450667980c8d52f4e0962aead5bceebace2e3b","observation_id":"ba7c5f91-2951-45f8-9761-ab594d74ede3","resolution":{"observed_at":"2026-08-11T16:13:21.666915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.671481Z","title":"Mask r-cnn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.671481Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:203359a852e0b70e558e52220495d75d5138d5cbf6e7020ca15e0e7d313e6f73","observation_id":"10e16bc9-9282-4430-941f-a8c1d73053d9","resolution":{"observed_at":"2026-08-11T16:13:21.671481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.676857Z","title":"Oneformer: One transformer to rule universal image segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.676857Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:9ccbaebe6f2c961914ccb9dbfd6f147cfcd3803248a97748ed6ebf781fbfce8b","observation_id":"3e660ae9-70d5-4658-8785-62a14b4c1f71","resolution":{"observed_at":"2026-08-11T16:13:21.676857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.681372Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.681372Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:bf13b2242e46b643542ec7e53771b7dcc71ac42895e8ec12f9d4b772b3de34df","observation_id":"1d1a2e84-204d-41c5-aa83-360b099bf749","resolution":{"observed_at":"2026-08-11T16:13:21.681372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:24.082138Z","title":"Instancecut: from edges to instances with multicut","venue":null,"work_id":"534145eb-c666-4c3c-b11a-46a85eb0bc43","year":2017},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.685842Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:a0b8228cd48a6421df4f72eb0b93224c18a9b66669b6cc587abb89ba30f0ee7f","observation_id":"97530eb1-ae01-4671-b6c5-3bca3fd0972b","resolution":{"observed_at":"2026-08-11T16:13:24.086330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:24.069239Z","title":"Panoptic segmentation","venue":null,"work_id":"9ab055a3-c43f-424b-ae94-5d1f047deb72","year":2019},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.689605Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:0a523f03ad3b6cf10b5bc5844bc5db502c9733d031c532bf7697e791f9c2ca02","observation_id":"8d665acf-ec11-4aab-a57c-a8203d4993cf","resolution":{"observed_at":"2026-08-11T16:13:24.073330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-11T16:13:21.693250Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.693250Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:478ff918ada7f2ab9e32081265722f962c21974015c6c88442cbe24496627925","observation_id":"e9ce9c7e-1942-4deb-bfb3-4b9999dba91c","resolution":{"observed_at":"2026-08-11T16:13:21.693250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:24.055831Z","title":"Language-driven semantic seg- mentation","venue":null,"work_id":"9523766c-5b7c-4665-b593-04072027b0de","year":2022},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.697081Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:a1fd18a7301358cacf37594b58133c8a2b2b14b96f75099d2904380041df63e5","observation_id":"bb7e6bfc-04af-49bd-89aa-0f4cdb55fed0","resolution":{"observed_at":"2026-08-11T16:13:24.060417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:24.040353Z","title":"Mask dino: Towards a unified transformer-based framework for object detection and segmentation","venue":null,"work_id":"52d8e000-130e-425e-a6db-29396c4d0456","year":2023},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.701587Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:43118bf1e633d2b20a0636dd484eb1eb31e9055bdd21ea2534e08cac4301e4ec","observation_id":"7c339f6f-d0aa-4818-bffa-95aa93759fc2","resolution":{"observed_at":"2026-08-11T16:13:24.046464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:23.848085Z","title":"Unifying training and inference for panoptic segmentation","venue":null,"work_id":"e5757079-3c7f-432d-847a-85a9744f87de","year":2020},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.705540Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:05d7e0c785997caf98989da869cbac93c1b3439c88854b7edcead8e2d66708bc","observation_id":"565bbd3a-5fab-498f-b57d-ec5d2c826f4e","resolution":{"observed_at":"2026-08-11T16:13:23.958330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:23.684733Z","title":"Panoptic segformer: Delving deeper into panoptic segmen- tation with transformers","venue":null,"work_id":"853f93b5-8a1f-46f7-8ce1-72ffa10fda46","year":2022},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.709501Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:ab5929a9dfd113187b6781f0fe25b1c64e7f1d2490542c5372ccff7f79c8938f","observation_id":"3aade755-30f5-4726-9942-82d3c0ec9a30","resolution":{"observed_at":"2026-08-11T16:13:23.717613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:23.666893Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip","venue":null,"work_id":"7821bba5-fed2-4d35-a924-d6aef9e73425","year":2023},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.713271Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:552c90cb2fa5fa861029fc197e120fbbc263fa065277c15fc78919c30d80d0e8","observation_id":"fdd069aa-3c09-46fc-a672-de5815654d52","resolution":{"observed_at":"2026-08-11T16:13:23.672448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:23.651306Z","title":"Feature pyra- mid networks for object detection","venue":null,"work_id":"36dac368-4340-41d5-ab5d-a1885e7a9c85","year":2017},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.717235Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:1bca581c9a0d6d7917d526aacba961b9c243fc59e1f06418ca02a1a41ce70dbe","observation_id":"4447bf7f-ce51-4c19-ad49-8ec1e9ac1114","resolution":{"observed_at":"2026-08-11T16:13:23.656137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:23.538490Z","title":"An end-to-end network for panoptic segmentation","venue":null,"work_id":"712f13fb-c2e5-45d5-919d-5bcf0ba15efb","year":2019},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.720660Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:5c0cafd2a31191752e6b11884197249a24ad99ff8a0d73f647140cc72240447d","observation_id":"92f42f4e-0992-431f-9280-d7aeeaf29b37","resolution":{"observed_at":"2026-08-11T16:13:23.641930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:23.367301Z","title":"Path aggregation network for instance segmentation","venue":null,"work_id":"7dc566ff-1dc5-485a-89ab-cd30070ad17a","year":2018},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.724191Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:dccfb9024c1e1af92723fb88265018a21a5d38ed271db8aec4489be8a61578f0","observation_id":"6b656021-bc98-4b0b-90df-f18a9402985d","resolution":{"observed_at":"2026-08-11T16:13:23.422067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-11T16:13:21.727761Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.727761Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:2582121d866f543ac69f22d464ce21ce1418975e678d2c1b31409538b0677b8a","observation_id":"c3f7285b-b5b5-4a22-aa95-718d35eeac55","resolution":{"observed_at":"2026-08-11T16:13:21.727761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.731798Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.731798Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:b8cc588364ba5e0af3a5d6e37c6f8393c68ea488652e9592528320bafdfb9f31","observation_id":"6319521a-28e8-4743-b39f-b638c60ff5b1","resolution":{"observed_at":"2026-08-11T16:13:21.731798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.735560Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.735560Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:90fb132427ef69df9959500e7ef470de3b97507efd6f0579ebea1faf577e2244","observation_id":"cfc97d40-303e-4e3a-9929-eff6686d3d9c","resolution":{"observed_at":"2026-08-11T16:13:21.735560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:23.336247Z","title":"V-net: Fully convolutional neural networks for volumetric medical image segmentation","venue":null,"work_id":"20f0a9e3-f45a-491b-b958-26de226ef6cd","year":2016},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.740123Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:091f38af8f0dff488aeaba3dc7f3fa26e8209c9cc9059f47436909ae3791c619","observation_id":"11ee1a28-3852-4f66-ae13-3ba4c5b0726d","resolution":{"observed_at":"2026-08-11T16:13:23.340520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.744142Z","title":"The role of context for object detection and semantic segmentation in the wild","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.744142Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:ecbad44cb03d0626ddbbf2b73bec2975a84817fda77799e2a285dd7c114104e9","observation_id":"10b3bb57-5e79-4c03-a53b-7828d0635850","resolution":{"observed_at":"2026-08-11T16:13:21.744142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:23.310505Z","title":"Detectors: Detecting objects with recursive feature pyramid and switch- able atrous convolution","venue":null,"work_id":"db419409-c30a-4712-bd33-a7bd3611f965","year":2021},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.747790Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:528065740c4d68b65b72f02ca9236db31f74eafd729fffb24c9c5cba54bbd30d","observation_id":"5fff1783-a63f-4219-8be2-74e295e2ea9a","resolution":{"observed_at":"2026-08-11T16:13:23.317158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:23.289613Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"6e36993b-b6f8-4105-a526-6f982a4c351e","year":2021},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.752338Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:41d13a10a9fa5f3dc8bb31ad00017e9c4de0f9b1bb9e9db9071a0658a7977fe7","observation_id":"ab46c988-d5d5-45a1-99d0-7a89d8050aa7","resolution":{"observed_at":"2026-08-11T16:13:23.294882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:23.179800Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"93851b23-2668-41ce-856a-f98e4fd9e113","year":2020},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.755568Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:02d2b1619b2414c4cb1610577cc12438e179e064a65c4d2071ffa65423cfe1d8","observation_id":"dd5cf608-1111-4de7-873e-94f9197e48c1","resolution":{"observed_at":"2026-08-11T16:13:23.225426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:23.068109Z","title":"High-resolution image 10 synthesis with latent diffusion models","venue":null,"work_id":"edb57b2d-4a11-47ea-accb-ce549d8ea2a1","year":2022},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.759012Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:a2905d43512070e1618927b28b0254fa6b7e956e415c4bd2fe3aedc94e5d00df","observation_id":"0038ec18-2c9a-4bfb-b700-0e93d263a3bc","resolution":{"observed_at":"2026-08-11T16:13:23.122034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.766215Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.766215Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:be861ed879660364019900ccc9a5961f44ca52455951a87f8412ff053f5ca67b","observation_id":"f2f2f104-89ac-4530-aa48-0715a368c2a5","resolution":{"observed_at":"2026-08-11T16:13:21.766215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.776084Z","title":"Segmenter: Transformer for semantic segmenta- tion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.776084Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:9f05bce3d715a0ed7c4272606410dfe5cb05382a295e1c26067248b33be1b866","observation_id":"b2bbe89a-7132-4d02-b8d5-256a564df82e","resolution":{"observed_at":"2026-08-11T16:13:21.776084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:23.025364Z","title":"Lxmert: Learning cross-modality encoder representations from transformers","venue":null,"work_id":"5382566d-8c8d-40be-b045-538c613f56a3","year":2019},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.786678Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:752f6fc3ace2cedef4d8707ba4625a78ab745dec7a87756739807ab93627b07a","observation_id":"a73f2adf-5e65-440a-a3d3-36db51d58200","resolution":{"observed_at":"2026-08-11T16:13:23.030590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.798478Z","title":"Conditional con- volutions for instance segmentation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.798478Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:63a177f595c97051cbc8824e14257cce94524c8c2586e7513a292c078725d2dc","observation_id":"c4a9df2a-bfe7-4e79-add8-48d5ab332d58","resolution":{"observed_at":"2026-08-11T16:13:21.798478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.814515Z","title":"Axial-deeplab: Stand- alone axial-attention for panoptic segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.814515Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:1ca7546d38fb2c40e1e3f06cf3d233fa44d2974206a66a12a8f34fcfb06f69f4","observation_id":"1decb700-23d8-44fe-a8ec-45b663701209","resolution":{"observed_at":"2026-08-11T16:13:21.814515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.832305Z","title":"Max-deeplab: End-to-end panoptic segmentation with mask transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.832305Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:e1621b41c102272f7df4f4b9f59268af435118c29c69ba650c58f0daa2a6bd21","observation_id":"788c0cd6-3d85-4d73-b183-5fd77680ef42","resolution":{"observed_at":"2026-08-11T16:13:21.832305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:22.963112Z","title":"Solov2: Dynamic and fast instance segmenta- tion","venue":null,"work_id":"2a38e8fd-0194-4504-a843-a82e215e3f6e","year":2020},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.836096Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:7241b755273564e17456c31996c808d4bca2a53a58e4849290979f15557028c2","observation_id":"f3ccbd32-2083-4742-bd89-23c0bca6605e","resolution":{"observed_at":"2026-08-11T16:13:22.980817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.839734Z","title":"Segformer: Simple and efficient design for semantic segmentation with transform- ers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.839734Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:a6cf3962e94306a8897b69733dafa3b9fd471c58f0038c0ba3a2cb891e09d621","observation_id":"62c8ab6b-dd68-42b2-83a2-a935ea2452c9","resolution":{"observed_at":"2026-08-11T16:13:21.839734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:22.829121Z","title":"Upsnet: A unified panoptic segmentation network","venue":null,"work_id":"84b017e9-7e8f-492f-a312-d7ee43b4d872","year":2019},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.844052Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:dfa32dc50e0bfa1455e223ada22e62b95c5fe911360fd21bb53a7d7f7035653b","observation_id":"cdf52ce1-b66b-4233-b8eb-1d68c0f62f0e","resolution":{"observed_at":"2026-08-11T16:13:22.893169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:22.806384Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":"a36fc282-d9b9-4598-9d2c-266253c9cd37","year":2022},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.848050Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:17ca7dc24f9ecb8e015133b6b2f8d76cfb1a8df984f78e0335c4050ee417c613","observation_id":"2f07b77a-1f20-45b0-a9bf-7a03315842ff","resolution":{"observed_at":"2026-08-11T16:13:22.811208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:22.792226Z","title":"Open-vocabulary panop- tic segmentation with text-to-image diffusion models","venue":null,"work_id":"1d7a150c-3896-46da-ac35-6a8bc662e808","year":2023},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.852784Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:d5def35a9834509a26cd614e0596a950f4884f7bb0de05009b4ff853924df6a2","observation_id":"ff660f5e-e3a8-4cdb-892b-355f73b84229","resolution":{"observed_at":"2026-08-11T16:13:22.796974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:22.780137Z","title":"A simple baseline for zero- shot semantic segmentation with pre-trained vision-language model","venue":null,"work_id":"5da942bf-9f82-45b1-9182-e9f123d56372","year":2021},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.857567Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:5846fc2ac27937377aec5ea04da7490fdf5d35141afa9713bbb60f3da98505d3","observation_id":"6913698f-df80-44c5-b51f-9a6844c42620","resolution":{"observed_at":"2026-08-11T16:13:22.783891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:22.766713Z","title":"A simple baseline for open- vocabulary semantic segmentation with pre-trained vision- language model","venue":null,"work_id":"db698b26-6541-4a48-9807-1609b4ace719","year":2022},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.861834Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:2000b2f8d4023f0aefe516979d876b102aab0d111c4b0d53f11d20dd6a56c008","observation_id":"3a97d447-90fa-4252-ab85-98b265c46ef8","resolution":{"observed_at":"2026-08-11T16:13:22.770981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:22.753745Z","title":"Side adapter network for open-vocabulary semantic segmentation","venue":null,"work_id":"bc0cd6b0-e4d7-446f-a78d-7d0b57cc04c1","year":2023},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.866417Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:9163df9c206da2a2703c6427a429f7c3a957a25031352d0ea6a6fe84db49b63a","observation_id":"134483c6-44ca-40e2-ae75-2423eddff60c","resolution":{"observed_at":"2026-08-11T16:13:22.757602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-13T15:12:42.567441Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-11T16:13:21.870499Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.870499Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:7a38a7514ef47e122614693e374788e0287e8088f560c0fbe07deea0c1df2a17","observation_id":"8e6d85a0-6a06-4f3d-8b66-d543223df33f","resolution":{"observed_at":"2026-08-11T16:13:21.870499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:22.736821Z","title":"Cmt-deeplab: Clustering mask transformers for panoptic segmentation","venue":null,"work_id":"83d8141f-d82e-44fe-8684-f4b42813e24f","year":2022},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.876893Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:6c12d2b300155e1d5b29ee3b4a53b30baf49667bc78600b4f213fae04b9ab7ed","observation_id":"b73dc158-4d40-4b6d-a05b-8d3de683a46c","resolution":{"observed_at":"2026-08-11T16:13:22.746174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.882311Z","title":"k-means mask transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.882311Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:8b69c9ad7b3d7917236471f09663874f0ccb70557ad30639ef9e4ac25e69aba2","observation_id":"f807e718-728c-4347-b818-036dae64a2bc","resolution":{"observed_at":"2026-08-11T16:13:21.882311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02487","last_updated":"2023-11-14T19:10:49Z","snapshot_observed_at":"2026-08-16T15:10:43.081176Z","submitted_at":"2023-08-04T17:59:01Z","title":"Convolutions Die Hard: Open-Vocabulary Segmentation with Single Frozen Convolutional CLIP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02487","snapshot_observed_at":"2026-08-11T16:13:21.887426Z","title":"Convolutions die hard: Open-vocabulary seg- mentation with single frozen convolutional clip","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.887426Z"},"links":{"cited_paper":"/paper/2308.02487","citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:b5088a057aef6eeaf1664bd644cfa81db9e51981a34f90b7b563d574152a78f2","observation_id":"89590fd0-1521-403e-8e7c-1d48aa671550","resolution":{"observed_at":"2026-08-11T16:13:21.887426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-11T16:13:21.892358Z","title":"Florence: A new foundation model for computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.892358Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:f2d7a2ff492e52988eb29fa7dfe5056550dacba6dae027cd63188f97c9788f6f","observation_id":"e242f922-0776-4662-be87-449281f230e7","resolution":{"observed_at":"2026-08-11T16:13:21.892358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:22.529361Z","title":"Object- contextual representations for semantic segmentation","venue":null,"work_id":"b41b67d6-39a7-4cf8-85bc-8ab49a9e07e9","year":2020},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.896562Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:6e1b2d30aaa11fd2da5b1d54e3752cd55e89605fac0b9c8cc6fc9f9f37a96d1c","observation_id":"379c04d5-196f-4f27-82db-e7ae1b9ebf1d","resolution":{"observed_at":"2026-08-11T16:13:22.602671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.900384Z","title":"Open-vocabulary object detection using captions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.900384Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:9afb4c01a794d6c71d247f14a70ea27c408ff37025c77777f979cb3191fa06cd","observation_id":"ec9410a8-bcd8-415b-9235-16073519642b","resolution":{"observed_at":"2026-08-11T16:13:21.900384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.904539Z","title":"Vinvl: Revisiting visual representations in vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.904539Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:7111a6c8bde69b52f54f782a0d762dda67e8b124552bdfa3f76ecb00ec483b6a","observation_id":"054d785e-36a2-4bea-b3b6-82c696bc0548","resolution":{"observed_at":"2026-08-11T16:13:21.904539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:22.455604Z","title":"Rethinking semantic segmen- tation from a sequence-to-sequence perspective with trans- formers","venue":null,"work_id":"482d19a4-7a9c-48c6-ae40-2508b95352e3","year":null},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.908636Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:c4ea369b427ff3da34689bd267caf887395a8f9e3c225d87324e2b1798085023","observation_id":"d9be8b47-b9d3-4dc9-ba5f-d2617866275d","resolution":{"observed_at":"2026-08-11T16:13:22.460651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:21.913367Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.913367Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:232747c5478283b34be252aab6eae3b82c93df3a6b5ab2db946e4e2351c0ea5d","observation_id":"aa6f45cc-a71a-4288-be9e-ed02b8eb9f83","resolution":{"observed_at":"2026-08-11T16:13:21.913367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:22.428087Z","title":"Extract free dense labels from clip","venue":null,"work_id":"14bb0f7d-1c0e-4e84-be2f-63adfdffb9b2","year":2022},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.918450Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:d20ba9fa886619d32e90f85c1398a0fb5bf04b780c4ef9ee96028ac9ea1fb83e","observation_id":"fb669aac-4fbd-4ea1-941c-1dc5f9285260","resolution":{"observed_at":"2026-08-11T16:13:22.439451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:22.398895Z","title":"Zegclip: Towards adapting clip for zero-shot se- mantic segmentation","venue":null,"work_id":"93e67df6-5599-4c06-8574-12360df54047","year":2023},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.937481Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:083687c305d62edf0b7a2081f3ad94bd1adb5f971636fa536024288c1955f621","observation_id":"0f90d819-b297-42e4-8234-8fc7878eaef0","resolution":{"observed_at":"2026-08-11T16:13:22.420152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-08-13T17:54:01.724774Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-11T16:13:21.969954Z","title":"Deformable detr: Deformable trans- formers for end-to-end object detection","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:21.969954Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:ff8ece215f2b94ca130854e9a0169797c09814e891a02be1ad649974a9ad9667","observation_id":"5c42331f-818e-4c5e-bc02-bfc55348086c","resolution":{"observed_at":"2026-08-11T16:13:21.969954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:22.001857Z","title":"Generalized decoding for pixel, image, and lan- guage","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:22.001857Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:8a2232a82ba6b0b4d2979f19e7aec8c96e0e874bfbfa2246c08492e3ecbbc225","observation_id":"310c9250-758f-46a5-a0a1-3c03f9875189","resolution":{"observed_at":"2026-08-11T16:13:22.001857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:22.315686Z","title":"MIT CSAIL","venue":null,"work_id":"51b87466-46bf-4faf-bc9b-c6750e650332","year":null},"citing_paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T16:13:22.031007Z"},"links":{"citing_paper":"/paper/2412.10292"},"observation_digest":"sha256:fab694db43c06f85b42e6cd4f13caad951974fd4251b9b673fa43b26741859de","observation_id":"434b21bf-5163-4fc2-be65-55584bba2d47","resolution":{"observed_at":"2026-08-11T16:13:22.347937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.10292","last_updated":"2024-12-13T17:22:50Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T13:37:34.693665Z","submitted_at":"2024-12-13T17:22:50Z","title":"Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":1,"verified_fuzzy":41},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2412.10292."}