{"as_of":"2026-08-16T23:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:638a2a1cf560d1544ae6011537880daf6cd092317b776b439bf37d7cb9634175","coverage":[{"denominator":96,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":96,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:34:51.235118Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.04410/citation-record","integrity":"/paper/2505.04410/integrity","json":"/paper/2505.04410/citation-record.json","paper":"/paper/2505.04410"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.10093","last_updated":"2025-02-20T23:59:44Z","snapshot_observed_at":"2026-08-16T14:18:15.072977Z","submitted_at":"2024-02-15T16:46:16Z","title":"MIM-Refiner: A Contrastive Learning Boost from Intermediate Pre-Trained Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10093","snapshot_observed_at":"2026-08-15T23:34:50.789353Z","title":"Mim-refiner: A contrastive learning boost from intermediate pre-trained representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.789353Z"},"links":{"cited_paper":"/paper/2402.10093","citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:cf7fad60e358d1246f2ad26fad79efeb0ecceea51c39bc486d1f6040896a55dd","observation_id":"e9aae3a4-dfd5-425b-a1c0-f4b125ccb202","resolution":{"observed_at":"2026-08-15T23:34:50.789353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:50.794776Z","title":"Multi-label cluster discrimination for vi- sual representation learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.794776Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:ec4ee356ca8c5135cb7afff10c399717b6bb1ed8cf3ccaef7a36ba622cdcfbff","observation_id":"0d225a0d-3206-4e4e-baf4-31be6a13ea0d","resolution":{"observed_at":"2026-08-15T23:34:50.794776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:50.799662Z","title":"Coco- stuff: Thing and stuff classes in context","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.799662Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:4bc73f2f096cea08f53eb5316021192d9667aeaf83516c7ea17b1e0a726362a0","observation_id":"8e370ba9-bba1-4df9-99a1-ff676b8cd86a","resolution":{"observed_at":"2026-08-15T23:34:50.799662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:50.804199Z","title":"End- to-end object detection with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.804199Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:dcd42095416d099e09baebc56b54aaf51b2b9772c473674fc1f8189a0f7ab724","observation_id":"ddff29ea-de4b-457b-8fa2-c63ee79e8cf6","resolution":{"observed_at":"2026-08-15T23:34:50.804199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:50.808752Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.808752Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:83c47e895a6d2fefaf951079f9be8bb20ff3c83a5531765e5706424fddc0f9af","observation_id":"68d404bc-9099-4d88-9636-7966d69ec71f","resolution":{"observed_at":"2026-08-15T23:34:50.808752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:50.813319Z","title":"Learn- ing to generate text-grounded mask for open-world semantic segmentation from only image-text pairs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.813319Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:3241ea2f380e717b6222a24b941aa0d0009ad7d506b88102071c85f22e41173b","observation_id":"76596e1e-6444-4b2c-9117-238ba3aec9db","resolution":{"observed_at":"2026-08-15T23:34:50.813319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:50.818111Z","title":"Enhanced training of query- based object detection via selective query recollection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.818111Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:1491042bb565e0ddd37217e04b830ff852ec5ec993b7b4e21d7f73095420e6c4","observation_id":"14c75a3c-c75e-4228-a46c-ce05fae03dba","resolution":{"observed_at":"2026-08-15T23:34:50.818111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19854","last_updated":"2024-05-30T09:03:23Z","snapshot_observed_at":"2026-08-16T13:47:50.963166Z","submitted_at":"2024-05-30T09:03:23Z","title":"RTGen: Generating Region-Text Pairs for Open-Vocabulary Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19854","snapshot_observed_at":"2026-08-15T23:34:50.823178Z","title":"Rtgen: Generating region-text pairs for open-vocabulary object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.823178Z"},"links":{"cited_paper":"/paper/2405.19854","citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:80ae4eeecf2084438ada93b5f0e8f5f35a31c5316465dbc86ece1194a074c40a","observation_id":"cff71e60-1f2a-42aa-9505-a23304f5a18b","resolution":{"observed_at":"2026-08-15T23:34:50.823178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:50.827975Z","title":"Exploring open-vocabulary semantic segmentation from clip vision encoder distilla- tion only","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.827975Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:02aead20844f596c5b1789993765cda9c80621b49ef05870372344d4584d3cc8","observation_id":"3234b041-7c1f-4ed1-8a03-273534d7e542","resolution":{"observed_at":"2026-08-15T23:34:50.827975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:50.832291Z","title":"An empiri- cal study of training self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.832291Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:afd360abd67bba790e598c030bc22ee5cd05172425d66d38d24b4f00047fae73","observation_id":"67be98ee-a142-40a7-9ae1-288be7e3f3f7","resolution":{"observed_at":"2026-08-15T23:34:50.832291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03525","last_updated":"2024-09-05T13:36:50Z","snapshot_observed_at":"2026-08-16T13:21:04.307164Z","submitted_at":"2024-09-05T13:36:50Z","title":"FrozenSeg: Harmonizing Frozen Foundation Models for Open-Vocabulary Segmentation","version":1},"cited_work":{"arxiv_id":"2409.03525","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.03525","snapshot_observed_at":"2026-08-15T23:34:51.548481Z","title":"FrozenSeg: Harmonizing Frozen Foundation Models for Open-Vocabulary Segmentation","venue":"cs.CV","work_id":"627b799a-ef54-457a-ab17-537ed93a781a","year":2024},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.836903Z"},"links":{"cited_paper":"/paper/2409.03525","citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:a221a680275b9bf70a165a01f975cff8ef9d82000db3b2522c888f80d91001ec","observation_id":"913c4eda-21fd-4fcb-811f-1c337e0cd8ee","resolution":{"observed_at":"2026-08-15T23:34:51.553868Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:50.842409Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.842409Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:9987a92fbafe8967ec02eba9f1fff0be74face5f0e2d083f32fb3abd855a5ff7","observation_id":"22383667-7fda-4fb1-ba59-4866674e2b1a","resolution":{"observed_at":"2026-08-15T23:34:50.842409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:50.846824Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.846824Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:fed53a812295d4f5e92e25fe4705d099909f9eb326dc2ddc83dcbb1b2c231f8c","observation_id":"37fefd88-d736-4261-8e80-34cf398d7143","resolution":{"observed_at":"2026-08-15T23:34:50.846824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:50.851332Z","title":"Cat- seg: Cost aggregation for open-vocabulary semantic seg- mentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.851332Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:a0ddbe075a9c052d59175d3d303fcb9ff341cae07a06e8eef5075e1f1beb6126","observation_id":"af632cf0-cd46-430d-9272-85831784784b","resolution":{"observed_at":"2026-08-15T23:34:50.851332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:50.855547Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.855547Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:58d34b0bfa31c84dd69f401d3533f03bb08b2bfae767b1e9f5a9e8985e837b4e","observation_id":"93b8383a-ba90-4fe1-8a6a-c45407bfc0a8","resolution":{"observed_at":"2026-08-15T23:34:50.855547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16588","snapshot_observed_at":"2026-08-15T23:34:50.859852Z","title":"Vision transformers need registers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.859852Z"},"links":{"cited_paper":"/paper/2309.16588","citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:75c5b1501e51b7a8e719f18fea986c3d0fee97b2bb7195985f23be4329924d1c","observation_id":"cebce2ac-f561-4ac4-8bed-4a939b6c9558","resolution":{"observed_at":"2026-08-15T23:34:50.859852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:50.864585Z","title":"De- coupling zero-shot semantic segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.864585Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:69490ebae8008f8f122f35ef4c8f07162691afa3877a1f4199138305ebd52e5b","observation_id":"0853771a-d97a-4169-8fb0-2fdafe56c009","resolution":{"observed_at":"2026-08-15T23:34:50.864585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:50.868992Z","title":"De- coupling zero-shot semantic segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.868992Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:939b3afeba3298b302d5047565383201f0c7eb0517187e4847a7b3f3fd9c4b27","observation_id":"468d10fa-c3e1-4c66-998d-0c539eaca17a","resolution":{"observed_at":"2026-08-15T23:34:50.868992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T23:34:50.873733Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.873733Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:ff519a190c75bd1f2a3ed4fddd8d15f93c4db42250a509ce5736e09b683649aa","observation_id":"462fd581-3f34-45dc-86ad-0bc55051bca9","resolution":{"observed_at":"2026-08-15T23:34:50.873733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:50.878506Z","title":"Learning to prompt for open-vocabulary ob- ject detection with vision-language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.878506Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:1b73e16fc158b867f01c89aee2667d6a2349122c5eb0341e7ffab1e01222f4da","observation_id":"1c5b858b-92a4-44d0-afcc-25ae57cb1028","resolution":{"observed_at":"2026-08-15T23:34:50.878506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:50.883069Z","title":"The pascal visual object classes (voc) challenge","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.883069Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:c74836062ee20a111ab0da5cc401420a08704832e6cf3653a1d826d8275defee","observation_id":"c0517833-1b5b-45fd-bfcf-38deb8eac989","resolution":{"observed_at":"2026-08-15T23:34:50.883069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:50.887480Z","title":"Eva-02: A visual representation for neon genesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.887480Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:ce376fbe674339a0a89ddee8ad43dcecad8ed2aba615543f1666d56c32a72ed2","observation_id":"3ac2733e-ef95-41d3-877d-7094c283477d","resolution":{"observed_at":"2026-08-15T23:34:50.887480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.465123Z","title":"Scal- ing open-vocabulary image segmentation with image-level labels","venue":null,"work_id":"6661df66-f3d9-45d2-8261-407e01333dd9","year":2022},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.892162Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:8b6cdeaaa4dfc509a817969a6ebef276def0d64a72f85bfc8c98c46bb8a20ec3","observation_id":"c08ac922-58bf-42fc-803e-c748758dac55","resolution":{"observed_at":"2026-08-15T23:34:52.469954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13921","last_updated":"2022-05-12T01:27:40Z","snapshot_observed_at":"2026-08-16T03:57:01.951598Z","submitted_at":"2021-04-28T17:58:57Z","title":"Open-vocabulary Object Detection via Vision and Language Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13921","snapshot_observed_at":"2026-08-15T23:34:50.896583Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.896583Z"},"links":{"cited_paper":"/paper/2104.13921","citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:3ca676bb60233f126b1c9d9c006cdf14f629848aff9b6822e3198dba922058a4","observation_id":"47bcd4df-4d2a-4635-b4a7-f89b9941b288","resolution":{"observed_at":"2026-08-15T23:34:50.896583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.450010Z","title":"Lvis: A dataset for large vocabulary instance segmentation","venue":null,"work_id":"6c116f9f-655e-4ece-951e-e8e6dfd3ceee","year":2019},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.901697Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:9fa9921cd2c1a995bbf6d2031f9f955a1abb389be5a07c51fed1cf1cc8991bc0","observation_id":"8eb4ec01-fd45-4696-97fb-123fc54c215c","resolution":{"observed_at":"2026-08-15T23:34:52.454645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.435642Z","title":"Global knowledge calibration for fast open-vocabulary segmentation","venue":null,"work_id":"5fa1f6bf-40da-464b-ac23-de328412f330","year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.906079Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:ed8bcf9ca69d0a59212480513ec9697ed2d9929ae8df3c15d7bcb164e1e693f9","observation_id":"a0f84489-692e-4350-9eed-fea9e5e69ea2","resolution":{"observed_at":"2026-08-15T23:34:52.440185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.419910Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"b927b6b0-c3ee-4fd8-bafa-5fe4d988f642","year":2016},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.911285Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:0fd92b3e5446638815a3cf1d32ac2d5cacae02ac84f5c75ba5ab460f8d3591b2","observation_id":"f64f60f8-04a9-471d-8a57-7e3846ed7a53","resolution":{"observed_at":"2026-08-15T23:34:52.425353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.405406Z","title":"Mask r-cnn","venue":null,"work_id":"69f1b062-dd03-49dc-a395-07b9399d9286","year":2017},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.915638Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:4fd9eee2923690cf80f9ced55688ffda3b51a08ec70c5f28989bc920a7c173c0","observation_id":"bf60fed1-5ef8-4462-afca-ab085d1bc05c","resolution":{"observed_at":"2026-08-15T23:34:52.410061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.390890Z","title":"Proxydet: Synthesizing proxy novel classes via classwise mixup for open-vocabulary object de- tection","venue":null,"work_id":"5ec635de-ad6c-4bc6-84bd-3f87132cf6ea","year":2024},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.919872Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:bad9700f02c21839481efb4448f11599d9fe25ac2b38875346c228d2cbaf6698","observation_id":"3ed427ba-2453-4f56-9234-df67cb096604","resolution":{"observed_at":"2026-08-15T23:34:52.395526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.375531Z","title":"Learning mask-aware clip representations for zero-shot segmentation","venue":null,"work_id":"d7fb5d9c-0a5f-4e28-b5f4-df0f1954b0f8","year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.924157Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:425c2417ead00ff7b99151828e4237d45ddfa2de609b9f12a28d90097f940c10","observation_id":"ebb4b513-25b4-48b5-bcac-f67570b5ba01","resolution":{"observed_at":"2026-08-15T23:34:52.380306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.360708Z","title":"Collaborative vision-text rep- resentation optimizing for open-vocabulary segmentation","venue":null,"work_id":"0bcbde50-f91f-4038-b782-b9bd643fd672","year":2025},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.928776Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:0c63b959c79e03b828802ac547d7a29c23b01fcb4d30a87d3799ec029ccc00b2","observation_id":"f94252f9-ed42-49dd-9e8c-01c8b515070b","resolution":{"observed_at":"2026-08-15T23:34:52.365408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09316","last_updated":"2024-09-30T03:17:39Z","snapshot_observed_at":"2026-08-16T15:23:34.442171Z","submitted_at":"2023-06-15T17:51:28Z","title":"Diffusion Models for Open-Vocabulary Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09316","snapshot_observed_at":"2026-08-15T23:34:50.933141Z","title":"Diffusion models for zero-shot open-vocabulary segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.933141Z"},"links":{"cited_paper":"/paper/2306.09316","citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:0c9a399dd5c0e51951d775f1a14a5891e7f74e19f7993f6c3f4ef1eb4391f30d","observation_id":"cb8c8593-2c30-4bd9-98bc-f2227ce10143","resolution":{"observed_at":"2026-08-15T23:34:50.933141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.345934Z","title":"Con- trastive feature masking open-vocabulary vision transformer","venue":null,"work_id":"ffc1b372-1a06-4847-867d-e03c0a3d6585","year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.937888Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:187ce8778525ae44172d10f26c1767d0bdd508d94c104142c5644f209290bf57","observation_id":"df49e70b-d91f-410d-a81c-5062c9f06733","resolution":{"observed_at":"2026-08-15T23:34:52.350785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.330912Z","title":"Region- aware pretraining for open-vocabulary object detection with vision transformers","venue":null,"work_id":"04b737bf-817b-4a14-8681-8e8acc6c3ef8","year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.942487Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:000a65dfecbf6ef6358f1f7a0f9cc1ee2ca53e9983e45c16930efd14a8a503e3","observation_id":"ae6c345f-e92a-478b-903f-87db34582ba0","resolution":{"observed_at":"2026-08-15T23:34:52.335636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.315153Z","title":"Region- aware pretraining for open-vocabulary object detection with vision transformers","venue":null,"work_id":"97ee516e-3686-489c-94dc-609b6ef5fe1d","year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.947314Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:6ed6b3db04120f3c20dc4d13b3f8f47510a2fc8dd81c2275194780f21c0ed6c7","observation_id":"a51bfe8b-5b8f-4a98-b5b7-9cf36b8bc568","resolution":{"observed_at":"2026-08-15T23:34:52.320853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.299548Z","title":"Segment anything","venue":null,"work_id":"7bc6e60f-7fbe-4127-911a-1e84ec8a451c","year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.951572Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:8535fff431e015d2bf08c991bfed2ab2a53eb34fed272ab03d8cc44ba3096a12","observation_id":"fcc4b647-7b24-401e-8fe6-f41b9e059f3a","resolution":{"observed_at":"2026-08-15T23:34:52.304379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15639","last_updated":"2023-02-23T19:14:52Z","snapshot_observed_at":"2026-08-16T16:27:46.006186Z","submitted_at":"2022-09-30T17:59:52Z","title":"F-VLM: Open-Vocabulary Object Detection upon Frozen Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15639","snapshot_observed_at":"2026-08-15T23:34:50.955849Z","title":"F-vlm: Open-vocabulary object detec- tion upon frozen vision and language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.955849Z"},"links":{"cited_paper":"/paper/2209.15639","citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:5a401185ecf99b584d6a7e884784f81130ed3e7c9dcb919ec131843d35343931","observation_id":"e714329a-5c46-4b32-a916-3ae7595cc14b","resolution":{"observed_at":"2026-08-15T23:34:50.955849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12442","last_updated":"2024-07-17T09:52:20Z","snapshot_observed_at":"2026-08-16T13:33:29.585467Z","submitted_at":"2024-07-17T09:52:20Z","title":"ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12442","snapshot_observed_at":"2026-08-15T23:34:50.960575Z","title":"Clearclip: Decom- posing clip representations for dense vision-language infer- ence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.960575Z"},"links":{"cited_paper":"/paper/2407.12442","citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:b1f9701facd595ba13f44a306fe423637e3d9a61256695c114a15c059061023c","observation_id":"960136d8-6208-4b67-b96c-d94464208b88","resolution":{"observed_at":"2026-08-15T23:34:50.960575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.03546","last_updated":"2022-04-03T03:33:43Z","snapshot_observed_at":"2026-08-01T06:14:31.660540Z","submitted_at":"2022-01-10T18:59:10Z","title":"Language-driven Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.03546","snapshot_observed_at":"2026-08-15T23:34:50.965316Z","title":"Language-driven semantic seg- mentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.965316Z"},"links":{"cited_paper":"/paper/2201.03546","citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:74a734d77189f0c432de7063d519d6f8c15667475eab053d5669e532046a481a","observation_id":"423546e5-4e07-4631-99fc-c795e0903234","resolution":{"observed_at":"2026-08-15T23:34:50.965316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.284536Z","title":"Mask dino: To- wards a unified transformer-based framework for object de- tection and segmentation","venue":null,"work_id":"ded01352-8a58-45af-820a-f09004c22d72","year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.970131Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:e6eabed20236a2002144f8f65d6b48178f1b1700733b1987d54a9b7b44561979","observation_id":"b52b739e-0161-498a-a34b-e77ed9835dd4","resolution":{"observed_at":"2026-08-15T23:34:52.289489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.270000Z","title":"Scaling language-image pre-training via masking","venue":null,"work_id":"a2f96faa-df3a-49ce-8072-29cd4a17d6ce","year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.974665Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:e5a692c2ac6a777167b3d716bb9a2d043c2808980ff62eadc44130a151e0a176","observation_id":"8d148b80-f1dc-47e0-b814-55f9f0dd4cab","resolution":{"observed_at":"2026-08-15T23:34:52.274532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.255691Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip","venue":null,"work_id":"14f30e1d-80c6-4303-8f60-4ae73cf2e0fe","year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.979337Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:60fb6cd112f45877c6c7a66c45f59ce02cafeb015909317bd8fb76bd9113391b","observation_id":"ab33abad-a8d4-4cf6-ae36-2fa3fabfc689","resolution":{"observed_at":"2026-08-15T23:34:52.260101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.240951Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"d147e189-35f8-45bc-87b0-b8d62977a54c","year":2014},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.984137Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:58cf093739ad4a241a2befcc5ac641d4bc1de6b8ca0bf907ec34afa731b911d2","observation_id":"beabadfd-bedb-4ce5-9f0d-5a76c012f6aa","resolution":{"observed_at":"2026-08-15T23:34:52.245850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.226191Z","title":"DAB-DETR: Dynamic anchor boxes are better queries for DETR","venue":null,"work_id":"075c729f-5bcb-4890-9b09-ea767c491e29","year":2022},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.988474Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:7e5bff5c6c61358c554948d55c6b1a31561a737df05598174e1eb98ccc300e0b","observation_id":"070c7d6e-30f8-46f9-adae-1813a64fbbac","resolution":{"observed_at":"2026-08-15T23:34:52.231000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.211142Z","title":"A convnet for the 2020s","venue":null,"work_id":"4c854322-d488-4389-9631-0f26a3e1706e","year":2022},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.992793Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:caa3b9bcfcdedacf667d8314cefae78a91b6b84955040284a598ce82b31246cc","observation_id":"290eae6f-31c2-4a0d-af10-4bb02af1a4ee","resolution":{"observed_at":"2026-08-15T23:34:52.215851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-15T23:34:50.996925Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:50.996925Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:8c30c6fe036590526e5d1d30147ded358b9739fd44444949655f9ed38dc1799c","observation_id":"042192fd-e0c5-4792-9083-4632687909b9","resolution":{"observed_at":"2026-08-15T23:34:50.996925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.196501Z","title":"Codet: Co-occurrence guided region-word alignment for open-vocabulary object detection","venue":null,"work_id":"6e26d32d-5adc-402b-bc9c-6be63b48be8e","year":2024},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.001353Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:73596ed9e94b5e97603ebc14827ed4f07dc9bcb71156d0525a168bf837be7a89","observation_id":"c7f0a4dd-4d11-4f02-ac1b-17b5f2374b62","resolution":{"observed_at":"2026-08-15T23:34:52.201151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.180958Z","title":"The role of context for object detection and se- mantic segmentation in the wild","venue":null,"work_id":"890088c7-c79e-4c97-89d4-c2e30515a2be","year":2014},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.005728Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:90c4091e07ab82ba9e6fd6b598cf0f4cbaabebc9986e903c7c93cf83d236b89f","observation_id":"7b4cee9c-5873-404f-8894-f8ecd200a4fb","resolution":{"observed_at":"2026-08-15T23:34:52.186262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.165216Z","title":"Open vocabulary semantic segmentation with patch aligned contrastive learning","venue":null,"work_id":"38722365-188f-4206-bd90-c42e6504a6c4","year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.010279Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:5f4b5f9d9fcf8039a8452f1139a3b07db5f0a5b134c272806e1974ca613d9766","observation_id":"a62eadd3-09d0-49d1-836c-f645f3b83aec","resolution":{"observed_at":"2026-08-15T23:34:52.170443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.149697Z","title":"Silc: Improving vision language pretraining with self-distillation","venue":null,"work_id":"b5d2a3da-d88c-4d76-b6fe-bd2a5f67e2b8","year":2025},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.015247Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:ccd01679bbeced7a31ec3542f81442efd0e3a5f27938c9e7175ad6804d249967","observation_id":"ce90d100-740b-4c16-8035-2ba832ba0e4a","resolution":{"observed_at":"2026-08-15T23:34:52.154332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-15T23:34:51.019945Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.019945Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:15d4c96019fc141263eb79cc68eecc000858fd39aca7c6e403fc27530d934fa8","observation_id":"7bd8280a-6ee1-45c4-8a30-c073dbcf4121","resolution":{"observed_at":"2026-08-15T23:34:51.019945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.133829Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"833fcd33-c428-492f-958b-ad7aea5f84ca","year":2021},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.024549Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:268654264c8718f1a79c6903f4dd9c95384aa895a8e2863704bc49edae898bfb","observation_id":"2f56c0a5-d4ce-42f2-aca4-bf6f2be1012b","resolution":{"observed_at":"2026-08-15T23:34:52.139163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.118942Z","title":"Am-radio: Agglomerative vision foundation model reduce all domains into one","venue":null,"work_id":"359d72ed-6f5c-415a-b091-cd8b97245678","year":2024},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.028958Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:822326f120c336ce5cacd1d0ffa54721da1739b2364f39d35143232c6edbfa4b","observation_id":"170ef4b5-5d35-4290-99ae-6ccd44fbea49","resolution":{"observed_at":"2026-08-15T23:34:52.123695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-15T23:34:51.033462Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.033462Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:d59f5ab876f2bf30a0cff7d44edb67d14e9bdb18bd519c43406ab11f7afa40f1","observation_id":"3a30c56d-7ebd-48d1-ae0b-e7a096b9db1a","resolution":{"observed_at":"2026-08-15T23:34:51.033462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.103408Z","title":"Faster r-cnn: Towards real-time object detection with re- gion proposal networks","venue":null,"work_id":"9efe8c3d-3045-4471-b1a6-c20b9400f3e8","year":2015},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.038243Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:642877c584a5a0e320a7d6f45216ef6315f64b901152271dfbd41035fe458c7b","observation_id":"422c6cf0-7904-48a9-b9d9-e71487fabc2b","resolution":{"observed_at":"2026-08-15T23:34:52.108194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.088211Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"54076cef-46db-4cc1-9dc3-3ac209e91ce3","year":2022},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.042828Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:0064f98075eec5af7efae4585d147d0f2221cfd76b653257551fd3946ec3f151","observation_id":"25a96dca-2d6e-44ae-b053-bc33d5675659","resolution":{"observed_at":"2026-08-15T23:34:52.092729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.047340Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.047340Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:1fc75daa5eae78744e47fc2877ba0532a739b6d9204e7248bf7a21828b3cd146","observation_id":"d8817179-a197-4cde-abe8-bf19f003de73","resolution":{"observed_at":"2026-08-15T23:34:51.047340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.063840Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":"f35acc03-e44c-467f-a93c-fcf5e8cf7e42","year":2019},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.051773Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:42a5da9633e89cfbac3e55d10f921cb3faf5b0f4d17386feb60166f0eff3c4c5","observation_id":"8482aed8-b069-40bc-b817-91a598cdbb7e","resolution":{"observed_at":"2026-08-15T23:34:52.068781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.049350Z","title":"Explore the potential of clip for training-free open vocab- ulary semantic segmentation","venue":null,"work_id":"7fdf4192-dfce-4eb4-9de1-2059218e66fe","year":2025},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.056392Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:6878faddf00869676cdcf12f0137cbd9c2a923bf3f78f18241714f0f4f16db7c","observation_id":"d9f9e63a-d1cc-47ae-bdbd-ccbcf5716fc0","resolution":{"observed_at":"2026-08-15T23:34:52.054043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.033427Z","title":"Reco: Re- trieve and co-segment for zero-shot transfer","venue":null,"work_id":"e2b0fd4b-b265-49b6-bffa-eb9fbd895733","year":null},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.060652Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:37a14b14fc4d096c6230d50b2f4d87ffe53526b6c223890dbdddbb8743c16018","observation_id":"109f509b-4cac-4186-ba97-88c6d5e40419","resolution":{"observed_at":"2026-08-15T23:34:52.038339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-08-16T07:24:08.156932Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-15T23:34:51.065371Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.065371Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:e3a4eac86763c3f2a8ed8953e34fc07861af5f6ab47ef0e3f067682964812854","observation_id":"ed593250-ddfb-47a2-af9e-4f127fa1458e","resolution":{"observed_at":"2026-08-15T23:34:51.065371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.070176Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.070176Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:02c3d3ec6bc85118ec68518f122452cec2b890f6a206122faf22967313bc8605","observation_id":"b3861b70-d2a1-419c-8138-fc70d2464651","resolution":{"observed_at":"2026-08-15T23:34:51.070176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","snapshot_observed_at":"2026-08-16T14:38:00.694387Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01597","snapshot_observed_at":"2026-08-15T23:34:51.075189Z","title":"Sclip: Rethink- ing self-attention for dense vision-language inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.075189Z"},"links":{"cited_paper":"/paper/2312.01597","citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:13265b7350b7f123ef281801187dd7c06c922658a364581013adcd855f07035a","observation_id":"ccdf75bc-5191-4cec-915c-76003b377e57","resolution":{"observed_at":"2026-08-15T23:34:51.075189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:52.007750Z","title":"Sam-clip: Merging vision foundation models to- wards semantic and spatial understanding","venue":null,"work_id":"cd7766d2-be21-4b21-a0d1-3b5c45ba07c6","year":2024},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.080461Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:b4339481bfb97dea4eb1798c80179c1a890ae2b5f865ace0d9c86a9205798bd8","observation_id":"0c73180c-46c6-40f0-8c18-72c72bb0c4dc","resolution":{"observed_at":"2026-08-15T23:34:52.012924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17913","last_updated":"2024-08-21T02:40:34Z","snapshot_observed_at":"2026-08-16T13:48:44.811481Z","submitted_at":"2024-05-28T07:33:27Z","title":"OV-DQUO: Open-Vocabulary DETR with Denoising Text Query Training and Open-World Unknown Objects Supervision","version":2},"cited_work":{"arxiv_id":"2405.17913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.17913","snapshot_observed_at":"2026-08-15T23:34:51.334702Z","title":"OV-DQUO: Open-Vocabulary DETR with Denoising Text Query Training and Open-World Unknown Objects Supervision","venue":"cs.CV","work_id":"40fb538b-238c-4418-9d14-68d4a537288c","year":2024},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.084967Z"},"links":{"cited_paper":"/paper/2405.17913","citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:2ac1a8f8548d7e324232023a1717a6ef36e9495f9c4295c12053b93e69c56ce4","observation_id":"5fca5207-427c-42a8-9253-3cd19660c357","resolution":{"observed_at":"2026-08-15T23:34:51.342151Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.992214Z","title":"Object-aware distillation pyramid for open-vocabulary object detection","venue":null,"work_id":"884c218c-2a3f-45bc-802c-7fc79d87f60b","year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.089911Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:61d02866a53d7865cb5fb6f706d8cb4bfc6293921c696ce901b13db7f36c43eb","observation_id":"03c20165-c1d3-4607-b754-5b9403f4b2d2","resolution":{"observed_at":"2026-08-15T23:34:51.996871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.977602Z","title":"Aligning bag of regions for open- vocabulary object detection","venue":null,"work_id":"d17060cd-e930-4a81-b37c-974c5b12dc6a","year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.094613Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:03e9e151114f1e09d3c37bc12c18b189b6bf887d690b5a6b4f6284c3c5cb48ca","observation_id":"a615a14f-0469-4e20-bca7-c7b0fd9a431d","resolution":{"observed_at":"2026-08-15T23:34:51.982056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.963596Z","title":"CLIPSelf: Vision transformer distills itself for open-vocabulary dense predic- tion","venue":null,"work_id":"3395ad74-7743-4aea-87b4-fd5cb6811d89","year":2024},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.099028Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:6ea18e2d07820bfbd5e9a246ec689d3d3840c3e629f76d990eba794749c2f6e5","observation_id":"7b10b19b-314a-4c9f-9dea-0e13204c3cd2","resolution":{"observed_at":"2026-08-15T23:34:51.967945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.949536Z","title":"Clim: Contrastive language- image mosaic for region representation","venue":null,"work_id":"4b9ba5f7-27ed-4a75-99ac-f4defbfdf863","year":2024},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.103452Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:de766a705894c9c9d7a6d29642e9f2df007c5dd81e5de0fae73c024aedc56ee4","observation_id":"f4c999de-617b-4fa2-b726-47d0f1d480fb","resolution":{"observed_at":"2026-08-15T23:34:51.954236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.935011Z","title":"Cora: Adapting clip for open-vocabulary detection with region prompting and anchor pre-matching","venue":null,"work_id":"9497c66e-427f-49b3-919b-4213a961b80f","year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.107835Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:ab69830be32645fe50120b9937fc0ea31b0a92868551cc862138aa1974bbdbfa","observation_id":"c000e75c-b8f3-4568-b730-fe922edf3b20","resolution":{"observed_at":"2026-08-15T23:34:51.939787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12359","last_updated":"2024-03-27T10:18:04Z","snapshot_observed_at":"2026-08-16T14:33:16.331243Z","submitted_at":"2023-12-19T17:40:27Z","title":"CLIP-DINOiser: Teaching CLIP a few DINO tricks for open-vocabulary semantic segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12359","snapshot_observed_at":"2026-08-15T23:34:51.113165Z","title":"Clip-dinoiser: Teaching clip a few dino tricks.arXiv preprint arXiv:2312.12359, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.113165Z"},"links":{"cited_paper":"/paper/2312.12359","citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:dd6d586a77ff8c679e82d61b95373a0336a3964eee6a1658d12feee020b2d415","observation_id":"83bd5aa6-70ee-4da8-8514-d9fa7599938e","resolution":{"observed_at":"2026-08-15T23:34:51.113165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.920214Z","title":"Sed: A simple encoder-decoder for open- vocabulary semantic segmentation","venue":null,"work_id":"8d0653f9-9694-4550-892c-89d9acf6574a","year":2024},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.117998Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:c29795a3eb2857141c7d4f0806b96fc55ee7755fde4dbdeef7d57d0b402a5811","observation_id":"e1b4d6bf-92a8-4b94-9c71-a4b60be16614","resolution":{"observed_at":"2026-08-15T23:34:51.925047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.905288Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":"53982852-bf9f-423b-9a1a-4f1aac5ceffb","year":2022},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.123474Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:b3d0696bddbbbdc0dd7bbc7a06b1f3dc7f4f52d4f2790d66929c5c56fbbbcd1c","observation_id":"02720cb8-6d13-47c0-8461-f19b3856e426","resolution":{"observed_at":"2026-08-15T23:34:51.909842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.890848Z","title":"Open-vocabulary panoptic segmentation with text-to-image diffusion models","venue":null,"work_id":"cbeab54a-384c-4dab-9899-b667ac865c38","year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.127989Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:bab14e2a439d9b9fd02efa862fb20e7580bc18f5d965d50066a6472c35287e31","observation_id":"04d6b0f0-068d-4cbd-9697-8e7e9eda7003","resolution":{"observed_at":"2026-08-15T23:34:51.895581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.876059Z","title":"A simple baseline for open- vocabulary semantic segmentation with pre-trained vision- language model","venue":null,"work_id":"710e6e5f-af24-432f-8911-3a5580e6219a","year":2022},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.132592Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:fedb18669bb9453860d151bcc14b09df7dbe5eb5ab8311de06b1d42508c0bc10","observation_id":"956e1fba-9e92-4576-997a-88adeabd0c96","resolution":{"observed_at":"2026-08-15T23:34:51.880802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.861238Z","title":"Side adapter network for open-vocabulary semantic segmentation","venue":null,"work_id":"3cc9a3bf-9350-4c04-9e0b-bd97294094eb","year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.137024Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:662ab29e8b776bfffe156c8fccc804daf444c0495501296727b7ee5d5e1e8474","observation_id":"ea888fa1-9dde-4126-b0ad-794a184a5432","resolution":{"observed_at":"2026-08-15T23:34:51.865949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.845213Z","title":"Masq- clip for open-vocabulary universal image segmentation","venue":null,"work_id":"3d1e5073-7970-409a-beb1-70ceb1163509","year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.141404Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:0717cbdd9dd6d04c7a7d50bb0789bd2ca607957d8a7d9369813601853f75e3b4","observation_id":"8d8167ef-10b8-466a-a158-959384331fb4","resolution":{"observed_at":"2026-08-15T23:34:51.850027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.829913Z","title":"Convolutions die hard: Open-vocabulary seg- mentation with single frozen convolutional clip","venue":null,"work_id":"38f4b42c-30cb-452b-97bf-7c3535afbf4f","year":2024},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.145824Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:558558811676f9d10300a9a4221e23efe40f119d2a006ad925f8ec72b96996a8","observation_id":"789a0f28-0753-4a92-aa35-f3bf09d4703e","resolution":{"observed_at":"2026-08-15T23:34:51.835151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.815208Z","title":"Open-vocabulary sam: Segment and recognize twenty-thousand classes interactively","venue":null,"work_id":"c6a3b48a-1fa6-454b-97dd-ae4c54561bc7","year":null},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.150424Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:414958a3b87fb7996be9b8795b61923692ad29d043fadb143392343936cb14b3","observation_id":"f71d9dc9-c45a-47ad-802e-ccc086dacf8e","resolution":{"observed_at":"2026-08-15T23:34:51.819800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.800343Z","title":"Open-vocabulary seman- tic segmentation using test-time distillation","venue":null,"work_id":"1de9268b-baeb-4849-ab66-f553840e2159","year":null},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.156069Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:2d4ca72de27f5d1cf0843054c544ec507d7baa2a891e1732a1ac2d13b1d72f35","observation_id":"88bcfc3d-56d5-46b7-84a3-dc8ffb1a88d6","resolution":{"observed_at":"2026-08-15T23:34:51.805520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.785298Z","title":"Open-vocabulary detr with conditional matching","venue":null,"work_id":"816c514e-138b-44d7-b325-59af6056f67a","year":2022},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.160994Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:beb9932841636ed412dad3b649568bd7a016e3cca11fd7d3f8122e1d3172fbfe","observation_id":"54eb1a4f-ef56-4c71-bb1d-64036837bf99","resolution":{"observed_at":"2026-08-15T23:34:51.790280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.770231Z","title":"Open-vocabulary object detection using captions","venue":null,"work_id":"b561b616-9f18-48a9-8f6a-71a6904ef09a","year":2021},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.165557Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:4ad7906765eaa11c6087f8a18f653b431f585d425582b4ffe18336e832af5159","observation_id":"477675a1-284f-42c7-89af-12bacbd4bf94","resolution":{"observed_at":"2026-08-15T23:34:51.775352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.753960Z","title":"Exploring region- word alignment in built-in detector for open-vocabulary ob- ject detection","venue":null,"work_id":"a367d1bb-bdb0-4183-be6f-99e126c42455","year":2024},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.170536Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:bfc5d4cfadc93adfdf1d3eae449991e0b30941bb4e9112da2f22821a5594877b","observation_id":"66ab4757-6d03-4830-af07-df3f4c335b6d","resolution":{"observed_at":"2026-08-15T23:34:51.760220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.738930Z","title":null,"venue":null,"work_id":"1b5a4be8-4d76-4fc1-bb96-7b12eeaf32de","year":2024},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.175359Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:470ebf3909d169b089dca0c7e7a1f4f3b3862274be8f43aa88fc8e6f2735dd28","observation_id":"e15bea48-ff31-4fdf-9203-3a459b7a28e7","resolution":{"observed_at":"2026-08-15T23:34:51.743586Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.723409Z","title":"Regionclip: Region- based language-image pretraining","venue":null,"work_id":"d3db7d28-11e4-4de4-9907-8a9dcc3016bb","year":2022},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.180913Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:5432ebbed5ae34d4f1053690535fb25208b03dd596295c53d91e3231fdf645df","observation_id":"484fd19c-1cdf-4d69-97d7-6c1aaa231ae5","resolution":{"observed_at":"2026-08-15T23:34:51.728407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.708365Z","title":"Semantic under- standing of scenes through the ade20k dataset","venue":null,"work_id":"ee9468bc-3282-4891-80be-a74bffd59af7","year":2019},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.185410Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:f845edc3bfe49eb9f1bfad3e41a700c3837c251626a50ebd0a5a35df099eba43","observation_id":"83fb5320-1d59-459f-a561-a82457df43e8","resolution":{"observed_at":"2026-08-15T23:34:51.713386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.693567Z","title":"Extract free dense labels from clip","venue":null,"work_id":"dc4c9acc-fdd9-47ea-8464-5497153a121a","year":2022},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.189743Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:c58cf87af6491eef7e36cf11d3576c01f74ce66de62a596398423377b8f3f5d4","observation_id":"84c38a45-464a-49a4-9eae-896fcb682c38","resolution":{"observed_at":"2026-08-15T23:34:51.698402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07832","last_updated":"2022-01-27T09:20:49Z","snapshot_observed_at":"2026-07-06T12:08:39.149450Z","submitted_at":"2021-11-15T15:18:05Z","title":"iBOT: Image BERT Pre-Training with Online Tokenizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07832","snapshot_observed_at":"2026-08-15T23:34:51.194148Z","title":"ibot: Image bert pre-training with online tokenizer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.194148Z"},"links":{"cited_paper":"/paper/2111.07832","citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:0d9e4a42df60e7f58cfa4e7045bf2b867faedb18a3b625a9848c06eac335c0ce","observation_id":"f2bb49e9-a457-4e16-b11f-cbe6639ad7fe","resolution":{"observed_at":"2026-08-15T23:34:51.194148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.678415Z","title":"Detecting twenty-thousand classes using image-level supervision","venue":null,"work_id":"245e7414-2623-418d-8006-4fe6b8175cb0","year":null},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.199346Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:93a5a249c51a4940568d7661af527d3687799e47488cb386d83c93140c97db0c","observation_id":"2b00f19d-44af-42a6-9c2d-4795dd0d353a","resolution":{"observed_at":"2026-08-15T23:34:51.683129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09220","last_updated":"2024-04-15T02:47:01Z","snapshot_observed_at":"2026-08-16T15:15:22.321499Z","submitted_at":"2023-07-18T12:52:49Z","title":"A Survey on Open-Vocabulary Detection and Segmentation: Past, Present, and Future","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09220","snapshot_observed_at":"2026-08-15T23:34:51.204889Z","title":"A survey on open- vocabulary detection and segmentation: Past, present, and future","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.204889Z"},"links":{"cited_paper":"/paper/2307.09220","citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:4df9381dd2a1d0199bdb5e38df7563805bf8bd72e72495422e6c23648ffe5400","observation_id":"3f943471-4305-40b5-9d58-4f1dd6ccf77f","resolution":{"observed_at":"2026-08-15T23:34:51.204889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-08-13T17:54:01.724774Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-15T23:34:51.210503Z","title":"Deformable detr: Deformable trans- formers for end-to-end object detection","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.210503Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:0dc33aedbefe1c027743102908bf8252ec7706af30d5fca8f8b6281728c48c96","observation_id":"d6afd2c4-e3ea-48ff-a9d4-61892665c171","resolution":{"observed_at":"2026-08-15T23:34:51.210503Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.662402Z","title":"global view","venue":null,"work_id":"4843c46f-ed4d-4525-b858-36db5c0b172d","year":null},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.215211Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:08a5640b9c366516feda4341e1b90686c4c978bfe37ce3273800581447ec779a","observation_id":"4ee1cfe7-f31e-466c-aae0-b93426701e27","resolution":{"observed_at":"2026-08-15T23:34:51.667175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.647355Z","title":null,"venue":null,"work_id":"bc87840f-4ff8-404f-a766-60cf295d1fc7","year":null},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.220569Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:b7cf9bd03c9ced8db37cb44c6786f00c660eb2297ad0d13a12f4c1f8a903b374","observation_id":"38f4ac70-acbb-429c-9f3c-d6485fd9ce36","resolution":{"observed_at":"2026-08-15T23:34:51.652065Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.631290Z","title":"bird” rather than to be “background","venue":null,"work_id":"2791dd65-917d-4139-9738-e6fd46d219f5","year":null},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.225273Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:9693739e2c40bf6a1c6f500a510139f97b2b361e9471ff53bf16eb753515067b","observation_id":"7398ef4e-35c6-4f80-938d-02a4af4db702","resolution":{"observed_at":"2026-08-15T23:34:51.636451Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.613945Z","title":null,"venue":null,"work_id":"68a2b020-aef4-4d95-9923-6c8483cc096b","year":2012},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.230225Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:0fbc07830fa8e075de12f6428a7d1f1d6bd0f71faac7b65cbcbed11e24b10624","observation_id":"9c4a0f9c-9bff-4ac8-b256-a86025346a41","resolution":{"observed_at":"2026-08-15T23:34:51.618973Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:34:51.598291Z","title":null,"venue":null,"work_id":"ec5f0b6d-f0d1-4917-af87-947e60b0ba89","year":null},"citing_paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T23:34:51.235118Z"},"links":{"citing_paper":"/paper/2505.04410"},"observation_digest":"sha256:5e3923c72e4f17109c6ecde46c32fb36f6237d199b7ee8373cac74a38cffaf49","observation_id":"6d86f5c9-9661-4a08-a392-a29cc178fbaa","resolution":{"observed_at":"2026-08-15T23:34:51.603267Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.04410","last_updated":"2025-05-07T13:46:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T23:27:27.160651Z","submitted_at":"2025-05-07T13:46:34Z","title":"DeCLIP: Decoupled Learning for Open-Vocabulary Dense Perception"},"reference_resolution":{"displayed":96,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":2,"verified_fuzzy":52},"total_outbound_references":96},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 96 of 96 outbound references and 0 inbound Pith citation observations for arXiv:2505.04410."}