{"as_of":"2026-08-07T19:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0d99aacb15607440bb5c5caa9655723e7cc099c4c150a2c284e8f2ef2e90fea2","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T07:40:23.337337Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.21371/citation-record","integrity":"/paper/2607.21371/integrity","json":"/paper/2607.21371/citation-record.json","paper":"/paper/2607.21371"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:16.693808Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recog- nition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:16.693808Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:4849d49c3e5b1db67300e8b84ca9fcf110c594dc36fa57d7e8a42a39389c0ca0","observation_id":"72f4209d-6301-45ec-8a67-ddcf49284b81","resolution":{"observed_at":"2026-08-01T07:40:16.693808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:16.776806Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:16.776806Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:37ff3f4c7334b6baf19296f4fde055bbd9e9f0a9ca9bf1beee91c6d4aa12267d","observation_id":"38193678-aff8-46ca-8511-cbf137a8ae3f","resolution":{"observed_at":"2026-08-01T07:40:16.776806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:16.852077Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:16.852077Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:7ec735475c96fd5bf49fdee5da0f10f79b77eb5a6d1c34b32408f4c964511821","observation_id":"b91ae615-acaf-4026-a985-5ee5537c1b89","resolution":{"observed_at":"2026-08-01T07:40:16.852077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:16.905763Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:16.905763Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:3330377a4450db989b5ea5b85b965c448cfcaa1bab5e86b95518ff5540c07cc4","observation_id":"1aa63614-1cc4-48b4-ad17-a1ad8120a89b","resolution":{"observed_at":"2026-08-01T07:40:16.905763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:16.946939Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:16.946939Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:894e55afb0b04fbd6345ef7849f5342b0f2addb3f49a080d884f24a9f6779657","observation_id":"1ba5e5de-c7e6-4a60-891d-65d92f5d3b9f","resolution":{"observed_at":"2026-08-01T07:40:16.946939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.011005Z","title":"In:ProceedingsoftheIEEEconferenceoncomputervisionandpatternrecognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.011005Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:e85ff457a02b728be64fde263c01721e6dbe2602ab40bce3b06fe84c517742f0","observation_id":"8548f69e-de82-4d7f-9d8c-d93376b13b70","resolution":{"observed_at":"2026-08-01T07:40:17.011005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.091131Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.091131Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:423ddb59a9dff530490aeec4f820d6a5220d172b388d8935e9f08fa451e58f51","observation_id":"32d66f3b-045b-4664-9956-cb43c813e0d1","resolution":{"observed_at":"2026-08-01T07:40:17.091131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.143075Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.143075Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:8b5c2bc4f9ebc1d948d58a73f65ee59d981382254f8a2ae8f7c24fd329d72707","observation_id":"a24bb0e0-1a42-48c7-987c-2a78147ca70e","resolution":{"observed_at":"2026-08-01T07:40:17.143075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.214480Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.214480Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:c89437cfd2c100e2ea06de9119ba5ac2a5a0ff1ba11e7f454ca51459ee0a238d","observation_id":"615382c0-bd3d-4bc6-ba71-19bbae663c45","resolution":{"observed_at":"2026-08-01T07:40:17.214480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.265831Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.265831Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:24fc5e3b8365b8bf085ba9103464997af7c7bab7a9ebec080a56603a47bb93c0","observation_id":"b516a120-c5d0-4569-b79e-b083ea08afe4","resolution":{"observed_at":"2026-08-01T07:40:17.265831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.337104Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.337104Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:4924f2234e72c36b8bb2ea3f8a277095e4533df6ec19df11aeeacce577ad6468","observation_id":"8d702406-bc79-465d-9b9c-e229683bb340","resolution":{"observed_at":"2026-08-01T07:40:17.337104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.413922Z","title":"In: Proceedings of the European conference on computer vision (ECCV)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.413922Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:9f72727cfd5aa15bbb0c032073db91d43b4b115b5a576230cdb29d32456be290","observation_id":"82de1b5a-5ff4-47c9-aab2-8c76b48e7212","resolution":{"observed_at":"2026-08-01T07:40:17.413922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.483022Z","title":"Advances in neural information processing systems31(2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.483022Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:a2769a7c6a9056dbd30b8d9628fa3aed8ad6f800cbd9f2ac09e479f37fda4bc4","observation_id":"efcf5ea3-c817-4ea7-b856-6c25a23f1be8","resolution":{"observed_at":"2026-08-01T07:40:17.483022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-01T07:40:17.534398Z","title":"arXiv preprint arXiv:1504.00325 (2015) DINOde: Continuous Vision-Text Alignment for OVSS 17","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.534398Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:f6e1584fed5fcc8a676a8c7a113da7980d6915243473a01245544dbac5041bb0","observation_id":"5d6bf94b-8846-442c-bad4-d1f5b74f77d8","resolution":{"observed_at":"2026-08-01T07:40:17.534398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.604383Z","title":"Advances in neural information processing systems34, 17864–17875 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.604383Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:0a8a5161b95f08507a332c1cd0469e19f4b5f94f1862a73ff00100d7adf471ed","observation_id":"1c14e3a0-e4d4-4be9-b17c-f75cb650d9a5","resolution":{"observed_at":"2026-08-01T07:40:17.604383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.675339Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.675339Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:745262aab8f06b4088eae3d478f920b6cfa0b2f5633bd21d5f9a8001127177d9","observation_id":"5a062388-6299-454b-9893-98e048352b19","resolution":{"observed_at":"2026-08-01T07:40:17.675339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.726285Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.726285Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:33b886cd6d18ddee64fcfc6dccbad8ad1011ffe896b52d5749d9e131fbd11d01","observation_id":"cbc16b31-85b8-4498-9ca1-cb78ccdcb4e5","resolution":{"observed_at":"2026-08-01T07:40:17.726285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16588","snapshot_observed_at":"2026-08-01T07:40:17.767610Z","title":"arXiv preprint arXiv:2309.16588 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.767610Z"},"links":{"cited_paper":"/paper/2309.16588","citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:8c99dccd831a768784e41e036ffcee42985402276528491b37bc5cac4ca987f0","observation_id":"dfefadaf-a863-4de0-82ef-4c82b927f3d0","resolution":{"observed_at":"2026-08-01T07:40:17.767610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.837553Z","title":"Advances in neural information processing systems32(2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.837553Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:db8825637c61c687ef6ba8d54320c9170a64535c3faaa3c1405ea15e5bd80fb3","observation_id":"31b5c7d1-e777-40d9-b461-9a73f1ff60ad","resolution":{"observed_at":"2026-08-01T07:40:17.837553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.919632Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.919632Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:ac3899122ab90a8d807b6d315ae12bff74a7194e4e3ae398dbad5ae9e6e0fce0","observation_id":"5e1b6986-d8a4-44e7-b87c-2d1ac0378418","resolution":{"observed_at":"2026-08-01T07:40:17.919632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03706","last_updated":"2025-06-04T08:36:56Z","snapshot_observed_at":"2026-08-07T10:54:42.907137Z","submitted_at":"2025-06-04T08:36:56Z","title":"OV-COAST: Cost Aggregation with Optimal Transport for Open-Vocabulary Semantic Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03706","snapshot_observed_at":"2026-08-01T07:40:17.970860Z","title":"arXiv preprint arXiv:2506.03706 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.970860Z"},"links":{"cited_paper":"/paper/2506.03706","citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:1b02a00a1f638dafb2b05833d0061dd6ae4bfbba4b88bb81cf33667b86aa5a30","observation_id":"61efe6ec-ec09-4db4-872a-3e2e77fbd26f","resolution":{"observed_at":"2026-08-01T07:40:17.970860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.018375Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.018375Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:6d3c0895b663549d623021954657bd6ad5fd2b3e9c3b04bf47557d194c31381a","observation_id":"878f6313-20c0-4076-8f6a-34249dc2f6df","resolution":{"observed_at":"2026-08-01T07:40:18.018375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.120076Z","title":"In: 2025 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.120076Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:f9c6183879a453856051e289a4fc91a22fa9f1f3ac4bdac9a7de29534a9fbc20","observation_id":"b058c95d-4eaf-4e71-91b5-fde51487969a","resolution":{"observed_at":"2026-08-01T07:40:18.120076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.173412Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.173412Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:1df44d9b34a76b0053a413578d33b29c85f489851c13aae795f9a8d35e43d222","observation_id":"a6305e01-b267-45b6-adea-e50d7f7c1d49","resolution":{"observed_at":"2026-08-01T07:40:18.173412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.228689Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.228689Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:8aa8fc71d4c49bf388d8cf7bb44595d407d0162aee76e8782fa649eb7304978d","observation_id":"a878428a-34ab-407c-8ebb-85aea571e493","resolution":{"observed_at":"2026-08-01T07:40:18.228689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.281047Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.281047Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:1379f8569aab13b297e5695540076c0fbcdc047fc7bb7332d67447b357aa1327","observation_id":"e04091dd-72fe-4c7e-978f-33492d580ab0","resolution":{"observed_at":"2026-08-01T07:40:18.281047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.329316Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.329316Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:cf6a841ac6c25876b7205b460bee334920f502b7f38b17467ae6bc5ea482e31f","observation_id":"b88ef087-344f-42c4-bde5-beacb9f5c599","resolution":{"observed_at":"2026-08-01T07:40:18.329316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.381649Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.381649Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:5a4dc2960ba5184c84a8bf3d974ccd3f715f3181526dc44d1f070a55012a210d","observation_id":"65ee1d57-6d32-4f5d-a5b0-46b5ddbd555a","resolution":{"observed_at":"2026-08-01T07:40:18.381649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.459247Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.459247Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:9268296f395f21b1896465c9cd4c35d12c76141cb3af3b0a6fa86eb6c376674b","observation_id":"1548cd1c-95f8-4160-a21b-40fd11b12213","resolution":{"observed_at":"2026-08-01T07:40:18.459247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.538126Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.538126Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:ba60a0e9a7f9b664a48a9cd7c785b9080521c0636b65121429c6d5d35e23c6a0","observation_id":"39976649-810e-4e0a-9893-6c5f41dd5011","resolution":{"observed_at":"2026-08-01T07:40:18.538126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.590492Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.590492Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:12388b62921060d14b79001eea837b0a31fd245fc572cb91627cad049c1ce8e2","observation_id":"d54a1efc-d4e1-4e1f-ba17-a475aa86b376","resolution":{"observed_at":"2026-08-01T07:40:18.590492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.638228Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.638228Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:be403a80feee44d126a7e0b47d25dfcd6d65bfcd39a0387d000cfa7a0a378435","observation_id":"6f07fdc4-7d56-4c32-bbb9-06493a72a412","resolution":{"observed_at":"2026-08-01T07:40:18.638228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.711283Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.711283Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:a21a6fd5ebff1dfa4ffeeb00b01786c6b5976faaa9260abe86da978815c6b049","observation_id":"ca706863-546e-424a-bfdf-1d1b94d72c77","resolution":{"observed_at":"2026-08-01T07:40:18.711283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.781464Z","title":"In: International Conference on Learning Representations (2022),https://openreview.net/forum?id=RriDjddCLN","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.781464Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:d4ea2e2ee7d4d8c5d2b870328ee369f6a2eff7f495f76758bd5d19c2bfe62f7b","observation_id":"d93f6e9c-34ff-40a2-b05d-419f292bae53","resolution":{"observed_at":"2026-08-01T07:40:18.781464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.871570Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recog- nition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.871570Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:c3c598e0754384a2c449f97d16f8e4d3eb1ecef2c73e4d57291ea1b5731cce30","observation_id":"334c2309-876d-4ad6-b458-c8da357b4eda","resolution":{"observed_at":"2026-08-01T07:40:18.871570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.949906Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.949906Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:2435f4b3f5057b644bac710c87f99adbdf01045fb6e430b7829bc8bd6c409fa8","observation_id":"1db39108-6435-4de1-8dd7-51e82fe2706e","resolution":{"observed_at":"2026-08-01T07:40:18.949906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-01T07:40:19.023076Z","title":"arXiv preprint arXiv:2210.02747 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:19.023076Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:b14ccf56eb496a752d8b21d018df7fb5520ffc17257e8edb19f94132eb3a02f9","observation_id":"52c9159e-181f-4f9c-9416-35fbe0d204d6","resolution":{"observed_at":"2026-08-01T07:40:19.023076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-01T07:40:19.107149Z","title":"arXiv preprint arXiv:2209.03003 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:19.107149Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:a8954128cbbb4774136fdd5f853cf167d4e1034fbc833f9d06ba3d2cf2d8d58b","observation_id":"ee0f6f73-a967-48f7-9324-329073c3af9b","resolution":{"observed_at":"2026-08-01T07:40:19.107149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:19.202308Z","title":"Advances in Neural Information Processing Systems33, 17548–17558 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:19.202308Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:a736837f348cb0f3b4e4aa514e24bb72fc5a7d410a59f5e109aaca8a5181ec71","observation_id":"6df66102-c0a8-491b-b7fb-b84257f0d326","resolution":{"observed_at":"2026-08-01T07:40:19.202308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:19.325587Z","title":"In: International Conference on Machine Learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:19.325587Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:a63f9c9468cdfd7fc7cb30030ccc9cf5b449da0c88e92b50dae8df352040de50","observation_id":"560928b5-c6e2-4ac4-b0e3-23616809c667","resolution":{"observed_at":"2026-08-01T07:40:19.325587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:19.447085Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:19.447085Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:2dc240bf8e4ca3280fbc3ed4d07705180413faf8680e70a9c5ee7b82907d5bc1","observation_id":"da3253bb-a888-4ca7-87c8-9c1a9e9e6747","resolution":{"observed_at":"2026-08-01T07:40:19.447085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:19.559072Z","title":"Advances in neural information processing systems33, 2503–2515 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:19.559072Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:7c26ecf98bcb128ff59c94e6c9d49d25bf0f73624c0338e5089bb7787430e2d7","observation_id":"b30874d8-9878-42bc-bc19-3987586126f0","resolution":{"observed_at":"2026-08-01T07:40:19.559072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:19.644026Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:19.644026Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:f690ea3b54d78dbbf030b0085b830c2852d2ea8da45613d933e9e82afe00d075","observation_id":"1083244f-ff0b-4a17-aae4-08ce85c7bef8","resolution":{"observed_at":"2026-08-01T07:40:19.644026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:19.762033Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:19.762033Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:480177f77812f8516548e3309ac8d5f25689e8d1f77f49042ff467b5eeccfb30","observation_id":"cbf6f60a-19a8-4654-a14c-47ead2cc3b38","resolution":{"observed_at":"2026-08-01T07:40:19.762033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.14482","last_updated":"2026-06-11T10:07:56Z","snapshot_observed_at":"2026-08-06T07:23:27.418432Z","submitted_at":"2026-03-15T17:02:40Z","title":"V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.14482","snapshot_observed_at":"2026-08-01T07:40:19.884363Z","title":"arXiv preprint arXiv:2603.14482 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:19.884363Z"},"links":{"cited_paper":"/paper/2603.14482","citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:4c7b431ce714219f50f20367b982e99d30a40b8dfab309f10b39d7ee16a5cd4d","observation_id":"7c712ee4-e3b5-46ca-bd55-e517a6413c94","resolution":{"observed_at":"2026-08-01T07:40:19.884363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-01T07:40:20.007080Z","title":"arXiv preprint arXiv:2304.07193 (2023) DINOde: Continuous Vision-Text Alignment for OVSS 19","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:20.007080Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:5e16d194fc6e2909ecde3eb42ff4eadd2923e5137ff9864d0d237b2f63d0dd2f","observation_id":"f83c0834-f7f9-4ac1-b9a0-03404430ce05","resolution":{"observed_at":"2026-08-01T07:40:20.007080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:20.127238Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:20.127238Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:400825b8dc2d4d2fd129157879f417e00e995d22617b91d5cc666ec2bc4fce1c","observation_id":"d7b52e03-8e32-4903-8b93-796045b78819","resolution":{"observed_at":"2026-08-01T07:40:20.127238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:20.216097Z","title":"In: Inter- national conference on machine learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:20.216097Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:fbc3df7c45a130036f3f090ffe26290487707333109ccd331ce324b69444ed87","observation_id":"e51f63b0-8dd3-43f4-9036-bd7062daae27","resolution":{"observed_at":"2026-08-01T07:40:20.216097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:20.322150Z","title":"In: International Conference on Medical image computing and computer-assisted intervention","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:20.322150Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:a6e2ae9b70b44195de1619e8349bfa035ae635b9f9b9e8dbb15fd031a1e680f3","observation_id":"3d1b7e0b-b6bc-42d5-85db-ff7d8f8ce89c","resolution":{"observed_at":"2026-08-01T07:40:20.322150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:20.437474Z","title":"In: Proceed- ings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:20.437474Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:83612420420b98cc61c09ee82ad00456c15c226d2df603fe1d8f11c58f306025","observation_id":"365b4457-32a1-46ab-896d-eaa8fce26182","resolution":{"observed_at":"2026-08-01T07:40:20.437474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:20.511875Z","title":"Advances in Neural Information Processing Systems35, 33754–33767 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:20.511875Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:a60ae8d01f5e51261cac5d69c98a7ffebe5f21be490272fc15bf12b0e9ae3ac2","observation_id":"c6430f8d-5115-4dd5-a71d-0506b845fd66","resolution":{"observed_at":"2026-08-01T07:40:20.511875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14279","last_updated":"2021-09-29T09:01:07Z","snapshot_observed_at":"2026-08-07T17:37:50.854585Z","submitted_at":"2021-09-29T09:01:07Z","title":"Localizing Objects with Self-Supervised Transformers and no Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14279","snapshot_observed_at":"2026-08-01T07:40:20.635579Z","title":"arXiv preprint arXiv:2109.14279 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:20.635579Z"},"links":{"cited_paper":"/paper/2109.14279","citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:34bbc240cd0d6814810cae1342e7838fef6831ff90e32d1f7e1d89dced6b39ec","observation_id":"cee11d61-f7d9-410b-9c72-da34172b2584","resolution":{"observed_at":"2026-08-01T07:40:20.635579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-01T07:40:20.761071Z","title":"arXiv preprint arXiv:2508.10104 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:20.761071Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:e122664827cec5179707b02adc7f7d1167c364a101bddb2b7e81e9de8e7b661d","observation_id":"b6e87052-92fa-474f-a502-e5676dedc8f5","resolution":{"observed_at":"2026-08-01T07:40:20.761071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:20.849924Z","title":"In: proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:20.849924Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:47007d546743cc0122ffef055970546c7aedf6d0e936abf20605fa945092dd06","observation_id":"3f5776ae-c8cc-4b0a-ad47-6200b5714390","resolution":{"observed_at":"2026-08-01T07:40:20.849924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:20.968018Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:20.968018Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:70533823b85a2aef2b06446cbcff6e61ef05df82c2b3ac89a71552373ae5716f","observation_id":"7c08d5da-9ca6-4d65-bde9-304688b424e6","resolution":{"observed_at":"2026-08-01T07:40:20.968018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.067271Z","title":"In: Proceed- ings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.067271Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:54c30c541fe7cdbf83fa754d6104c12ccf4f5adb4dd8541b7189c5d78231c5c2","observation_id":"bd74770f-1225-4426-8a6f-8e1b3ad02411","resolution":{"observed_at":"2026-08-01T07:40:21.067271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.185848Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.185848Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:56def9865736fe4220a4fdac86fe52a25cdea8c7c550894c58083bf29134d255","observation_id":"0e014fe4-6bee-4761-be9c-8f3329f8849b","resolution":{"observed_at":"2026-08-01T07:40:21.185848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.245590Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.245590Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:ecd9d7926b54e20047f8ed55637f274c0c53ad25e0f7aade024d7ca8592cd5c4","observation_id":"2edb8d19-f4a6-4642-b246-dbae0ed8c12d","resolution":{"observed_at":"2026-08-01T07:40:21.245590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.251032Z","title":"IEEE transactions on pattern analysis and machine intelligence45(12), 15790–15801 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.251032Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:09ff3f849b2a38c9d825c5f5d38a85b259f47b01da46c504424bbed3d60fe6ac","observation_id":"a0532b57-21ab-4c65-a602-65015e16509b","resolution":{"observed_at":"2026-08-01T07:40:21.251032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.269783Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.269783Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:6eb42279b59112add590450fd04e70670207cbeae06922f421d9ecdd5f274461","observation_id":"e0598853-8b68-459d-9912-e0b6acfcc8f6","resolution":{"observed_at":"2026-08-01T07:40:21.269783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.428292Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.428292Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:f048bf38076c8ccfbfe6ff230dcf7107ed3d6772aab7eb4e1aaff5c37c05b6ac","observation_id":"fc690a68-3acb-437e-8e22-f540e1b7f615","resolution":{"observed_at":"2026-08-01T07:40:21.428292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.543877Z","title":"Advances in neural information processing systems34, 12077–12090 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.543877Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:8dae1c9139e6505815b3cbcac5f6621a7b1f33d41acb14915c13c51fc4099dc8","observation_id":"5028f612-5369-4b2b-afae-ec1729c461b2","resolution":{"observed_at":"2026-08-01T07:40:21.543877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.688368Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.688368Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:3b3c1665250f1193ca62bd95c717457aa1de60411492bd6c48834708bde329bf","observation_id":"807ac49a-e08f-4b95-ac22-2d65745faae2","resolution":{"observed_at":"2026-08-01T07:40:21.688368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.782619Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.782619Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:72232ef5a935b84b4d0689ccc360e241336cf07e39f304e9bad9389cf471f78a","observation_id":"9fadf9cc-636d-4bdc-9544-a4de39e53d59","resolution":{"observed_at":"2026-08-01T07:40:21.782619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.829934Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.829934Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:5ce48849bbccebd2fe9a6f3ec07520539eb8bb246af103c736dd42b1205e5322","observation_id":"d093b7b9-0e96-4b30-8d8c-6fb88e876172","resolution":{"observed_at":"2026-08-01T07:40:21.829934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.871342Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recog- nition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.871342Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:ff28558e893d7dde72bf592e1fc67340311980d7d215cbf7100b63009f921062","observation_id":"5c07dd39-57ee-47a4-8d6b-9d2d06e91fc2","resolution":{"observed_at":"2026-08-01T07:40:21.871342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.898253Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.898253Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:eaf2a8c48b9c7f7833898eba4ccc34c2894e53c762d11acbd317dbfb6f5463af","observation_id":"0cfcfd22-4bb9-489b-80b4-181cb48dc248","resolution":{"observed_at":"2026-08-01T07:40:21.898253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.937501Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.937501Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:63a36e2a80b0830faf9130088efcd61f68827596fb0b4f7a79bf250186b1cd47","observation_id":"56fb6e76-1627-4eea-a75a-f9a6d967f0ff","resolution":{"observed_at":"2026-08-01T07:40:21.937501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.983850Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.983850Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:f3050c7371674ee7af5e2bf395c45269da0e93b2d03c244b4d00f72261e5b203","observation_id":"2ac74284-a36f-45fe-8383-e40131f107cd","resolution":{"observed_at":"2026-08-01T07:40:21.983850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:22.043900Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:22.043900Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:26f7b03c698f424c545fe4533cf1b6e4daee0139f863df25fc58c5290365e731","observation_id":"63b93f90-8378-475b-a8db-a1ca9f8eee05","resolution":{"observed_at":"2026-08-01T07:40:22.043900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:22.125955Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:22.125955Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:e5374ac77aeec944e75dd086339815faa01b0d15aeec3b610d712df90f25fe0e","observation_id":"39adc645-8ba7-413b-86af-d58fcc3fc85a","resolution":{"observed_at":"2026-08-01T07:40:22.125955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:22.240638Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:22.240638Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:88436571dad581b1e17b6779852677abfef6379e27a20619486e691484c3f03e","observation_id":"e0b7bf65-e8a7-4282-961f-338ba6ef7108","resolution":{"observed_at":"2026-08-01T07:40:22.240638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:22.333890Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:22.333890Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:c19b89bb584cfdcafdef52c6d3aee6ad590263f13426e68a4e2a2161dce6c6dc","observation_id":"17157c53-b5ef-4bd2-90ca-89962fa27f38","resolution":{"observed_at":"2026-08-01T07:40:22.333890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:22.451095Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:22.451095Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:f8dcb4fabcde648f907a59001b25cbec4630c0824c362dabb1f157bcc7221c47","observation_id":"f99400db-bbc3-460a-a2bf-f254fe966658","resolution":{"observed_at":"2026-08-01T07:40:22.451095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:22.485622Z","title":"Advances in Neural Information Processing Systems36, 32215–32234 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:22.485622Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:762c561b5ff41f72eef68a970bbfac1db39f85ccf550d4d4b4ee906031f326ab","observation_id":"e2201288-a6c1-457e-ab9d-24013a43a91a","resolution":{"observed_at":"2026-08-01T07:40:22.485622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:22.564721Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:22.564721Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:a4407ec39f0dd48de17896cdb8db268a34edb81ccf3fab460af12db4edfd6286","observation_id":"f1c480cb-9916-472b-9231-0b317a1a0676","resolution":{"observed_at":"2026-08-01T07:40:22.564721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:22.659146Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:22.659146Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:f4256166325331a1e945a89f76865271905bbd61fc32813d52f34973cfb3496e","observation_id":"211449f5-9e05-4e76-8165-39930ac5a627","resolution":{"observed_at":"2026-08-01T07:40:22.659146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:22.796740Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:22.796740Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:4f4d40ee348012a03c0812e42811215be044c03e68027c45ec5477aed5346f4d","observation_id":"4963a0c5-fac6-4e57-b866-9e4d8d83a79d","resolution":{"observed_at":"2026-08-01T07:40:22.796740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:22.901598Z","title":"In: International Conference on Machine Learning (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:22.901598Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:e8e4a0dd1cef02a33ada1a92a26e08820f80930dfdfaaa565eedc8b8f2c2c0b9","observation_id":"457936c3-c74b-495b-ad9e-ecb9837f04d5","resolution":{"observed_at":"2026-08-01T07:40:22.901598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:23.033716Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:23.033716Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:d6f6323879e001338585f200c42de013f2b1973a8fb32893221f4f2dc8cf8a61","observation_id":"2e349262-56f0-49b6-8809-dec3967f80fc","resolution":{"observed_at":"2026-08-01T07:40:23.033716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:23.094277Z","title":"International journal of computer vision127(3), 302–321 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:23.094277Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:7df383a596186b0e1cd0ddac01508e1b14171377a86ab362e77db3020226c532","observation_id":"69835ccb-c2c3-45ed-8f5c-8a34817a4f41","resolution":{"observed_at":"2026-08-01T07:40:23.094277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:23.166884Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:23.166884Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:5203656a804a42661a4165191fe0ed8dc83c5a5fdaf303dde187b8829699a337","observation_id":"98cd83d0-4ce8-45e1-ba3e-a1d9a1ad0c00","resolution":{"observed_at":"2026-08-01T07:40:23.166884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07832","last_updated":"2022-01-27T09:20:49Z","snapshot_observed_at":"2026-07-06T12:08:39.149450Z","submitted_at":"2021-11-15T15:18:05Z","title":"iBOT: Image BERT Pre-Training with Online Tokenizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07832","snapshot_observed_at":"2026-08-01T07:40:23.235845Z","title":"arXiv preprint arXiv:2111.07832 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:23.235845Z"},"links":{"cited_paper":"/paper/2111.07832","citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:68d0d21adc0113a9752da8b809458d2690e2f817bf1d3f70897313056065a62c","observation_id":"3ea9a268-e319-4b50-9b30-2124dad99346","resolution":{"observed_at":"2026-08-01T07:40:23.235845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:23.337337Z","title":"In: Proceed- ings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:23.337337Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:67bb32e961fcc3aff31189bec2c963561cb70d2348ee8533c772b350b95ed873","observation_id":"46839edd-3d62-433f-8047-c6339a77f4d9","resolution":{"observed_at":"2026-08-01T07:40:23.337337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T17:38:11.183534Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":84,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 0 inbound Pith citation observations for arXiv:2607.21371."}