{"as_of":"2026-08-09T06:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:50bb4175ddaa7729fd19186016bf7f4c275a17001c458154c46e9983c62c0f79","coverage":[{"denominator":116,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:10:19.724032Z","state":"measured"},{"denominator":104,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":104,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T13:42:25.796548Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T13:33:28.299770Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"cited_work":{"arxiv_id":"2508.11256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.11256","snapshot_observed_at":"2026-06-29T13:33:28.299770Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","venue":null,"work_id":"25489e52-69ed-496e-9a89-e96910750a83","year":2025},"citing_paper":{"arxiv_id":"2604.17914","last_updated":"2026-04-20T07:47:51Z","snapshot_observed_at":"2026-08-02T06:34:24.155889Z","submitted_at":"2026-04-20T07:47:51Z","title":"Beyond Binary Contrast: Modeling Continuous Skeleton Action Spaces with Transitional Anchors","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T04:32:04.547197Z"},"links":{"cited_paper":"/paper/2508.11256","citing_paper":"/paper/2604.17914"},"observation_digest":"sha256:9b142295583d3f787b18c55f44d65407df6cb8fcb7d59850f3d35a110425de8c","observation_id":"f308d82d-f00e-4cfe-8560-93a223e5e313","resolution":{"observed_at":"2026-05-11T11:51:03.571495Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"cited_work":{"arxiv_id":"2508.11256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.11256","snapshot_observed_at":"2026-06-29T13:33:28.299770Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","venue":null,"work_id":"25489e52-69ed-496e-9a89-e96910750a83","year":2025},"citing_paper":{"arxiv_id":"2605.17583","last_updated":"2026-05-14T13:31:23Z","snapshot_observed_at":"2026-08-02T22:28:42.271827Z","submitted_at":"2026-05-14T13:31:23Z","title":"AgentSteerTTS: A Multi-Agent Closed-Loop Framework for Composite-Instruction Text-to-Speech","version":1},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-05-20T21:14:58.814362Z"},"links":{"cited_paper":"/paper/2508.11256","citing_paper":"/paper/2605.17583"},"observation_digest":"sha256:f9867d308c1c501582cbcf1c730e88afb59a2767ff2e9a61491dd8a4ac956f95","observation_id":"d2be249b-5a9f-4509-b7a5-0bb8fe90acfc","resolution":{"observed_at":"2026-05-20T21:19:03.217532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"cited_work":{"arxiv_id":"2508.11256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.11256","snapshot_observed_at":"2026-06-29T13:33:28.299770Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","venue":null,"work_id":"25489e52-69ed-496e-9a89-e96910750a83","year":2025},"citing_paper":{"arxiv_id":"2606.26120","last_updated":"2026-05-27T02:47:50Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-05-27T02:47:50Z","title":"Dynamic-dLLM: Dynamic Cache-Budget and Adaptive Parallel Decoding for Training-Free Acceleration of Diffusion LLM","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T13:27:45.796650Z"},"links":{"cited_paper":"/paper/2508.11256","citing_paper":"/paper/2606.26120"},"observation_digest":"sha256:a3cef397bb7c88f9e3ccc5932ad5d194b5f8cb2dbe9b675038f2f20b74c3aedb","observation_id":"0d581b57-d70b-4243-b350-5a8155b7ea8f","resolution":{"observed_at":"2026-06-29T13:33:28.301224Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11256","snapshot_observed_at":"2026-08-02T13:42:25.796548Z","title":"Declip: Decoupled learning for open-vocabulary dense perception","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20467","last_updated":"2026-05-19T06:27:58Z","snapshot_observed_at":"2026-08-08T06:33:24.325410Z","submitted_at":"2026-05-19T06:27:58Z","title":"DC-Leap: Training-Free Acceleration of dLLMs via Draft-Guided Contiguous Leaping Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T13:42:25.796548Z"},"links":{"cited_paper":"/paper/2508.11256","citing_paper":"/paper/2607.20467"},"observation_digest":"sha256:1559867be257ae7a730ad235660e9104b0e40470457532ad398b06a6742eed22","observation_id":"2648fb87-7a24-4a22-bfd8-9cbc79320386","resolution":{"observed_at":"2026-08-02T13:42:25.796548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.11256/citation-record","integrity":"/paper/2508.11256/integrity","json":"/paper/2508.11256/citation-record.json","paper":"/paper/2508.11256"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:09.840942Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:09.840942Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:9973400ff6c7bcf9ba932f0ac7c43799117a56f21b159301d0bb27e922db4838","observation_id":"b6e465b7-0a4d-4f1e-99af-92c722ea4481","resolution":{"observed_at":"2026-08-05T20:10:09.840942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:09.985717Z","title":"DAB-DETR: Dynamic anchor boxes are better queries for DETR,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:09.985717Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:f8022062d6632b3e268b008a6b1488fa025cb6cd1b7f5f85b91446ec8eff047a","observation_id":"b13cb74d-faf2-41ad-aa96-8b19e342e8fa","resolution":{"observed_at":"2026-08-05T20:10:09.985717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:10.172898Z","title":"U-net: Convolutional net- works for biomedical image segmentation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:10.172898Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:69b18cc531178e1da83b09fa357f672ebbf6ec6bef0964ab30e49283ecbff95b","observation_id":"a81e8b4b-1baf-4134-a92b-8061e6e25e0a","resolution":{"observed_at":"2026-08-05T20:10:10.172898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:10.358448Z","title":"Masked-attention mask transformer for universal image segmenta- tion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:10.358448Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:f70da9cb338665031cf0f4fc95f3a530347d8663c6fba3c4916d79849bfba438","observation_id":"676ab988-432f-499b-bcb3-7877e37249b7","resolution":{"observed_at":"2026-08-05T20:10:10.358448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:10.521983Z","title":"Mask dino: Towards a unified transformer-based framework for object detection and segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:10.521983Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:27567092c3c38f02c85d2280d17d8d8a69df423cad9047f6d4a5c96b4c5cd832","observation_id":"26dd1416-6cde-424a-8587-73b8f536edc4","resolution":{"observed_at":"2026-08-05T20:10:10.521983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:10.665833Z","title":"Enhanced training of query-based object detection via selective query recollection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:10.665833Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:705be1ced2842b480e39a11988f70f2ef057540425fe24635d8725371ef693b8","observation_id":"3720bf71-4fe1-469c-8eca-f51954994a68","resolution":{"observed_at":"2026-08-05T20:10:10.665833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:10.784765Z","title":"Deformable detr: Deformable transformers for end-to-end object detection,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:10.784765Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:42d74951c19abd17360dd3e8899256b028fd25d5d2ede0ac1b8c9f3f162d2bf6","observation_id":"fee31577-53ec-4b70-972d-1b8c35b02531","resolution":{"observed_at":"2026-08-05T20:10:10.784765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:10.884468Z","title":"Open-vocabulary object detection using captions,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:10.884468Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:47e24b89220826614978f81235457ed5a18dd1040535b05be7ee06bb74f0b135","observation_id":"a55b8869-a91b-4a9c-9e25-458a2551f58c","resolution":{"observed_at":"2026-08-05T20:10:10.884468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:10.958133Z","title":"Aligning bag of regions for open-vocabulary object detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:10.958133Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:1802b61bbb9096973f2ed0a2f4304a96f1ab0838a27f4e0316cdbd62d3fad83c","observation_id":"41ae203e-0c3f-479d-86a3-f58951966f6f","resolution":{"observed_at":"2026-08-05T20:10:10.958133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:11.041423Z","title":"Cora: Adapting clip for open- vocabulary detection with region prompting and anchor pre-matching,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:11.041423Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:3efb9eb1a56d42f0e09fdd8e7605d24e34267ed3bd4d4d0d38239088d434314e","observation_id":"80667852-540e-44d3-9631-282ed239b717","resolution":{"observed_at":"2026-08-05T20:10:11.041423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:11.095095Z","title":"Cat- seg: Cost aggregation for open-vocabulary semantic segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:11.095095Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:c0bd71d84ad1febb1c649aad417790c4d6b400dffd0bf6e73c77a2f46d170044","observation_id":"4b505aa2-f179-4821-b956-5f601838d1c6","resolution":{"observed_at":"2026-08-05T20:10:11.095095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:11.167225Z","title":"Learning transferable visual models from natural language supervi- sion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:11.167225Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:66207fac8a03b45bc31a5800b6ddd1fbe4ad608b62057a077539c86814352566","observation_id":"005594f2-0264-46a5-acf0-9f44c9ce3e10","resolution":{"observed_at":"2026-08-05T20:10:11.167225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:11.249205Z","title":"Scaling language- image pre-training via masking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:11.249205Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:1538a131c2d399a9afe14a8748c0c704855921e0affd4740cc4e28e50a52144e","observation_id":"254a089b-43b8-4ebb-bb04-7832a204a03b","resolution":{"observed_at":"2026-08-05T20:10:11.249205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:11.367823Z","title":"Clim: Contrastive language-image mosaic for region representation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:11.367823Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:2208b696ef38e34a0758ede5cdaab40c9626017f44829fa97651ef23f32cd025","observation_id":"51e3ac40-5b5c-4e61-b2e7-35fc905e8009","resolution":{"observed_at":"2026-08-05T20:10:11.367823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:11.471990Z","title":"CLIPSelf: Vision transformer distills itself for open-vocabulary dense prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:11.471990Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:ad0bf165bff21e3fc228be67988277c59f7fab7936bcd87184d03dd3211e40e3","observation_id":"3cbf97b9-dfb9-46f1-b7aa-f2fa527463e9","resolution":{"observed_at":"2026-08-05T20:10:11.471990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:11.550247Z","title":"Regionclip: Region-based language- image pretraining,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:11.550247Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:4bd21400d132ac6c3b731dba150543762ac38eda5de0a98329d30f5bf201bbff","observation_id":"4ffefd41-6b38-4499-b361-7086adddb965","resolution":{"observed_at":"2026-08-05T20:10:11.550247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:11.632230Z","title":"Ov-dquo: Open-vocabulary detr with denoising text query train- ing and open-world unknown objects supervision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:11.632230Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:0fd8aa6f59b5ccce4f9fec431fc0a66298cbd57de8dbad56b16e446228231a90","observation_id":"d66d7f3c-8cb1-4afd-8f2a-3fd23eae852f","resolution":{"observed_at":"2026-08-05T20:10:11.632230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:11.712835Z","title":"Open-vocabulary object de- tection via vision and language knowledge distillation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:11.712835Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:ba4d5192332b41ee3cbf5ec0151cfea4517e7ca988a5202a6aac9f5147e88365","observation_id":"92b6f947-9229-436a-9b7a-8db1109c8f04","resolution":{"observed_at":"2026-08-05T20:10:11.712835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:11.778514Z","title":"F-vlm: Open-vocabulary object detection upon frozen vision and language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:11.778514Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:967da8a812402e36506c87aba918abfe69440ac2a542a40b7cb8393ff5e1df10","observation_id":"b511101e-e005-4623-89cc-81a6ce653cf9","resolution":{"observed_at":"2026-08-05T20:10:11.778514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:11.880929Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:11.880929Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:d94c9598d71ded873b9cea5e1d4863406990ba37008bc644975d85f92569ab6b","observation_id":"59667dd5-5997-409f-ad3a-25b3c4c980f5","resolution":{"observed_at":"2026-08-05T20:10:11.880929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:12.005807Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:12.005807Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:19d79090f3052b1d19157003ee6ec68b8d30fb83ac6dd126a863c788b554b0a8","observation_id":"c4ab2810-05bc-487f-9d45-591ebcfe8151","resolution":{"observed_at":"2026-08-05T20:10:12.005807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:12.093572Z","title":"A survey on open-vocabulary detection and seg- mentation: Past, present, and future,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:12.093572Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:fa929120f6551032c13e62cd48b7b7ab33303b66cc908185ab79bcf42d9c7a93","observation_id":"3cd92037-2c8a-4627-b85f-0d5216336030","resolution":{"observed_at":"2026-08-05T20:10:12.093572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:12.169894Z","title":"Towards open vocabulary learning: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:12.169894Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:4647c0917fe980ca9adb359be21d5b98c832f08221d8f1c499668f0ddfa1c79b","observation_id":"6ebec5cc-a8ed-426f-8684-035a8e05981c","resolution":{"observed_at":"2026-08-05T20:10:12.169894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:12.210528Z","title":"Object-aware distillation pyramid for open-vocabulary object detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:12.210528Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:96c1c02cddbe3e82c7c5301e3b15af88b3adec4e196473a1b48a1754425501e2","observation_id":"b9605788-1ab7-4438-beb8-d969d2a32bbe","resolution":{"observed_at":"2026-08-05T20:10:12.210528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:12.287880Z","title":"Groupvit: Semantic segmentation emerges from text supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:12.287880Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:54c374bc78e000cf5dabb950cd0bacc254b7fbad537c2c81debe5886e915e527","observation_id":"23979c0f-7801-4bfa-aca1-778effe26441","resolution":{"observed_at":"2026-08-05T20:10:12.287880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:12.348029Z","title":"Scaling open-vocabulary image segmentation with image-level labels,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:12.348029Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:d115af48a408162ef77f8f39b70bd1a8c71cc3c00549ecdc29bf8b39538ba7ca","observation_id":"8a0721e4-2a9c-4870-9444-f119a472b4eb","resolution":{"observed_at":"2026-08-05T20:10:12.348029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:12.474425Z","title":"Taming self-training for open-vocabulary object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:12.474425Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:705486be3f98d68eb674c224709bc997011dcffb11cc10161d70ef03b95e5a09","observation_id":"b36b47c6-cb06-4053-a69a-b1310328eeb5","resolution":{"observed_at":"2026-08-05T20:10:12.474425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:12.594935Z","title":"Detecting twenty-thousand classes using image-level supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:12.594935Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:812ab129410385684d8ef7b5233b486ca5f45fa866ddacb3197c332f30f25eaa","observation_id":"54c81a43-db65-43fc-9ea9-fe6458e595fe","resolution":{"observed_at":"2026-08-05T20:10:12.594935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:12.694061Z","title":"Open-vocabulary detr with conditional matching,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:12.694061Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:5883e03ded5a7b67bfd12bf7008a7f4724f938d8031e8f07afbe55d58a9bbf8a","observation_id":"87e73afb-085b-43e8-8cb6-617f97ab90ce","resolution":{"observed_at":"2026-08-05T20:10:12.694061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:12.791515Z","title":"Global knowledge calibration for fast open-vocabulary segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:12.791515Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:85bab7ae49720f462c52317e13ac2f7ecda348e510ed73595618d12fe8fd53b1","observation_id":"7933283e-d56e-48c3-8910-4478e6c73780","resolution":{"observed_at":"2026-08-05T20:10:12.791515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:12.869705Z","title":"Densegrounding: Improving dense language- vision semantics for ego-centric 3d visual grounding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:12.869705Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:939021b99dda23f59d7095a6a224829c6ad42bb977f6c8c85210da24c55cd0b9","observation_id":"70b6f036-7c3c-46b1-9a72-94c8db72d67a","resolution":{"observed_at":"2026-08-05T20:10:12.869705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:13.005986Z","title":"Detect anything 3d in the wild,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:13.005986Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:eecff95fcfb37b65b29dc2a606726431be7e2c7575840e95563f3875af125bce","observation_id":"65466bf6-0e39-45c0-bee0-9607668b5824","resolution":{"observed_at":"2026-08-05T20:10:13.005986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:13.097939Z","title":"Sam3d: Segment anything in 3d scenes,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:13.097939Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:159eeb03777dc3c72c63a887c1052e92d91c04173b43e9ecbe4cadf6b8fd31af","observation_id":"9e3e68d5-8023-4b95-8956-d49f03946f03","resolution":{"observed_at":"2026-08-05T20:10:13.097939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:13.236236Z","title":"Ovir-3d: Open-vocabulary 3d instance retrieval without training on 3d data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:13.236236Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:8fa5aebcb7a47cd8d1c732aa740ab4ae5be91d149ebe1f92bcaa2ccfa492059c","observation_id":"a294c18a-4d55-4924-82c5-b2ba4e5da431","resolution":{"observed_at":"2026-08-05T20:10:13.236236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:13.309695Z","title":"Open- vocabulary object 6d pose estimation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:13.309695Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:36b66c14c329791cd13cd2ca0723e19aaca62001b4eceac6866969b04abf8d7c","observation_id":"f63594e5-8b8c-45dd-82cd-bcd277462492","resolution":{"observed_at":"2026-08-05T20:10:13.309695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:13.348117Z","title":"Open3dis: Open-vocabulary 3d instance segmentation with 2d mask guidance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:13.348117Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:63459f2bd7ee1791a5013f6bdb72dccc1b04ce2872d19284d4c23523ba68c2a4","observation_id":"c5725e7e-534b-46ba-b95f-7ec2ef16536b","resolution":{"observed_at":"2026-08-05T20:10:13.348117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:24.100695Z","title":"Openmask3d: Open-vocabulary 3d instance segmenta- tion,","venue":null,"work_id":"bdc06b72-5e2d-47f9-81ca-fdad27fd1a32","year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:13.444699Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:a3a7c23ccc2d57891d0a1b0c8885b0cd5d0290c6c6e2b6677187e65401c2682a","observation_id":"97ff88ea-e009-408f-9049-a35ac8abe379","resolution":{"observed_at":"2026-08-05T20:10:24.104216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:24.091865Z","title":"Clip-vis: Adapting clip for open-vocabulary video instance segmentation,","venue":null,"work_id":"634667b5-4525-486e-a6b7-6bc8dbdc2984","year":2024},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:13.562789Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:eaab2499c88b5002c352b0c7e767f4adc5711b50420a0620ccd705f7fc695923","observation_id":"a6081716-0575-49b1-b84c-03f10a955575","resolution":{"observed_at":"2026-08-05T20:10:24.095328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:24.083207Z","title":"Semantic and sequential alignment for referring video object segmentation,","venue":null,"work_id":"c3674ca3-34f1-4f92-87d2-2f3746e24768","year":2025},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:13.698246Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:e657e0021219658fa50a31b3b3b9b6e5dc9196a3c81922616cb39a1bb33b2082","observation_id":"ccb798fd-ca9f-45e8-9765-4fb34d4485ae","resolution":{"observed_at":"2026-08-05T20:10:24.086407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:24.073372Z","title":"Unified embedding align- ment for open-vocabulary video instance segmentation,","venue":null,"work_id":"222a00eb-7aec-49ff-8e64-08d2c4abd13a","year":2024},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:13.776707Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:406b395583454a286b01e4de22d964da0f00ff6386ea13ec1ba6627433719207","observation_id":"a6de5595-2620-4bed-8115-fd83c51a5ce7","resolution":{"observed_at":"2026-08-05T20:10:24.076767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:24.063767Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":"c4f7f652-9536-4f20-bf57-799c4ff6b217","year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:13.860179Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:a9323810af51fa8228c1b6c153f37b5e75b794f8b83ccc8416c0ebe1520307e9","observation_id":"58b3e3ad-cc6a-4666-a1a0-406302272a52","resolution":{"observed_at":"2026-08-05T20:10:24.066746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:24.054295Z","title":"Learning mask-aware clip representations for zero-shot segmentation,","venue":null,"work_id":"60ffec4f-d67c-4f14-8a4c-7c17db23d62c","year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:13.940164Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:8750b9ee486ad6e208470eb9ab090d59e88fe8cf19738ef32dba94513678bc20","observation_id":"a556ba8d-5184-490a-9d16-65668d7f8f84","resolution":{"observed_at":"2026-08-05T20:10:24.057529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:24.044765Z","title":"Language-driven semantic segmentation,","venue":null,"work_id":"03f4a023-da10-447b-936d-2f5b50a95dce","year":2022},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:14.042602Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:4db8a92df0d656d3fce0047753b4aa9f05f8c934efdfa4dd166f8ee583815d96","observation_id":"cadb0cd1-c63c-48b8-be3f-afa148e45b02","resolution":{"observed_at":"2026-08-05T20:10:24.048518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:24.035277Z","title":"Open vocabulary semantic segmentation with patch aligned contrastive learning,","venue":null,"work_id":"a9f8f73a-6764-4040-9cd6-31ef968942e2","year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:14.204613Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:4091367660912d742a9f0b9de15c1b2a44ee656b7287a41ddda6a95434756942","observation_id":"65b5c39a-8931-4ff1-bd2b-2c2ff2964766","resolution":{"observed_at":"2026-08-05T20:10:24.039381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:24.024530Z","title":"Sam-clip: Merging vision foundation models towards semantic and spatial under- standing,","venue":null,"work_id":"22cb830f-fc3f-426f-9287-361d2e1abc49","year":2024},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:14.294410Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:3deb1b08315e57c98625cf5c410d0bab7d341fc3f81650e61753fd2de409fcd9","observation_id":"b25a119c-0a21-4bb7-8a81-19d80f4db41c","resolution":{"observed_at":"2026-08-05T20:10:24.028511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:24.015905Z","title":"Open- vocabulary sam: Segment and recognize twenty-thousand classes in- teractively,","venue":null,"work_id":"6b063425-a5e4-4481-8418-2746f1040814","year":2024},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:14.362385Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:888b2117d37af015aea19526617c0f61e7a2e0171dffd3033367e9f1dc644b7f","observation_id":"c51eff8f-92a3-4ad1-a9d2-80ea322a2df9","resolution":{"observed_at":"2026-08-05T20:10:24.018831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:24.005260Z","title":"Frozenseg: Harmo- nizing frozen foundation models for open-vocabulary segmentation,","venue":null,"work_id":"7e8ee232-64fd-4f9a-a5fd-3bfe86ba7f18","year":2024},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:14.437271Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:bd5b07f0a74ff22ba2285d028943584c450d958066f623f30b052b6e32a405d2","observation_id":"61478947-f6cf-4a1a-a6fe-e8d95eb959e3","resolution":{"observed_at":"2026-08-05T20:10:24.009620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.994186Z","title":"Segment anything,","venue":null,"work_id":"ac405997-c448-45ff-b2d5-5833ff2bfc77","year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:14.544984Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:4ba66aa3b9e5b8b607cf51cd9ad1284e05a6cb8b64b19d228f9e412f9db27a2c","observation_id":"aee0f0a6-dac6-4a7c-94a9-c223bfc651c2","resolution":{"observed_at":"2026-08-05T20:10:23.998121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.983527Z","title":"Rep- resentation alignment for generation: Training diffusion transformers is easier than you think,","venue":null,"work_id":"5789a209-6bb9-4ac7-8189-acc95bf9618d","year":2024},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:14.679168Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:2a092cd4c1910b7c538916bb37fa86656bee2595d27ff31aa6898bab47f7c05f","observation_id":"f0d793ae-1c9d-4c32-b3eb-7c4d95387681","resolution":{"observed_at":"2026-08-05T20:10:23.987948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.972364Z","title":"A convnet for the 2020s,","venue":null,"work_id":"0057d1a7-0b5f-49e3-a14e-f673ee65c631","year":2022},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:14.803588Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:e0164854b5898c7ed5e438b1e8de05169bcbffe974b35d6ae5d6c641ef1508d0","observation_id":"986b009c-be4d-49bf-b945-6923fd7e86fc","resolution":{"observed_at":"2026-08-05T20:10:23.976472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.961903Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":"88117188-c844-4208-b519-3297f0e526e1","year":2016},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:14.906924Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:74c898efe31c454e4bf08ec84ee44adfead1ea4fd517c4697a9ebac9ddd5c4a9","observation_id":"6619ccf9-cac6-4c3b-a27e-5dcf43a1f0f7","resolution":{"observed_at":"2026-08-05T20:10:23.965878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.951965Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"62d4a44c-cd91-4ca3-8c70-920bebb3f2c8","year":2020},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:14.996849Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:52ddaa4e93c219864398046f8adde98257dc5023c97ca824c32f49b9b91f84dc","observation_id":"9dac5372-388a-45fd-83ee-fafa1ae2fb26","resolution":{"observed_at":"2026-08-05T20:10:23.956105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.941208Z","title":"Attention is all you need,","venue":null,"work_id":"37523c7b-21f9-4cc8-9d3c-7ccbbc24d45e","year":2017},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:15.076869Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:2b978aac2c6144c6db400e23b54f103069cab1c72c411ea254a6d4e7ba9cf503","observation_id":"cbe289d1-a07c-4257-b58e-5fff0805e3be","resolution":{"observed_at":"2026-08-05T20:10:23.945286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.932368Z","title":"Emerging properties in self-supervised vision transformers,","venue":null,"work_id":"a3bc41a7-07aa-4e0c-aa43-1719ac21440f","year":2021},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:15.183668Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:656d51925bc8e406ab4c54e5254d76b69e257043e6f2ad90980d37e8377871a9","observation_id":"f708fa24-1712-4b72-a4a0-53afdca8449b","resolution":{"observed_at":"2026-08-05T20:10:23.936097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.919680Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":"0404d469-491e-491c-b593-a481779d7ff9","year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:15.290363Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:ad642e3f6c4ac4284f7348ffe69a2355bfd089bf2df34ad3b620fa4eade08d76","observation_id":"92be49f7-c9f9-4161-83cc-5667cf040cd3","resolution":{"observed_at":"2026-08-05T20:10:23.924042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.910006Z","title":"Sam 2: Segment anything in images and videos,","venue":null,"work_id":"fca1f0f4-e9a6-4fb5-9ac0-984898626d35","year":2024},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:15.436149Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:f9d8f04993b3ed5036e80c55d9e1cae4b49a2d824403d8ab85f50216f32ba01f","observation_id":"25aedd9a-1bc6-4701-8e1b-018f207f79f8","resolution":{"observed_at":"2026-08-05T20:10:23.913865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.898512Z","title":"Sclip: Rethinking self-attention for dense vision-language inference,","venue":null,"work_id":"298d2673-d916-4438-94b5-5bf5e2d71081","year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:15.507929Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:4c3bb6507cf3868a8b29fc3938e5197858ffe75546b1d4f87c74c6af2856b015","observation_id":"be12a41f-a993-416a-a2ec-6610f7d176a2","resolution":{"observed_at":"2026-08-05T20:10:23.902701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.888401Z","title":"Explore the potential of clip for training-free open vocabulary semantic segmentation,","venue":null,"work_id":"d82fb9b4-539b-4c23-ab57-0481a99992ae","year":2025},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:15.616014Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:4bceb158e9a890381003f2d82f2e891d539efb4f16b8171fb7f3507b8e6916f3","observation_id":"bd6458fc-e7a9-4dc9-bd71-68a633858bc7","resolution":{"observed_at":"2026-08-05T20:10:23.891619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.877669Z","title":"Clearclip: Decomposing clip representations for dense vision-language inference,","venue":null,"work_id":"8a14e996-26fc-4c35-8cdb-19b674edbf14","year":2024},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:15.780654Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:ddcbcd28e0685d150c7c873c4926c4b82c2340092938f3a1cdbdf4ff726a092c","observation_id":"5dd4cad7-b9f6-48e7-9757-c62281e5afcd","resolution":{"observed_at":"2026-08-05T20:10:23.881675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.868681Z","title":"Clip-dinoiser: Teaching clip a few dino tricks,","venue":null,"work_id":"42f04e9a-fcaa-4c77-87a0-94306ca877ef","year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:15.922960Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:1d265b9f816e1471a4c045187be211bf6cea0735740ee2e59b55dfcd46dbe74e","observation_id":"4b4c6637-59b2-4460-949b-50c2aaf538e0","resolution":{"observed_at":"2026-08-05T20:10:23.871784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.859702Z","title":"Diffusion model is secretly a training-free open vocabulary semantic segmenter,","venue":null,"work_id":"9bd2f1c2-2203-456e-97b2-7fbadbaf213e","year":2025},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:16.113871Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:4af2c962ad6ed125f104b3178dfeaff26f3aa0bfdf3be3b680eb0bde33ce7a4a","observation_id":"41efa2dc-4218-4e97-864a-f07ff8cdb94b","resolution":{"observed_at":"2026-08-05T20:10:23.862851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.849663Z","title":"Dynamic prompt learning: Addressing cross-attention leakage for text-based image editing,","venue":null,"work_id":"ed44c789-aec2-4616-9bd7-dd8c98ffb249","year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:16.260625Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:c1a2ae0ec34e0337f542c7712de9657a97c942489bdc09613b442a035a28fc72","observation_id":"2ba01bef-113a-4131-ba3e-c5c23fb7c13a","resolution":{"observed_at":"2026-08-05T20:10:23.852800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.839656Z","title":"Cliper: Hierarchically improving spatial representation of clip for open-vocabulary semantic segmentation,","venue":null,"work_id":"149b29cd-3386-4008-b2f4-f01527825fe0","year":2024},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:16.380258Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:2940c51b43dcfe0ca9d52f24c52ba877aff775637da5fd5e7d5052ea87ef6395","observation_id":"600b1258-c5b5-49a7-8d24-4f7667c938e0","resolution":{"observed_at":"2026-08-05T20:10:23.843352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.830255Z","title":"Silc: Improving vision language pretraining with self-distillation,","venue":null,"work_id":"126b3f67-9436-4fe6-a50d-524aa4371639","year":2025},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:16.477605Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:0d6de641394a32aa350e05583b47d6d1cb8b9fe4c215a1d98ab8c32d1dd62d17","observation_id":"2f936345-1d95-44fb-b4dd-c5bcd21ee3b3","resolution":{"observed_at":"2026-08-05T20:10:23.834223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.821183Z","title":"Exploring open-vocabulary semantic segmentation from clip vision encoder distillation only,","venue":null,"work_id":"5ef6a41a-c64c-4b16-aeba-e263029c95c8","year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:16.681775Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:a5f41b610d3689aeb8f71b37159a2a25c03737128111b4781125f321b5942b1e","observation_id":"79b85762-b0b9-45ce-8510-9b50eb619c28","resolution":{"observed_at":"2026-08-05T20:10:23.824247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.810294Z","title":"Mask r-cnn,","venue":null,"work_id":"915a845b-e92a-4723-aa31-2d7c94e4b438","year":2017},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:16.782295Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:ed024af02290fa2259d417f2d72e21566300f4da0ebf6f0d43d2946eea12e4ca","observation_id":"d5193b3c-ebda-45e2-bbfb-feada88a460f","resolution":{"observed_at":"2026-08-05T20:10:23.814331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.801088Z","title":"Relational knowledge distilla- tion,","venue":null,"work_id":"2a612add-9ad6-45fe-b513-bc6cb0c98a22","year":2019},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:16.829689Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:c6113e2923994702ef0ec44035f53346d5e3d1e24e7c036a6405e3342c849d8d","observation_id":"205d5565-0b63-4285-ad22-aede1d0d3094","resolution":{"observed_at":"2026-08-05T20:10:23.804002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.792347Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":"a9d0f75e-5138-4f50-b202-b73a6631ec1e","year":2014},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:16.894190Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:29b3798a79a0e2ad212c2474bc6ac9d06a90f7c2ad5cdaf05729eaae61730db6","observation_id":"5277c74d-472f-4a68-bc85-9d836843269a","resolution":{"observed_at":"2026-08-05T20:10:23.796031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.782038Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":"d0537e8c-8c37-4590-92d8-fd678c3ea043","year":2017},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:16.986846Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:1199f96e5ec5bc9ed1ee040e74645db3db35a3b47def12ed80bcd8c297edd287","observation_id":"972f6476-b4b4-464e-84df-73550f4a0523","resolution":{"observed_at":"2026-08-05T20:10:23.785855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.772160Z","title":"Eva-clip: Improved training techniques for clip at scale,","venue":null,"work_id":"03782380-10f2-4890-983b-1ef4d14ad441","year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:17.061374Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:0866c23748c6451ac0dda583f80419326b2e026d48601dc17a75c107eba25942","observation_id":"c5f7be36-a448-4687-b029-a22148928726","resolution":{"observed_at":"2026-08-05T20:10:23.775193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.762072Z","title":"Vision transform- ers need registers,","venue":null,"work_id":"c9199cd0-1595-47bd-9071-c063594b144e","year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:17.191747Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:404cef6eafde55a86b0bf82a377e7d7b72a0f7c3002beafedc94f8230f5596a3","observation_id":"49b7510c-7d13-4880-83a3-33a7159b7b58","resolution":{"observed_at":"2026-08-05T20:10:23.765935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.752512Z","title":"Language-grounded indoor 3d semantic segmentation in the wild,","venue":null,"work_id":"72f4a630-9a60-40c3-b73c-72815311ed9b","year":2022},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:17.276128Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:df3a91f5f3dc378fec134f1661e7ec6e83f179ebd0005585cc67f55188bfb18a","observation_id":"ac1612bb-55dc-4acf-b6c9-47460689030c","resolution":{"observed_at":"2026-08-05T20:10:23.755803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.742824Z","title":"Isbnet: a 3d point cloud instance segmentation network with instance-aware sampling and box-aware dynamic convolution,","venue":null,"work_id":"460c71a4-2117-41e8-8a05-1caaed962a79","year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:17.352021Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:d9d75e94362ec8a2ecc612e66d1eda4ab7a9efeee53c2da0eb198adae63093b3","observation_id":"5275d7da-9d4d-4006-9db1-1ea7e7fc4c0a","resolution":{"observed_at":"2026-08-05T20:10:23.746015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.734161Z","title":"Mask3d: Mask transformer for 3d semantic instance segmentation,","venue":null,"work_id":"d32a5f21-ed96-47ea-bdc5-5e60229ea5f2","year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:17.411695Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:4bb80537136e9ba743b89f1120c21b2539e6ef555eadea2cd2127e43091ee1b7","observation_id":"987cc53e-740e-42e2-923e-af661b8ca986","resolution":{"observed_at":"2026-08-05T20:10:23.736986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.726270Z","title":"Openscene: 3d scene understanding with open vocabularies,","venue":null,"work_id":"c568b679-7794-41f9-97d0-d4399aaee7f8","year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:17.473786Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:8e19803b5a4851d47f0308bfb3e7a3ab44988bfe612dd2c2a3f6e18130a3245a","observation_id":"9e692ed7-6df9-4e5c-81c2-946d6f8602a6","resolution":{"observed_at":"2026-08-05T20:10:23.729040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.717256Z","title":"A density-based algorithm for discovering clusters in large spatial databases with noise,","venue":null,"work_id":"4cb893bd-7050-42bc-baf6-d188c7b62bb1","year":1996},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:17.540970Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:0bd2ed90b70b5e2a35f35286cc2a7f5ba38ae65283c4c5b09bbd90d26035a002","observation_id":"b2983b14-f286-460e-be1d-1c5dd73729b2","resolution":{"observed_at":"2026-08-05T20:10:23.720545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.709213Z","title":"Openins3d: Snap and lookup for 3d open-vocabulary instance seg- mentation,","venue":null,"work_id":"eedf3c42-e532-4ca6-ace8-8250d68e125e","year":2024},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:17.680891Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:39a5fd462221bb8c47db80f3f7c252d5b2e5ed121cbac9cf20589c77f2b19bf3","observation_id":"b13a1cb6-7574-49f7-a680-3c51c19c1489","resolution":{"observed_at":"2026-08-05T20:10:23.711917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.693704Z","title":"In defense of on- line models for video instance segmentation,","venue":null,"work_id":"75bc8cda-11a3-45fb-902b-1c8911d6bd57","year":2022},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:17.852582Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:c5e618f941dfd38d99fd2b8acfca2d9c72e02a69ce078e155ae7a60ee8072717","observation_id":"7de92333-3e91-4dfd-b235-963bf0d22236","resolution":{"observed_at":"2026-08-05T20:10:23.696296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.685500Z","title":"Simple online and realtime tracking,","venue":null,"work_id":"22fccac2-6bfd-431f-86e5-8f60bf0432b6","year":2016},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:17.953660Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:e24957306dcef86abdacb1362491d83c5516a04ada180971bfdcaacdea52a141","observation_id":"7efe7155-1222-4a61-9e89-ad21db25f6c7","resolution":{"observed_at":"2026-08-05T20:10:23.688453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.676104Z","title":"Opening up open world tracking,","venue":null,"work_id":"054ff3d1-4921-49f0-b78f-cca28b1af6ce","year":2022},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:18.020767Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:847580121d893e4eff8acf7968f882b7aa2a5a6ccd119a59f6942c3a179cc90e","observation_id":"f8650d5b-ca4f-4e2c-9d15-bb844a8fbff5","resolution":{"observed_at":"2026-08-05T20:10:23.678693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.668542Z","title":"Xmem: Long-term video object segmentation with an atkinson-shiffrin memory model,","venue":null,"work_id":"e0fe803e-6670-48aa-8941-788251b543b6","year":2022},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:18.097949Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:677813c5e258dba1178cb1572bcaef0715529838e6ba126fb4794a9caf149b99","observation_id":"1bda6104-ec21-4a83-bebc-6bacaeb08a6f","resolution":{"observed_at":"2026-08-05T20:10:23.671067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.659593Z","title":"Towards open-vocabulary video instance segmentation,","venue":null,"work_id":"4a26911c-2760-478d-aebf-9f963cb8b919","year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:18.158794Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:6d029f9fe9cfdbb8ddd6e76c18e74b86da1f89b48bc57371f9cad8e9c4c0dd92","observation_id":"ad7dbb41-7e45-494e-8aa1-47daaebdad62","resolution":{"observed_at":"2026-08-05T20:10:23.662817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.701883Z","title":"Video instance segmentation,","venue":null,"work_id":"3c931a19-f741-43c7-abe7-2dd56cd59a6f","year":2019},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:18.232954Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:f2b9b888deacdece5b09b9fe4b150bf74c48a78813f21fe196fbca09839911ee","observation_id":"5e01609f-edcc-41c0-8839-39878b1d24b9","resolution":{"observed_at":"2026-08-05T20:10:23.704463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.652246Z","title":"Lvis: A dataset for large vocabulary instance segmentation,","venue":null,"work_id":"6aadc64a-4f14-47b9-a41c-11708c17e8b6","year":2019},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:18.300865Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:5cba240417482afcc487de2c55b215e27be4b3d2ad51401405ff4de9efbd5ac9","observation_id":"3c4543e9-4a42-49c0-99cb-81610213c364","resolution":{"observed_at":"2026-08-05T20:10:23.654980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.644318Z","title":"Occluded video instance segmentation: A benchmark,","venue":null,"work_id":"0d9ab62d-4e0b-4b96-92fc-2ba654d47599","year":2022},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:18.362458Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:1fb8ed36cc96287005b0f863698e322c3cef0dadf050b9b5021bcb8f7b29947b","observation_id":"33b1d745-9ae6-4fab-91c6-5b7a5caa95db","resolution":{"observed_at":"2026-08-05T20:10:23.647349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.635855Z","title":"Burst: A benchmark for unifying object recognition, segmentation and tracking in video,","venue":null,"work_id":"e263080d-871d-41c9-924b-485ce76549c1","year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:18.428705Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:22a8cea8f345ed8736bc4c64f4c6bf9321eed781f2f5cd1de8573ce40ccdf091","observation_id":"897b2fb6-e632-4d5f-aed8-d1bf679cb521","resolution":{"observed_at":"2026-08-05T20:10:23.638704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.626619Z","title":"Fs6d: Few-shot 6d pose estimation of novel objects,","venue":null,"work_id":"decfa737-4e19-4bf2-ba7f-30980970c8e3","year":2022},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:18.508453Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:a0163b83c4456f8c5c57bdf2b76cdffcdd1c295568ea13c549b08b6177d6d024","observation_id":"6f2340bc-7af9-4092-9e04-cac822a5bb02","resolution":{"observed_at":"2026-08-05T20:10:23.629572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.617906Z","title":"Semantically-enriched 3d models for common-sense knowledge,","venue":null,"work_id":"604d856e-556d-40cc-b255-35e77f2e33cd","year":2015},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:18.606981Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:50aa1a5f0409765e2d1d3232dd3722c501397216e90ff3fb575428e880882e77","observation_id":"11d3065d-c56c-43d4-86b7-dc4ee7ebef54","resolution":{"observed_at":"2026-08-05T20:10:23.621276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.608888Z","title":"Normalized object coordinate space for category-level 6d object pose and size estimation,","venue":null,"work_id":"69f2e521-1bbe-4685-a307-5e53bc8d22c0","year":2019},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:18.686622Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:5200492abeaa30a1b5d3c1e4485ce1d0d2768eaf85ed63bdc43fc7058042c3e8","observation_id":"400933f0-9f5a-40b3-9f94-ab77701c2ef2","resolution":{"observed_at":"2026-08-05T20:10:23.612037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.601228Z","title":"Bop: Benchmark for 6d object pose estimation,","venue":null,"work_id":"fd012114-0515-4dbf-82e6-fc76f9e9477a","year":2018},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:18.797052Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:855f3097f097a32d2ce42b8a4fac96d7c7d3f316837dd4af8f10d14cba664519","observation_id":"aba4668e-f6a4-421e-9de1-5324e94dbd0f","resolution":{"observed_at":"2026-08-05T20:10:23.604203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.594072Z","title":"Bop challenge 2020 on 6d object localization,","venue":null,"work_id":"77f3cc80-9370-417e-8feb-db752c957971","year":2020},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:18.894916Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:3f289003d1453146e7e4e4ccb0df3c297606b62d5df37cc6a20d585ac73123ba","observation_id":"15346383-ffe8-4f89-990c-41b4c8cb622e","resolution":{"observed_at":"2026-08-05T20:10:23.596699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.586463Z","title":"Swin transformer: Hierarchical vision transformer using shifted win- dows,","venue":null,"work_id":"9991b14a-a0ef-4f08-9243-b233ec076fc6","year":2021},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:18.985082Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:a2ddafa49fa1563de7105d04cbb4379150a54e0df251fd19d63a0baa4ebf8d12","observation_id":"2c6b7203-98e8-47a2-815b-c7245133b94a","resolution":{"observed_at":"2026-08-05T20:10:23.589444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.577073Z","title":"End-to-end object detection with transformers,","venue":null,"work_id":"2dd82240-4397-44d1-8817-3e60499b4d02","year":2020},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:19.045927Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:ab33a0375789501bf0261f7c0ca9b6f4890c80b76cc3ee462be63b813a378c0a","observation_id":"9fbd2366-3de6-43a1-b8b5-861ae8405fb9","resolution":{"observed_at":"2026-08-05T20:10:23.579542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.567287Z","title":"Region-aware pretraining for open-vocabulary object detection with vision transformers,","venue":null,"work_id":"f8e9b24a-966a-446b-95f3-cca56b15bb6a","year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:19.131544Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:4f6c7582e78a39d690a46567ba15c91ccb9e462991ead72cd5337a49e2a0c51e","observation_id":"40a25b6f-db23-4027-955a-9d5abd0cdeea","resolution":{"observed_at":"2026-08-05T20:10:23.570341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.559628Z","title":"Contrastive feature masking open-vocabulary vision trans- former,","venue":null,"work_id":"72d1dd8d-2972-4fa9-993f-90b9c09d5958","year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:19.218112Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:dbd51ab7bce3606f8d13032f0b34e5d0a4dd70217d9115050e14ae7ce0677584","observation_id":"2fba74c1-a24c-448e-83bc-cfa1b4c1fc96","resolution":{"observed_at":"2026-08-05T20:10:23.562591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.544285Z","title":"A simple baseline for open-vocabulary semantic segmentation with pre-trained vision-language model,","venue":null,"work_id":"7d255014-1e44-4119-a271-aa58b838fd85","year":2022},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:19.393386Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:b932da68eb5a56bcd8ace340954bbfa3fed8738ef77d10943fc3aa14a3f70b35","observation_id":"941618b2-67e7-4535-9552-166819674ef0","resolution":{"observed_at":"2026-08-05T20:10:23.547138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.534979Z","title":"Side adapter network for open-vocabulary semantic segmentation,","venue":null,"work_id":"858bc832-fc9f-4c4e-aab3-4dd0ce9e70a1","year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:19.456741Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:89b1b897cb5d530dc8f097247e24290ecd878abc3c1ee69740026d595ae9683f","observation_id":"b58ed32b-0a2a-4836-886a-5f7a700fb054","resolution":{"observed_at":"2026-08-05T20:10:23.538678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.526487Z","title":"Open-vocabulary panoptic segmentation with text-to-image diffusion models,","venue":null,"work_id":"7e43c89b-998d-42db-bac4-cc9ee1f9a988","year":2023},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:19.565524Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:1b04f54ddcc528b4d5ac03ad1342e0b9362d8d13922b817b95a6d27c685cf749","observation_id":"b08179dd-ad6b-48fa-bdd1-4767272c1b8f","resolution":{"observed_at":"2026-08-05T20:10:23.528893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.517216Z","title":"Convolutions die hard: Open-vocabulary segmentation with single frozen convolutional clip,","venue":null,"work_id":"853a0c2d-64b9-4b69-9a44-e1657cba1b37","year":2024},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:19.641618Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:fe3897e15fca953f86fcb04e1bc18183e9f2213e757ef7f147501814af2eba82","observation_id":"d6babb57-d5f7-4925-be5f-4a8e1d18117f","resolution":{"observed_at":"2026-08-05T20:10:23.520963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:10:23.508745Z","title":"Extract free dense labels from clip,","venue":null,"work_id":"f69b51af-3041-43f4-b20d-38792ba0b640","year":2022},"citing_paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:19.724032Z"},"links":{"citing_paper":"/paper/2508.11256"},"observation_digest":"sha256:cb0bf765cae9c24a9e9dd867a4b6b5e02fdb6c29881a7a3c2fef449da1cf03e5","observation_id":"7482feaa-5a78-4153-a5c2-3bf695e44b61","resolution":{"observed_at":"2026-08-05T20:10:23.511695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.11256","last_updated":"2025-08-15T06:43:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:04:02.338549Z","submitted_at":"2025-08-15T06:43:51Z","title":"Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":64},"total_outbound_references":116},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 116 outbound references and 4 inbound Pith citation observations for arXiv:2508.11256."}