{"as_of":"2026-08-08T20:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6d30b9d6ec3b16cd5ea30ed242c3babf9a7511a34ce08991f57e29367f89cea4","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:35:23.429742Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T14:18:31.349318Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14792","snapshot_observed_at":"2026-08-01T14:18:31.349318Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18827","last_updated":"2026-07-21T08:03:02Z","snapshot_observed_at":"2026-08-06T22:10:20.694387Z","submitted_at":"2026-07-21T08:03:02Z","title":"Open-Vocabulary Gaze Object Prediction: Benchmark and Method","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T14:18:31.349318Z"},"links":{"cited_paper":"/paper/2510.14792","citing_paper":"/paper/2607.18827"},"observation_digest":"sha256:113ec019b9330a18a6e0b64d85a28aa78f66c04785e757dd72b361c51ce99dbb","observation_id":"0438c3e1-e886-4764-9bd7-8e249fa6c60e","resolution":{"observed_at":"2026-08-01T14:18:31.349318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.14792/citation-record","integrity":"/paper/2510.14792/integrity","json":"/paper/2510.14792/citation-record.json","paper":"/paper/2510.14792"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:16.813582Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:16.813582Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:b0c157a363da3a6f93d2c29194b2f325344f64f97828d28f7141d6e81ed1c572","observation_id":"67c99223-9bb6-40b3-958b-eef35b68bb2a","resolution":{"observed_at":"2026-08-04T09:35:16.813582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:16.997885Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:16.997885Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:aab4e204ac36afb39b5c97a55642d4108534dff9a0e1f952da6eddc205f4b9bc","observation_id":"9fb82ad0-37a0-4ccf-938f-3b7dfca0ec9a","resolution":{"observed_at":"2026-08-04T09:35:16.997885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:17.215421Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:17.215421Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:4c1c5b5c96dee0ba4e216a77323b7e6845ab9d844c4878d9e0d84705eea9e32c","observation_id":"2216ac6a-b8b7-4b51-b2a0-c16b44e723d2","resolution":{"observed_at":"2026-08-04T09:35:17.215421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:17.250043Z","title":"Open vocabulary object detection with pseudo bounding-box labels","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:17.250043Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:cc2af8f2e9c08206a5a905e159f04b42576856a3613319013302c2201ff0d865","observation_id":"530313d8-f5d5-4d4e-a9c7-cea3a5c006fd","resolution":{"observed_at":"2026-08-04T09:35:17.250043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:17.355048Z","title":"Open-vocabulary object detection via vi- sion and language knowledge distillation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:17.355048Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:10eb4966ec6500ce96e4f2542dd01a5ea9bfa3b17e4f0b316ba2175f11c67308","observation_id":"aed3c5f6-f5f4-4076-a956-0ce112b59a2e","resolution":{"observed_at":"2026-08-04T09:35:17.355048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:17.400780Z","title":"Hallusionbench: An advanced diagnostic suite for entangled language hallucination and visual illusion in large vision- language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:17.400780Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:bab364792e599167f3e6d4c40c2e9bc2894fe5f200e5a389ea5bcea988cf307f","observation_id":"59f105c5-3272-4eee-a9ff-7c0797a48d9c","resolution":{"observed_at":"2026-08-04T09:35:17.400780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:17.463323Z","title":"Girshick","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:17.463323Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:674a5d5e8741bba544fd6c7819d190e7fdaa2b058ea3f9b706095a2f745fa86b","observation_id":"e8d29ef8-7309-42bf-bb68-59cf56dda22c","resolution":{"observed_at":"2026-08-04T09:35:17.463323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:17.674232Z","title":"Deep residual learning for image recog- nition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:17.674232Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:a7ff248f023e10264244d942770b486705cf09317022a0237d603680384d0e33","observation_id":"e7331a40-11c8-4e45-a550-bc8e4dc2918a","resolution":{"observed_at":"2026-08-04T09:35:17.674232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:17.854854Z","title":"Le, Yun-Hsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:17.854854Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:2f4597b8ce0f7e59ffe14d1cbdeb47793b63c346ab35dd26ebe3b00db97f389c","observation_id":"6a93db05-df4f-47f6-99e4-5f4db472c8a7","resolution":{"observed_at":"2026-08-04T09:35:17.854854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:17.936094Z","title":"Llms meet vlms: Boost open vocabulary object detection with fine-grained descriptors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:17.936094Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:102d7ab4c276ab7c65ee79321271385e7cc4becadf25328f02ddc512aaac9f0c","observation_id":"29d1116d-4be4-44a5-aa2b-ea0464fe2e90","resolution":{"observed_at":"2026-08-04T09:35:17.936094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:18.097591Z","title":"Contrastive feature masking open-vocabulary vision transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:18.097591Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:dfc97015ed90bd01970720725710def611fb8a7e939f96a3ffa21c089bf92ecb","observation_id":"9eb55558-0da3-459a-83fe-e1055a451883","resolution":{"observed_at":"2026-08-04T09:35:18.097591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:18.294047Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:18.294047Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:650ed46e711622925aee41aefef409fe2c9b4e063e11b8bcccbca3ddf61cab97","observation_id":"ab306b65-08f7-4cdf-b87e-4019a1a8f6bc","resolution":{"observed_at":"2026-08-04T09:35:18.294047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:18.418186Z","title":"Learning background prompts to discover implicit knowledge for open vocabulary object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:18.418186Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:2caeb55f915f298cb0a37c02ab17fe3adc98a85a06386450e89022b3b80cffd3","observation_id":"985eb1ac-cbfb-4bb9-bf77-63771903ef8e","resolution":{"observed_at":"2026-08-04T09:35:18.418186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:18.634751Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:18.634751Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:efad49695e7ccb876decc267d5f3733790972063e4ad22eff7f5902438eabaec","observation_id":"a70221cb-e9fa-4880-babb-9dffbba2ecec","resolution":{"observed_at":"2026-08-04T09:35:18.634751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:18.751834Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Doll´ar, and C","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:18.751834Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:ae649c31aeb2085724d7ce409ddc187153d0316e40c96a78e43452799e12e661","observation_id":"ebcb540b-aad9-453a-b259-235dc710c9b0","resolution":{"observed_at":"2026-08-04T09:35:18.751834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:18.982265Z","title":"Class-agnostic object detection with multi-modal transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:18.982265Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:66618c39b90315abe64a4d578ca396048bd2d13f0714e964c2773398812b6b7e","observation_id":"b24b1e1e-9a7d-47fe-b6a4-afe478c37ff7","resolution":{"observed_at":"2026-08-04T09:35:18.982265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:19.053658Z","title":"LP-OVOD: open-vocabulary object detection by linear probing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:19.053658Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:32d2e2f07f7ed4baf1d59503f71c0e1c60593dbd587c7ce8d07e380009f33f2a","observation_id":"cc953704-3a0d-4928-a98e-5c93eb2a1757","resolution":{"observed_at":"2026-08-04T09:35:19.053658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:19.162960Z","title":"Belongie, Alan L","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:19.162960Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:af022754880149bfe258dcfc8401347f0159966ed5767e30857f64511c6e7083","observation_id":"eedd3210-749b-4cb8-af0c-94e6d7c3f80c","resolution":{"observed_at":"2026-08-04T09:35:19.162960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:19.343376Z","title":"Langsplat: 3d lan- guage gaussian splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:19.343376Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:51db9df1b8e21a2f7d7b4728b51bb0293195cd538df57ca5ceb9158c31e67d9f","observation_id":"25ad7e8e-12cd-4d5b-9ddd-0c3629fe0f54","resolution":{"observed_at":"2026-08-04T09:35:19.343376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:19.455358Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:19.455358Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:c221e662e3e0e963a49b0bb09e2480be5f6d0b563f05e3ca0836550bf65e3d61","observation_id":"377b704e-5830-4895-b6fb-bd76426a82e0","resolution":{"observed_at":"2026-08-04T09:35:19.455358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:19.523732Z","title":"Khan, and Fahad Shahbaz Khan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:19.523732Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:96a0cb83bb88a39f677028012d9284dce518c7312388d1c58403bbbea1f73f4a","observation_id":"e6c9d458-59f7-45aa-99d3-79e02814e0ec","resolution":{"observed_at":"2026-08-04T09:35:19.523732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:19.563544Z","title":"Girshick, and Jian Sun","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:19.563544Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:e54664286593e01331bfa6803b67742e95612c7cb1b8182fc19a2a273b125983","observation_id":"5930ab74-7ce0-4168-b4f0-22e83e12124a","resolution":{"observed_at":"2026-08-04T09:35:19.563544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:19.683807Z","title":"Visual cot: Advancing multi-modal language models with a comprehensive dataset and benchmark for chain-of-thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:19.683807Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:ffc9fb3cc22d6b130f65db7e733277993265aae80ed3786eca3d5b2cfc777904","observation_id":"97de76e0-8766-48f3-b0cd-30e376b8d744","resolution":{"observed_at":"2026-08-04T09:35:19.683807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:19.755231Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:19.755231Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:dec0e7954a1de4eb9e82902ff47b5c723278d3ff266e7e98e67d6addc69cb6d1","observation_id":"44d90eed-e159-425f-89de-b3dd5f9d3d35","resolution":{"observed_at":"2026-08-04T09:35:19.755231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:20.085490Z","title":"Chi, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:20.085490Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:ce14c7f1fdf2804a2d31674c628eafc1fc6b008f5f9dc2a42663ecac284f8844","observation_id":"0c288643-834a-4782-9ecb-8c8828e1183b","resolution":{"observed_at":"2026-08-04T09:35:20.085490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:20.209307Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models.CoRR, 2023a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:20.209307Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:7a3d0253de46f41da15f48109a77e50e910551982c6ce184510b368fe7070086","observation_id":"f7d3afe1-1576-480a-9b25-af1c4b08aaee","resolution":{"observed_at":"2026-08-04T09:35:20.209307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:20.317597Z","title":"CORA: adapting CLIP for open-vocabulary detection with region prompting and anchor pre-matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:20.317597Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:27557626f7d18c6b8b2543ca8b1a08b2529f2f66639a6c24199a7bfaa443ab76","observation_id":"ef315cbc-3076-4d46-83bd-a637c515b7e6","resolution":{"observed_at":"2026-08-04T09:35:20.317597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:20.406912Z","title":"Open- vocabulary SAM: segment and recognize twenty-thousand classes interactively","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:20.406912Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:b55f56dbce514ef735549665478d219f8d5efaf6658ec177960f63776f4a379f","observation_id":"01f6b61e-39e9-4a08-96df-dcc009a53d99","resolution":{"observed_at":"2026-08-04T09:35:20.406912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:20.470447Z","title":"MMMU: A massive multi-discipline multimodal understanding and reasoning benchmark for expert AGI","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:20.470447Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:4286fd031b857d44d52aa47fa7cc0a49611f646ff0ab0a6eea0e9af700d71a97","observation_id":"57e05f2e-9bb7-4a8b-8351-7ec79da1d123","resolution":{"observed_at":"2026-08-04T09:35:20.470447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:20.520244Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:20.520244Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:6b2e2b0cae3d4062f3542e6c81a2b9d4c37dadc5165e6ccb5e658bcaa98bf46a","observation_id":"5d66b5f2-2d22-44ea-a77b-e6ce05915537","resolution":{"observed_at":"2026-08-04T09:35:20.520244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:20.640024Z","title":"Open-vocabulary DETR with conditional matching","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:20.640024Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:aef1308b5630ba689c65bae38dbaadfa348e9e800a8f3af3c86515101244d429","observation_id":"ac61a795-6c54-47f6-ab65-c22dd4bf2218","resolution":{"observed_at":"2026-08-04T09:35:20.640024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:20.749701Z","title":"Open-vocabulary object detection using captions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:20.749701Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:19a39223fb32d321f4397fc9c27b968d7c16910a2e9a0bc97dcd472ef58314c6","observation_id":"3fc0d4c7-4fde-4a74-9072-931b85eb970e","resolution":{"observed_at":"2026-08-04T09:35:20.749701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:20.846034Z","title":"Cyclic contrastive knowledge transfer for open-vocabulary object detection.CoRR, 2025a","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:20.846034Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:9e3a43cc18291cf4326a514882732fd6b89936268af0b1e56818b2ac9df4297e","observation_id":"a36016a4-b0f8-490d-bfaf-67314fb47c1d","resolution":{"observed_at":"2026-08-04T09:35:20.846034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:21.067074Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:21.067074Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:566912efc2b5828799e558d2c3863c3f4f7ec5d3a456222920c62491e4e9776e","observation_id":"e37b534c-a736-40ce-b7be-b1e2e3766b15","resolution":{"observed_at":"2026-08-04T09:35:21.067074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:21.145590Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:21.145590Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:29b766d6acb3ebb273293da7cb5760d7d37a171f582aae7e2d7b2cbc4c8aee2c","observation_id":"1f7b0b68-2aaf-4339-a9e0-38e0941a216e","resolution":{"observed_at":"2026-08-04T09:35:21.145590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:21.299476Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:21.299476Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:f2d4e76b9a7018d175fe39d5172306c3200fad7bd6f7f2a27f9a8eda828ec68e","observation_id":"92503e48-32e5-4b7d-8f91-c9f324219b51","resolution":{"observed_at":"2026-08-04T09:35:21.299476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:21.416411Z","title":"Regionclip: Region-based language- image pretraining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:21.416411Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:b30472b656c201adcf685b26e6a7bfa0c0f8be1cb4af25cd02be536fc8b2c3ef","observation_id":"efda1dee-48b8-492f-90d5-3be24d0f9d51","resolution":{"observed_at":"2026-08-04T09:35:21.416411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:21.559089Z","title":"Detecting twenty-thousand classes using image-level supervision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:21.559089Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:0057d9db9ac5717292c0958a6dd9ac1957827bb75c03502e490a6bed555f817e","observation_id":"9ed4b80c-440b-4f3a-a7e0-cb0101c5d195","resolution":{"observed_at":"2026-08-04T09:35:21.559089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:21.593792Z","title":"We adopt the 1×training schedule for OV- COCO (Lin et al.,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:21.593792Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:44fba932cc5089ce1e87009e841cd00bff496efc068c0040632ade69e01171e0","observation_id":"585c94c9-62ea-4859-862f-7761287000f7","resolution":{"observed_at":"2026-08-04T09:35:21.593792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:21.728091Z","title":"Pseudo-label generation process.During our offline pseudo-label generation process, we lever- age SAM (Kirillov et al., 2023; Qin et al.,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:21.728091Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:a8561a2270e083696ce31e14da5beeb11a880ebd84be05d6d12b0108bbd9c33b","observation_id":"23549c58-cc21-42ae-b872-8efb22ddc678","resolution":{"observed_at":"2026-08-04T09:35:21.728091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:21.838261Z","title":"a photo of [OBJ]","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:21.838261Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:a45f6175bd4cebbec77039c46de294e95889b308471b2e1b008cb72f47de30a0","observation_id":"f7b590ad-8493-465d-a7eb-bde72ff30b8b","resolution":{"observed_at":"2026-08-04T09:35:21.838261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:21.955030Z","title":"During training, model checkpoints are saved every 10,000 iter- ations for OV-COCO and every 30,000 iterations for OV-LVIS","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:21.955030Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:d565d687f87ad6ac957777ad15a8f099a4707eedc8b19151e7002ce5c2195462","observation_id":"d6d63770-9df3-428f-89ba-c953cdbe053c","resolution":{"observed_at":"2026-08-04T09:35:21.955030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:22.070458Z","title":"For semantic anchor construction, we filter out infrequent pseudo-labels using a minimum annotation threshold—set to 1,237 for OV-COCO and 1 for OV-LVIS","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:22.070458Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:f4f44dab4b61f1a7d4652e98e637b20ce0f5551fa7ead8a4013e2ae1bd1306be","observation_id":"e5a75ad0-1e7f-4b5e-9d01-abd0b0599e58","resolution":{"observed_at":"2026-08-04T09:35:22.070458Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:22.208389Z","title":"Due to the severe long-tail distribution, some rare categories contain fewer than five instances; such categories are removed during semantic anchor construction","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:22.208389Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:1cb2cea395d6c2e72375eef4750696148af2c18ff2bd1e4661c7f11e1a706e4a","observation_id":"3a849e54-46ec-434e-9b42-5006a173968e","resolution":{"observed_at":"2026-08-04T09:35:22.208389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:22.643760Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:22.643760Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:7af465f21ab031e85d685dc8a6595b5f58c72ee89b9a6b12fde784cf0f55baae","observation_id":"3a651cc9-7038-4aac-b17d-ddb104e76178","resolution":{"observed_at":"2026-08-04T09:35:22.643760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:22.755267Z","title":"By densely sampling point prompts across the image, SAM generates a diverse set of masks that capture object regions at varying levels of granularity","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:22.755267Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:365eb6d73fbd1c9c4df33082afbcd8551315bae127e1b24b18208e20e73701bd","observation_id":"39f61c1b-f31b-4f84-aae0-38c5e0f1fbd6","resolution":{"observed_at":"2026-08-04T09:35:22.755267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:22.831446Z","title":"This setup enables efficient vision-language alignment and achieves strong performance on tasks such as image captioning and visual question answer- ing (VQA) with minimal training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:22.831446Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:d0f5e6bbcab98402ac409c123e9475979336900c37efdb21f17adea804f5e188","observation_id":"78b23153-865b-406e-b1d2-da4d448cb56d","resolution":{"observed_at":"2026-08-04T09:35:22.831446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:22.897657Z","title":"This design allows the model to follow natural language instructions and generalize across diverse multimodal tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:22.897657Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:2481033f7a67819b900c8eda9328a1437b7a086ed5b8601d5f92bd560033b577","observation_id":"5aa921a1-96bd-46d9-91a8-22e0ffae75da","resolution":{"observed_at":"2026-08-04T09:35:22.897657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:23.012989Z","title":"However, when applied to object-level understanding, recent studies (Zang et al., 2025; Fu et al.,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:23.012989Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:148e11314c45b029b573275c5f8da73870fa178bcde13d60df03e282b965d0c9","observation_id":"9646b8cd-f58c-4ee0-bb93-b877bb427cba","resolution":{"observed_at":"2026-08-04T09:35:23.012989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:23.124208Z","title":"In our setting, where the MLLM is prompted on individual region proposals, it is essential to emphasize the target object while suppressing ir- relevant background information","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:23.124208Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:c9fb4486fb41e63316cfdbfaa5cf9b6d7acd7050c6a4f0e64f4ed13fcab1283a","observation_id":"a7f72a77-bb85-4a78-9f6d-53f189bf01f8","resolution":{"observed_at":"2026-08-04T09:35:23.124208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:23.222469Z","title":"In practice, we validate that this strategy improves localization and reasoning in MLLMs (Bai et al., 2023), as shown in Table","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:23.222469Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:4518407f8ab07ea8152847618f934b832dec27df52b4baf0a1651c540ffb0c7b","observation_id":"cb2b61cc-4c82-4810-ad4e-db481c88035c","resolution":{"observed_at":"2026-08-04T09:35:23.222469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:23.291069Z","title":"dog,” “knife,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:23.291069Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:a667a450df16f2e7111674cbbbcb7927ac372a57f52b1634e1730dfb791b085c","observation_id":"0a37189c-00f9-41d2-9a29-4257a7a22123","resolution":{"observed_at":"2026-08-04T09:35:23.291069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:23.362304Z","title":"Methods MS-COCO(Lin et al., 2014)Objects365(Shao et al., 2019b) AP (%) AP 50 (%) AP 75 (%) AP (%) AP 50 (%) AP 75 (%) Supervised (Gu et al.,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:23.362304Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:6a50db27c6121641b4e650ae89166c83a52e7d25f1b56dee01b7805360f69085","observation_id":"e967c3d0-3062-48de-86cb-9d1597096ce9","resolution":{"observed_at":"2026-08-04T09:35:23.362304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:23.429742Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:23.429742Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:af4e3de22dec6bde80c39b8395253716d8d360526b61c1b3422fbf64926f6eb2","observation_id":"42269362-2d26-4b98-9855-c5c011f243f9","resolution":{"observed_at":"2026-08-04T09:35:23.429742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:19.894678Z","title":"Kankanhalli, and Ying Shan","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:19.894678Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:a5d7c92a7d7df6d5d57b03e3061763738f00a6637351e29bfb79ac01fa5814c7","observation_id":"6538adc5-190c-43d9-844c-1f86fad57a53","resolution":{"observed_at":"2026-08-04T09:35:19.894678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:18.886254Z","title":"Hayes, Elisa Ricci, Gabriela Csurka, and Riccardo V olpi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:18.886254Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:569cd7e4c5d759cf4aac56f04ac582359a9ecfc2366e8399d403207cb8f46b76","observation_id":"594b1a58-3227-4837-98ff-f08f2d199481","resolution":{"observed_at":"2026-08-04T09:35:18.886254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:22.523259Z","title":"a photo of{category}in the scene","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:22.523259Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:0e125bc99bb6bdfc36dde90c249b61a85526840640ecb0ebfeb9b347c04bf6ba","observation_id":"ac309470-1164-431f-87d4-8b44e0629b10","resolution":{"observed_at":"2026-08-04T09:35:22.523259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:17.791453Z","title":"Girshick","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:17.791453Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:5a079c0854f57e3e71916ba3fb3414889f0e1f4bcb3169aff0240f531a92e54d","observation_id":"f06382dd-2f20-4bdc-8ad6-30d44c383ae2","resolution":{"observed_at":"2026-08-04T09:35:17.791453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:22.337410Z","title":"VLMs support novel class recognition in OVD through various techniques, such as pseudo-labeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:22.337410Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:d62c7792c73e6679e985eef73bf1241f0b74380d892c71cb408e88db7cae298d","observation_id":"0244a37a-3d9e-4c7f-bdb4-457947a8a11a","resolution":{"observed_at":"2026-08-04T09:35:22.337410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:20.924311Z","title":"Explor- ing region-word alignment in built-in detector for open-vocabulary object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:20.924311Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:dd0a4c9794cbbc5ac959ce77708738ad321749bd5d0544081d574f1867872259","observation_id":"612f1ae3-368d-4f84-8d11-8fe8726368b5","resolution":{"observed_at":"2026-08-04T09:35:20.924311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:17.552719Z","title":"Boosting segment anything model towards open-vocabulary learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:17.552719Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:3610c741e7475fa4c39619ce0561504c22e8e5f834dd0af5057a5af762fe51f1","observation_id":"ef5db736-1543-42fc-9929-ce4a968be38f","resolution":{"observed_at":"2026-08-04T09:35:17.552719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:17.032278Z","title":"Learning to prompt for open-vocabulary object detection with vision-language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:17.032278Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:0c65af1169a1a66b0036cde704805d0053d97fb80cf80a3e665ab138a6d09de3","observation_id":"5d4af65b-e3ad-4f17-a5ed-68c90d7acc70","resolution":{"observed_at":"2026-08-04T09:35:17.032278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:17.116728Z","title":"Instagen: Enhancing object detection by training on synthetic dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:17.116728Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:9ba5084f1e408a36729742221b3ef37bc357245fd2e220c36e2b243896deada1","observation_id":"e1535c60-5bf2-4a68-828b-b4d0785338e0","resolution":{"observed_at":"2026-08-04T09:35:17.116728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:16.697520Z","title":"Zero-shot ob- ject detection","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:16.697520Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:4ff293d0affbeb475264acae950f258609b210896cfec87154b1a97ddc759c3e","observation_id":"e7f41c67-25f2-4d46-84fb-77781eca7e28","resolution":{"observed_at":"2026-08-04T09:35:16.697520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:16.939365Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:16.939365Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:d94d6bf2ad14d50b02939d65302601da8c33a75e9c04c4802704d3abeeafaf44","observation_id":"ed8c3fdd-b288-42b4-a18f-43ee2c15f00f","resolution":{"observed_at":"2026-08-04T09:35:16.939365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:35:19.999865Z","title":"Object-aware distillation pyramid for open-vocabulary object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T09:35:19.999865Z"},"links":{"citing_paper":"/paper/2510.14792"},"observation_digest":"sha256:d2d00e5c04d0659e364a08953bf73837d1d3c27f8882ad991f4c3db1f9810b69","observation_id":"9e366de6-f153-4957-8ada-1b66f236641b","resolution":{"observed_at":"2026-08-04T09:35:19.999865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.14792","last_updated":"2026-06-23T06:49:19Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T09:35:14.636143Z","submitted_at":"2025-10-16T15:27:10Z","title":"MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 1 inbound Pith citation observation for arXiv:2510.14792."}