{"as_of":"2026-08-23T07:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6ed38d49d3cf66c78b2acc8c8dff124d2bb5b87c506e2bfb229e25d096786fcb","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:54:15.981453Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.18273/citation-record","integrity":"/paper/2412.18273/integrity","json":"/paper/2412.18273/citation-record.json","paper":"/paper/2412.18273"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.644518Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"ac748914-ac28-4a70-96f2-6a14fd3df7b8","year":2021},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.788032Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:1a19aafc832ba43131709b49c5d58525d68f24b55c50c3f9a916a2ad23bf0ce5","observation_id":"76ed49ca-bb52-4ecc-8c75-16fd8c383ef3","resolution":{"observed_at":"2026-08-11T04:54:16.649642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.627677Z","title":"BERT: pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":"218c6258-57f5-4961-8ca9-344a37384835","year":2019},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.793979Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:85e1ea4a7bfba3745db299e8e63d6cf8fd1bb7a72be8f9adeb283bb8d28ef8b2","observation_id":"f498da6c-e767-46fa-a723-7ff0e2a183b2","resolution":{"observed_at":"2026-08-11T04:54:16.633782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.609345Z","title":"Maskclip: Masked self-distillation advances contrastive language-image pretraining","venue":null,"work_id":"2db113f2-9981-42ae-b084-2c74e6dc8997","year":null},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.799621Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:200bdea3b06b7ef0abda584793ebf8bca976341fad1271a32c44344c48c8e57e","observation_id":"e0233477-f7ef-4530-b6cf-8350a8f840e5","resolution":{"observed_at":"2026-08-11T04:54:16.616349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.580629Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"3de7fa44-10f5-4bdb-89df-ce813ff327e2","year":2021},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.805140Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:f228c05e0cf9ca9ef80df638c46985aea926ade6622244a86225d9779ec24da1","observation_id":"4f7d1c1b-bb7e-4377-ad29-3430fc19fa82","resolution":{"observed_at":"2026-08-11T04:54:16.592199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.564128Z","title":"Learning to prompt for open-vocabulary ob- ject detection with vision-language model","venue":null,"work_id":"3636724f-d10c-49e8-8cbc-ca11d72f8bc2","year":2022},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.812201Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:a1ec2dd91731dd8cbdc608acfa2656cb6db4dd110e00ffe9192b2ab9974ca4b8","observation_id":"bcbfbf62-7ac7-4c92-89b0-25befc6ed58b","resolution":{"observed_at":"2026-08-11T04:54:16.569650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.547821Z","title":"Instagen: Enhancing object detection by training on synthetic dataset","venue":null,"work_id":"69e70033-f820-4d65-a7e3-2a4bc98859da","year":2024},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.817875Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:57d5485b6154a147a5b9eb052ec4bfe43f71e515970156d03ec4f53e7ea0260d","observation_id":"e75b010e-deba-4fce-86bc-3d66d288d9e6","resolution":{"observed_at":"2026-08-11T04:54:16.552932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.532461Z","title":"Open vocabulary object detection with pseudo bounding-box labels","venue":null,"work_id":"2b6e23af-d67c-4d6a-b0b5-27ada8348f72","year":2022},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.822761Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:e4ca2a4ce4ac4ce907a2a304e55df0ffb51fbe161bd73dc8038ad672500a607d","observation_id":"8354aa8e-6f02-4148-8890-e9635db0495c","resolution":{"observed_at":"2026-08-11T04:54:16.537595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.517123Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":"e10f4e72-1e0b-496c-9ca3-7f7588839cad","year":2022},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.828233Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:2ba48efba71b518ab42cc38439a01e1d0e67a77145ba367af3fe593211faa663","observation_id":"b99b713f-bf5c-42b7-8d4e-5efd6434ee4d","resolution":{"observed_at":"2026-08-11T04:54:16.522339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.500316Z","title":"Girshick","venue":null,"work_id":"374c7e1c-950d-4921-a451-65d31d7428e9","year":2019},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.833042Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:26e74f4136f89c0d2fc04a21998a1446623433cf817d49e5317e4c38819b7c71","observation_id":"123e6990-972e-4452-863a-a8c5f0608717","resolution":{"observed_at":"2026-08-11T04:54:16.505366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.482502Z","title":"Llms meet vlms: Boost open vocabulary object detection with fine-grained descriptors","venue":null,"work_id":"8876a6e1-7ab2-41a7-8f55-0efe8c7a292e","year":2024},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.837675Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:faa8ecec459e9188015e604ae5f4c3a3e20d09435ac9ab616c0f60d8dd7da442","observation_id":"c4ede2fb-41bc-4c8d-aa0b-0a9c1ba04968","resolution":{"observed_at":"2026-08-11T04:54:16.488039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.466541Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross B","venue":null,"work_id":"48ad2f73-4bf3-4a00-b7ad-7db3638b6946","year":2023},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.842483Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:e85be6772f0bc9f15acc563caf140c450a61e0fe787485d3bdb1aa80e082e0c8","observation_id":"91ab5031-46cf-4f5c-81a2-77eb9e273d57","resolution":{"observed_at":"2026-08-11T04:54:16.471637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15639","last_updated":"2023-02-23T19:14:52Z","snapshot_observed_at":"2026-08-16T16:27:46.006186Z","submitted_at":"2022-09-30T17:59:52Z","title":"F-VLM: Open-Vocabulary Object Detection upon Frozen Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15639","snapshot_observed_at":"2026-08-11T04:54:15.847431Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.847431Z"},"links":{"cited_paper":"/paper/2209.15639","citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:6ed102117de71ab9e46a772810e40206b2ce0b99531e41e43ec1682e79e0b281","observation_id":"5b74ae8d-072e-42a6-bebd-5ebe4f743038","resolution":{"observed_at":"2026-08-11T04:54:15.847431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.448859Z","title":"Grounded language-image pre-training","venue":null,"work_id":"f979d273-5b46-4fab-a67f-d7b25d413e2a","year":2022},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.852764Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:809a79fb374f3adb6403a3ed4006229c489ac97e3a0f6ada1f6406e9dcc6fb77","observation_id":"83bba66e-ddaf-468c-bc54-df397d630c3c","resolution":{"observed_at":"2026-08-11T04:54:16.454379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.432630Z","title":"Learning object-language alignments for open-vocabulary object de- tection","venue":null,"work_id":"e80365ce-a26f-4d38-ad60-0e32a5ae4902","year":2023},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.857560Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:6c0210498fdcc7a55944572deee5ce8eebfe11504256c9273a999ea1e9c36159","observation_id":"0d5ea0cb-8bb4-4a5d-88db-dec512a21806","resolution":{"observed_at":"2026-08-11T04:54:16.437654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.416182Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Doll ´ar, and C","venue":null,"work_id":"168df2b6-a5ef-4547-9b3e-07fa8a091cf7","year":2014},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.862578Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:ccf458bfd7a669d4c3331dc2a3971aa74f40707dd7b1a74bbbbf440c533c6ce2","observation_id":"0ff37328-b66f-40c0-8318-4d135ed78481","resolution":{"observed_at":"2026-08-11T04:54:16.421352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.401115Z","title":"Girshick, Kaiming He, Bharath Hariharan, and Serge J","venue":null,"work_id":"6164bb2f-f9fb-472a-a58d-fcda9fbc4924","year":null},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.867784Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:a67fbc5d9a471632792233ca4015b789afccc38d88641ff254b0dcdb6f91f6dd","observation_id":"227de7a7-7b61-464d-8dd7-721936a71264","resolution":{"observed_at":"2026-08-11T04:54:16.406347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.384613Z","title":"Hayes, Elisa Ricci, Gabriela Csurka, and Riccardo V olpi","venue":null,"work_id":"93a71ceb-b6d8-4c16-912c-48dcf57ac04c","year":2024},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.873336Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:82ae321c4bb7d053580627f56698e01332054290c5e5bb460c9b58a3289f801f","observation_id":"d0ae1594-c2ba-4f5e-a17c-30766aae277b","resolution":{"observed_at":"2026-08-11T04:54:16.390078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-08-19T16:02:58.628969Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-11T04:54:15.878737Z","title":"Grounding DINO: marrying DINO with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.878737Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:c067c2cd0fdc5500506bc0c1222f78bdb26e47cf4aae94932194a2f0f0358ccc","observation_id":"4ff2329d-90e5-4527-87ef-8d21389b4ac2","resolution":{"observed_at":"2026-08-11T04:54:15.878737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.367325Z","title":"Eigen-cam: Class activation map using principal compo- nents","venue":null,"work_id":"c5b8c02b-f07a-4408-8cb0-f22262cf9271","year":2020},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.884355Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:c8f8994ba42c4270ebfcb01474ba21c71c4c128043b33792eff30d863fc6cea6","observation_id":"ffe69bbe-7c79-4b85-863f-79a85a09f8a2","resolution":{"observed_at":"2026-08-11T04:54:16.374046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.348882Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"850c51aa-1f8f-44a5-a287-d86032898948","year":2021},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.889801Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:e44cc191f63acddab3ad3c41b5802e6d4efcaad142541660ee326bb41f979a8e","observation_id":"3d50d2d9-5696-4072-b75b-e40b1e528ced","resolution":{"observed_at":"2026-08-11T04:54:16.353901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.332705Z","title":"Khan, and Fahad Shahbaz Khan","venue":null,"work_id":"66d86e77-7f57-4044-a9af-da631dc4abc7","year":null},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.896725Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:d3d95314fe8109954faa49edd6e1894e9a78ce17209404cc6b4b7101cace2bb4","observation_id":"3de08c0c-8b9f-4b27-9ac1-5ff194be5833","resolution":{"observed_at":"2026-08-11T04:54:16.337797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.315108Z","title":"Girshick, and Jian Sun","venue":null,"work_id":"da8b728d-863e-43a5-b67f-def5158cf1f9","year":2015},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.902477Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:99977beda003fef450804b75f3f743a8350e71c71333b18e9fa95d99ee0b1309","observation_id":"717d1985-6fe1-44bd-a0c8-d94d450fc539","resolution":{"observed_at":"2026-08-11T04:54:16.321039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.296376Z","title":"Object-aware dis- tillation pyramid for open-vocabulary object detection","venue":null,"work_id":"448ae0bd-18fe-4b7d-af56-75628918eced","year":2023},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.907795Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:33660b2f56d5b194a2c3eed8a1d1bd3b0ce7ea77dffe77c1ef620bf1807a0a65","observation_id":"52e6c6c3-47ce-45d3-ad48-188c70b3d54a","resolution":{"observed_at":"2026-08-11T04:54:16.302795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.278192Z","title":"Aligning pretraining for detection via object-level con- trastive learning","venue":null,"work_id":"7161c55e-aaaa-4007-9f70-43164a4bf091","year":2021},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.913152Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:1ecc883e139fda5736348fcfa8aa308bc4c08381d8a42da4b0d862be39df12d7","observation_id":"27a6b00c-2e96-45ee-947a-a91a225e7979","resolution":{"observed_at":"2026-08-11T04:54:16.283397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.261855Z","title":"Aligning bag of regions for open- vocabulary object detection","venue":null,"work_id":"eecf4f70-6db8-48b9-b3e4-8857cbc1c323","year":null},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.918332Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:2db40e3d799f3a28764ca19f69f430fe7b70fc5b1e136830d9d922f8107a1382","observation_id":"210fa201-86c9-46da-94dd-a39f5149d977","resolution":{"observed_at":"2026-08-11T04:54:16.267558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.244064Z","title":"CORA: adapting CLIP for open-vocabulary detection with 9 region prompting and anchor pre-matching","venue":null,"work_id":"8eec9715-5841-4d42-938e-a5bb2d9f0569","year":2023},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.924353Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:4deaca5ab6b2f6c240bb8fcc627b6c1566751926d560c848cf9274fa252ed08e","observation_id":"b38011ec-b1a8-4279-9f42-74ef016d5347","resolution":{"observed_at":"2026-08-11T04:54:16.250261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.227489Z","title":"Open-vocabulary DETR with conditional matching","venue":null,"work_id":"08e0ab2c-3614-4d85-acd9-9ada6d940761","year":2022},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.929642Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:fab8c57610623d9e42b37d19763898679c643b098bed3b70b18e677872d1f61c","observation_id":"40f07b54-57cb-4d8b-b1d8-581af9eec208","resolution":{"observed_at":"2026-08-11T04:54:16.232541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18279","last_updated":"2024-08-12T07:14:00Z","snapshot_observed_at":"2026-08-22T13:10:08.416211Z","submitted_at":"2023-05-29T17:50:33Z","title":"Contextual Object Detection with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18279","snapshot_observed_at":"2026-08-11T04:54:15.934733Z","title":"Contextual object detection with multi- modal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.934733Z"},"links":{"cited_paper":"/paper/2305.18279","citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:edcd2e0511fd459c1c9882d2c7d24fc0ab8f65546fd307b012535145e93c4720","observation_id":"79a0ffac-7210-4173-b046-5470cefb38a8","resolution":{"observed_at":"2026-08-11T04:54:15.934733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.211139Z","title":"Open-vocabulary object detection using captions","venue":null,"work_id":"5ab14daa-e2c7-4ea4-b788-67b866702a6a","year":2021},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.939864Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:4f9635f61b24826c51e3c0cc0a7f0676cfb06f09372cfc8b15f82610f64fd9b5","observation_id":"9eab2abc-b10a-4cd6-b3b7-a804a480dc27","resolution":{"observed_at":"2026-08-11T04:54:16.216357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.191097Z","title":"Dana, Jianping Shi, Zhongyue Zhang, Xiaogang Wang, Ambrish Tyagi, and Amit Agrawal","venue":null,"work_id":"5300c4c9-81c5-4922-91cb-7e15e3621877","year":2018},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.945093Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:0e748f9a92cc9414e51cfacce974ea658b4ffd0c076f93ba7eac1548dd8854b5","observation_id":"22bd368f-22e3-483d-b96a-0aba7920811a","resolution":{"observed_at":"2026-08-11T04:54:16.197487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.174273Z","title":"Exploring region-word alignment in built-in detector for open-vocabulary object de- tection","venue":null,"work_id":"a6cad358-eea0-4b42-bef4-d2c7d747b95b","year":2024},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.950054Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:e6424ad8f0322704467b1d59df32861865c2b0b097ca21ab2a5599d5e122bc48","observation_id":"925fdd27-4440-4a5f-bfd2-44d764df3d96","resolution":{"observed_at":"2026-08-11T04:54:16.179734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.157589Z","title":"Scene-adaptive and region-aware multi- modal prompt for open vocabulary object detection","venue":null,"work_id":"ec5aabf4-5c7f-48d4-8bb1-77977a9e14e4","year":2024},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.955050Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:b7714f36aeb053f25567b1ee75b5fb4a7f5d0a06676948e6630a521d9befaff6","observation_id":"ea666e6a-13e1-40da-9dd1-b64430bb5e30","resolution":{"observed_at":"2026-08-11T04:54:16.162507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.141397Z","title":"Regionclip: Region-based language-image pretraining","venue":null,"work_id":"c564344e-fcce-4864-ab3b-75062088ee8d","year":2022},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.960195Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:045143953edbf049d1f8ddb094259d6360d67ba6b0f83546ec6582e461825215","observation_id":"e021ddcd-2b18-4f42-9c8b-5758a62de028","resolution":{"observed_at":"2026-08-11T04:54:16.146531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.125968Z","title":"Detecting twenty-thousand classes using image-level supervision","venue":null,"work_id":"8e717cec-850c-4618-bbca-bc2099d730e9","year":2022},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.965310Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:1aafa65814dc358280c07951e4f62a36b33d2eb876f40be71efb470ef4907e29","observation_id":"1d3fe10b-0bdf-4e36-b429-4dc26cdfbe4b","resolution":{"observed_at":"2026-08-11T04:54:16.131266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.107723Z","title":"Deformable DETR: deformable transformers for end-to-end object detection","venue":null,"work_id":"9d1c434f-e15a-467a-bce7-e33b6cd34948","year":2021},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.970130Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:5e6da12cb9109c4ec3db7dd6f4e2709c4db7cd7221036a312776deb680ff3ac1","observation_id":"37a1d438-2a62-4b2f-a96e-8dd2e9317c64","resolution":{"observed_at":"2026-08-11T04:54:16.114496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.089190Z","title":null,"venue":null,"work_id":"438926b1-c5d0-4010-bd83-0f520e2105af","year":null},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.975887Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:88be5c343f617395c72deabded43957954da985013e2e02ed1ab1f8a112a0db4","observation_id":"cab8c39d-ada5-4466-8046-16669207ec1f","resolution":{"observed_at":"2026-08-11T04:54:16.094517Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:54:16.071348Z","title":"dog”, “mirror","venue":null,"work_id":"bce8cf26-4617-4825-ac58-a91d8803f92a","year":null},"citing_paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:15.981453Z"},"links":{"citing_paper":"/paper/2412.18273"},"observation_digest":"sha256:79a1b7ef3a1e2a914a8ffb1546d1a1e6dab6a368a8b49d90d7fc880b1bb510f0","observation_id":"9b35570b-00a2-444c-9e47-23e243609fab","resolution":{"observed_at":"2026-08-11T04:54:16.077571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.18273","last_updated":"2024-12-24T08:32:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-23T00:32:08.211574Z","submitted_at":"2024-12-24T08:32:38Z","title":"Sampling Bag of Views for Open-Vocabulary Object Detection"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2412.18273."}