{"as_of":"2026-08-08T07:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ec220af994d524f594230f8c7fa3b65d7035b73068fa3cf84465e7c24b42fddc","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:25:43.959038Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T07:07:59.925795Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T10:17:58.075590Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"cited_work":{"arxiv_id":"2505.18986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18986","snapshot_observed_at":"2026-07-03T10:17:58.075590Z","title":"VL-SAM-v2: Open-world object detection with general and specific query fusion","venue":null,"work_id":"b34a0281-8115-4ab2-bfdc-3fb5d86ea1bb","year":2025},"citing_paper":{"arxiv_id":"2604.04564","last_updated":"2026-04-06T09:53:31Z","snapshot_observed_at":"2026-07-06T22:53:29.118925Z","submitted_at":"2026-04-06T09:53:31Z","title":"Visual Prompt Based Reasoning for Offroad Mapping using Multimodal LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T19:51:59.102471Z"},"links":{"cited_paper":"/paper/2505.18986","citing_paper":"/paper/2604.04564"},"observation_digest":"sha256:018a2435c3cc9efbd031c5c10700a3db1fbebe7a3e1e805cc2dcb4b314b1c917","observation_id":"f945f4ea-7141-4be0-a3e6-3f2553c5d7f9","resolution":{"observed_at":"2026-05-10T22:25:51.983415Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"cited_work":{"arxiv_id":"2505.18986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18986","snapshot_observed_at":"2026-07-03T10:17:58.075590Z","title":"VL-SAM-v2: Open-world object detection with general and specific query fusion","venue":null,"work_id":"b34a0281-8115-4ab2-bfdc-3fb5d86ea1bb","year":2025},"citing_paper":{"arxiv_id":"2605.03456","last_updated":"2026-05-09T04:48:21Z","snapshot_observed_at":"2026-08-05T18:06:31.983558Z","submitted_at":"2026-05-05T07:44:03Z","title":"VL-SAM-v3: Memory-Guided Visual Priors for Open-World Object Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T01:24:56.236650Z"},"links":{"cited_paper":"/paper/2505.18986","citing_paper":"/paper/2605.03456"},"observation_digest":"sha256:31113c3a13d63fbe1b906afc95a4fbb03bc640f935f4a2bf1ce6b2655eba2980","observation_id":"fdd5e044-6917-4c84-b422-71aaa53799e8","resolution":{"observed_at":"2026-05-12T11:01:30.268838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"cited_work":{"arxiv_id":"2505.18986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18986","snapshot_observed_at":"2026-07-03T10:17:58.075590Z","title":"VL-SAM-v2: Open-world object detection with general and specific query fusion","venue":null,"work_id":"b34a0281-8115-4ab2-bfdc-3fb5d86ea1bb","year":2025},"citing_paper":{"arxiv_id":"2605.03456","last_updated":"2026-05-09T04:48:21Z","snapshot_observed_at":"2026-08-05T18:06:31.983558Z","submitted_at":"2026-05-05T07:44:03Z","title":"VL-SAM-v3: Memory-Guided Visual Priors for Open-World Object Detection","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T19:14:12.092478Z"},"links":{"cited_paper":"/paper/2505.18986","citing_paper":"/paper/2605.03456"},"observation_digest":"sha256:da364879838cf5e0c5508c2e10a8aead8864149b6c89f9f166f504e39665e143","observation_id":"d0f78be8-c593-4474-959b-3a09d910a640","resolution":{"observed_at":"2026-05-09T06:00:35.844779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"cited_work":{"arxiv_id":"2505.18986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18986","snapshot_observed_at":"2026-07-03T10:17:58.075590Z","title":"VL-SAM-v2: Open-world object detection with general and specific query fusion","venue":null,"work_id":"b34a0281-8115-4ab2-bfdc-3fb5d86ea1bb","year":2025},"citing_paper":{"arxiv_id":"2605.03456","last_updated":"2026-05-09T04:48:21Z","snapshot_observed_at":"2026-08-05T18:06:31.983558Z","submitted_at":"2026-05-05T07:44:03Z","title":"VL-SAM-v3: Memory-Guided Visual Priors for Open-World Object Detection","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T01:33:55.317107Z"},"links":{"cited_paper":"/paper/2505.18986","citing_paper":"/paper/2605.03456"},"observation_digest":"sha256:579cae98b883603d04d47f5d7a5df37a5d3f8f87bae06f3964ef2368602f4bbf","observation_id":"36545036-448a-4b16-a2fa-2703d6456869","resolution":{"observed_at":"2026-05-12T07:51:48.393215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"cited_work":{"arxiv_id":"2505.18986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18986","snapshot_observed_at":"2026-07-03T10:17:58.075590Z","title":"VL-SAM-v2: Open-world object detection with general and specific query fusion","venue":null,"work_id":"b34a0281-8115-4ab2-bfdc-3fb5d86ea1bb","year":2025},"citing_paper":{"arxiv_id":"2605.05499","last_updated":"2026-05-06T22:46:59Z","snapshot_observed_at":"2026-08-05T14:02:24.726190Z","submitted_at":"2026-05-06T22:46:59Z","title":"FoodCHA: Multi-Modal LLM Agent for Fine-Grained Food Analysis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T16:11:26.104498Z"},"links":{"cited_paper":"/paper/2505.18986","citing_paper":"/paper/2605.05499"},"observation_digest":"sha256:22b97d3c12b5b3a01d9320adcf8811cdfaa16db59c9732be18121c66f7788907","observation_id":"0e043359-7b35-4c85-b811-1538a58c95d3","resolution":{"observed_at":"2026-05-11T18:21:09.469192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"cited_work":{"arxiv_id":"2505.18986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18986","snapshot_observed_at":"2026-07-03T10:17:58.075590Z","title":"VL-SAM-v2: Open-world object detection with general and specific query fusion","venue":null,"work_id":"b34a0281-8115-4ab2-bfdc-3fb5d86ea1bb","year":2025},"citing_paper":{"arxiv_id":"2605.29416","last_updated":"2026-05-28T06:07:57Z","snapshot_observed_at":"2026-08-05T02:47:57.177913Z","submitted_at":"2026-05-28T06:07:57Z","title":"3DVLA: Enhancing Vision-Language-Action Models via 3D Spatial and Instance Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T07:07:59.925795Z"},"links":{"cited_paper":"/paper/2505.18986","citing_paper":"/paper/2605.29416"},"observation_digest":"sha256:c632e4db2af6d30655492f205d440263e16f99d0e087b936b5bf5403bc7aaa83","observation_id":"3bae7f73-e0ef-4b89-8e37-602e64d41309","resolution":{"observed_at":"2026-06-29T07:13:16.671658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"cited_work":{"arxiv_id":"2505.18986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18986","snapshot_observed_at":"2026-07-03T10:17:58.075590Z","title":"VL-SAM-v2: Open-world object detection with general and specific query fusion","venue":null,"work_id":"b34a0281-8115-4ab2-bfdc-3fb5d86ea1bb","year":2025},"citing_paper":{"arxiv_id":"2606.12236","last_updated":"2026-06-11T01:12:41Z","snapshot_observed_at":"2026-08-07T09:18:29.279286Z","submitted_at":"2026-06-10T15:42:25Z","title":"DrivingAgent: Design and Scheduling Agents for Autonomous Driving Systems","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T10:05:38.910257Z"},"links":{"cited_paper":"/paper/2505.18986","citing_paper":"/paper/2606.12236"},"observation_digest":"sha256:f843f6b34f8a03c7db2f072b5ef7f29fe142428c0e0a961f1f2274fbfb67d2e5","observation_id":"0aeb88e6-1235-4112-9af7-b80b89eb9aba","resolution":{"observed_at":"2026-07-03T10:17:58.077080Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18986/citation-record","integrity":"/paper/2505.18986/integrity","json":"/paper/2505.18986/citation-record.json","paper":"/paper/2505.18986"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.642390Z","title":"Lang, Sourabh V ora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yu Pan, Giancarlo Baldan, and Oscar Beijbom","venue":null,"work_id":"82d796b5-13cb-46cc-ad42-f032207a92c9","year":2020},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.306134Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:b900a6303e565d25ac2ce17a297c0b08c7ff7dcb7638cfd3fa1a3cee7c8cad10","observation_id":"8031d5a1-ae22-493d-b571-74ad3918e70f","resolution":{"observed_at":"2026-08-07T14:25:44.647029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.07155","last_updated":"2019-06-17T17:58:12Z","snapshot_observed_at":"2026-08-03T13:01:27.142233Z","submitted_at":"2019-06-17T17:58:12Z","title":"MMDetection: Open MMLab Detection Toolbox and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.07155","snapshot_observed_at":"2026-08-07T14:25:41.407593Z","title":"Mmdetection: Open mmlab detection toolbox and benchmark","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.407593Z"},"links":{"cited_paper":"/paper/1906.07155","citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:282c26cb214a27fe001e4f8ac706e6032daba98684e2887a1a3e7758e9ae0e24","observation_id":"80bd6b94-22d0-4e78-98cc-3191d61c86c3","resolution":{"observed_at":"2026-08-07T14:25:41.407593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:41.524550Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.524550Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:470d1a18fc1ca29f36d089e0a8c249020ee6c0f686f6d751198e81a786c01ea3","observation_id":"6815a255-5f92-403c-a406-0daa57900b10","resolution":{"observed_at":"2026-08-07T14:25:41.524550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10852","last_updated":"2022-03-27T14:44:00Z","snapshot_observed_at":"2026-07-06T11:50:20.455700Z","submitted_at":"2021-09-22T17:26:36Z","title":"Pix2seq: A Language Modeling Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10852","snapshot_observed_at":"2026-08-07T14:25:41.630304Z","title":"Pix2seq: A language modeling framework for object detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.630304Z"},"links":{"cited_paper":"/paper/2109.10852","citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:097564978e1927dc6e3cedfb0597ffa662fe8dca0f5012044b27894b50a44ea3","observation_id":"7695381b-dbd6-445b-acb7-586bd352201e","resolution":{"observed_at":"2026-08-07T14:25:41.630304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:25:41.747798Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.747798Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:6510fa3f65fd26e37f4eac9454633dbb52ece78327dc10dcc3a826995afb3a2b","observation_id":"33c63cf9-3e2e-4215-ada8-85d55d388162","resolution":{"observed_at":"2026-08-07T14:25:41.747798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:41.836297Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.836297Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:8a550a9e6bb09151b2e19cc7e85cca5641a7d3785ced2ac77d337493ae454572","observation_id":"48a071c6-3d4b-4e2f-bffb-25d64aea5eb1","resolution":{"observed_at":"2026-08-07T14:25:41.836297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.607444Z","title":"Yolo-world: Real- time open-vocabulary object detection","venue":null,"work_id":"2fddbda9-498b-487a-9f87-28c45d5ba00e","year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.984356Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:c435f5635e722e61295800ceba66eba330d798c3c92178b2e68e2121c2d908c1","observation_id":"288d0ccd-d231-4159-be59-242400cd12f7","resolution":{"observed_at":"2026-08-07T14:25:44.612379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01066","last_updated":"2022-03-15T06:04:05Z","snapshot_observed_at":"2026-08-06T10:32:10.043910Z","submitted_at":"2021-02-01T18:56:02Z","title":"Evaluating Large-Vocabulary Object Detectors: The Devil is in the Details","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.01066","snapshot_observed_at":"2026-08-07T14:25:42.104267Z","title":"Evaluating large- vocabulary object detectors: The devil is in the details","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:42.104267Z"},"links":{"cited_paper":"/paper/2102.01066","citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:dc83a049a1aecf9205e0697f32dd4169c306a2840a19bb04fb1bf40070f3db9a","observation_id":"83de4954-8d7b-44f0-9aa2-636c8924faf8","resolution":{"observed_at":"2026-08-07T14:25:42.104267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.592317Z","title":"Reducing network agnostophobia","venue":null,"work_id":"e4933a97-3b09-4c90-a8b1-c37c6bbbd349","year":2018},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:42.210795Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:a4d71b852b83316113d74ec0b2a1e5ea70b73938121e962e3fd16625814437e9","observation_id":"b01f4f06-47e3-4fb3-ae57-d385e3b4b817","resolution":{"observed_at":"2026-08-07T14:25:44.596905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.576866Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"a8417af3-fdde-4d9a-a298-d98202b7822e","year":2020},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:42.302873Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:77c025c079b4fdb6eb198c08cbc709cb29ad15e9d45bb412319f54c5f9d30272","observation_id":"9db2f7de-1b34-4bd2-9a0c-f139f406c28a","resolution":{"observed_at":"2026-08-07T14:25:44.582137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18954","last_updated":"2025-01-31T08:27:31Z","snapshot_observed_at":"2026-07-06T20:28:52.880548Z","submitted_at":"2025-01-31T08:27:31Z","title":"LLMDet: Learning Strong Open-Vocabulary Object Detectors under the Supervision of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18954","snapshot_observed_at":"2026-08-07T14:25:42.436018Z","title":"Llmdet: Learning strong open-vocabulary object detectors under the supervision of large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:42.436018Z"},"links":{"cited_paper":"/paper/2501.18954","citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:6651ce68e40d2ea075cffe7703c6b7d4b67b4017a952c4286a4cee8bbf575ac0","observation_id":"f63d6b4c-fd85-4bc0-ad99-27228d92063a","resolution":{"observed_at":"2026-08-07T14:25:42.436018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.560636Z","title":"Recent advances in open set recognition: A survey","venue":null,"work_id":"85548c2a-da11-40d8-ac79-2fc5bf3ecb88","year":2020},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:42.562637Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:d10e4bf08bec413a3e8dc2b327a465ef129c3f7662fab37ae9d677f2ea5f9a63","observation_id":"19dd24c6-c3e8-4896-9945-e7cf4b572175","resolution":{"observed_at":"2026-08-07T14:25:44.566449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.545265Z","title":"Lvis: A dataset for large vocabulary instance segmentation","venue":null,"work_id":"9f3cbe30-9d6d-4365-ad5d-a8911ec010af","year":2019},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:42.643665Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:339c6ab4e42f9de52d32c2f87158cf5e27ed7b61450cac0a8ed4b18222710dda","observation_id":"d1c5f081-6694-4ff2-8139-7c0bcc87d935","resolution":{"observed_at":"2026-08-07T14:25:44.550654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.529846Z","title":"Ow- detr: Open-world detection transformer","venue":null,"work_id":"4cfd7fbd-10dc-46c6-bc3f-5bfc530f7745","year":2022},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:42.746308Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:de0e21d1c321ead892a19b1df871a5e6a615ca7cd74c92d2e4d8735c882da7da","observation_id":"129904e7-f0fc-417d-a952-164a0f83f016","resolution":{"observed_at":"2026-08-07T14:25:44.535337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.515361Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":"a539dde2-09e7-48ac-974b-9304811d18d8","year":2020},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:42.853037Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:dbf127de88a2fbd8e963412afd2d611c97b684baf90848568755536c3cc7e6f9","observation_id":"b5ca2b6e-0f50-4553-a3d8-05fb99cb394f","resolution":{"observed_at":"2026-08-07T14:25:44.520086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.500675Z","title":"Mask r-cnn","venue":null,"work_id":"bb2e0604-37ca-448c-bb20-6c1fd015e440","year":2017},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:42.964370Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:e7f6f556f1ec510eef31d5be7d7198ac694bfdc0c568d9d0bb4e8b8256511fd7","observation_id":"1c8338aa-67bb-4a63-9bc2-2445730ab42b","resolution":{"observed_at":"2026-08-07T14:25:44.505146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.485120Z","title":"T-rex2: Towards generic object detection via text-visual prompt synergy","venue":null,"work_id":"122df147-172f-465e-9dde-c861c7a68c11","year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.103990Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:d2da741675b5951d1fcac45a5e2a4a0c8c2a51501fbc6980d83963d23c90841b","observation_id":"e2ea59b2-12b6-42dc-9e04-128fea24ba2f","resolution":{"observed_at":"2026-08-07T14:25:44.490204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.469898Z","title":"Segment anything","venue":null,"work_id":"a483e409-7931-4735-a520-a59461e9f36c","year":2023},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.228584Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:c70276749f38c56984d6b85ee94dc8028459a7e833d76bdc04c91e38912703a8","observation_id":"d3a8e7ce-0b56-4ead-b1f4-6a1d7596a753","resolution":{"observed_at":"2026-08-07T14:25:44.474379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.453785Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"9aed432d-2251-4a65-a9e0-93aa5a4f743f","year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.350210Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:e5a4f1b79d92dd780172fa974e933b9fefafd0037b7a5eb15865186f4c2afa6c","observation_id":"c0219f15-f889-4c94-a70b-64a2b3560a8c","resolution":{"observed_at":"2026-08-07T14:25:44.458987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T14:25:43.465321Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.465321Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:a1bce291e983045f1b1609574de8f5c06a0799e420c295f5e0b40a2d2f133c8b","observation_id":"95ca5c2d-c1c2-4d79-807c-bc76acb402a1","resolution":{"observed_at":"2026-08-07T14:25:43.465321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.437616Z","title":"Dn-detr: Accelerate detr training by introducing query denoising","venue":null,"work_id":"c5046e43-297b-4003-abf4-a8c9b0e7466c","year":2022},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.514620Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:7d0c6f4c59dda6086eaea27570cd1ee44c6a02053436d6a3bc266b648c8850a0","observation_id":"0a9ca5e0-6b27-41a1-bd80-8c35644b54c7","resolution":{"observed_at":"2026-08-07T14:25:44.443299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.420102Z","title":"Coda: A real-world road corner case dataset for object detection in autonomous driving","venue":null,"work_id":"56df99c5-7878-462a-b524-d0433a936e8c","year":2022},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.613826Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:eea6e2239acbc2e019c0f6b8c070718c8c569faab960509d170c08396d8359ae","observation_id":"a9ccb8e4-1767-4134-806f-97bc6c3f423b","resolution":{"observed_at":"2026-08-07T14:25:44.426559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.403574Z","title":"Desco: Learning object recognition with rich language descriptions","venue":null,"work_id":"53e83f68-5a54-45cd-9158-c005bea7a6b9","year":2023},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.758188Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:548f27e38923668b197c49d6e501ece708349158f0fc040f00f126f07e2391e8","observation_id":"1767c512-b56c-4a29-8389-15275d85d357","resolution":{"observed_at":"2026-08-07T14:25:44.409036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.388074Z","title":"Grounded language-image pre-training","venue":null,"work_id":"b2165477-234b-49b5-8148-988cd3f57034","year":2022},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.847663Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:e1865d646a96e5bd037a61c62671c8b7c533cf811bae9b1097477db6bbde7e1e","observation_id":"6188faa5-3e31-4a7e-a0f4-045ff99fa574","resolution":{"observed_at":"2026-08-07T14:25:44.393433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.373208Z","title":"Generative region-language pretraining for open-ended object detection","venue":null,"work_id":"5e0aefa8-ce7b-4db2-8145-2e9255c1fb02","year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.855977Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:e508761ffe36d29b127f798a50b02d2ea066f27e8598a7597975638d8b1a7df2","observation_id":"1ea8ff82-22a0-4319-a530-fb6425cc897f","resolution":{"observed_at":"2026-08-07T14:25:44.377953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.355645Z","title":"Training-free open-ended object detection and segmentation via attention as prompts","venue":null,"work_id":"c8313c2a-56b1-4255-9755-c5370ce60a24","year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.862354Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:e300e2b05974b1a867bc9eb29845cf8c04c071f75acf793c57e86e8a64740623","observation_id":"b1cd2f1d-0e0a-4292-b2cf-c793afca37fb","resolution":{"observed_at":"2026-08-07T14:25:44.361788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.339660Z","title":"Visual instruction tuning.Neural Information Processing Systems (NeurIPS), 2023","venue":null,"work_id":"dbf0e01e-4673-416f-9596-46ce6be5767c","year":2023},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.867202Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:4faf3e6a902fa58306771174cc7d26e31940515edecc76d703ade27f2e3428aa","observation_id":"e459fbe4-2f7e-433e-943f-ce29b7572115","resolution":{"observed_at":"2026-08-07T14:25:44.344472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.323040Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"2c714bc8-0c12-4815-ba7f-02dfac4b0145","year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.873335Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:bdc093fd5a26b3d0766172d3f96fb34323cf1d80c911854bebfe23cdc40e35ce","observation_id":"65e03801-1900-45f7-a0fb-91aff4a1bc80","resolution":{"observed_at":"2026-08-07T14:25:44.328450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.307033Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"57807ae0-e216-4e8e-b0ea-a5c6a0cf500f","year":2021},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.879076Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:e2c8f61bbd03f45dc4cd1b3726f44841063d73c1a5c2b3ce9ec01ea6c7fbe5fc","observation_id":"66878a2e-4dc8-44c5-a84a-3a94ab7d4a43","resolution":{"observed_at":"2026-08-07T14:25:44.312770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.291651Z","title":"Capdet: Unifying dense captioning and open-world detection pretraining","venue":null,"work_id":"f941900d-87ac-48ac-9d22-5bd5b90e1f76","year":2023},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.884458Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:3ad1850eb8217125bd8726a3d537521cba846c46806b955fb531d01bf768f79b","observation_id":"53e798e5-d546-4307-b90d-0fb5d8dc97ad","resolution":{"observed_at":"2026-08-07T14:25:44.296731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.276724Z","title":"Scaling open-vocabulary object detection.Neural Information Processing Systems (NeurIPS), 2023","venue":null,"work_id":"eb8085e9-06df-438f-8132-e93c7df2a873","year":2023},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.889852Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:7e3f9c9435629023a053f1389fde26a5cd58f5b239cfcac83f470c0d80e286e9","observation_id":"86bf87f0-ecd7-4e52-9836-8ac65fd7ce75","resolution":{"observed_at":"2026-08-07T14:25:44.281439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:43.895759Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.895759Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:e23bfef7f763a83dde2d3f9f358caf23a677f4fd2fd89db4ca7ae2e961282bd4","observation_id":"d0e3482c-010f-4af8-8e77-014c190f77be","resolution":{"observed_at":"2026-08-07T14:25:43.895759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.250040Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":"ed90a1ff-4103-4f27-9692-b8412c3f1775","year":2015},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.901395Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:87dee82a1420f82a95fc4b8d79c13ab8622c03d4698f15b7713c41ad8af16040","observation_id":"1cf861bd-aa92-4732-b410-788eb9ba0f3d","resolution":{"observed_at":"2026-08-07T14:25:44.256381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-07T14:25:43.907816Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.907816Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:caa8e5cc8262b0d22ebc939a6cf78369c5514c8475b1f44475f0b46ae557efee","observation_id":"952f7a13-222b-4092-b791-fa62baf447d8","resolution":{"observed_at":"2026-08-07T14:25:43.907816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.234402Z","title":"Scalability in perception for autonomous driving: Waymo open dataset","venue":null,"work_id":"9a7d1d7a-8367-4d28-b54a-546f8bfe8f0d","year":2020},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.914161Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:b21cb87ea314fb161504f7b053984f27c0c9ebef13d5361e88e5839c2bd97353","observation_id":"bc5ded50-7edf-402d-a22f-6193f73cc3b1","resolution":{"observed_at":"2026-08-07T14:25:44.239758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07844","last_updated":"2024-07-22T03:26:21Z","snapshot_observed_at":"2026-08-05T18:50:42.664160Z","submitted_at":"2024-07-10T17:05:49Z","title":"OV-DINO: Unified Open-Vocabulary Detection with Language-Aware Selective Fusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07844","snapshot_observed_at":"2026-08-07T14:25:43.919389Z","title":"Ov-dino: Unified open-vocabulary detection with language-aware selective fusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.919389Z"},"links":{"cited_paper":"/paper/2407.07844","citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:48362cfb928270c5a6b176ab68fd30e2eebdeea8ece5d3da2408d890ac48b5cf","observation_id":"46e99aa6-694f-4db8-ab1f-aac1b4d565c3","resolution":{"observed_at":"2026-08-07T14:25:43.919389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.218033Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":"eec4ec91-dca6-4f00-94a1-fa0299733af4","year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.926211Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:54cc12ec78ae74ab207d4d5429c3b0b34a69b8eb18de27ac4c14c95133955b63","observation_id":"c90909b2-a67e-4f66-8a7d-cde1ca2d1edb","resolution":{"observed_at":"2026-08-07T14:25:44.223244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.200710Z","title":"Detclipv2: Scalable open-vocabulary object detection pre-training via word-region alignment","venue":null,"work_id":"90c145ab-a883-4c41-8766-4182386f84bd","year":2023},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.931973Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:6c69f87145f94c2d34d9a3c493b2ae7d75fb475412f26f49101688c3666e7b14","observation_id":"f802fc6a-8f2c-467f-998a-c86d33c79d40","resolution":{"observed_at":"2026-08-07T14:25:44.207117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.182545Z","title":"Detclip: Dictionary-enriched visual-concept paralleled pre-training for open-world detection","venue":null,"work_id":"26eea1a8-a63f-4b5e-b608-d1e1e2641a8c","year":2022},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.937160Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:64dd7db583ebe3bdd8f6fe5de88eb350332bb87be5f3e0a27c3edd08b40ebac4","observation_id":"a048e2b5-a136-4b19-ae26-7e841210f4b8","resolution":{"observed_at":"2026-08-07T14:25:44.188398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.166984Z","title":"Detclipv3: Towards versatile generative open-vocabulary object detection","venue":null,"work_id":"221f5ded-922e-45f8-ae9c-a195dfb2e02b","year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.942085Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:0b38586355152de975826101d03018d216cb130b8f29e24eec9d1b16c56b168b","observation_id":"0cfd0a67-5e40-40cb-ad5a-0454b65051c3","resolution":{"observed_at":"2026-08-07T14:25:44.171851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.150811Z","title":"Ni, and Heung-Yeung Shum","venue":null,"work_id":"226bfcfd-5688-46ae-98bd-e60c8d1c467a","year":2023},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.947653Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:ed00ba71638adf66b26aa40747655cceb86b84ca87bab144e4f1e15111f93ac1","observation_id":"e33a2214-f781-4e90-92e1-5313eccf1022","resolution":{"observed_at":"2026-08-07T14:25:44.155459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.134407Z","title":"Llava-grounding: Grounded visual chat with large multimodal models","venue":null,"work_id":"4f43b091-9eba-4b71-a94b-e9d1d8910b38","year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.953447Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:085c82743852c86014bf81731c89263d8a5ec5c8768d3ed8ab08fc2eaaa453dd","observation_id":"bf19aa99-7d41-4b33-830f-9a967b0586c9","resolution":{"observed_at":"2026-08-07T14:25:44.140375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:44.116586Z","title":"Glipv2: Unifying localization and vision-language understanding","venue":null,"work_id":"ebce6405-3c48-4a84-9e9b-eb7991f6c315","year":2022},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:43.959038Z"},"links":{"citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:a17c01e406e47f60aeef1a10b956e59be0be80302c52a74344b80baad61114e6","observation_id":"a910885d-f952-4053-a270-93fbdc12f077","resolution":{"observed_at":"2026-08-07T14:25:44.123477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:20:13.537394Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 7 inbound Pith citation observations for arXiv:2505.18986."}