{"as_of":"2026-08-13T21:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3538b66f6a12f23402da107a6a4161d48e1875f55475dd6c5f098447268cf080","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:14:07.816202Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T13:27:41.333932Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00622","snapshot_observed_at":"2026-08-04T13:27:41.333932Z","title":"Medeiros, Atif Belal, Srikanth Muralidharan, Eric Granger, and Marco Pedersoli","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.00458","last_updated":"2026-07-02T20:01:06Z","snapshot_observed_at":"2026-08-10T21:47:42.986597Z","submitted_at":"2025-10-01T03:17:56Z","title":"VLOD-TTA: Test-Time Adaptation of Vision-Language Object Detectors","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T13:27:41.333932Z"},"links":{"cited_paper":"/paper/2412.00622","citing_paper":"/paper/2510.00458"},"observation_digest":"sha256:5d45271447fe9808f0fb74c0d008eb6a0b74b8ca901b5de0a5275e68204af183","observation_id":"c06edf00-497d-4209-bd28-1461fec91371","resolution":{"observed_at":"2026-08-04T13:27:41.333932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.00622/citation-record","integrity":"/paper/2412.00622/integrity","json":"/paper/2412.00622/citation-record.json","paper":"/paper/2412.00622"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2203.17274","last_updated":"2022-06-03T17:52:04Z","snapshot_observed_at":"2026-08-13T16:10:42.555436Z","submitted_at":"2022-03-31T17:59:30Z","title":"Exploring Visual Prompts for Adapting Large-Scale Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17274","snapshot_observed_at":"2026-08-12T05:14:07.584130Z","title":"Exploring visual prompts for adapting large- scale models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.584130Z"},"links":{"cited_paper":"/paper/2203.17274","citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:86fbf406f854f4d28c324edb790080b911103c2849974f7b2273c25750c015db","observation_id":"1a167833-5801-41e8-8b56-083c57f186d2","resolution":{"observed_at":"2026-08-12T05:14:07.584130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.458325Z","title":"Zero-shot object detection","venue":null,"work_id":"8e037bec-4ebf-4090-b09c-359e1440844d","year":2018},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.591559Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:53a226e4f4f6debe47a3f9b7094e491484edf7665559e5ecf0a53d69b47a6e76","observation_id":"6fca56ee-a54d-4c6a-8b8e-d89335892ef6","resolution":{"observed_at":"2026-08-12T05:14:08.462880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.445723Z","title":"A systematic literature review on object detection using near infrared and thermal images","venue":null,"work_id":"911c9164-0b15-4bb3-abe7-b26c60908920","year":2023},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.596017Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:a7912f9aaca544197a3cba1a88c18b5b0d073f809b1a96e6884e93a5d56a6348","observation_id":"840ae565-9265-4906-8987-7ccfecfc9ccd","resolution":{"observed_at":"2026-08-12T05:14:08.449862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.433987Z","title":"Multimodal object detection by channel switching and spatial attention","venue":null,"work_id":"aa18b5f6-3f52-45d9-afcc-bc43caf09b34","year":2023},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.599778Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:a38f1e875c0e9fd18cb7fe68bd13e6764c9157edcb90c81fc4b7f7c85b7f2c4e","observation_id":"095d2fb8-baf9-40a2-967a-64c0c81c31a0","resolution":{"observed_at":"2026-08-12T05:14:08.437720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.07155","last_updated":"2019-06-17T17:58:12Z","snapshot_observed_at":"2026-08-03T13:01:27.142233Z","submitted_at":"2019-06-17T17:58:12Z","title":"MMDetection: Open MMLab Detection Toolbox and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.07155","snapshot_observed_at":"2026-08-12T05:14:07.603671Z","title":"MMDetection: Open mmlab detection toolbox and benchmark","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.603671Z"},"links":{"cited_paper":"/paper/1906.07155","citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:45ed6807c9d26f1309ea45ea0d7794affddc3bccf33858ceb12ea9348636f4a2","observation_id":"d4fd734f-ce10-4f19-8d11-55a4c90b169b","resolution":{"observed_at":"2026-08-12T05:14:07.603671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.422241Z","title":"Yolo-world: Real-time open-vocabulary object detection","venue":null,"work_id":"3598b172-c7d1-47a1-8c1f-472b6c8ef6cd","year":2024},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.607890Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:90aab43b447f1629e91673cbd0947927ec336fd6aa9995674a456f6ac45feb73","observation_id":"1c495f39-6dbc-450c-a721-74e228b975d5","resolution":{"observed_at":"2026-08-12T05:14:08.426259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-12T05:14:07.613076Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.613076Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:c6902f5d7c5e2f5451bbd3f614e3c0866aab168815d62b6a02af4bfe236d0e6a","observation_id":"e3fac7cd-91ee-4457-9875-6bd37c11ecbb","resolution":{"observed_at":"2026-08-12T05:14:07.613076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.408645Z","title":"Privacy-preserving person detection using low-resolution infrared cameras","venue":null,"work_id":"de048446-c87b-4dcf-8559-98fe6199d3e2","year":2022},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.617461Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:82a51a400111cd281b5b2c70fac277c748a8213c8445883c281c5f1f0de9d338","observation_id":"5e86fe4f-a111-4e82-9606-52ea2f79e351","resolution":{"observed_at":"2026-08-12T05:14:08.413352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.394750Z","title":"Multimodal deep learning for robust rgb-d object recognition","venue":null,"work_id":"3c819152-5ce3-4570-9c6e-077b73f35340","year":2015},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.622230Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:db78d4f33a7da8a66d5986f1ff8e818809664f389de755d46182a7b82983d7bd","observation_id":"4a41182c-f8d0-46e9-ba77-10b1502ced32","resolution":{"observed_at":"2026-08-12T05:14:08.400719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.378345Z","title":"Tood: Task-aligned one-stage object detec- tion","venue":null,"work_id":"3554966b-e54f-4fd8-8aee-255f56d179e9","year":2021},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.627099Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:653fbbb467a91a2fb33585f1bde836b530c9f5ba82065dac70a7d252d5637158","observation_id":"0660f560-94c3-4928-aeae-883dd16cdc53","resolution":{"observed_at":"2026-08-12T05:14:08.385766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:07.631293Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.631293Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:69c37d9ab5164620afadb1fd5bb74e97fafe7fe79066ff03c0eb05391b797f79","observation_id":"a1f1076c-6eda-4b51-b22f-786bc0cbcacc","resolution":{"observed_at":"2026-08-12T05:14:07.631293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:07.635483Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.635483Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:3e7129fde0c4105c3202fc8f44cfed3733272b3e4ca314ab2cfef5acd3703b7f","observation_id":"da194059-8a97-4f64-a5d1-24a3ad54dddd","resolution":{"observed_at":"2026-08-12T05:14:07.635483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13921","last_updated":"2022-05-12T01:27:40Z","snapshot_observed_at":"2026-08-08T10:08:57.896975Z","submitted_at":"2021-04-28T17:58:57Z","title":"Open-vocabulary Object Detection via Vision and Language Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13921","snapshot_observed_at":"2026-08-12T05:14:07.639541Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.639541Z"},"links":{"cited_paper":"/paper/2104.13921","citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:aa5f10fa7cba825b11e93807311f7fee24d103f1d3de211ec03b59f7e072b729","observation_id":"225828cf-b3e3-44f4-9d96-34c7faa66649","resolution":{"observed_at":"2026-08-12T05:14:07.639541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.347005Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"eb1c1e1c-d1aa-43bb-a689-562811f07aa9","year":2016},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.643921Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:14fc15c806551bfb7f31a29ddf24053d5ddb089caef23f2b433fa56c566226a5","observation_id":"4d90fa25-4ccf-48a0-b996-2ebae8562ed7","resolution":{"observed_at":"2026-08-12T05:14:08.351235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.334343Z","title":"Cnn- based thermal infrared person detection by domain adapta- tion","venue":null,"work_id":"be945115-0287-4ed8-a668-0b62735ef1a6","year":2018},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.648697Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:7b88fbc1b22f7dc7b9385b7d4ecf2c7bf2557b4f5c6f93b70696fac03bb66845","observation_id":"1c167d08-4ca1-4ade-9490-174fbb91f9a3","resolution":{"observed_at":"2026-08-12T05:14:08.338030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04861","last_updated":"2017-04-17T03:57:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-04-17T03:57:34Z","title":"MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04861","snapshot_observed_at":"2026-08-12T05:14:07.652300Z","title":"Mobilenets: Efficient convolu- tional neural networks for mobile vision applications","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.652300Z"},"links":{"cited_paper":"/paper/1704.04861","citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:8072b008a468033eb13826bbd56ba69c2f6b3e64ddcd0c513bd7d94bebba14ce","observation_id":"6d486159-7bd9-4c47-a84c-5c2b691f2c04","resolution":{"observed_at":"2026-08-12T05:14:07.652300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.322980Z","title":"Image-to-image translation with conditional adver- sarial networks","venue":null,"work_id":"5e14de04-fbbb-499e-bd03-3ad2887e8257","year":2017},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.656848Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:029d9794c2b64b43778c03aedca7276b7a079194a742125370b22b7d4ac0b284","observation_id":"b1d9d204-f1cf-49f8-bcb8-33b4860a11ff","resolution":{"observed_at":"2026-08-12T05:14:08.327234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.310892Z","title":"Multimodal computer vision framework for human assistive robotics","venue":null,"work_id":"bf05c727-6389-46ea-94db-32d42e4d0af1","year":2018},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.660904Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:1f0c8eb5159d6877a84672862fdfc46e2dea33ac5d2259436dc17324614870c1","observation_id":"0417fcb2-0601-4b50-bfa0-bf93f472e162","resolution":{"observed_at":"2026-08-12T05:14:08.314408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:07.666025Z","title":"Vi- sual prompt tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.666025Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:d7e3e521cc2ec337a6e3de0b743587e044e647b0ad84bf3f0a7da648a9d880f6","observation_id":"cc36ed3b-85fb-4de4-9a56-96cad4b77ca7","resolution":{"observed_at":"2026-08-12T05:14:07.666025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.290986Z","title":"Ultralyt- ics yolov8","venue":null,"work_id":"7a2fbcf4-60c3-4db7-a443-308f2c03418b","year":2023},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.670492Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:b6f2efceef7020751ada1ee8e6c86e81e8fa2af8aa4322da4ea3e61d62e7bb32","observation_id":"a583c228-cd9d-4fd7-9fe8-ef01cbc51566","resolution":{"observed_at":"2026-08-12T05:14:08.297182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:07.675822Z","title":"Mdetr – mod- ulated detection for end-to-end multi-modal understanding,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.675822Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:a8bbaaff9d2f443305eec898b07929717a74e0fc7336f7a18681b83371daee11","observation_id":"3d884374-38fc-47c8-b2c5-777e0a6d729f","resolution":{"observed_at":"2026-08-12T05:14:07.675822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:07.680049Z","title":"Auto-encoding varia- tional bayes, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.680049Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:2b12408d6b0f590fba2bd0ec5c6f6427423de9638aaaffea014d1c1626052ee7","observation_id":"775e8f50-b2e9-45d3-bc9a-62181c9a2d15","resolution":{"observed_at":"2026-08-12T05:14:07.680049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:07.684638Z","title":"The power of scale for parameter-efficient prompt tuning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.684638Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:be18f8dec2912b63f889381d180b61d0e8d74d0c311cb64db69576d0bcdf4267","observation_id":"21101b2f-d61c-4005-b3f4-ec6bc0aa0138","resolution":{"observed_at":"2026-08-12T05:14:07.684638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:07.689759Z","title":"Grounded language-image pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.689759Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:13c1dc7f4bb7bd130305eebb20928397f93515fc8b196666fb6fa44234f7dca1","observation_id":"435e7c0b-06a7-4da0-b69d-9fde29cf566c","resolution":{"observed_at":"2026-08-12T05:14:07.689759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.243543Z","title":"Yolo-firi: Improved yolov5 for infrared image object detection","venue":null,"work_id":"2d5e9bc7-79d3-4969-b2e2-bfbf1a48160f","year":2021},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.694269Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:fa108462a5119c194d8037e1ac962cb562b2994848750246e5bbd96f9819924a","observation_id":"b9b25b53-87a1-4735-99d4-a794d1b0e708","resolution":{"observed_at":"2026-08-12T05:14:08.250096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.231508Z","title":"Bevdepth: Acquisition of reliable depth for multi-view 3d object detec- tion","venue":null,"work_id":"37c8da69-ade7-4e95-a009-8ef3f7d009d4","year":2023},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.698181Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:fa926a987bce17d8e65cdca428f07b2e60caf1a0ea2dad596e0bf022af60b9f6","observation_id":"f19f62c2-cac1-4fa2-8012-83fc0bfc458d","resolution":{"observed_at":"2026-08-12T05:14:08.235199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14843","last_updated":"2022-11-27T14:47:31Z","snapshot_observed_at":"2026-08-13T13:33:58.387799Z","submitted_at":"2022-11-27T14:47:31Z","title":"Learning Object-Language Alignments for Open-Vocabulary Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14843","snapshot_observed_at":"2026-08-12T05:14:07.702032Z","title":"Learning object-language alignments for open-vocabulary object de- tection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.702032Z"},"links":{"cited_paper":"/paper/2211.14843","citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:f0514f1dab078861c9cbd8b6e34aa8a7b706c1d3e2ff5f25e08244157f1f31c1","observation_id":"b6de8078-fbeb-4780-a43e-f89e47cb20e2","resolution":{"observed_at":"2026-08-12T05:14:07.702032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:07.706765Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.706765Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:9274b2c9ebcea3fd19868103cb49e82bd06d334440467cbf51b94cb579fd57db","observation_id":"ccd5248c-08cc-4eb4-a6e6-2f4ad8c3b1f5","resolution":{"observed_at":"2026-08-12T05:14:07.706765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-12T05:14:07.710518Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.710518Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:79e1b968a42eef66150d3eeba4925daf943990707ed5e26eeba13d7f1015a357","observation_id":"daf16f2c-3223-4d34-8718-85a5d3381314","resolution":{"observed_at":"2026-08-12T05:14:07.710518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:07.714992Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.714992Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:6c77d7274be09d486ed2a693eb2b1636dc40bcb16b69be9e9a1edf074eca383a","observation_id":"25b7252f-2d4d-4dd7-837c-f90d7b0f4559","resolution":{"observed_at":"2026-08-12T05:14:07.714992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01492","last_updated":"2024-07-31T21:50:57Z","snapshot_observed_at":"2026-08-13T00:39:46.827645Z","submitted_at":"2024-04-01T21:28:50Z","title":"Modality Translation for Object Detection Adaptation Without Forgetting Prior Knowledge","version":3},"cited_work":{"arxiv_id":"2404.01492","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01492","snapshot_observed_at":"2026-08-12T05:14:07.901150Z","title":"Modality Translation for Object Detection Adaptation Without Forgetting Prior Knowledge","venue":"cs.CV","work_id":"62b56da9-19cf-49a9-bad8-255aa7c58ae7","year":2024},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.718415Z"},"links":{"cited_paper":"/paper/2404.01492","citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:3437bf1d6eb079ba44174d24fcc600bd4c7ae6ff74ad537e28b331cd1776b327","observation_id":"1c7c6a05-b942-41e1-a9a6-6598a8cc9b88","resolution":{"observed_at":"2026-08-12T05:14:07.905453Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18849","last_updated":"2024-08-02T16:13:40Z","snapshot_observed_at":"2026-08-13T00:19:18.789142Z","submitted_at":"2024-04-29T16:42:58Z","title":"MiPa: Mixed Patch Infrared-Visible Modality Agnostic Object Detection","version":2},"cited_work":{"arxiv_id":"2404.18849","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.18849","snapshot_observed_at":"2026-08-12T05:14:07.882851Z","title":"MiPa: Mixed Patch Infrared-Visible Modality Agnostic Object Detection","venue":"cs.CV","work_id":"f8f7a353-f0c3-4baf-a162-54e04c7e7bc0","year":2024},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.723074Z"},"links":{"cited_paper":"/paper/2404.18849","citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:4fafd6ddef77c6a2f3819276c341191555aacaf36f0fcc8081108a17a7889d03","observation_id":"367dd8f2-dac4-4329-9015-32375c942547","resolution":{"observed_at":"2026-08-12T05:14:07.889750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.207455Z","title":"Hallucidet: Hallucinating rgb modality for person de- tection through privileged information","venue":null,"work_id":"308711b6-2d51-4c0e-a506-283749410192","year":2024},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.727176Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:9d9a0cd45da3b04c6fcebf9f3930996ddc0d5cb7404a2bdd3ffca8180a4ee457","observation_id":"bb4f3a5d-53ab-4410-9a56-58a7f29a66c5","resolution":{"observed_at":"2026-08-12T05:14:08.211656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.07484","last_updated":"2020-03-31T08:42:46Z","snapshot_observed_at":"2026-08-11T22:50:00.622782Z","submitted_at":"2019-07-17T12:51:10Z","title":"Benchmarking Robustness in Object Detection: Autonomous Driving when Winter is Coming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.07484","snapshot_observed_at":"2026-08-12T05:14:07.730657Z","title":"Benchmarking ro- bustness in object detection: Autonomous driving when win- ter is coming","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.730657Z"},"links":{"cited_paper":"/paper/1907.07484","citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:2e8bb6082a0741dbde46ac8dee85f32a00ff7a604ff68611092121681d35b3f8","observation_id":"a9375eb4-5963-42e8-804e-db5ebc2dc2f3","resolution":{"observed_at":"2026-08-12T05:14:07.730657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.195017Z","title":"Infragan: A gan ar- chitecture to transfer visible images to infrared domain","venue":null,"work_id":"71ef0f1c-992a-4408-a3a5-73457327cced","year":2022},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.734344Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:8698d6247ee913ae03d8020c3ec7689bce36cdbe4b83d12633a92ad6007912b0","observation_id":"49209bc5-376c-4f02-b71d-2e8b6095df20","resolution":{"observed_at":"2026-08-12T05:14:08.200277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.182775Z","title":"Image-to-image translation: Methods and applications,","venue":null,"work_id":"a4ba8c98-6b59-463c-a280-f04f9b1594e0","year":null},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.737760Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:f2c4852da65324ab35c4269dcd290dccf1865d1e3a04c07c2b64d274338a92af","observation_id":"e29cc390-dc07-4947-bc2a-01c12150291d","resolution":{"observed_at":"2026-08-12T05:14:08.187048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.171543Z","title":"Deep learning in robotics: a review of recent research","venue":null,"work_id":"b65c23af-5055-4692-9357-e3a29d90bfa9","year":2017},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.741096Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:44aba53a82b8de1efc97a14a929d6059c52383847534d8ae37bd6759205747db","observation_id":"958999c3-8af4-4266-8f6b-e8567ff2033f","resolution":{"observed_at":"2026-08-12T05:14:08.175358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:07.744433Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.744433Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:877efb424638d5d26aa1ec3c5b3eca0875b8b6dfdc53335c80b909fc3d3f3b9f","observation_id":"534ce3c7-87cb-47ea-9288-7cadbcfeeae3","resolution":{"observed_at":"2026-08-12T05:14:07.744433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.154825Z","title":"A review on object detection in unmanned aerial vehicle surveillance","venue":null,"work_id":"cdecc43c-fb53-4d51-8545-6a11558dd639","year":2021},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.748144Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:e1347c1010eb5f22978f83eeec0faf4e5f93cd3f0a4942ba92333a47a38be7da","observation_id":"93d88d10-915e-4702-9451-16f2c5263a17","resolution":{"observed_at":"2026-08-12T05:14:08.158487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:07.752113Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.752113Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:0fc536d453a9b86abd5721c20910e4711c63bd79e2a5304e8607c144e036e73f","observation_id":"8b679228-15af-4c9a-86fc-dd29164108a4","resolution":{"observed_at":"2026-08-12T05:14:07.752113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.138888Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":"3295eb2b-f6e4-4050-94ea-54f177e841fa","year":2019},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.755827Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:e20bb6a46c50b6902179d59f09c078b4f60ed569c909c4f4b22c58f566d7c498","observation_id":"101440e3-f1ef-45dc-8d3c-57f8eec05a7d","resolution":{"observed_at":"2026-08-12T05:14:08.143049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:07.759913Z","title":"Indoor segmentation and support inference from rgbd images","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.759913Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:0084beceb05c874e7ba10cea214906af81a7ee567f63d50a88e06db11a3cf4bf","observation_id":"eff25ee5-0fba-4e28-8ad7-bc7a706a5d94","resolution":{"observed_at":"2026-08-12T05:14:07.759913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.120533Z","title":"Machine learning, social learning and the gov- ernance of self-driving cars","venue":null,"work_id":"ef8d39df-f11a-4cfc-b85f-904c36182199","year":2018},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.765096Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:f12acb6208aca559f79d8039882bb09e485bf47172cc1ca776826d8a99bda66a","observation_id":"0d66c541-bc8a-4e3e-9e70-41c7fb6a9274","resolution":{"observed_at":"2026-08-12T05:14:08.125101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.107707Z","title":"Improving rgb-infrared object detec- tion by reducing cross-modality redundancy","venue":null,"work_id":"e73a84d2-469a-493c-98ea-f943a9313a63","year":2020},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.768988Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:8eedc67bb4d4132f46d58015255d74d2393d58d9a4674d88686356fb41af0c51","observation_id":"e50ff276-f9ad-41c4-986e-95ebf182fdd8","resolution":{"observed_at":"2026-08-12T05:14:08.112045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.094349Z","title":"Multi-modal deep feature learning for rgb-d object detection","venue":null,"work_id":"7470ef21-4401-4061-a109-67f9c3183e73","year":2017},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.773358Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:d4a8972d25a4dc0a8221701b4f6fa9c66f9bb9a59a082e4e7fbf0af3bf2e1476","observation_id":"9e488f3b-8f29-40c2-be7b-39de08d93926","resolution":{"observed_at":"2026-08-12T05:14:08.099080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.079020Z","title":"Deepinteraction: 3d object detection via modality interaction","venue":null,"work_id":"eed3d223-4009-47ca-9224-e5d2cb6171a9","year":1992},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.777499Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:dfeea0faadc119f2640cf8c713478eba69e0abf5c1028abeed7ad8ae53d79d87","observation_id":"c8148bdb-46ac-44ad-b77c-cf406f83d721","resolution":{"observed_at":"2026-08-12T05:14:08.083543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.064164Z","title":"Task residual for tuning vision-language models","venue":null,"work_id":"398171c4-1cad-40e1-a9ac-3822805ab012","year":2023},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.781750Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:0912d54f70ad0c6c4dbab2009d5fae8eb01a52747e96596c3b23ce53456c5bf4","observation_id":"bdfe7a95-fe66-4a55-9f07-260e4b64e4ae","resolution":{"observed_at":"2026-08-12T05:14:08.069362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:07.785634Z","title":"Open-vocabulary detr with conditional matching","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.785634Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:7b484487cae2ff2ad0e713b78c8d606c43b7d330af1a1caa75f69acb0790747d","observation_id":"ace1f26f-f669-4de8-906c-f0861248fe94","resolution":{"observed_at":"2026-08-12T05:14:07.785634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.044591Z","title":"Multispectral fusion for object detection with cyclic fuse-and-refine blocks","venue":null,"work_id":"df2301a9-c707-4297-a4f2-372fc8fbc98d","year":2020},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.789780Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:a7530f48ec3536aa65cc9f35caa215e8263bc574d3b8706f5adc6159478d23ab","observation_id":"1bfbe532-a403-42f8-9857-4e3187f6915f","resolution":{"observed_at":"2026-08-12T05:14:08.048694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03605","last_updated":"2022-07-11T10:30:29Z","snapshot_observed_at":"2026-08-07T03:38:32.486362Z","submitted_at":"2022-03-07T18:55:26Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03605","snapshot_observed_at":"2026-08-12T05:14:07.794382Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.794382Z"},"links":{"cited_paper":"/paper/2203.03605","citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:308d0e50029c3c7be239027bf8b5fc812b50bece560f532e9ed67964b30e4359","observation_id":"debd8d31-5710-40de-84a3-4d4ee334a89f","resolution":{"observed_at":"2026-08-12T05:14:07.794382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.034082Z","title":"Glipv2: Unifying localiza- tion and vision-language understanding","venue":null,"work_id":"7a3f7e95-c5ad-4983-8ef1-9ec8fedfe989","year":2022},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.798554Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:8b1289ca7580c62f531798fd4ecf0ddd724e92846add190d14287c50b126dc96","observation_id":"d175c05d-ccb5-4eba-ba8e-8d60cb88dce8","resolution":{"observed_at":"2026-08-12T05:14:08.038118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:08.022909Z","title":"Regionclip: Region- based language-image pretraining","venue":null,"work_id":"a540c43b-5081-4347-91b4-da9c19ce0b47","year":2022},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.802083Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:26c98fd02011abf213b9530fb8e7603ece0ed94bee636c20ea2779210fd510d0","observation_id":"c0e00a36-24c9-4984-8f6b-d8316995c4b3","resolution":{"observed_at":"2026-08-12T05:14:08.026724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:07.805426Z","title":"Conditional prompt learning for vision-language mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.805426Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:b0e055e4f3b95f0b707865135504c95e2f46fe846d67e6c089f7c7f45e3e8b64","observation_id":"dbeaa7aa-83ee-4adc-854b-7f2e90212277","resolution":{"observed_at":"2026-08-12T05:14:07.805426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:07.809125Z","title":"Learning to prompt for vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.809125Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:f5f5319c072cf14e9ca77003118ca9519dd0fe17c10d3a2922ac13124f9fb4cb","observation_id":"cb4cfcbc-858a-4d1b-b4ea-6f8742ee50e4","resolution":{"observed_at":"2026-08-12T05:14:07.809125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:07.999260Z","title":"Unpaired image-to-image translation using cycle- consistent adversarial networks","venue":null,"work_id":"cc089ead-9b7e-4cec-9259-471b8b67f978","year":2017},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.812687Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:8627cc87b40b5f09bf3bdb68e886460586252b8f46c662e674d9c47bc8310c0f","observation_id":"2e05eda2-8cc2-4b98-a09a-27ce680fde51","resolution":{"observed_at":"2026-08-12T05:14:08.004209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:14:07.987865Z","title":"Object detection in 20 years: A survey.Proceed- ings of the IEEE, 111(3):257–276, 2023","venue":null,"work_id":"fcdab342-ac4d-4519-936f-59e32fb33155","year":2023},"citing_paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T05:14:07.816202Z"},"links":{"citing_paper":"/paper/2412.00622"},"observation_digest":"sha256:f4eb8baebbf547f79ff8d65f47c667108ba9956c57a7b84e98083f488f76ccff","observation_id":"90174e29-0e3f-4a48-bad1-43c2cc7cff63","resolution":{"observed_at":"2026-08-12T05:14:07.991671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.00622","last_updated":"2025-03-14T20:32:12Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T09:13:52.564417Z","submitted_at":"2024-12-01T00:19:59Z","title":"Visual Modality Prompt for Adapting Vision-Language Object Detectors"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":2,"verified_fuzzy":30},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 1 inbound Pith citation observation for arXiv:2412.00622."}