{"as_of":"2026-08-08T08:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e53c7a02842612dfc5f0d282649c8e756407de1272bfdac61f6d70221b05ec0b","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:37:08.897852Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.23785/citation-record","integrity":"/paper/2506.23785/integrity","json":"/paper/2506.23785/citation-record.json","paper":"/paper/2506.23785"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.342650Z","title":"Lung image database consor- tium: developing a resource for the medical imaging research community","venue":null,"work_id":"fee7c3c3-54c1-4fa6-8ff5-d73b00be030a","year":2004},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:02.947288Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:82923364e1e5b8f6906556b45f436a23ac6afa4ccbb84ff734aabcf3317c278f","observation_id":"cf10745e-c8e4-4e84-81dc-bf97e68189d9","resolution":{"observed_at":"2026-08-06T21:37:10.347738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17274","last_updated":"2022-06-03T17:52:04Z","snapshot_observed_at":"2026-07-06T12:55:27.843060Z","submitted_at":"2022-03-31T17:59:30Z","title":"Exploring Visual Prompts for Adapting Large-Scale Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17274","snapshot_observed_at":"2026-08-06T21:37:03.071096Z","title":"Exploring visual prompts for adapting large- scale models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:03.071096Z"},"links":{"cited_paper":"/paper/2203.17274","citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:1106a81374ec2c346f1e2d3e761bd9efe9e2ed6debb3cb78b607c0f34da3b838","observation_id":"a8a31ae4-53dd-4930-936c-bc8d7851bbba","resolution":{"observed_at":"2026-08-06T21:37:03.071096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.328065Z","title":"Fs-detr: Few-shot detection transformer with prompting and without re-training","venue":null,"work_id":"04455200-bf3b-43c0-9932-41481ee20b7e","year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:03.162281Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:09f15f997f7c9a46982b981fef0475c0ab2a15ad51f07ca4745c8ce1d8917acc","observation_id":"494e3f34-7810-4fca-94fa-730bd867c9cc","resolution":{"observed_at":"2026-08-06T21:37:10.332668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.311960Z","title":"Apollo: Unified adapter and prompt learning for vision language models","venue":null,"work_id":"de09bd9f-2e70-4108-92bc-7ffd417108aa","year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:03.251458Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:4c394bb7322518d302b08f92001fa99b92937f3665014137e366a7bda3758064","observation_id":"c10b563c-4060-489f-b9b8-d1a0a9c4ea95","resolution":{"observed_at":"2026-08-06T21:37:10.316861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.288388Z","title":"Coarse-to-fine vision-language pre-training with fusion in the backbone.NeurIPS, 35:32942–32956, 2022","venue":null,"work_id":"f8b0dd52-aeea-4334-ac9d-5b9c705ce11b","year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:03.345641Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:0e929b0806bb2fcdfa1110d979b226e40ed3ed8fdbd8108465670dd668087c50","observation_id":"f4129d0f-d7d2-41ab-ab60-dc6c1fc394c2","resolution":{"observed_at":"2026-08-06T21:37:10.299990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.270791Z","title":"s- adaptive decoupled prototype for few-shot object detection","venue":null,"work_id":"44ec8a51-1150-441e-ba3f-f6bcc76f8c8a","year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:03.421737Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:7acfbc8e4a3da47f066569965228e536adeadc57f43ec3fee428ea7fae333029","observation_id":"b47ad70b-726a-4417-8822-148ba1e39462","resolution":{"observed_at":"2026-08-06T21:37:10.276015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.251872Z","title":"Learning to prompt for open-vocabulary object detection with vision-language model","venue":null,"work_id":"ca00853d-eb5c-4c13-b1a0-2e9689757181","year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:03.502861Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:ccd5287f74ddb89c3b6dd11abf799eaa9a3ef096e72eb9f3ca635ba28da6b38b","observation_id":"02332cf4-9657-440c-b52a-6f5b0fca1064","resolution":{"observed_at":"2026-08-06T21:37:10.258469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11982","last_updated":"2020-10-22T18:44:16Z","snapshot_observed_at":"2026-07-06T10:07:25.152925Z","submitted_at":"2020-10-22T18:44:16Z","title":"The Turking Test: Can Language Models Understand Instructions?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11982","snapshot_observed_at":"2026-08-06T21:37:03.644571Z","title":"The turking test: Can lan- guage models understand instructions? arXiv preprint arXiv:2010.11982, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:03.644571Z"},"links":{"cited_paper":"/paper/2010.11982","citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:3e67bf12b226fa9b5e49db5797acd405c46acf4d517a7a77edf11fe5ea0ee218","observation_id":"fc7a5f35-5371-4a1f-8b5f-125bf38d7737","resolution":{"observed_at":"2026-08-06T21:37:03.644571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.229027Z","title":"The pascal visual object classes (voc) challenge","venue":null,"work_id":"0cfd0f8d-67b4-4055-8eec-9207c727e048","year":2010},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:03.743469Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:ce076b72d71051b38f3b82ba766d45aea52cf966cb1d25199b81d0a9b4adea62","observation_id":"5d4286b5-c630-43ea-91e4-2648e1275036","resolution":{"observed_at":"2026-08-06T21:37:10.235878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:03.829699Z","title":"Few- shot object detection with attention-rpn and multi-relation detector","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:03.829699Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:4705de6eb4d5c354e2aaabb2868fc96ec147285aec89d1b5973b0f7887e8e2f7","observation_id":"da991085-3e35-48f9-92af-c7c2e6ba7bef","resolution":{"observed_at":"2026-08-06T21:37:03.829699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.197197Z","title":"Nuclei grading of clear cell renal cell carcinoma in histopatho- logical image by composite high-resolution network","venue":null,"work_id":"5c47a089-9f76-44e4-9388-9cd29d08b164","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:03.904842Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:6e69ed8b2768aa6cedbcb19a44dccc66d0b8c9527cca10bf0bae8f87b14cf556","observation_id":"d5dc14cd-cb45-4eec-8789-e2f26e00a6e2","resolution":{"observed_at":"2026-08-06T21:37:10.205060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.178557Z","title":"Hover-net: Simultaneous segmentation and classification of nuclei in multi-tissue histology images","venue":null,"work_id":"b05db57a-15ea-477d-8c0a-fba9c08bd45b","year":2019},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:04.004247Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:1e53e356ca0ea8325090e0c7a8fb5e68fb304e27d5a572564ff91beb937a85f9","observation_id":"0c33a867-fc55-40ee-9428-acedea4ca5b9","resolution":{"observed_at":"2026-08-06T21:37:10.185000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12980","last_updated":"2023-07-24T17:58:06Z","snapshot_observed_at":"2026-07-31T11:07:41.486136Z","submitted_at":"2023-07-24T17:58:06Z","title":"A Systematic Survey of Prompt Engineering on Vision-Language Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12980","snapshot_observed_at":"2026-08-06T21:37:04.064646Z","title":"A systematic survey of prompt engineer- ing on vision-language foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:04.064646Z"},"links":{"cited_paper":"/paper/2307.12980","citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:a85866771c69e5bc2503680916d891c3895ca4fdbe41c6b44108dc98f7d56dcf","observation_id":"482ae711-fa47-4911-ab40-5dd7c88d34a5","resolution":{"observed_at":"2026-08-06T21:37:04.064646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13921","last_updated":"2022-05-12T01:27:40Z","snapshot_observed_at":"2026-07-06T11:04:30.929441Z","submitted_at":"2021-04-28T17:58:57Z","title":"Open-vocabulary Object Detection via Vision and Language Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13921","snapshot_observed_at":"2026-08-06T21:37:04.138434Z","title":"Open- vocabulary object detection via vision and language knowl- edge distillation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:04.138434Z"},"links":{"cited_paper":"/paper/2104.13921","citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:e92d3d06fe9338ac88d19eae39cd10642453abe3f3dac762fbfad1ec7a3fb753","observation_id":"966a79fa-1baa-48e3-bde5-e59e1b4c9e28","resolution":{"observed_at":"2026-08-06T21:37:04.138434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.162214Z","title":"Dp-ddcl: A discriminative prototype with dual decou- pled contrast learning method for few-shot object detection","venue":null,"work_id":"32bff2ac-83ba-4fb1-943e-a09e2f8168ac","year":2024},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:04.250057Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:b9768becfad2bed0e09cc5c5c61031c4831fdfe534aeb1ff1fabf64256ed7639","observation_id":"d248f254-2407-4685-a5a7-ce97d22d99b7","resolution":{"observed_at":"2026-08-06T21:37:10.166743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.144975Z","title":"Lvis: A dataset for large vocabulary instance segmentation","venue":null,"work_id":"a36c1438-1cf0-4c07-98ad-af5b6a70b0c4","year":2019},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:04.369673Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:6e04879987d666f1dcf378184112a7bb1bbc48b5b2e4a4bc076f6358e680323a","observation_id":"2c1e0f48-be20-4d20-b198-254041fd36b0","resolution":{"observed_at":"2026-08-06T21:37:10.149088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.130635Z","title":"Few-shot object detection with foundation models","venue":null,"work_id":"a05cbf7b-1c7f-48fa-825d-222affd911e1","year":2024},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:04.489927Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:458d97474a1cc09e59e9e90134baf51f0492a08b89a5fb957d4a1bf37a9ce4cc","observation_id":"75988dd5-13ac-45a7-8487-7f4ad5410f54","resolution":{"observed_at":"2026-08-06T21:37:10.135836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.113753Z","title":"Query adaptive few-shot object detec- tion with heterogeneous graph convolutional networks","venue":null,"work_id":"cdc6b496-f9e5-4e82-820c-531e0e41336e","year":2021},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:04.567751Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:03103b08844db32b4b64a9162e6f126e9fd5ac6f71228710d974f08ec91bacf6","observation_id":"e848ea3a-8a08-4488-8694-157cb8550f99","resolution":{"observed_at":"2026-08-06T21:37:10.119455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.07841","last_updated":"2023-03-27T15:40:57Z","snapshot_observed_at":"2026-07-06T13:00:57.257337Z","submitted_at":"2022-04-16T16:45:06Z","title":"Multi-Modal Few-Shot Object Detection with Meta-Learning-Based Cross-Modal Prompting","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.07841","snapshot_observed_at":"2026-08-06T21:37:04.660592Z","title":"Multi-modal few- shot object detection with meta-learning-based cross-modal prompting","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:04.660592Z"},"links":{"cited_paper":"/paper/2204.07841","citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:a4305ab441454208ff1c06ea022422e02ee3374d56530461e948e4b7310fa57a","observation_id":"0eb56578-ed90-408c-b085-e6eee5a18312","resolution":{"observed_at":"2026-08-06T21:37:04.660592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.095775Z","title":"Meta faster r-cnn: Towards accurate few-shot object detection with attentive feature alignment","venue":null,"work_id":"2719919c-f281-4136-ae07-fcc854b9fe0c","year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:04.727426Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:b7305620af5257827a1a18905e7d9db8b49f12282869669601687770009e07db","observation_id":"0b083cbe-5052-4226-b5da-d752dfbf10b3","resolution":{"observed_at":"2026-08-06T21:37:10.100727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.078981Z","title":"Few-shot object detection with fully cross- transformer","venue":null,"work_id":"b054ada2-b008-4b8d-9db7-92cb9de4bdc6","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:04.978030Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:b0168d5b305dfef43f08255aa01e0c8063ff2d4b2987072312542803f7f4316d","observation_id":"68627033-c1b9-4d89-9ce7-a487d2873efb","resolution":{"observed_at":"2026-08-06T21:37:10.084388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.941860Z","title":"Few-shot object detection via variational feature aggregation","venue":null,"work_id":"93bd5175-bfa9-4737-bb6f-838c42e48d97","year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:05.120058Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:6ce2dc7dc5f2235382622d498d54cdb3814bf87a41d6e75876993610472be999","observation_id":"a3f2ac37-d0a0-4ebb-8c91-099a6c3c8f29","resolution":{"observed_at":"2026-08-06T21:37:09.947853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.926279Z","title":"Visual prompt tuning","venue":null,"work_id":"c901d7f9-3ac6-443d-b343-b70aa1be6a4a","year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:05.202072Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:7c8170c53507d5c898d5649a2af1eced1599df83789a487543e3f7f4da6a32e2","observation_id":"02f4ff15-dfd7-4c74-ba03-bcff5b1ea601","resolution":{"observed_at":"2026-08-06T21:37:09.931188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.906233Z","title":"Bert: Pre-training of deep bidirectional transform- ers for language understanding","venue":null,"work_id":"caebe143-d0af-4eea-8213-1d8a538cec5c","year":2019},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:05.307636Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:3347548917dc762937d77848f6a015901ec6682d409204e8ce41260e5652a959","observation_id":"d8e8e50f-2e4b-4c46-af8e-5097595a48d5","resolution":{"observed_at":"2026-08-06T21:37:09.913726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.887168Z","title":"Maple: Multi- modal prompt learning","venue":null,"work_id":"8c64ba52-2a7a-463f-84c3-da94565985b8","year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:05.404038Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:627b4b59152e7bc38209aeb75b90f5b3643eae615d73912ca60527ee139a5540","observation_id":"8fb616bd-3570-45dc-8811-9f2bf38cb355","resolution":{"observed_at":"2026-08-06T21:37:09.891918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.867433Z","title":"A dataset and a technique for generalized nuclear segmentation for computa- tional pathology","venue":null,"work_id":"6b7e877d-3bd1-4dd5-842f-0b289cf8c7af","year":2017},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:05.530990Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:a88684066092be02c99453462e9e505ee4fef605afaba81214194568f1a4f25d","observation_id":"5b792927-2702-4896-8eec-86b34a410cca","resolution":{"observed_at":"2026-08-06T21:37:09.871760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15639","last_updated":"2023-02-23T19:14:52Z","snapshot_observed_at":"2026-07-06T13:58:22.032846Z","submitted_at":"2022-09-30T17:59:52Z","title":"F-VLM: Open-Vocabulary Object Detection upon Frozen Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15639","snapshot_observed_at":"2026-08-06T21:37:05.649074Z","title":"F-vlm: Open-vocabulary object detection upon frozen vision and language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:05.649074Z"},"links":{"cited_paper":"/paper/2209.15639","citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:6cca76b70984ad668947562e2e4ebc34115aef451e2ef38abaea6beab65bed8a","observation_id":"d737176b-afa7-4a34-9af7-dd51e16057d7","resolution":{"observed_at":"2026-08-06T21:37:05.649074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.851536Z","title":"Elevater: A benchmark and toolkit for evaluating language-augmented visual models","venue":null,"work_id":"a3485c1a-b5a3-4034-a026-0f0531b5c299","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:05.790125Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:705f62847d39bb173d03a249a60c14d82d5aae31e5281f6f669d40387bbb1b97","observation_id":"7be32b2c-81c1-47a8-b5ac-15dbca57af3b","resolution":{"observed_at":"2026-08-06T21:37:09.855850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.836663Z","title":"Disentangle and remerge: interventional knowledge distillation for few-shot object detection from a conditional causal perspective","venue":null,"work_id":"55db2b28-52b5-4e9b-822a-292b9028fcaa","year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:05.875694Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:c2583462b7f13a062a7719ae28439388efd6e43740713e457ba1d03d468b48d7","observation_id":"002258a5-4867-4e66-936b-65487eb0445c","resolution":{"observed_at":"2026-08-06T21:37:09.841297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.816088Z","title":"Grounded language- image pre-training","venue":null,"work_id":"5003c47e-82c4-48cd-8aa4-bf9079515125","year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:05.969037Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:bc3dffe93bd2626c5877642828812d5055d2338bcf36958177d2ac8a835f9f5c","observation_id":"e4c5e956-6447-4a4a-9cc8-20fcf753f8c8","resolution":{"observed_at":"2026-08-06T21:37:09.820928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.782212Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"4fa041be-8510-4f55-a93a-bfee8c259052","year":2014},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.045211Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:461e665540861b59c6f906963881a5a4fb53253b07254d8f56f7915ceb512563","observation_id":"9edc8e46-7db7-4c90-9e95-dd493c8605c8","resolution":{"observed_at":"2026-08-06T21:37:09.788346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-06T21:37:06.107791Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.107791Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:7f5100c6cde6ffb9971095201418ae86b96044269078d5fee58979b4e0207733","observation_id":"b2801c4e-e958-4df3-9fca-ba4b3f05eab5","resolution":{"observed_at":"2026-08-06T21:37:06.107791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:06.250780Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.250780Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:cc9f3895d35b444422a187283039b21a2a470ab64c4d0f5e4c67a71e7aed320b","observation_id":"01277d58-5a56-4099-b94e-764c9deffc45","resolution":{"observed_at":"2026-08-06T21:37:06.250780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.751571Z","title":"Breaking immutable: Information-coupled prototype elaboration for few-shot ob- ject detection","venue":null,"work_id":"0a652512-09a1-4e46-8b14-de73760b3d1d","year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.324343Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:628b6336865327a9c6542b09349d3ce99c6f0c437bc2777280a68a164531fb3e","observation_id":"739b0451-22e2-4f15-a6aa-48fd1e79a463","resolution":{"observed_at":"2026-08-06T21:37:09.756412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.731881Z","title":"Image segmentation us- ing text and image prompts","venue":null,"work_id":"a57b6221-74a3-4d2b-aa42-c86153a5c632","year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.388853Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:4971819857e0b27fd5407c6510bd766936a0984a5872b44344ce6b1e91096997","observation_id":"c39a64d9-a64f-48d1-99da-e3a2469eb890","resolution":{"observed_at":"2026-08-06T21:37:09.737378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.716980Z","title":"Digeo: Discriminative geometry-aware learning for generalized few-shot object de- tection","venue":null,"work_id":"e400df1b-1f80-4038-9c8f-0ad59be60db5","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.440503Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:4360a1ac349de0efbe00f4d1875a1435c24cb4edb52cc6be047e2844929f8aa4","observation_id":"f0c2cc35-7f82-4ae8-af0e-e8d608ccaf31","resolution":{"observed_at":"2026-08-06T21:37:09.722011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.693968Z","title":"Simple open-vocabulary object detection","venue":null,"work_id":"769efc20-55d6-4ddc-a338-386cfa452d5a","year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.497243Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:174540a7e3203a22f3c758dfd0ea9243cc88806159bc17e7ae1d4f0ffb490d79","observation_id":"5f89670f-611c-4991-91f4-bc0e8c45a54a","resolution":{"observed_at":"2026-08-06T21:37:09.701594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.671597Z","title":"Scal- ing open-vocabulary object detection","venue":null,"work_id":"fb170fec-0127-407e-a6ec-fe8dd3748a71","year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.557963Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:d364c49c91043b4634661cfb7a2a7e99a29eac1d6144a89ab1c6a55bd59543b0","observation_id":"e0af7dcd-d85c-45f1-b10d-0fdc4ff3770f","resolution":{"observed_at":"2026-08-06T21:37:09.678121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.654215Z","title":"Defrcn: Decoupled faster r-cnn for few-shot object detection","venue":null,"work_id":"15878a71-10e5-427d-94ee-b89aa181000d","year":2021},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.624223Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:c8ac7e8d0fb1f1398db7b0d67c88cd30c7c45284d676efae7ec8307feae65d2a","observation_id":"a907e535-54c4-4178-8f1b-7ead7169f35e","resolution":{"observed_at":"2026-08-06T21:37:09.659393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.630832Z","title":"Language models are unsuper- vised multitask learners","venue":null,"work_id":"9fa6c80d-cde2-4ed8-803b-8972f46c2453","year":2019},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.665207Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:4f885b6d523cae8f6a826adad0b82fa08d2a8495164464d96f17c0fb0bb4b4d3","observation_id":"60171d71-81d6-4b39-a81b-16cc0df5ae2a","resolution":{"observed_at":"2026-08-06T21:37:09.638175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.605568Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"e361eb4f-e013-4fe0-9e8f-0322fec7373b","year":2021},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.744231Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:26670efac946bcc48612e52c990e0de29161911910b2051b33072d818e9866a5","observation_id":"3de2fc5b-5b78-44e4-a450-e5c16d79a758","resolution":{"observed_at":"2026-08-06T21:37:09.611623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.582101Z","title":"Adaptive multi-task learning for few-shot object detection","venue":null,"work_id":"c5dfd35c-97aa-46a3-9233-b7089573a858","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.869279Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:39dafa48d8ec952d0d93ef86b81e816d42e3f8b9a7a348c53113c2b3238f4227","observation_id":"6157ef5e-b882-49eb-a9d0-f5d86407f505","resolution":{"observed_at":"2026-08-06T21:37:09.588564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:06.980275Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.980275Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:9f7796f9d687306fbd8c001d1d60948992a9524d85712375f0be4760e84b4890","observation_id":"9042d0fc-ffe6-4c22-afa7-39b41f8cacbf","resolution":{"observed_at":"2026-08-06T21:37:06.980275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.546151Z","title":"Few- shot adaptive faster r-cnn","venue":null,"work_id":"fa895125-e6d5-49c8-83dd-0998aa580227","year":2019},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:07.045297Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:09d86c1d89e771ac2a383135b9e7ab32189cad7eef0f5ad11004a8382d396a64","observation_id":"9b62f9e8-eb53-4952-bd87-25f58b822722","resolution":{"observed_at":"2026-08-06T21:37:09.551444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.06957","last_updated":"2020-03-16T00:29:14Z","snapshot_observed_at":"2026-07-06T09:04:52.181755Z","submitted_at":"2020-03-16T00:29:14Z","title":"Frustratingly Simple Few-Shot Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.06957","snapshot_observed_at":"2026-08-06T21:37:07.148413Z","title":"Frustratingly simple few-shot object detection","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:07.148413Z"},"links":{"cited_paper":"/paper/2003.06957","citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:acee2d69376ac249a5a582d3522005397876561ec900cc9089b2d2278721c485","observation_id":"86f89577-7cb6-453c-810b-285054f4d9b3","resolution":{"observed_at":"2026-08-06T21:37:07.148413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.526165Z","title":"Snida: Unlocking few-shot object detection with non- linear semantic decoupling augmentation","venue":null,"work_id":"522bd30c-ad35-437c-9b44-d33188767d26","year":2024},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:07.207653Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:dbf73cfb855d7df5877832412fa90848eb1fead9e96140d97c5db8599540ba6f","observation_id":"3e24ebcb-cddf-4047-90bd-acd227207b64","resolution":{"observed_at":"2026-08-06T21:37:09.530773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.511808Z","title":"Multi- scale positive sample refinement for few-shot object detection","venue":null,"work_id":"5318281f-d7a7-4bf2-8121-199fc8e97e5a","year":2020},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:07.267887Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:10e53db085f220ec075cb5676c7d9a4bd2be5c6bbfdce052558a3f06d29258db","observation_id":"dfa01c67-5c5f-4333-b46e-b41aa717ed20","resolution":{"observed_at":"2026-08-06T21:37:09.516661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.496456Z","title":"Multi-faceted distillation of base-novel commonality for few-shot object detection","venue":null,"work_id":"54fab45d-16f3-488c-a9c5-9b4fba2dc308","year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:07.331054Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:344eb62a5ea648b74be162e61a5cff44c5aa72432a5c9e1430f8b491c0c0689b","observation_id":"c7e19578-69fe-445c-abf4-20e2d9dc6474","resolution":{"observed_at":"2026-08-06T21:37:09.501311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.480358Z","title":"Cora: Adapting clip for open-vocabulary detection with region prompting and anchor pre-matching","venue":null,"work_id":"958d9db0-beb5-41ca-adf1-1ab161cc5591","year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:07.456827Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:8bcad5a4cb6be756e08d1fe35e09f7062271328c1cd6e10b3f8c5c212c30ccd6","observation_id":"1767531d-f860-461e-b608-09d2122bdc64","resolution":{"observed_at":"2026-08-06T21:37:09.485161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.465225Z","title":"Generating fea- tures with increased crop-related diversity for few-shot ob- ject detection","venue":null,"work_id":"b9fa5e28-f263-434c-93d5-f83ca8167e32","year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:07.524136Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:9b421d22c7132cfc4706eef0f78d64a715d45568021d18c5a90f839a8cea32fc","observation_id":"2feb1fc3-d790-4a12-aaf4-a92cecd2fceb","resolution":{"observed_at":"2026-08-06T21:37:09.469861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.449840Z","title":"Multi-modal queried object detection in the wild","venue":null,"work_id":"014f394a-d856-4ee6-abc3-d0ab02a8f908","year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:07.577668Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:029dd392afda85248720409d1b14de36b5fed8610c37f1242fd966b0b919c3ce","observation_id":"a057a633-5693-40a9-82c8-13bf30038f4f","resolution":{"observed_at":"2026-08-06T21:37:09.454659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.01766","last_updated":"2017-10-10T17:49:41Z","snapshot_observed_at":"2026-07-06T06:02:47.911804Z","submitted_at":"2017-10-04T19:10:38Z","title":"DeepLesion: Automated Deep Mining, Categorization and Detection of Significant Radiology Image Findings using Large-Scale Clinical Lesion Annotations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.01766","snapshot_observed_at":"2026-08-06T21:37:07.600258Z","title":"Deeplesion: Automated deep mining, categorization and detection of significant radiology image findings us- ing large-scale clinical lesion annotations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:07.600258Z"},"links":{"cited_paper":"/paper/1710.01766","citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:e6ca89a14bb28fd7b4b9e7d37f09304559be432920063e4efaaf85ff2d99c6ac","observation_id":"0c0f5449-7811-4090-ba43-158692c4fef9","resolution":{"observed_at":"2026-08-06T21:37:07.600258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.431513Z","title":"Meta r-cnn: Towards general solver for instance-level low-shot learning","venue":null,"work_id":"90e952e2-4b32-489f-9f28-6b3c9d5acc06","year":2019},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:07.694527Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:510ebe4bb5283541334cdad2ef5f9be3d30ba3537a2161717f7972a237b52222","observation_id":"73132bc0-6d32-4dd3-b3f0-56030f5c197d","resolution":{"observed_at":"2026-08-06T21:37:09.438524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.416564Z","title":"Meta-detr: Image-level few-shot detection with inter-class correlation exploitation","venue":null,"work_id":"7d2bafa8-cce0-452c-a848-8e82ea0e4166","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:07.849351Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:3774b626fba11a2e8c0bd31681388c61d17a766b1a5af58758f21db10074cfc7","observation_id":"e0e62d53-abc9-42a2-90d8-3c4e5d8d3c68","resolution":{"observed_at":"2026-08-06T21:37:09.421162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12969","last_updated":"2024-10-02T19:26:18Z","snapshot_observed_at":"2026-07-06T16:22:26.069983Z","submitted_at":"2023-09-22T16:07:16Z","title":"Detect Everything with Few Examples","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12969","snapshot_observed_at":"2026-08-06T21:37:08.017364Z","title":"Detect every thing with few examples","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.017364Z"},"links":{"cited_paper":"/paper/2309.12969","citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:54f973dfaff371cda52add9f5db82b80a4ac098e80209aa6ad3605da76cc4a71","observation_id":"e6ad7f42-c487-4313-b2c1-295f968ec37e","resolution":{"observed_at":"2026-08-06T21:37:08.017364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.393189Z","title":"Vlm-guided explicit-implicit complementary novel class semantic learning for few-shot object detection","venue":null,"work_id":"2a7fb715-1a3b-4c09-ab54-b70f54c9b0eb","year":2024},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.184430Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:2f39dd8bdf23bef3cdf2b45fe4a6250479bf9f30bec2a2add30bcafdb7330f4d","observation_id":"42ad3728-b973-43cf-af2f-2cb443f79a27","resolution":{"observed_at":"2026-08-06T21:37:09.399983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.372264Z","title":"Scene-adaptive and region-aware multi-modal prompt for open vocabulary object detection","venue":null,"work_id":"e4404662-2a33-4276-ac04-56c97743ce6b","year":2024},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.351578Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:8318c205aff58524c47ad5abe03cd2e7176f53b968d9646caf7bfd5e1e349563","observation_id":"a5d45fcf-aa5b-47a6-8f2a-2ad0baa3c275","resolution":{"observed_at":"2026-08-06T21:37:09.377603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.348423Z","title":"Regionclip: Region-based language-image pretraining","venue":null,"work_id":"7ada1497-1ab4-4299-b8cb-686d80be9395","year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.516525Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:837b0630879d241ff14bede6cfe4286f2032dc7868ddf00142dee2023eaec4a5","observation_id":"08905e76-b956-41e3-930d-b50160e36131","resolution":{"observed_at":"2026-08-06T21:37:09.355023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.332016Z","title":"Conditional prompt learning for vision-language models","venue":null,"work_id":"e7ad6fa0-d05a-4f29-b05d-73111b10a554","year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.683479Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:845740c49c2d6f5815d073fb4d5fc2c9d4ddc12c9f8b6601ff5d614d9f59529a","observation_id":"5cd787c3-1d4a-4e53-82d9-7dfe83fd4d3c","resolution":{"observed_at":"2026-08-06T21:37:09.336727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.317619Z","title":"Learning to prompt for vision-language models","venue":null,"work_id":"b6e32244-1984-4260-9a8f-20a6348e91f9","year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.801070Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:4ccc307073731b47574fc6b51a782684c397015079e91c0fac192e40ba78e189","observation_id":"f5b47bc4-f299-46af-a8da-1e0ec522b2e6","resolution":{"observed_at":"2026-08-06T21:37:09.322179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.298504Z","title":"fully connected (fc) + ReLU","venue":null,"work_id":"95b82308-4061-4e4a-9b47-dd073a4cd25a","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.863444Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:c21fbaba4904d4802a2a54900ad78a8547938aca51de0473c1cbacf498b6df94","observation_id":"0e5d6e64-5eae-4609-bc1c-f0d391d14a4d","resolution":{"observed_at":"2026-08-06T21:37:09.304934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.278501Z","title":"4.3 of the main text, we provide detailed transfer results on the ODinW13 subsets [ 31] in Tab","venue":null,"work_id":"9d070a39-e181-442b-bc9e-cf1bb0a8ae83","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.869019Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:643405286a27b28d54ffe1730dfd6e35973cb8f9e8746f1abb3843f5dedc4dbe","observation_id":"08b86e82-9e0c-4100-8457-b110e286e90a","resolution":{"observed_at":"2026-08-06T21:37:09.283734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.262640Z","title":null,"venue":null,"work_id":"2f814663-4454-44ae-8ccc-aefbee92a0ca","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.873838Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:8c24e1ca098353d249150addddbd8302240192962945faa0e754bcf0a762cb23","observation_id":"d24f22c8-c160-4757-98b8-9f389092278b","resolution":{"observed_at":"2026-08-06T21:37:09.267762Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.241430Z","title":"8, we report the computational overhead for process- ing one image using GLIP-L on RTX3090 with one support image, comparing it to MQ-Det and GLIP-FF","venue":null,"work_id":"d7161199-29d0-437f-8e23-54c592c34c69","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.880919Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:986ce1fc1f473f8b9462a628613a05885b109c67e451021e6da8202b1cb3185e","observation_id":"089e77eb-2e4a-4a55-8010-4c8199a976db","resolution":{"observed_at":"2026-08-06T21:37:09.247972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.218819Z","title":"BG blur\" technique performs best. It high- lights the target object while preserving some background, unlike","venue":null,"work_id":"bf570e34-756a-4cbe-9b7c-80af32a0ce54","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.889886Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:300a0d819eaffa776c1273b6a98d33f7869b65a762d2b45615493fcf92866170","observation_id":"254e521a-4c25-470c-9c16-6511e3952a71","resolution":{"observed_at":"2026-08-06T21:37:09.227510Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.197290Z","title":"Base- line","venue":null,"work_id":"e5d640c7-8dec-411d-abe0-8450e8d24c7a","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.897852Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:8a8a3927605d794f519603ac9a1293ac70f964386910d0372c044f81463d6f40","observation_id":"a9ddc82e-4ae4-4035-b9c4-0517e3f24bc1","resolution":{"observed_at":"2026-08-06T21:37:09.203949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T23:32:11.173462Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":51},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2506.23785."}