{"as_of":"2026-07-25T01:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97288f4f3141dd2e7f95644d55383eb0b4211378106964ac4d5f8ce33e17662b","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T19:38:38.452093Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-24T06:31:00.690269+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2603.23455/citation-record","integrity":"/paper/2603.23455/integrity","json":"/paper/2603.23455/citation-record.json","paper":"/paper/2603.23455"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"arXiv preprint arXiv:2303.08774 (2023) 1","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:7dddfacfe9cc37a30b4d7bed74471a5b67cf19070f5626c74495eb875e4b986c","observation_id":"2371f3fa-85f5-4438-a96b-8e3ee13ab574","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19457","last_updated":"2026-02-14T11:42:30Z","snapshot_observed_at":"2026-07-06T22:02:56.216824Z","submitted_at":"2025-07-25T17:42:32Z","title":"GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19457","snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"arXiv preprint arXiv:2507.19457 (2025) 5, 7, 8, 21, 31","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"cited_paper":"/paper/2507.19457","citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:4c7dae7c46dd58e0c0e402d845524bf711ae224b4facb23d55535c0146b5741d","observation_id":"b97683a4-9a49-48ad-9255-cd48a1a6d0df","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"Advances in neural information processing systems35, 23716– 23736 (2022) 5","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:641389b48d973a6d4ba5263039c61404efa6a6e367cd1dca72a401a3d61760e0","observation_id":"7eeaa761-e9de-4ed4-96cc-e9ca06d522af","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"arXiv preprint arXiv:2511.21631 (2025) 1, 3, 4, 7, 8, 9, 12, 24, 31, 34","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:195e5015befda51b3e27517ed8ed2220303cea3c69e041a053bc8060c291b526","observation_id":"d1de435d-226f-40e5-b84c-4ce83d2529eb","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:03ed1c836626c2234de7c900faf75cdc27127030f27444d337f9983abfe7530b","observation_id":"a79c0461-ebcf-42d4-9da9-8afc642f94c3","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"Transactions of the Association for Computational Linguistics10, 414–433 (2022) 5","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:fda64aba879ae67e621665192616ff4bf5914372fccb25a4aa759f9d42cd6ab8","observation_id":"d6c49c92-dd13-41f0-8564-1f083b6d7022","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:f498213bc04f1c0aeaa1e0246b171a26470170a786be1b0b31663d7a921d2dab","observation_id":"365701b2-e563-4068-94b7-92528a66dc29","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"Advances in neural information processing systems33, 1877–1901 (2020) 2, 5","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:6d1211461db648aba591c6513b378b50aedbfe4be93f3304d11c3a157160c06d","observation_id":"28cf7630-5de1-43ee-8847-4e3c23e4909d","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"arXiv preprint arXiv:2511.16719 (2025) 7, 8, 31","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:4ce54356e41a67684f1f5237514cccb0adbbf3998113fc749864cdc2098a543c","observation_id":"c0d0156a-a90a-48c1-ace4-14a837ab822c","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.07155","last_updated":"2019-06-17T17:58:12Z","snapshot_observed_at":"2026-07-06T08:00:55.517161Z","submitted_at":"2019-06-17T17:58:12Z","title":"MMDetection: Open MMLab Detection Toolbox and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.07155","snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"arXiv preprint arXiv:1906.07155 (2019) 12","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"cited_paper":"/paper/1906.07155","citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:a35367939ffa3d608225b3ec7f1aa598e9389ed7b00d48511dba25484e9d7214","observation_id":"d7080d23-3891-450d-94e5-be97cd04b64d","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"arXiv preprint arXiv:2507.06261 (2025) 1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:a9b3e36f60007f87d916acaca83840c02769a51bf7aec138981d2bccaf76471f","observation_id":"89f8ffe6-6108-497b-a147-6f6d17b9ad3b","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:fa8cd1c388e6a033ae1900a3db45ab8f8402ca3870676c6c1e7368ffc6c88848","observation_id":"721c195c-cb6b-4302-8faf-97c324d5a25c","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"https://storage.googleapis.com/deepmind- media/Model-Cards/Gemini-3-Pro-Model-Card.pdf (2025) 3, 4, 7, 8, 12","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:ef4b5e9f153d9729c297f78d0ce0aed0a478a5e9639f402204265dca28121b73","observation_id":"cb68c3a6-d35a-48d3-ba58-b6ee0fba04c1","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: Proceedings of the 2024 conference on empirical methods in natural language processing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:d769355f0011277228f40ede3289cddd872a3846887240ce63c599e8b3f182eb","observation_id":"f8dd3507-d1ce-465f-b01b-ec0de6356126","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:f4d77fe1a9bc09ee2f62f36fb346d605aa25d4e73d04506c251d8daa0fb66c6d","observation_id":"48fa4b94-9fcd-4cc3-95f9-185bacfe24ad","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:af90f46afe9660765dc2b3515f64f81d08e0442ec8bcc6bf7f87e0b152784068","observation_id":"e52681e3-328e-41d4-af7a-1862ab4eaa6d","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.00505","last_updated":"2019-09-02T01:41:00Z","snapshot_observed_at":"2026-07-06T08:18:18.838990Z","submitted_at":"2019-09-02T01:41:00Z","title":"Commonsense Knowledge Mining from Pretrained Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.00505","snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"arXiv preprint arXiv:1909.00505 (2019) 5","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"cited_paper":"/paper/1909.00505","citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:71a59385a7d387b00d800048d653c2af1dd3cbf33aec4a4361ab794186f4af7e","observation_id":"dc474e9d-cdfa-4397-9ce9-965f410cda2e","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:244653a1089a1800be7732bd36e247aaf607f224312b1e303992470029312147","observation_id":"828e8db6-8d16-4be2-a4c4-7957c35f28aa","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13921","last_updated":"2022-05-12T01:27:40Z","snapshot_observed_at":"2026-07-06T11:04:30.929441Z","submitted_at":"2021-04-28T17:58:57Z","title":"Open-vocabulary Object Detection via Vision and Language Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13921","snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"arXiv preprint arXiv:2104.13921 (2021) 4","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"cited_paper":"/paper/2104.13921","citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:00390301c45cdc97883352c56194b74ff1447f00dff77b781fe20480c93838f8","observation_id":"0a740081-5956-48e3-9cde-c87a64a0d2ed","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:958d821950b4e213774a88ef6f8712a56cccc34accbdbb1e01c3a05e79c2afa3","observation_id":"e39941fd-0c3a-401a-bac4-478ad8628c68","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:8e6e8263e7d59bd65319a622480f44045efa8118ebbc44f1de84b67c0f770e8b","observation_id":"16ac7b8c-857c-4188-804c-15584f25ea04","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03714","last_updated":"2023-10-05T17:37:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:37:25Z","title":"DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03714","snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"arXiv preprint arXiv:2310.03714 (2023) 7, 20","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"cited_paper":"/paper/2310.03714","citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:89b4987cf887c447566ae51741b9c3ed355e811ffdad42e4d750133661ed17d6","observation_id":"ec16a1c4-8fa7-4153-9666-c211014fe971","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10115","last_updated":"2024-10-15T14:54:01Z","snapshot_observed_at":"2026-07-06T18:31:04.425917Z","submitted_at":"2024-06-14T15:21:57Z","title":"Shelf-Supervised Cross-Modal Pre-Training for 3D Object Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10115","snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"arXiv preprint arXiv:2406.10115 (2024) 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"cited_paper":"/paper/2406.10115","citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:8febc603e0eaf135362316430171e522ef461403aa008ea03b22f83bf0d2f943","observation_id":"3b4e8573-c4cf-452d-95c2-7c8f2d72eee7","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11699","last_updated":"2022-09-15T10:44:22Z","snapshot_observed_at":"2026-07-06T12:21:24.416553Z","submitted_at":"2021-12-22T07:08:53Z","title":"Few-Shot Object Detection: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11699","snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"arXiv preprint arXiv:2112.11699 (2021) 4","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"cited_paper":"/paper/2112.11699","citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:24cc277d7ec68b291b41e4df083732ff4a89eb3ba6696ee61104fa9b6780fb18","observation_id":"2f811163-15a0-4ee1-ad88-6ac0c699dc9b","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15639","last_updated":"2023-02-23T19:14:52Z","snapshot_observed_at":"2026-07-06T13:58:22.032846Z","submitted_at":"2022-09-30T17:59:52Z","title":"F-VLM: Open-Vocabulary Object Detection upon Frozen Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15639","snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"arXiv preprint arXiv:2209.15639 (2022) 4","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"cited_paper":"/paper/2209.15639","citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:8a50eb1e0cfac3e88e2deb0c25eca33e3ed5247bd9cd68b0ec744e48203fc96d","observation_id":"8a814cf7-50f5-4028-9b0e-aff1988a1a85","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: Proceedings of the ACM SIGOPS 29th Symposium on Operating Systems Principles (2023) 13","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:e469a26465b1eaea662ad646346e4664994888b8c98d22b84490fbf129a308e6","observation_id":"23703751-585e-4cf9-ad2f-8a27397fe8f1","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"arXiv preprint arXiv:2104.08691 (2021) 5","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:3b158cdccc775a62e33cb2e9d6d936ec943ebfad4c6648461f620d37b5b21a75","observation_id":"2634d552-5cb0-4651-9ea6-4091c29d4356","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: The Thirty-eighth Annual Conference on Neural Information Processing Systems (2024) 12","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:66434500a7a29278320c3fd1d1e843b02964871ec9e11fc5ce4096300f4d88ec","observation_id":"b1fe76cf-9f4d-440d-8f1a-be9ec7b19547","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"Neural Information Processing Systems (2022) 1, 4 In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection 17","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:ed42057101d6df49ae5bf12914ca52d0609fdef8b692db7bf4be4d8db96d4119","observation_id":"6e162843-c6ca-4d07-9e38-169d27c68e7c","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:76bf7f6718ac3a9634316847c7e540bb557b02ad869d235ce2d91ee0bdc21969","observation_id":"3a09f45d-9eb6-4b3f-a0fa-08889c2f4d24","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: Computer vision– ECCV 2014: 13th European conference, zurich, Switzerland, September 6-12, 2014, proceedings, part v 13","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:a92b5ac8ad2818b0997669f3441536020a2d91863c99d3ea036ad87f8eba4268","observation_id":"43bae8b6-67a6-49aa-aae3-85422ffdc44a","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:823b59a73652eb0f6ee59f407692078c7289472c1816adff6f8f307bd1e033bc","observation_id":"37458a2f-a1c3-4ac6-9089-9636018976d5","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:9d51648b20caba86ec6e6ed1d1fab119c8cfaead328dea785c606b37308a1c83","observation_id":"78ea61e9-7ab9-4272-be33-65531587fd13","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"arXiv preprint arXiv:2303.05499 (2023) 4, 20, 31","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:862b5629e812408d55f8d84d0efe23f10bca846a6dddbe80ffc278906dddc34f","observation_id":"4c14c2a3-a563-42ea-b018-6c345dac1761","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"AI Open5, 208–215 (2024) 5","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:34bd190f08ec266a19ddec6837b87827058ee8e55c1df324e5322d9534b64d08","observation_id":"114c7683-3421-4279-bb1a-6a6da2fcc9f9","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"arXiv preprint arXiv:2312.10986 (2023) 4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:433ea3c45dc45a791b5c0d0758f0e706080adb01cf59d99a1d43a80457b58f2e","observation_id":"ef5d693e-32c6-4a1e-9176-f82951974ad7","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"Advances in Neural Information Processing Systems 37, 19547–19560 (2024) 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:4e4108d2228294ea2da8e8750fa9587948cf87f8e848ca37214b21162ee78e1d","observation_id":"3aba87ed-1d68-4593-b316-1cd6b5cc432a","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09683","last_updated":"2024-05-22T13:00:02Z","snapshot_observed_at":"2026-07-06T15:43:23.212393Z","submitted_at":"2023-06-16T08:27:46Z","title":"Scaling Open-Vocabulary Object Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09683","snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"arXiv preprint arXiv:2306.09683 (2023) 4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"cited_paper":"/paper/2306.09683","citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:0ec3264a8c0ec0a0f2192fcd68b2ff0b9911c3381e2d25b7548b9bfd59ef961f","observation_id":"0363f2ac-3605-4faf-8d60-31a710927521","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:21c6098710e0e3b8de0af0159590e1a78668095a5c475d10da905405e8b321d7","observation_id":"6f993eb6-0ca7-43af-9440-a6de5df3462e","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11695","last_updated":"2024-10-06T17:34:26Z","snapshot_observed_at":"2026-07-06T18:32:19.794373Z","submitted_at":"2024-06-17T16:12:03Z","title":"Optimizing Instructions and Demonstrations for Multi-Stage Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11695","snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"arXiv preprint arXiv:2406.11695 (2024) 5, 7, 8, 21, 31","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"cited_paper":"/paper/2406.11695","citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:a6b19b4a33a3cb684a2fae36cc75b4d9b05f955ecaa0dc8f1452c3d65a74342e","observation_id":"1b55ba21-b018-475a-9c95-c3a45ad72ded","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: ECCV (2024) 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:486397be5ba392c1788e866e0e9e4b4f6d82b90ee158fbc453531eacbd5bf7a0","observation_id":"84c783aa-2d4a-4719-a742-aa3510e10442","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:2d40cba219a83d9ffa4680b6136cd091c28a15668a76885cd17189514f85827e","observation_id":"225b3f1e-9e18-436e-a3fd-16cbd0e2e2a2","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: Conference on Robot Learning","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:869bfee70b61411cd3bb21a7c7bea8405d54cd87c65d686fe29ecc3ccdc207d2","observation_id":"53308a65-920b-4eaa-931e-59d47d67aaa1","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: The Thirty-ninth Annual Conference on Neural Information Processing Systems Datasets and Benchmarks Track (2025) 2, 7, 12","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:a7f8ea1898170189f83edf792d460e43a5893c801c92b60d77271bf6ef840cdf","observation_id":"deb0bcd4-52f3-4533-a4d1-b18d74702774","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.06599","last_updated":"2021-04-14T02:56:14Z","snapshot_observed_at":"2026-07-06T10:59:26.299730Z","submitted_at":"2021-04-14T02:56:14Z","title":"Learning How to Ask: Querying LMs with Mixtures of Soft Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.06599","snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"arXiv preprint arXiv:2104.06599 (2021) 5","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"cited_paper":"/paper/2104.06599","citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:3a169a555316b99fbd98c76dd792cfa8576578474bbb0b8137eca0966370705f","observation_id":"4b3f93ef-c1e2-4a45-820d-5094c9f6a78f","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:4490c657c866ab8159b9401cfe17f67b1d54cc1c8e42aa34ead4728108035b18","observation_id":"b44fbfa2-c557-4c9a-9def-341e5644b551","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"arXiv preprint arXiv:2502.16923 (2025) 5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:dbd378a5560d8265213fe80de8ad9477fcb517d8a48aa4e8bea8f7a74b8c6a84","observation_id":"75be6ec9-1aa5-4479-8393-8771106d8286","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: Extended abstracts of the 2021 CHI conference on human factors in computing systems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:96f794f12970a4bf695a5b34c55137bca789a914df9bd23737a541ba6ad31f2f","observation_id":"aea65d49-6b56-45e4-aad7-914a44292119","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"International journal of computer vision115, 211–252 (2015) 4","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:03bfe5509a43049eb7e5225adfac57586a99c371d54d89b6b618deb0f6e29459","observation_id":"4d8d5a05-c291-4400-b3bc-b0069b70b8ac","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08207","last_updated":"2022-03-17T17:53:01Z","snapshot_observed_at":"2026-07-06T11:58:21.596920Z","submitted_at":"2021-10-15T17:08:57Z","title":"Multitask Prompted Training Enables Zero-Shot Task Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08207","snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"arXiv preprint arXiv:2110.08207 (2021) 5","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"cited_paper":"/paper/2110.08207","citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:2726cc230e42bac8d53b5fc3d16832db89ae971c6362576a91d8623b875c2a21","observation_id":"477eadef-7ac4-4618-a42d-e21323561006","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: Proceedings of the 16th conference of the European chapter of the association for computational linguistics: main volume","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:6ac8d7164cf76b02943b10e23f964d9c44bb9f180bf1a9e3bb28c92f671e04ec","observation_id":"ccddf1d7-6515-41f5-acfd-75c523ad3e58","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"Advances in neural information processing systems35, 25278–25294 (2022) 4","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:772c97a042e974a383b16e814a51d26370e6eb2ff5e7691af5e2b1d605e6bf54","observation_id":"1696ba99-6860-4445-b2ed-75de70996567","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.15980","last_updated":"2020-11-07T05:33:35Z","snapshot_observed_at":"2026-07-06T10:10:03.255419Z","submitted_at":"2020-10-29T22:54:00Z","title":"AutoPrompt: Eliciting Knowledge from Language Models with Automatically Generated Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.15980","snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"arXiv preprint arXiv:2010.15980 (2020) 5","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"cited_paper":"/paper/2010.15980","citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:2118207546db71f01099dfb35abce018f5326cd64d4cfdfad97b4b50a7fa7ed2","observation_id":"e4949bc1-1499-4bf3-b0a3-63726ab385c7","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:cb7524f8b16c3a3d68f78f0999957180b2d3cc238f13ad0b80fa5eb6779f9907","observation_id":"e11d3599-3d3b-44a2-a050-17ff8073fb00","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: International Conference on Machine Learning (ICML) (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:67ca40e61f49aa436bafe7663559c56f4ee8669ed4ad2f6025883ba812e81c60","observation_id":"08cca384-a6e5-4345-a649-7729fa250fbb","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"arXiv preprint arXiv:2502.14786 (2025) 9","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:4d0fa7dc1367faf5d1dbb036442f02ffad3b4d77b5a4a02a85f385ced9ee62d1","observation_id":"81ef8fdd-77ef-4643-a2e2-5abe9ace3cb0","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:2dde7cca816b348fe19a81c682ccb7642f376de466f856845f65b74295553d78","observation_id":"9bcab663-5809-411c-96d7-45077f4e4c9c","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: International Conference on Machine Learning (ICML) (2020) 4","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:fac6ef18ac6933d7eea1c37853cebbf69bfc9bcd5f7c97dce2a0ada02006f063","observation_id":"50ec113c-4a89-4dea-86ec-3057ac856d01","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:c47b182e911112f7e8269310ad6e167c7f2e3fbe6e5524579973e75f720f05c8","observation_id":"bffb353b-c52d-46c2-b8a1-504e8f653d28","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"Advances in neural information processing systems35, 24824–24837 (2022) 5","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:4e0d9e98da371744b716d5dfc148cf379871865e9c646feed6b1eb4c82e91d94","observation_id":"74295db9-a90a-4cf2-b6d4-bb14f9423d36","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:1d99fed8ec7a52ddea383dfcf7a2c708a7966c817a52dc04455abcee078700c3","observation_id":"4a980362-413d-4216-b3b4-9d94a730666f","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence45(3), 3090–3106 (2022) 4","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:207d28d9cf39becf0aaa91544f1c22bf66faad032f0a88a1c133661071df3c3e","observation_id":"25303518-0ae6-4ed0-93ec-c684ff35f5d4","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:ca3d9ea26bf097791f0fc55e4c2af48fc20da984befcdf858ca355213376d6e4","observation_id":"5e87feec-fde8-4c04-92b2-f5e6491c9438","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"Advances in Neural Information Processing Systems 36, 4452–4469 (2023) 7, 8","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:3abcb810a426c6108d655ed81160a069e9ad9048bcefd2d893704d72f9dcfff1","observation_id":"0d9730ba-290a-4051-aae4-b24e9fab2e36","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"Advances in neural information processing systems36, 11809–11822 (2023) 5","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:53f3da6b5dc62f7744621970aa20977badf915198abe3aa3335133f8fd3c9d3f","observation_id":"bfe0994d-1a55-4463-a85c-581ee02f4cbc","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:7fd9b6328e3d97ca0ea4dce96925950c38ae14374379aea050f55370c8727cd6","observation_id":"75c4fb4d-f9ef-4c46-a340-50d987035c6b","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"Advances in neural information processing systems34, 27263–27277 (2021) 5","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:7d5bd1d642eee4cd02aff79ef231c1eff7a53272075de65f411d0f78caebd058","observation_id":"d9c38819-15b5-443f-afae-ce4114470a33","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 3: System Demonstrations)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:71c662afc8fb1acfea5b16f88787daec8a7f9a54939d31c685c0879ecc873a5f","observation_id":"11d6ffc7-7885-4a74-9327-f60a58d61820","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:e5ea1d4d5f8fe093dd13cd728574479b46b88cb5c4decf71d76bbfe0152d75ec","observation_id":"4674bf4e-b55d-435a-bd67-35217219858b","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"a brown dog","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:32db596ed26897b74f686f57be36a67da44e13e969bf2877c6bf657ace1802f7","observation_id":"7e6a6c37-caea-4f32-b38c-1528d29a9eca","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:38:38.452093Z","title":"white-box","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-13T19:38:38.452093Z"},"links":{"citing_paper":"/paper/2603.23455"},"observation_digest":"sha256:02c7b958e4d3605add01370d1735e82f5bb1d99d5b36a44ac4b4f3bf14b3773f","observation_id":"d97186f3-ec4a-4a7e-be7f-9c9ef2d12e09","resolution":{"observed_at":"2026-07-13T19:38:38.452093Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":70,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"thesis":"As of 25 July 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:2603.23455."}