{"as_of":"2026-08-13T10:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6a49348df101cd38dd8bbabee254efbd134aeaee2123ba3c8902f7db5c2d9a67","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:39:40.687439Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.13317/citation-record","integrity":"/paper/2411.13317/integrity","json":"/paper/2411.13317/citation-record.json","paper":"/paper/2411.13317"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-12T16:39:40.456544Z","title":"Pixtral 12b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.456544Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:c135c63270cd2cc35bea2951fdcc4c6a0e32cfef31293fedbc7a64d4adfe53f6","observation_id":"37ddf28d-cbe8-43cd-9fdf-5bf0c0da1bee","resolution":{"observed_at":"2026-08-12T16:39:40.456544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.544967Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":null,"work_id":"619bb258-8a08-4685-adf8-322b1282c2de","year":2022},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.461608Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:1b3ee38fce1e89986efb95e5e39532cc2d2cbb74731f8159bbf7f2484da8cfcc","observation_id":"6a83b50c-0057-4a65-98c3-638a881f30a4","resolution":{"observed_at":"2026-08-12T16:39:41.549331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T16:39:40.465499Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.465499Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:4de71f8973ba49f250c74f3b0ba8e647cf5810d775402995d4d998e6fc1dc526","observation_id":"acb2a615-02de-4be6-8190-6425fbe40cbd","resolution":{"observed_at":"2026-08-12T16:39:40.465499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14528","last_updated":"2025-04-09T22:43:46Z","snapshot_observed_at":"2026-08-12T23:38:09.124198Z","submitted_at":"2024-06-20T17:40:18Z","title":"DeciMamba: Exploring the Length Extrapolation Potential of Mamba","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14528","snapshot_observed_at":"2026-08-12T16:39:40.469752Z","title":"Decimamba: Exploring the length extrapolation potential of mamba","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.469752Z"},"links":{"cited_paper":"/paper/2406.14528","citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:2a96cfe84fb3e449432f34d4f1f9e411d06345720f069e6bcf7ed9f8a64cbdaf","observation_id":"7a938626-bc81-4701-9e58-4cf7c375e58d","resolution":{"observed_at":"2026-08-12T16:39:40.469752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:40.474895Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.474895Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:7e33258908b92b2c67bc5c3fb63a33b5a1e704f3d16276a0981027ed6f7407fd","observation_id":"3c5f6a9b-5fae-489e-a060-19bbac3f903d","resolution":{"observed_at":"2026-08-12T16:39:40.474895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.525016Z","title":null,"venue":null,"work_id":"27c644ce-864f-40f2-b3b3-70bb196d0793","year":2020},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.478781Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:edd539539de5652a5ac14f2da321c982d14df59018ddc5d4e9a4acf841e185cf","observation_id":"1ce28c8d-a6d9-4b19-b1b8-e17f57bd4801","resolution":{"observed_at":"2026-08-12T16:39:41.529173Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.513753Z","title":"MiniGPT-v2: Large Language Model as a Unified Interface for Vision-Language Multi-task Learning","venue":null,"work_id":"bfbca643-a96c-4fdd-b05f-79a2f19fd4b6","year":null},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.482901Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:96e02bbc20e4e5fc41b42984b1d91af834fc377311de5b95c6b527827a0a5da1","observation_id":"a547f13d-6ce2-4733-aece-8b0ed6f60aee","resolution":{"observed_at":"2026-08-12T16:39:41.517511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-12T16:39:40.487264Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.487264Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:f8fea053a41221d6ad3705a61291088cbcd6501661b827feec688bc29c9559a5","observation_id":"4bb4b678-9d7f-4dc3-965d-839f697798bd","resolution":{"observed_at":"2026-08-12T16:39:40.487264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.502289Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"48a04795-9d5a-4511-a371-24c15c5373d1","year":2023},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.491205Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:a0a3c0c08e01ac127f6d90cfa74cb65f64aed0e51e6d1816fe77f1d8ddab9819","observation_id":"660e31e1-6833-46ff-aaaf-41de340fa4aa","resolution":{"observed_at":"2026-08-12T16:39:41.506480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.490382Z","title":"InstructBLIP: Towards General-purpose Vision- Language Models with Instruction Tuning","venue":null,"work_id":"68976130-9844-43a1-980f-8dd064dabb9c","year":null},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.494839Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:0a223c595d9f9d429253cdb93bf1f25c6f4822ef3efdc65484e5162facae9a26","observation_id":"56991c9d-8caa-4af0-b942-95d8e8e38f2f","resolution":{"observed_at":"2026-08-12T16:39:41.494396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.478230Z","title":"Tao: A large-scale bench- mark for tracking any object","venue":null,"work_id":"6b90cc28-7789-4d0a-9769-457227bc306b","year":2020},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.498165Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:5a333f343e27894e282e1df92e518c506e23ea58624d467a5667fae5f0aa23e5","observation_id":"fefc5034-5bc1-4149-a8c1-52a3968fae0d","resolution":{"observed_at":"2026-08-12T16:39:41.482721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.465369Z","title":"Dense and Aligned Captions (DAC) Promote Compositional Reasoning in VL Models","venue":null,"work_id":"c456c181-e788-4261-97f4-3398dfb80f5a","year":2023},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.501315Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:37d178e06c270d7b0107718be2a19cbe085cdc821cc1406d5c5b2c2616c63383","observation_id":"72c2c290-9dbf-4842-897e-d2185b5ee624","resolution":{"observed_at":"2026-08-12T16:39:41.469865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.452858Z","title":"Teaching structured vision & language concepts to vision & language models","venue":null,"work_id":"a7830896-be99-4de0-9e9e-17f503751dd6","year":2023},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.505137Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:7d880519f0c6e03ea377026c01b960ba7516bb071db1defa27a1f09cb4c8108b","observation_id":"aa7b3741-3448-489a-819e-b80b7ec9db98","resolution":{"observed_at":"2026-08-12T16:39:41.456962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12736","last_updated":"2024-07-17T08:13:02Z","snapshot_observed_at":"2026-08-13T00:50:20.381068Z","submitted_at":"2024-03-19T13:53:37Z","title":"Towards Multimodal In-Context Learning for Vision & Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12736","snapshot_observed_at":"2026-08-12T16:39:40.508301Z","title":"Towards multimodal in-context learning for vision & language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.508301Z"},"links":{"cited_paper":"/paper/2403.12736","citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:68196d80666444eabff3164512e466dc7f934ffad0811cfe6ae15fa0647ad179","observation_id":"f9cbc167-0a17-4e7e-8298-5527f44f95f3","resolution":{"observed_at":"2026-08-12T16:39:40.508301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T16:39:40.512501Z","title":"The Llama 3 Herd of Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.512501Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:dc219006398fc15a57def602c35f2f1df17da2f44129eae27fb4290bc47ce83e","observation_id":"8b7704a9-01ed-4ebe-adf9-a5a4c901f8a0","resolution":{"observed_at":"2026-08-12T16:39:40.512501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:40.516794Z","title":"Lasot: A high-quality benchmark for large-scale single ob- ject tracking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.516794Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:97b032dadb2ef2de81571abaa62aa40d0d94bfc8e51b7fa905a607419dd78534","observation_id":"8c326ce3-f619-4baa-80a9-b62541567166","resolution":{"observed_at":"2026-08-12T16:39:40.516794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.434098Z","title":"SEED: Self-supervised Dis- 9 tillation for Visual Representation","venue":null,"work_id":"027f3908-8257-4509-af5e-15f18a35b3ca","year":2021},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.520549Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:f04eccb01d5a1b5c2a371cf0b635da52057f431b5927ad398c50f8e6ac4617c3","observation_id":"03581bc5-4c3b-42cb-819c-1eeece0d12ca","resolution":{"observed_at":"2026-08-12T16:39:41.438365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.420758Z","title":"Cross-domain few-shot object detection via enhanced open-set object detector","venue":null,"work_id":"3e6b44bc-bf63-4287-9572-e4fa93c736e1","year":2025},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.524498Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:c3e669c3a99ae4b232db5aee65d7212da9aff6e1c1752e3a66abf821f1dbccf2","observation_id":"3124bf49-f3ba-4c40-aa7a-62ec7484cc3f","resolution":{"observed_at":"2026-08-12T16:39:41.424973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22330","last_updated":"2025-05-07T17:59:59Z","snapshot_observed_at":"2026-08-12T22:12:29.955096Z","submitted_at":"2024-10-29T17:59:45Z","title":"Vision-Language Models Create Cross-Modal Task Representations","version":2},"cited_work":{"arxiv_id":"2410.22330","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.22330","snapshot_observed_at":"2026-08-12T16:39:41.015681Z","title":"Vision-Language Models Create Cross-Modal Task Representations","venue":"cs.CV","work_id":"f88a82d6-c0b8-4523-8ad7-6a81e7db8b79","year":2024},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.528370Z"},"links":{"cited_paper":"/paper/2410.22330","citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:3d7dbb4fd7a993ed91fdb1b76f07a0fb05323c53804b549f418385db2a0ead9f","observation_id":"d571833c-e27a-4c74-b083-dcc1f19b7e47","resolution":{"observed_at":"2026-08-12T16:39:41.022727Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T16:39:40.532371Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.532371Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:3d6f34f9490ab44a534f17420beaa303abe2a3f19c2302b2029fd39fb4b04270","observation_id":"f1cbd9f0-fa7b-4745-bc9c-bbb8d444ac47","resolution":{"observed_at":"2026-08-12T16:39:40.532371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15334","last_updated":"2024-12-20T01:24:51Z","snapshot_observed_at":"2026-08-12T23:37:19.817513Z","submitted_at":"2024-06-21T17:50:02Z","title":"Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15334","snapshot_observed_at":"2026-08-12T16:39:40.536776Z","title":"Multimodal task vectors enable many-shot multimodal in-context learn- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.536776Z"},"links":{"cited_paper":"/paper/2406.15334","citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:4cc4fd79efb072d7d0f80270b9301ef356dd8e993c0575c9a1035fede4399102","observation_id":"da2197ba-17e3-46ba-8e97-32736727f1de","resolution":{"observed_at":"2026-08-12T16:39:40.536776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08164","last_updated":"2024-11-13T00:15:20Z","snapshot_observed_at":"2026-08-12T23:44:37.287660Z","submitted_at":"2024-06-12T12:54:27Z","title":"ConMe: Rethinking Evaluation of Compositional Reasoning for Modern VLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08164","snapshot_observed_at":"2026-08-12T16:39:40.541079Z","title":"ConMe: Rethinking Evaluation of Compositional Reasoning for Modern VLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.541079Z"},"links":{"cited_paper":"/paper/2406.08164","citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:03119f6c81ad23e12b1b622842914f840e5653b4032d57482c12cf34c6b21103","observation_id":"8a132cbb-8e01-4271-975d-a27d5e071e5f","resolution":{"observed_at":"2026-08-12T16:39:40.541079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.408595Z","title":"Got-10k: A large high-diversity benchmark for generic object tracking in the wild","venue":null,"work_id":"adef5687-9932-4892-b26e-902a523f8fcf","year":2019},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.545070Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:c1f0e3fac5ae36748cbb189cf735ddf2b2cc5e6ae962bdef003f71915b20c906","observation_id":"c545965a-a60e-44d3-bf91-d8ae4a21144c","resolution":{"observed_at":"2026-08-12T16:39:41.412751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.395492Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"21570261-3cb1-4083-8a9d-2b6d23161970","year":2019},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.549059Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:d267c99626f4799f43c116e4ba6e983b191e7636ecce5ee4caf55970be02cf54","observation_id":"33af747b-5247-4e84-8b00-3d5771dd7a2a","resolution":{"observed_at":"2026-08-12T16:39:41.400012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.384125Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":"70753e4e-febd-4a9c-b675-2bac0fa8013a","year":null},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.552750Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:644991cbaa61a069c641e49e5b44463301d37036f0fa9fc502a2c5c75b82c157","observation_id":"94fe1d9f-b150-4776-acd0-b0a29c10cbf6","resolution":{"observed_at":"2026-08-12T16:39:41.387969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00784","last_updated":"2022-12-01T18:59:03Z","snapshot_observed_at":"2026-08-09T21:23:06.626842Z","submitted_at":"2022-12-01T18:59:03Z","title":"Improving Zero-Shot Models with Label Distribution Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.00784","snapshot_observed_at":"2026-08-12T16:39:40.557149Z","title":"Im- proving Zero-Shot Models with Label Distribution Priors","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.557149Z"},"links":{"cited_paper":"/paper/2212.00784","citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:48d9e1050923acdee74397f6f0fd838e5769e39903a843630bb64b48b7c3290f","observation_id":"35fc6464-8f6e-4c8d-bec8-7506fc282719","resolution":{"observed_at":"2026-08-12T16:39:40.557149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.371806Z","title":"Building and better understanding vision- language models: insights and future directions., 2024","venue":null,"work_id":"0d9c2ec2-fbc3-4aaa-a0a7-647f91b77dbe","year":2024},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.560467Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:fc1508e9cd8e08f0f59681aa2f5159c96009843966d1309852d5f4423b4fa164","observation_id":"6fdff393-4014-45ea-b112-dbb80debdda9","resolution":{"observed_at":"2026-08-12T16:39:41.376507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:40.563667Z","title":"Rush, Douwe Kiela, Matthieu Cord, and Victor Sanh","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.563667Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:367b9ce8c4b310afc2c980bd99e71f3964a721e16d2607171789e49bdf2a8d7f","observation_id":"01145f1d-b456-4daa-b31b-da539b857769","resolution":{"observed_at":"2026-08-12T16:39:40.563667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T16:39:40.567068Z","title":"LLaV A-OneVision: Easy Visual Task Trans- fer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.567068Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:87998a1761e7d1e1e2e84b56999aacdbad7ea24c06f1db8c0317c9ada43f6649","observation_id":"aa5e7dce-cfde-4538-917b-f031368508ec","resolution":{"observed_at":"2026-08-12T16:39:40.567068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.352325Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":null,"work_id":"35c0435d-926c-49dc-878e-1d86ae2aed45","year":2023},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.570471Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:83e2159b70d32e0c35bc06deb6234da963bc39148b498ec16842d200fcf42f10","observation_id":"c84b9ba8-0073-4f37-be49-5db383960f33","resolution":{"observed_at":"2026-08-12T16:39:41.357258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-12T16:39:40.573595Z","title":"Evaluating object hallucina- tion in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.573595Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:f96e5cc217e1835268ceb6531d3489b750ca52c7b059a9e2df619270f3752358","observation_id":"b0813bb4-f2e8-4f14-8a16-a738e03b66a6","resolution":{"observed_at":"2026-08-12T16:39:40.573595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.340745Z","title":"Video-LLaV A: Learning united visual repre- sentation by alignment before projection","venue":null,"work_id":"6fe79cf0-f8b0-4d9f-939a-ad308aceb090","year":2024},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.577439Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:c7d5453072a3465fe2e3b1b19b25884913469daf5c506d0c1f118e78dec6b5fb","observation_id":"c91f8eed-6ed1-4d0c-a355-a4dbce10b525","resolution":{"observed_at":"2026-08-12T16:39:41.345079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.329734Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"f6375ace-b77c-40d9-8a22-6ce3c7873bc3","year":2014},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.581006Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:96e8f724b48b8b77038fdb141185b736dab83d5eaf2da38d4c71a8f3b709814c","observation_id":"519c5fd0-9609-44ef-a658-9fd720182095","resolution":{"observed_at":"2026-08-12T16:39:41.333635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.318214Z","title":"MAtch, eXpand and Improve: Unsupervised Finetuning for Zero-Shot Action Recognition with Language Knowledge","venue":null,"work_id":"2155b348-06ca-483d-b0b1-9818664ed72b","year":null},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.584841Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:e642d18e40d36fc105d1dc700c7e06cac772f7cfa3e5f2235a016266e3726ddc","observation_id":"4c5fb39b-bd6b-4146-86d0-5ce1a19cf6a5","resolution":{"observed_at":"2026-08-12T16:39:41.322994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.307097Z","title":"LLaV A-NeXT: Improved reasoning, OCR, and world knowl- edge, 2023","venue":null,"work_id":"4f5c6e60-6755-4f9a-8548-0b347aa3cb1e","year":2023},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.588422Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:11c3f2f1b16f4035598b82588e53b9aaa2d62313be15d5c373f2b36603c6707a","observation_id":"fe242f4f-7192-4569-b606-d8581bcd90fe","resolution":{"observed_at":"2026-08-12T16:39:41.311111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.295677Z","title":"Improved Baselines with Visual Instruction Tuning","venue":null,"work_id":"041e31e6-59f9-4a07-b3cd-ee660e97f96f","year":2024},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.592000Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:cc14a6f8021e8dadcdf108730deb47e33424fe4708dc64c7016c43446de20c9e","observation_id":"6dd04bcd-bac5-47bd-a1e7-44bb346c8192","resolution":{"observed_at":"2026-08-12T16:39:41.299613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.283515Z","title":"Visual Instruction Tuning","venue":null,"work_id":"b49187af-c727-470d-b418-74ba9fbfb268","year":2023},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.595416Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:ea3471a5d3111ce4c97c2f9c1f2cc314afea80dc89128a287d70fb8e605315ee","observation_id":"baff4608-4631-4f08-af17-81cd5f94941c","resolution":{"observed_at":"2026-08-12T16:39:41.288260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.272343Z","title":"MetaICL: Learning to Learn In Context","venue":null,"work_id":"3043059e-ad7d-4942-99bb-ad57b680fa89","year":2022},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.598963Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:01ca166f6b03f744d7668af068f59eb7aa189c7550b50b79aa8548ac0304e77c","observation_id":"0c31c0e0-c363-424b-95bd-4fe8a5fa9407","resolution":{"observed_at":"2026-08-12T16:39:41.276171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.259506Z","title":"Simple open-vocabulary object detection","venue":null,"work_id":"81c89603-a9df-4da2-83da-657a7cffd03e","year":2022},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.602374Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:bd9bcb0e2b9fc6e4f009459cf3bca6ed7803ca068c666a2a005bcfc74ef12d20","observation_id":"9fa3ac82-a1f5-4457-8a1c-5a3dbc7a2aa3","resolution":{"observed_at":"2026-08-12T16:39:41.264856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.247148Z","title":"Jehanzeb Mirza, Leonid Karlinsky, Wei Lin, Sivan Doveh, , Jakub Micorek, Mateusz Kozinski, Hilde Kuhene, and Horst Possegger","venue":null,"work_id":"c0e58021-fdc7-4881-b38a-2b1b38271a9b","year":2024},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.605839Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:b3d257f22c6161f3008a7db4cc51fc9742e3fd8618a0f5807f42ded865ca8b57","observation_id":"c8fb27d6-9170-4d02-886a-c7274d494a5b","resolution":{"observed_at":"2026-08-12T16:39:41.251810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06809","last_updated":"2023-09-13T08:59:54Z","snapshot_observed_at":"2026-07-06T16:17:50.837748Z","submitted_at":"2023-09-13T08:59:54Z","title":"TAP: Targeted Prompting for Task Adaptive Generation of Textual Training Instances for Visual Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06809","snapshot_observed_at":"2026-08-12T16:39:40.609623Z","title":"Jehanzeb Mirza, Leonid Karlinsky, Wei Lin, Horst Pos- segger, Rogerio Feris, and Horst Bischof","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.609623Z"},"links":{"cited_paper":"/paper/2309.06809","citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:9a81f5679ae99f08532c4d659b9d5321231acd12a3c0c71692d5fc50f93702a7","observation_id":"5164a560-0e1b-4fc1-95e4-5b9e5ae55f2b","resolution":{"observed_at":"2026-08-12T16:39:40.609623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.235103Z","title":"LaFTer: Label-Free Tuning of Zero-shot Classifier using Language and Unlabeled Image Collections","venue":null,"work_id":"ca67b6fe-aa00-4e08-818c-8f1b35b32406","year":2023},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.614016Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:6736358f1853bda01d1f06dacf7a87dbab58b7a507f4a1373e617a436c8d5299","observation_id":"175230ee-ede7-4953-8990-398a4235376f","resolution":{"observed_at":"2026-08-12T16:39:41.238798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06154","last_updated":"2025-08-20T19:02:24Z","snapshot_observed_at":"2026-08-12T22:28:02.495992Z","submitted_at":"2024-10-08T15:55:40Z","title":"GLOV: Guided Large Language Models as Implicit Optimizers for Vision Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06154","snapshot_observed_at":"2026-08-12T16:39:40.617774Z","title":"Glov: Guided large language models as implicit optimizers for vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.617774Z"},"links":{"cited_paper":"/paper/2410.06154","citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:27727feff5e0cdf9411ad05f4b3875e5b07b4b9794cebd7c0827a5697db02b31","observation_id":"a11f86cc-1d84-4f14-86dc-26392ea575c6","resolution":{"observed_at":"2026-08-12T16:39:40.617774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T16:39:40.621780Z","title":"GPT-4 Technical Report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.621780Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:a75b65e63028152e185086a8c5f392d1cf5d959874b3db9e5c0d0f586298c6af","observation_id":"e8e46f47-cb9b-4ddd-84da-400aa6b54e99","resolution":{"observed_at":"2026-08-12T16:39:40.621780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-08-07T11:26:24.970964Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-08-12T16:39:40.625552Z","title":"Train short, 10 test long: Attention with linear biases enables input length extrapolation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.625552Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:b8651e9dd91c0be0f821facdcdf6eae390917fffd512ed8c7167ad4cad3132b1","observation_id":"f3e373b9-d24c-4297-aa9b-3283af0c9793","resolution":{"observed_at":"2026-08-12T16:39:40.625552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.222901Z","title":"Learning Transferable Visual Models from Natural Language Supervision","venue":null,"work_id":"45ce7b78-9881-4d88-9f0a-221df6e2d9d6","year":null},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.629796Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:4e846800325327ae5a6852604d16b6104fd297cd5e4fa7fd0333ccbac639e0de","observation_id":"160657ba-b93e-49f5-a829-2bcf62741f84","resolution":{"observed_at":"2026-08-12T16:39:41.227513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.210846Z","title":"Where’s waldo: Diffusion features for person- alized segmentation and retrieval","venue":null,"work_id":"4590bd25-bb8f-4afa-9a44-b3a0eb989053","year":2024},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.633609Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:4b3b995ae8db9fb712f4ce15700dda0ef58c5cde2b3a9200a1a1c93d018a3f3e","observation_id":"3b28e437-91ac-4fe9-a4a3-f28f1477b76d","resolution":{"observed_at":"2026-08-12T16:39:41.214913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.198828Z","title":"LAION-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"5f7697c4-30ce-4257-a5d4-efc21d736c0a","year":2022},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.637531Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:0cdf50d7d96dd4ae0f5cbe5d52b1dcbed8572e4c874917af6fc478fc1b736222","observation_id":"0b6132a6-ce8a-4202-aa88-0afec2a19689","resolution":{"observed_at":"2026-08-12T16:39:41.202871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-08-13T04:57:24.068800Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-12T16:39:40.641230Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.641230Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:f6b6af9e5a7a810026d1b5ff09f7fbe8ac556044f4b8bfb46e922f99825cdad0","observation_id":"ba8e2d6a-1097-4033-9fbb-5e5a2cc5a152","resolution":{"observed_at":"2026-08-12T16:39:40.641230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-12T16:39:40.645655Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.645655Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:feaef3cb44733e2900dd54e7ae1f98dea14bc2e97692b0a671b88032cfb7fe9a","observation_id":"3924a722-b553-4b89-8913-59da0fdae312","resolution":{"observed_at":"2026-08-12T16:39:40.645655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.06957","last_updated":"2020-03-16T00:29:14Z","snapshot_observed_at":"2026-08-09T03:00:56.661396Z","submitted_at":"2020-03-16T00:29:14Z","title":"Frustratingly Simple Few-Shot Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.06957","snapshot_observed_at":"2026-08-12T16:39:40.649624Z","title":"Frustratingly simple few-shot object detection","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.649624Z"},"links":{"cited_paper":"/paper/2003.06957","citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:cdab3cc4af2093bc08a9e00918e770b8f699c7e26a0d405cd9fcab4324b36edf","observation_id":"ef08ee48-1c8a-4169-b68c-9fe9d13dac31","resolution":{"observed_at":"2026-08-12T16:39:40.649624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.185811Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","venue":null,"work_id":"aafaa6c7-d981-4221-bc96-8f8ce1a6f2af","year":2022},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.653529Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:a3884c27b74d6f1afaf3c782b48c879f19d83eb715e42d161aea06d305c99307","observation_id":"9fa68b21-9f5e-464f-99dc-765642284e80","resolution":{"observed_at":"2026-08-12T16:39:41.190180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03846","last_updated":"2023-03-08T07:37:43Z","snapshot_observed_at":"2026-08-13T05:58:47.434911Z","submitted_at":"2023-03-07T12:24:17Z","title":"Larger language models do in-context learning differently","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03846","snapshot_observed_at":"2026-08-12T16:39:40.656379Z","title":"Larger language models do in-context learning differently","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.656379Z"},"links":{"cited_paper":"/paper/2303.03846","citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:1a9d5afe27718813fd119cc6ccd3a497ccd9b21a11e9c7408df89904a32b3424","observation_id":"205c90c8-e051-41f4-845c-0666c1fb871c","resolution":{"observed_at":"2026-08-12T16:39:40.656379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.170948Z","title":"Demystify- ing CLIP Data","venue":null,"work_id":"ba592827-4dda-47c0-be24-58200f086651","year":2023},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.659764Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:6e70946307a42d8a2f3afc684b5e6deca3a790524b32519fbc238a08fa27bcd6","observation_id":"77021848-34fa-4134-9011-7cbe8b15e93a","resolution":{"observed_at":"2026-08-12T16:39:41.175239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.156197Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","venue":null,"work_id":"f58f1e0b-e57b-431a-bc91-70d611751a92","year":2023},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.662991Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:d6ff57603452165ad13b0d0e872688f91137f45f7509628a3d0dcbcbbbb76f66","observation_id":"d4c46cb3-2366-49d2-8401-fc9c3fc6659f","resolution":{"observed_at":"2026-08-12T16:39:41.160513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.143145Z","title":"Sigmoid Loss for Language Image Pre- training","venue":null,"work_id":"1956de37-ff02-443a-8c7b-14d9383d3e18","year":2023},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.666254Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:58478b35348616df92867b100589a3f49ccacf9c5feb4e9aa7823bad8cd6ec9b","observation_id":"9f94954e-ca22-44fb-8a66-c9b02056ee0e","resolution":{"observed_at":"2026-08-12T16:39:41.148368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03048","last_updated":"2023-10-04T01:15:21Z","snapshot_observed_at":"2026-08-11T05:11:27.416196Z","submitted_at":"2023-05-04T17:59:36Z","title":"Personalize Segment Anything Model with One Shot","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03048","snapshot_observed_at":"2026-08-12T16:39:40.670404Z","title":"Personalize segment anything model with one shot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.670404Z"},"links":{"cited_paper":"/paper/2305.03048","citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:d8fcab39f1155f42db4c3da2ada844578cce52223c82ac752aae7614db1ca080","observation_id":"d274c548-9ea8-40aa-9335-2e17f8c9b0ab","resolution":{"observed_at":"2026-08-12T16:39:40.670404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-08-12T16:39:40.674841Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.674841Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:6acf975ac0b7e2225c5c5c367c5f0acc064c88d28309dd3374486b7623017451","observation_id":"938945a8-1bf8-4757-9a8a-2697a5c556ff","resolution":{"observed_at":"2026-08-12T16:39:40.674841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.130417Z","title":"Llamafac- tory: Unified efficient fine-tuning of 100+ language mod- els","venue":null,"work_id":"1a83676b-d41c-4226-a7f1-2061f4cc0c1d","year":2024},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.678763Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:f432d292963423518797e60a6084788a1c4e859164ac9846c6ef4a9fc613a231","observation_id":"c2ab052d-2b49-4d7b-9950-fa3c2055ab67","resolution":{"observed_at":"2026-08-12T16:39:41.134100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.118250Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":null,"work_id":"cdeba7a3-a80d-4150-8c86-3adcb7a70130","year":2024},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.682746Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:ecac088f18aef5451adfff7fa8b4785a9e19c8ac89ee17400913c411d8cf03de","observation_id":"94ae1924-e7c2-43f3-830a-1e3029e61081","resolution":{"observed_at":"2026-08-12T16:39:41.122145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:39:41.105833Z","title":"<ref>category</ref>","venue":null,"work_id":"eeb07dc8-60e1-4e09-b6b8-112593f657d2","year":null},"citing_paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T16:39:40.687439Z"},"links":{"citing_paper":"/paper/2411.13317"},"observation_digest":"sha256:758b13f6d19b102371b5fcd803916d1cfafe84679e0c86aeb62a5be9b495379b","observation_id":"2778b1e1-baad-4af4-83b2-95b3c377f8ec","resolution":{"observed_at":"2026-08-12T16:39:41.109720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.13317","last_updated":"2025-03-12T19:43:14Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T16:31:13.006323Z","submitted_at":"2024-11-20T13:34:22Z","title":"Teaching VLMs to Localize Specific Objects from In-context Examples"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":34},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2411.13317."}