{"as_of":"2026-08-07T20:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1a42687f77f5ae93dbbcf9a21416b4a5729bf9c41e2352fd2210f09a0ab79041","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:25:30.497174Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:43:16.986690Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07936","snapshot_observed_at":"2026-08-06T15:43:16.986690Z","title":"Mimicking or reasoning: Rethinking multi-modal in-context learning in vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15285","last_updated":"2025-07-21T06:35:46Z","snapshot_observed_at":"2026-08-06T15:33:16.546956Z","submitted_at":"2025-07-21T06:35:46Z","title":"In-context Learning of Vision Language Models for Detection of Physical and Digital Attacks against Face Recognition Systems","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T15:43:16.986690Z"},"links":{"cited_paper":"/paper/2506.07936","citing_paper":"/paper/2507.15285"},"observation_digest":"sha256:1c8fd0920fde9cd87e0c97f66df2404de2e4ad7eab0575dce45a2497b4519eef","observation_id":"adec5307-bff3-4d51-9fa7-21126ac3a9bb","resolution":{"observed_at":"2026-08-06T15:43:16.986690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07936","snapshot_observed_at":"2026-08-06T15:29:34.173300Z","title":"Mimicking or reasoning: Rethinking multi-modal in-context learning in vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-06T15:20:44.610829Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:34.173300Z"},"links":{"cited_paper":"/paper/2506.07936","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:d2cb1729c6c0f8a98df4dea9612c17f4a251a6831da4ed77a13db5b398144b4d","observation_id":"f5ca7f5c-4333-4f1f-ac79-bab58917cdb4","resolution":{"observed_at":"2026-08-06T15:29:34.173300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2506.07936","doi":"10.48550/arxiv.2506.07936","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07936","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mimicking or reasoning: Rethinking multi-modal in-context learning in vision-language models","venue":"ArXiv.org","work_id":"c261c017-38ca-45cd-9194-9f91bdb93a00","year":2025},"citing_paper":{"arxiv_id":"2509.18095","last_updated":"2026-04-06T19:57:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T17:59:42Z","title":"MetaEmbed: Scaling Multimodal Retrieval at Test-Time with Flexible Late Interaction","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-18T14:09:22.942238Z"},"links":{"cited_paper":"/paper/2506.07936","citing_paper":"/paper/2509.18095"},"observation_digest":"sha256:ab8a7b5fe249aeb2119487a8f4ced638b821a5bf6d04f85a2507529dbdf089ec","observation_id":"84d6614a-312c-4db4-b403-35f50e49d566","resolution":{"observed_at":"2026-05-18T14:11:27.448460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2506.07936","doi":"10.48550/arxiv.2506.07936","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07936","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mimicking or reasoning: Rethinking multi-modal in-context learning in vision-language models","venue":"ArXiv.org","work_id":"c261c017-38ca-45cd-9194-9f91bdb93a00","year":2025},"citing_paper":{"arxiv_id":"2604.13403","last_updated":"2026-04-15T02:12:51Z","snapshot_observed_at":"2026-07-06T23:01:23.771347Z","submitted_at":"2026-04-15T02:12:51Z","title":"Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and Bottlenecks","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-10T13:41:37.942145Z"},"links":{"cited_paper":"/paper/2506.07936","citing_paper":"/paper/2604.13403"},"observation_digest":"sha256:524249f0407da602b0d313963c873978adbc09e7e8401e59c417633051f22780","observation_id":"957de704-b9a9-4c56-983f-e25012054cec","resolution":{"observed_at":"2026-05-10T13:45:28.245354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2506.07936","doi":"10.48550/arxiv.2506.07936","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07936","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mimicking or reasoning: Rethinking multi-modal in-context learning in vision-language models","venue":"ArXiv.org","work_id":"c261c017-38ca-45cd-9194-9f91bdb93a00","year":2025},"citing_paper":{"arxiv_id":"2605.01333","last_updated":"2026-05-08T01:08:56Z","snapshot_observed_at":"2026-08-04T10:46:08.275509Z","submitted_at":"2026-05-02T09:08:33Z","title":"OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-11T01:03:50.055081Z"},"links":{"cited_paper":"/paper/2506.07936","citing_paper":"/paper/2605.01333"},"observation_digest":"sha256:5d11b72962c537d562aaebf634c486bff0f38fbe52082e16dd18aefe1e2cf7b2","observation_id":"1dae7721-237e-4948-8945-f6b27325da46","resolution":{"observed_at":"2026-05-11T01:05:50.173877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07936/citation-record","integrity":"/paper/2506.07936/integrity","json":"/paper/2506.07936/citation-record.json","paper":"/paper/2506.07936"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-07T05:25:30.326469Z","title":"Openflamingo: An open- source framework for training large autoregressive vision-language models.arXiv preprint arXiv:2308.01390, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.326469Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:e03048bf3e4ebef99b72e981d4a5d2fd010d3cc3489b84da30bbdde4ac6026bf","observation_id":"b5eba608-dd3f-43d8-809a-2737621f1a43","resolution":{"observed_at":"2026-08-07T05:25:30.326469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T05:25:30.330578Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond, October 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.330578Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:09243655945fa1772c7ba0a0d41b2469f620e6cb54f278afb05acc3330ab638a","observation_id":"6ac019dc-ebe7-4ccd-93b3-2005b827e975","resolution":{"observed_at":"2026-08-07T05:25:30.330578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T05:25:30.333944Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.333944Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:bc8102a33ec790df0edde0e0a7c1f03879762a71c73b9fbf5b2239dc5ac31aa1","observation_id":"0206e29a-924e-436e-8dc7-d959a0587dfe","resolution":{"observed_at":"2026-08-07T05:25:30.333944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.337467Z","title":"What makes multimodal in-context learning work? InProceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 1539–1550, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.337467Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:3ab4bf6a25b183f58bef8113e00c58d16627cb8f2749da5b260eb5425e03fa97","observation_id":"66e436cd-5e95-4931-ae50-c3bd46f26429","resolution":{"observed_at":"2026-08-07T05:25:30.337467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.340707Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901, 2020","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.340707Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:db0f50d3ac78a1582a0c0f07e74edcf0518952a8ecd2ff3b65a8b570e7974a94","observation_id":"1b60879c-f6ec-499a-a516-da1b4fdfefe6","resolution":{"observed_at":"2026-08-07T05:25:30.340707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-07-06T18:20:05.707144Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T05:25:30.344139Z","title":"M 3cot: A novel benchmark for multi-domain multi-step multi-modal chain-of-thought, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.344139Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:69778680e8fa769d55ebdb5d45bf299aab1ebb70df3b311c33e15c696a364317","observation_id":"5cfa213e-4e85-4600-8e5a-d68347522cd7","resolution":{"observed_at":"2026-08-07T05:25:30.344139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18021","last_updated":"2024-12-07T15:34:23Z","snapshot_observed_at":"2026-07-06T16:54:37.940527Z","submitted_at":"2023-11-29T19:08:11Z","title":"Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18021","snapshot_observed_at":"2026-08-07T05:25:30.347857Z","title":"Can Multimodal Large Language Models Truly Perform Multi- modal In-Context Learning?, December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.347857Z"},"links":{"cited_paper":"/paper/2311.18021","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:0a3cbbdee8b7084d32857b56fe322c59a325b9619993e71959b82f3a8fef7252","observation_id":"0a990664-95bc-4ed7-9107-548f6eb72e66","resolution":{"observed_at":"2026-08-07T05:25:30.347857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T05:25:30.352098Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.352098Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:b49268cb5a4bd5a0d977cd05f872a8c06d00f3f36ca42b8bbedea27a116c02e5","observation_id":"d7134849-2ec4-4fe9-9076-ec3d3ab643e4","resolution":{"observed_at":"2026-08-07T05:25:30.352098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-07T05:25:30.355259Z","title":"A survey on in-context learning.arXiv preprint arXiv:2301.00234, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.355259Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:0c82c7af1217e7d8fae8801549c2cfd3204be3567fc0b2d01431948f15e35669","observation_id":"b3be597a-86b0-4857-a4ed-2e67d0c0c170","resolution":{"observed_at":"2026-08-07T05:25:30.355259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.358643Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.358643Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:ab077959e1e0b9c47d7c4abbefe723988eb896c66cb4f73fa32cdee62ba8831d","observation_id":"3124b6bc-7b85-49ed-8d4a-6cc563b1ffcb","resolution":{"observed_at":"2026-08-07T05:25:30.358643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19488","last_updated":"2025-03-17T09:01:38Z","snapshot_observed_at":"2026-07-06T19:58:44.149533Z","submitted_at":"2024-11-29T06:06:35Z","title":"Interleaved-Modal Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19488","snapshot_observed_at":"2026-08-07T05:25:30.361398Z","title":"Interleaved-Modal Chain-of-Thought, November 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.361398Z"},"links":{"cited_paper":"/paper/2411.19488","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:03cc8f7eb407b9ae454c8a162a9f2a2e37788002b1bd156398fa140f71f5fdb0","observation_id":"79eb36fa-ddc5-4e7c-9127-09243a67138f","resolution":{"observed_at":"2026-08-07T05:25:30.361398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19602","last_updated":"2025-03-25T12:37:22Z","snapshot_observed_at":"2026-08-07T16:38:32.727220Z","submitted_at":"2025-03-25T12:37:22Z","title":"Innate Reasoning is Not Enough: In-Context Learning Enhances Reasoning Large Language Models with Less Overthinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19602","snapshot_observed_at":"2026-08-07T05:25:30.364635Z","title":"Innate Reasoning is Not Enough: In-Context Learning Enhances Reasoning Large Language Models with Less Overthinking, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.364635Z"},"links":{"cited_paper":"/paper/2503.19602","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:0c078e4c1f3cff916fe9dd53669e44c8cb2d27d20bfef042ea2ef75e8a04fa1b","observation_id":"caf709a0-2700-4a83-a67d-e1ac8b44295c","resolution":{"observed_at":"2026-08-07T05:25:30.364635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T05:25:30.367946Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced Multi- Modal ReAsoning Benchmark, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.367946Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:05724ca721422f0fa07c04261462ad249c0852fa4e8229bf06c5a824199e47c7","observation_id":"58541b15-d921-4064-b89d-6dee79b1e6b8","resolution":{"observed_at":"2026-08-07T05:25:30.367946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-07T20:46:02.743961Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-07T05:25:30.371674Z","title":"MME- CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency, February 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.371674Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:a78513872177d9d424baccf270bda6e236690afdf67f101b7b3426d9a7ee7543","observation_id":"cac6d4c7-64c9-4415-9f84-4ca332bb8d68","resolution":{"observed_at":"2026-08-07T05:25:30.371674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.14024","last_updated":"2023-01-23T17:00:01Z","snapshot_observed_at":"2026-08-06T22:47:15.172350Z","submitted_at":"2022-12-28T18:52:44Z","title":"Demonstrate-Search-Predict: Composing retrieval and language models for knowledge-intensive NLP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.14024","snapshot_observed_at":"2026-08-07T05:25:30.375814Z","title":"Demonstrate-Search-Predict: Composing retrieval and language models for knowledge-intensive NLP, January 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.375814Z"},"links":{"cited_paper":"/paper/2212.14024","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:366155fe356ad811ecfcaa301a96bc857b060ea4fdec1f2bbdb0d8a22e653eca","observation_id":"725bc155-8341-46d3-a66d-1a6395d71782","resolution":{"observed_at":"2026-08-07T05:25:30.375814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-07-06T18:09:29.876755Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-07T05:25:30.379020Z","title":"What matters when building vision-language models?arXiv preprint arXiv:2405.02246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.379020Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:c98302047252d37e1c8acf12cba6c9eb106d03a94e06a9cf65600e330a9d59d5","observation_id":"be9d5f8a-08dc-47bc-a483-72007514d435","resolution":{"observed_at":"2026-08-07T05:25:30.379020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.09513","last_updated":"2022-10-17T07:46:47Z","snapshot_observed_at":"2026-08-02T03:10:19.073297Z","submitted_at":"2022-09-20T07:04:24Z","title":"Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.09513","snapshot_observed_at":"2026-08-07T05:25:30.381931Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.381931Z"},"links":{"cited_paper":"/paper/2209.09513","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:7c19344c944588b634b5dd112b353fc12f1c3d0ec764c409b5230e4f5f527ed8","observation_id":"a003c4e3-e160-4134-952d-a5187c342958","resolution":{"observed_at":"2026-08-07T05:25:30.381931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T05:25:30.385062Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.385062Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:ebbd023ebbc0cf187ee285c2f4f1383719b7b28ec2434710930797d12c30eff4","observation_id":"c9adec86-6858-4838-8f48-a51fcd794183","resolution":{"observed_at":"2026-08-07T05:25:30.385062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08786","last_updated":"2022-03-03T12:10:58Z","snapshot_observed_at":"2026-07-06T11:01:05.577957Z","submitted_at":"2021-04-18T09:29:16Z","title":"Fantastically Ordered Prompts and Where to Find Them: Overcoming Few-Shot Prompt Order Sensitivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08786","snapshot_observed_at":"2026-08-07T05:25:30.388110Z","title":"Fantastically ordered prompts and where to find them: Overcoming few-shot prompt order sensitivity.arXiv preprint arXiv:2104.08786, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.388110Z"},"links":{"cited_paper":"/paper/2104.08786","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:0e4622a963b0e0f7a6be471cecfaa00869481558936389cc220c9cf875c6363c","observation_id":"ee0fcb41-a038-4742-940b-4121a9091338","resolution":{"observed_at":"2026-08-07T05:25:30.388110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:31.045764Z","title":"Llama 3.2: Revolutionizing edge ai and vision with open, customizable models.https: //ai.meta.com/blog/llama-3-2-connect-2024-vision-edge-mobile-devices/ , 2024","venue":null,"work_id":"e17fe615-7d31-4829-8601-9af29e60d992","year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.391394Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:6ce050adf6ef93313279bf9cd16f406235de727f1f1869dc27bd4d67122a9a7c","observation_id":"6903f7b2-2961-4c17-8107-a935e8baa3e8","resolution":{"observed_at":"2026-08-07T05:25:31.049043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16938","last_updated":"2023-05-30T08:34:49Z","snapshot_observed_at":"2026-07-06T15:33:57.659685Z","submitted_at":"2023-05-26T13:55:17Z","title":"Few-shot Fine-tuning vs. In-context Learning: A Fair Comparison and Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16938","snapshot_observed_at":"2026-08-07T05:25:30.394417Z","title":"Few- shot fine-tuning vs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.394417Z"},"links":{"cited_paper":"/paper/2305.16938","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:6e1c352e29602cbbb2ad81ffc218ad514b75b14bb749fbd07de5301be8ddc7a1","observation_id":"1a023700-31db-4bd3-be62-7c1147e17792","resolution":{"observed_at":"2026-08-07T05:25:30.394417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14799","last_updated":"2023-10-23T10:56:03Z","snapshot_observed_at":"2026-07-06T16:37:07.197221Z","submitted_at":"2023-10-23T10:56:03Z","title":"Cross-lingual Prompting: Improving Zero-shot Chain-of-Thought Reasoning across Languages","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14799","snapshot_observed_at":"2026-08-07T05:25:30.397479Z","title":"Cross-lingual prompting: Improving zero-shot chain-of-thought reasoning across languages.arXiv preprint arXiv:2310.14799, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.397479Z"},"links":{"cited_paper":"/paper/2310.14799","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:a5c23cc52f8afca16bf54bb51bd4817e911708e41e1afebd24c913c1a62fb5f6","observation_id":"f8ae2fe6-4446-47d9-9941-f825c3bfb4e9","resolution":{"observed_at":"2026-08-07T05:25:30.397479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20482","last_updated":"2024-10-27T15:37:51Z","snapshot_observed_at":"2026-07-06T19:40:21.797132Z","submitted_at":"2024-10-27T15:37:51Z","title":"What Factors Affect Multi-Modal In-Context Learning? An In-Depth Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20482","snapshot_observed_at":"2026-08-07T05:25:30.400396Z","title":"What factors affect multi-modal in-context learning? an in-depth exploration.arXiv preprint arXiv:2410.20482, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.400396Z"},"links":{"cited_paper":"/paper/2410.20482","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:839a4301852e5e89fb532921c6ee3d1788bda4544c0be5d35798ab39f819e70b","observation_id":"9d60bd3c-8794-4bbd-9635-e66877b7d1e4","resolution":{"observed_at":"2026-08-07T05:25:30.400396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.403345Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.403345Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:6dc0bf8b352b54bf0ed4e4104d79a67129f6180233764647dd042dfb0470523d","observation_id":"0d358e1e-a868-4533-be8e-b2a645030683","resolution":{"observed_at":"2026-08-07T05:25:30.403345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01718","last_updated":"2022-06-03T17:52:27Z","snapshot_observed_at":"2026-07-06T13:17:15.959025Z","submitted_at":"2022-06-03T17:52:27Z","title":"A-OKVQA: A Benchmark for Visual Question Answering using World Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01718","snapshot_observed_at":"2026-08-07T05:25:30.406334Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.406334Z"},"links":{"cited_paper":"/paper/2206.01718","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:6b5346b70164ef239d4a4fa583f80bdfd43c0e86ae59400c9aca5c819c8611d3","observation_id":"cdd8f034-939e-43fc-bb23-0587c90b662e","resolution":{"observed_at":"2026-08-07T05:25:30.406334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T05:25:30.409388Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.409388Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:1ed1eebdc5713331567b2ba9ed95fe6bc5b3bcf3f03d120160b44717b6c3dc85","observation_id":"905500d6-2fba-4677-9eb9-ce6a287ce378","resolution":{"observed_at":"2026-08-07T05:25:30.409388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:31.036819Z","title":"Towards vqa models that can read","venue":null,"work_id":"e1a87b05-5bd1-4fff-90a5-acb1d42ea11b","year":2019},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.412385Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:6d5c4c0dd965ee663b4f1cff61d7c0a49b2d14c4363342a4d7e3f92a399cf385","observation_id":"c79db2fd-71d1-418f-af04-e7c53c07e56f","resolution":{"observed_at":"2026-08-07T05:25:31.040011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-07T05:25:30.415272Z","title":"Vl- rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.415272Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:20d61b8a4ee6cb98ce1b5f78cdd41d876b4295ff194acaa797f04a1ceb78a8f8","observation_id":"51a84144-6660-4ddd-8a42-896548d3a749","resolution":{"observed_at":"2026-08-07T05:25:30.415272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-07T05:25:30.418218Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization.arXiv preprint arXiv:2411.10442, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.418218Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:9fec518a7997f577c364f7fa6e9bcfcc06a2397654e3c9e397dafbc3a56ed799","observation_id":"9fef8f3e-b170-4db1-9add-e81f420a39da","resolution":{"observed_at":"2026-08-07T05:25:30.418218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12605","snapshot_observed_at":"2026-08-07T05:25:30.421112Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.421112Z"},"links":{"cited_paper":"/paper/2503.12605","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:3a4f55f408390611d207b82c921c6f4ba13164667fbebfbf20545d65eba0f86f","observation_id":"ed83cb5c-4e55-47a7-a25b-9fdef8c40abb","resolution":{"observed_at":"2026-08-07T05:25:30.421112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-07T05:25:30.424057Z","title":"Emergent abilities of large language models.arXiv preprint arXiv:2206.07682, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.424057Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:ae78b3562d140cade6197faabeff53716bdec60915e1d2683686b96b65eac21c","observation_id":"269f6903-dc82-4e4e-b990-fe6d1046415c","resolution":{"observed_at":"2026-08-07T05:25:30.424057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-07T05:25:30.427120Z","title":"Chain-of-thought prompting elicits reasoning in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.427120Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:5f23b0f0eb86f14dd73ed33e1c4b49e9df9d69ae330000b9e0d2897fc6747ca6","observation_id":"0db51feb-290f-4c93-b4ca-b6f292731f52","resolution":{"observed_at":"2026-08-07T05:25:30.427120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10375","last_updated":"2023-05-03T14:43:50Z","snapshot_observed_at":"2026-07-06T14:33:03.656499Z","submitted_at":"2022-12-20T15:55:21Z","title":"Self-Adaptive In-Context Learning: An Information Compression Perspective for In-Context Example Selection and Ordering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10375","snapshot_observed_at":"2026-08-07T05:25:30.430572Z","title":"Self-adaptive in-context learning: An information compression perspective for in-context example selection and ordering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.430572Z"},"links":{"cited_paper":"/paper/2212.10375","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:a60f8227543de45ad645db05f7ed97aad994edeb950063470845fa7be16ca309","observation_id":"0aad04a6-6109-44b6-be93-8f56153d5371","resolution":{"observed_at":"2026-08-07T05:25:30.430572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15637","last_updated":"2024-06-06T12:01:09Z","snapshot_observed_at":"2026-07-06T17:34:49.001670Z","submitted_at":"2024-02-23T22:39:12Z","title":"Addressing Order Sensitivity of In-Context Demonstration Examples in Causal Language Models","version":2},"cited_work":{"arxiv_id":"2402.15637","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.15637","snapshot_observed_at":"2026-08-07T05:25:30.642640Z","title":"Addressing Order Sensitivity of In-Context Demonstration Examples in Causal Language Models","venue":"cs.CL","work_id":"59222e3e-4284-445d-bb4b-67770412eb42","year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.433663Z"},"links":{"cited_paper":"/paper/2402.15637","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:132992e227746a6bebeef84b7035313e8459a768909470e9f65d0e22dc229541","observation_id":"736cf377-7b4e-4e2b-8d0a-bb9eff84a94c","resolution":{"observed_at":"2026-08-07T05:25:30.646131Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T05:25:30.436700Z","title":"Llava-o1: Let vision language models reason step-by-step.arXiv preprint arXiv:2411.10440, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.436700Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:554e6546b86b2ab5978590d94393e05b1abbd01080a70b44f063f9500aabdd35","observation_id":"0a3eec10-ee2b-4186-89bb-5b762e7a11a6","resolution":{"observed_at":"2026-08-07T05:25:30.436700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00902","last_updated":"2025-02-07T02:29:02Z","snapshot_observed_at":"2026-07-06T18:39:16.236400Z","submitted_at":"2024-07-01T01:57:21Z","title":"From Introspection to Best Practices: Principled Analysis of Demonstrations in Multimodal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00902","snapshot_observed_at":"2026-08-07T05:25:30.439676Z","title":"From introspection to best practices: Principled analysis of demonstrations in multimodal in-context learning.arXiv preprint arXiv:2407.00902, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.439676Z"},"links":{"cited_paper":"/paper/2407.00902","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:e03937d9d5d905381eb14e0a174ad734e7d78669b8ab92354dd0302c3827a5b0","observation_id":"ef44611e-ed1c-4af7-8c56-8c74eb41f55c","resolution":{"observed_at":"2026-08-07T05:25:30.439676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16075","last_updated":"2024-12-20T17:19:24Z","snapshot_observed_at":"2026-08-05T03:18:11.955456Z","submitted_at":"2024-12-20T17:19:24Z","title":"Formal Mathematical Reasoning: A New Frontier in AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16075","snapshot_observed_at":"2026-08-07T05:25:30.442609Z","title":"Formal Mathematical Reasoning: A New Frontier in AI, December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.442609Z"},"links":{"cited_paper":"/paper/2412.16075","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:6ad078def89f259bca54374dff1818541482fbd0473ecc7aedb04de423403747","observation_id":"56d2d879-eda2-45fa-a7d1-d766326c8e85","resolution":{"observed_at":"2026-08-07T05:25:30.442609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:31.028008Z","title":"An empirical study of gpt-3 for few-shot knowledge-based vqa","venue":null,"work_id":"16812329-09f1-4c09-94a0-05aaaa385abb","year":2022},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.445696Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:baaba1d97a8dc912b791f69b5a2c8a1c4c0fad8aa08cb47c4631e8105f29bc8f","observation_id":"35657318-eab6-4585-a89d-41f3582b7ffb","resolution":{"observed_at":"2026-08-07T05:25:31.031434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03493","last_updated":"2022-10-07T12:28:21Z","snapshot_observed_at":"2026-07-06T14:01:50.333970Z","submitted_at":"2022-10-07T12:28:21Z","title":"Automatic Chain of Thought Prompting in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03493","snapshot_observed_at":"2026-08-07T05:25:30.448415Z","title":"Automatic chain of thought prompting in large language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.448415Z"},"links":{"cited_paper":"/paper/2210.03493","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:f4f5564484516d41bff279e66423abf70c9f59e6f4a87d061433a145fda4c602","observation_id":"3d2ce3f7-cb96-49b9-a637-0ebc28f48b68","resolution":{"observed_at":"2026-08-07T05:25:30.448415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.451593Z","title":"Wong, and Simon See","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.451593Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:90cff3a4e82ed005fd9ac019398e349b01ac5b50175cc90d7b0374593c28cb49","observation_id":"cf7df1ba-8ce8-49cd-91ef-48a135e90ccb","resolution":{"observed_at":"2026-08-07T05:25:30.451593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-06T09:00:42.886249Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-07T05:25:30.454384Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models, April 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.454384Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:d0b85199ca9502f31660028f07b5d9d383f997f789d9c94d224a211d0b5318fe","observation_id":"ae870c12-76c4-4867-99aa-71454747ca65","resolution":{"observed_at":"2026-08-07T05:25:30.454384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13164","last_updated":"2025-03-31T20:03:34Z","snapshot_observed_at":"2026-07-30T21:00:03.825989Z","submitted_at":"2024-03-19T21:31:56Z","title":"VL-ICL Bench: The Devil in the Details of Multimodal In-Context Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13164","snapshot_observed_at":"2026-08-07T05:25:30.457496Z","title":"Vl-icl bench: The devil in the details of benchmarking multimodal in-context learning.arXiv preprint arXiv:2403.13164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.457496Z"},"links":{"cited_paper":"/paper/2403.13164","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:e0c821dd178f6f3218b1942be8bd0a64c61ec71fa868aa44bd2f217f3166da8a","observation_id":"964eca0e-c530-40d4-8056-76e070db338b","resolution":{"observed_at":"2026-08-07T05:25:30.457496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.01692","last_updated":"2023-07-19T06:48:35Z","snapshot_observed_at":"2026-07-06T14:26:29.296405Z","submitted_at":"2022-12-03T21:14:32Z","title":"Can In-context Learners Learn a Reasoning Concept from Demonstrations?","version":4},"cited_work":{"arxiv_id":"2212.01692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.01692","snapshot_observed_at":"2026-08-07T05:25:30.522043Z","title":"Can In-context Learners Learn a Reasoning Concept from Demonstrations?","venue":"cs.CL","work_id":"e576e0b7-e4b3-4b2e-91dc-070c9ed6748c","year":2022},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.460503Z"},"links":{"cited_paper":"/paper/2212.01692","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:17f77a3ec3aec4b3a1808081e8913404fcf0d0c0510eca0d8706385734359b31","observation_id":"bd652441-f733-40b4-bdb2-c4b0485883a4","resolution":{"observed_at":"2026-08-07T05:25:30.527381Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:31.019677Z","title":"Density is calculated as mass/volume","venue":null,"work_id":"3629c94f-115e-4229-964d-8de0a486e4ae","year":null},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.464287Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:7fde236a81e86a281f1c548a06381d319b9764253e0a66d29cab431af4feb422","observation_id":"4a36758c-10e8-4e96-bdba-3a2e18ee3d68","resolution":{"observed_at":"2026-08-07T05:25:31.022770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:31.011025Z","title":null,"venue":null,"work_id":"f98bc677-fb9a-4ded-8731-d00130164177","year":null},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.467233Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:ca893a3f0d7e525734ff21c35d151035c88fd18b0d9324a35007a1b38a28bc51","observation_id":"574fe031-2fd9-4b20-aa9b-b76a3abdb119","resolution":{"observed_at":"2026-08-07T05:25:31.014289Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:31.002429Z","title":null,"venue":null,"work_id":"d584978b-2cb3-449d-9589-0c1178048a3c","year":null},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.470376Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:80ccc6df394ed2856cc17cf0ce9b0f4f93a180a9a52d99cea2f2bdd60f4e6aa3","observation_id":"d43821c7-b720-4112-ab66-d3ff04106176","resolution":{"observed_at":"2026-08-07T05:25:31.005482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.993838Z","title":"Final answer:","venue":null,"work_id":"655a949a-3baa-439b-8834-5da377b027b3","year":2020},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.473371Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:5674ef3270156d91652e8bc3f1515dee9c3443c2342da2064badf20444595fa6","observation_id":"084a3b22-a8ff-479f-9e4c-88a6f6bbcafa","resolution":{"observed_at":"2026-08-07T05:25:30.996962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.984545Z","title":"In the graphs, we need to compare the export value (top graph) with the import value (bottom graph) for each country in the year 2020","venue":null,"work_id":"84f42c03-3d35-4da3-97d8-5a9e1fd46e23","year":2020},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.476297Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:0ab82522f67804f23635fe730c7944a18b56c161ee25f1b2381ed4f0dbb21246","observation_id":"a5b37fc7-91ce-4e09-860f-d97eaaba693e","resolution":{"observed_at":"2026-08-07T05:25:30.988293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.974762Z","title":"Export > Import, so Country 3 has a surplus","venue":null,"work_id":"00a6eaee-b70a-48c1-adb8-25674a66fcee","year":2020},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.479128Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:c2b9bdca1780db055cbba74396a641da97539e0ee0eb9ccfcba420d4413b0046","observation_id":"99a3edf5-38dd-49e6-afcf-e42e0a996b9b","resolution":{"observed_at":"2026-08-07T05:25:30.978120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.966365Z","title":null,"venue":null,"work_id":"4e2cb220-8bac-4ed3-8517-ce4453274ec5","year":2020},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.482045Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:715b77132b8f3f0167212b3547b419bda1bfdf1cfd2a1fc9478b29e8d108e8f9","observation_id":"dcf0a135-2d0a-411b-b19e-a5c855ae7879","resolution":{"observed_at":"2026-08-07T05:25:30.969273Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.956412Z","title":"Final answer:","venue":null,"work_id":"b23966f3-98ae-41bc-895b-5b1efb1cd529","year":2020},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.484729Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:32adf164b57d0d2c58fcfbb4c90649e97c05c89cc682af1abf63a628cf1a4e69","observation_id":"2a9c27f2-c4f4-41c8-9844-8a492ad6ffd2","resolution":{"observed_at":"2026-08-07T05:25:30.959723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.946935Z","title":"a² varies inversely with b³","venue":null,"work_id":"8335d65b-b461-4370-84f6-424bc12a111d","year":null},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.487895Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:74c58246592e514993e35d6a28203f4532e00517730e75f0539ccdaf6d2b2088","observation_id":"4c6fbc48-6bfe-4c30-bba2-6546a303e330","resolution":{"observed_at":"2026-08-07T05:25:30.949945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.938236Z","title":"Therefore, a² = 7² = 49","venue":null,"work_id":"8afc3815-95e3-425e-bc2e-8dcfcad44fd0","year":null},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.491118Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:4336ebb3942a232586dbdd9ff90458e43bfd8182b638de136e376b17ad008d6f","observation_id":"3e46e54a-673e-47f6-a7ba-0ae533126ade","resolution":{"observed_at":"2026-08-07T05:25:30.941221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.928999Z","title":"When b = 6, a² = 1323 / 6³ = 1323 / 216 = 6.125","venue":null,"work_id":"bf0be17c-28be-4d26-b424-a21c375648bb","year":null},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.494019Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:9c7eeb784ce46e0d9e4dabbb0bb0c9f2133e297040807b6c18d76e8ab1e96f81","observation_id":"e64c6f14-4372-42e7-b695-b4ca36a8aab3","resolution":{"observed_at":"2026-08-07T05:25:30.932322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:25:30.920436Z","title":null,"venue":null,"work_id":"30543e0a-a8ec-40a0-8959-e537a2218420","year":null},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.497174Z"},"links":{"citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:f4c0b5afea3112366e1009a4accd496ee1c2e0ba33fb7c977122f349ef2ce55f","observation_id":"54bdac12-e0f8-42b8-92ef-2625aef72dec","resolution":{"observed_at":"2026-08-07T05:25:30.923432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:27:16.192025Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 5 inbound Pith citation observations for arXiv:2506.07936."}